k평균 군집분석 개념
k평균 군집분석은 표본들을 k개의 군집으로 나누되, 각 군집 내 거리가 최소가 되도록 군집 중심을 반복적으로 조정하는방법입니다. 핵심 문장은 다음과 같습니다. “k평균 군집은 k개의 군집 중심을 기준으로 개체를 배분하고, 군집 내 제곱합을 최소화되도록 중심을 반복 업데이트하는비계층적 군집 분석이다.”
절차(알고리즘) 단순정리
복잡한 표현이 필요 없습니다. 아래 4단계를 그대로 기억하면 됩니다. 1단계. k개의 군집 중심을 초기 설정한다. 2단계. 각 개체를 가장 가까운 중심에 배정한다. 3단계. 새로 배정된 개체들을 기준으로 군집 중심을 다시 계산한다. 4단계. 중심 변화가 없을 때까지 2~3단계를 반복한다.
k값(군집 수) 선택 방법
k 선택 방법은 다음 3가지만 기억하면 충분합니다.
첫째, 엘보우 방법(Elbow Method)
군집 내 제곱합 감소가 완만해지는 지점을 k로 선택합니다.
둘째, 실루엣 계수(Silhouette Coefficient)
군집 응집도와 분리도를 동시에 고려합니다.
셋째, 해석 가능성
마케팅 세그먼트가 의미 있게 나누어지는지 판단합니다.
k평균의 장점과 한계
시험에 계층적 군집화와 비계층적 군집화를 비교해 나오기 가장 쉬운 부분입니다.
장점
- · 계산이 빠르고 대규모 데이터에 적합
- · 결과가 단순하고 해석이 쉽다
- · 실무 활용도가 높다
단점
- · 초기 중심에 따라 결과가 달라짐
- · 이상치에 민감함
- · 구형(원형) 군집 형태에만 적합
계층적 군집과 k평균 군집 비교
- · 군집 수 : 계층적 사후 결정 / k평균 사전 결정(k 설정)
- · 방식 : 계층적 병합·분할 단계적 / k평균 중심 기반 반복
- · 계산비용 : 계층적 비교적 큼 / k평균 매우 빠름
- · 데이터 규모 : 계층적 중·소 / k평균 대규모에 강함
- · 이상치 민감도 : 계층적 중간 / k평균 매우 민감
k평균에서 자주 나오는 실수 방지 포인트
실수하는 부분은 딱 네 가지입니다.
- · 첫째, 군집 수를 문제에서 주지 않았을 때 근거 없이 임의로 설정
- · 둘째, 군집 변수의 표준화를 하지 않음(스케일이 다르면 왜곡)
- · 셋째, 이상치를 제거하지 않음
- · 넷째, 반복 수렴 과정 이해 부족