카이제곱 교차분석 개념
카이제곱 교차분석은 두 범주형 변수 간의 관련성(독립성 여부)을 검정하는 방법입니다. 관찰빈도와 기대빈도의 차이가 우연인지, 아니면 실제로 변수 간 관계가 있는지를 판단합니다. 핵심 정의 문장은 다음과 같습니다. 카이제곱 교차분석은 범주형 변수 간 독립성을 검정하기 위해 관찰빈도와 기대빈도의 차이를 기반으로 검정통계량을 산출하는 비모수 검정이다.
가설 설정 방식
가설은 두 문장만 기억하면 충분합니다.
- · 귀무가설: 두 변수는 서로 독립적이다.
- · 대립가설: 두 변수는 관련이 있다.
기대빈도 개념
기대빈도는 두 변수가 독립이라고 가정했을 때 각 셀에 들어가야 할 이론적 빈도입니다. 계산 방식은 간단합니다. 기대빈도 = (해당 행합계 × 해당 열합계) / 전체합계
카이제곱 통계량 계산 원리
카이제곱 값은 각 셀에서 관찰빈도와 기대빈도의 차이가 얼마나 큰지를 합산한 것입니다. 공식 구조만 기억하면 됩니다. 카이제곱 = Σ (관찰빈도 – 기대빈도)² / 기대빈도 여기서 기대빈도가 작을수록 민감하게 반응하며, 관찰빈도와 기대빈도 차이가 커지면 카이제곱 값이 커집니다.
자유도 계산
자유도는 구조 기억법으로 접근하면 쉽습니다. 자유도 = (행의 개수 – 1) × (열의 개수 – 1) 예를 들어 2×3 교차표라면자유도 = (2-1)×(3-1) = 2 이 자유도와 유의수준을 바탕으로 카이제곱 분포표를 확인합니다.
해석 방식
해석은 세 줄 구조로 정리합니다.
- · 첫째, 유의확률(p값)을 확인한다.
- · 둘째, p값이 0.05 미만이면 귀무가설을 기각한다.
- · 셋째, 변수 간 관련성이 존재한다고 결론 내린다.
정리된 해석 문장은 다음과 같습니다. “유의수준 0.05 기준 p값이 0.05 미만이므로 귀무가설을 기각하며, 두 변수 간에는 통계적으로 유의한 관련성이 존재한다.”
카이제곱 분석에서 자주 나오는 실수 방지 포인트
다음 네 가지 실수만 조심하면 문제를 틀릴 가능성이 크게 줄어듭니다.
- · 기대빈도 5 미만 셀 과다 발생
- · 비율이 아닌 ‘빈도’를 사용해야 함
- · 표본수가 너무 작으면 결과 불안정
- · 자유도 계산 실수 주의