회귀분석 개념
회귀분석은 종속변수(Y)를 설명하기 위해 독립변수(X)의 영향을 추정하는 통계 기법입니다. 독립변수 변화가 종속변수에 어떤 영향을 미치는지를 수치로 보여줍니다.
핵심 문장
“회귀분석은 독립변수가 종속변수에 미치는 영향을 추정해 관계를 설명하는 분석 기법이다.”
회귀식 구조(가장 중요한 기본형)
Y = β0 + β1X1 + β2X2 + … + ε 여기서
- · β0: 절편
- · β1, β2: 회귀계수(독립변수의 영향력)
- · ε: 오차항
해석은 다음 한 줄로 충분합니다. “회귀계수 β는 X가 1단위 증가할 때 Y가 얼마나 변하는지를 의미한다.”
회귀계수의 방향성과 크기 해석
회귀계수는 두 가지 기준으로 해석합니다.
첫째, 방향성
β ≥ 0: 정(+)의 영향 β < 0: 부(-)의 영향
둘째, 크기
계수 절댓값이 클수록 영향력이 큽니다. 예시 β1 = 0.35 → X1 증가하면 Y가 증가하는 경향 β2 = -0.20 → X2 증가하면 Y가 감소하는 경향 시험에서 가장 많이 쓰는 문장 “회귀계수는 독립변수 변화에 따른 종속변수의 변화량을 의미하며, 값이 클수록 영향력이 크다.”
유의성 검정(t값·p값)
회귀분석 문제의 절반은 ‘이 계수가 유의한가’를 묻는 구조입니다. 기준은 단순합니다. 0.05는 예시입니다. p값 < 0.05 → 유의함(영향 있음) p값 ≥ 0.05 → 유의하지 않음(영향 없음)
다중공선성 체크(VIF)
회귀에서 자주 나오는 필수 문장입니다. VIF가 10 이상이면 다중공선성이 심해 계수 해석이 불안정해집니다.
간단 문장
“VIF가 10 이상이면 다중공선성이 심한 것으로 판단해 변수 제거나 통합을 고려한다.”
모형 전체 적합도(R²)
R²은 회귀식이 얼마나 잘 설명하는지 나타내는 값입니다. 0~1 사이이며 높을수록 설명력이 좋습니다.
핵심 문장
“R²은 독립변수들이 종속변수 변동을 얼마나 설명하는지를 나타내는 지표로, 값이 높을수록 모형 적합도가 높다.”