Menu

카이제곱 분포는 어디서 오는가

chi-squared distribution · goodness of fit & independence — 표준정규 제곱합의 분포, 그리고 오른쪽 꼬리 넓이(p-value)로 판정하는 법
제곱해서 더하면 생기는 분포

공식으로만 외웠던 그 분포. 정체는 단순하다 — 표준정규 값들을 제곱해서 더한 것. 그리고 그것으로 "관찰이 기대와 맞는지", "두 분류가 관련 있는지"를 검정한다.

Part 1 — 정체

표준정규 값을 제곱해서 더하면

카이제곱 분포의 정체는 이 한 줄이다 — 표준정규분포(평균 0, 표준편차 1)를 따르는 값들을 제곱해서 더한 것.

더한 개수 k가 자유도다. 실제로 이 Z는 한 모집단에서 뽑은 표본을 표준화한 것 — Zᵢ = (Xᵢ−μ)/σ. 아래에서 직접 만들어보자: 모집단에서 표본을 뽑고 → 표준화하고 → 제곱해서 더하면, 정말 카이제곱이 나온다.

인터랙티브 · 모집단 → 표본 → 표준화 → 제곱합
STEP A · 표본 추출
STEP B · 표준정규화
STEP C · 제곱해서 더하기
4
STEP A: 모집단(정규분포, 3000개)에서 표본 n개를 뽑았다. 원래 평균 μ=50, 표준편차 σ=12 근처에 분포한다. 탭을 눌러 다음 단계로.
왜 한쪽으로 쏠렸나
제곱하면 무조건 0 이상이라 음수가 없다 → 좌우대칭 종 모양이 될 수 없다. 0에서 시작해 오른쪽으로 긴 꼬리. 자유도 1이면: Z는 대부분 0 근처(종 모양)라 제곱하면 0 근처에 몰리고, 가끔 Z가 크면 제곱해서 확 커져 오른쪽 꼬리로 튄다. 자유도가 커지면 봉우리가 오른쪽으로 가며 점점 대칭에 가까워진다(많이 더하면 정규분포 — 중심극한정리).
variance 자료의 그 자유도
순수 정의의 Z는 "표준정규를 따르는 값들"이지만, 실제로는 Zᵢ=(Xᵢ−μ)/σ로 표본을 표준화한 것이다. μ 대신 표본평균 X̄를 쓰면 자유도가 하나 줄어 n−1표본분산에서 n−1로 나눴던 바로 그 자유도가 여기서도 나온다.
Part 2 — 용도 ① 적합도 검정

관찰이 기대와 맞는가 — 주사위

주사위를 600번 던진다. 공정하다면 각 눈이 100번씩 나와야 한다(기대). 실제 관찰이 그 기대에서 얼마나 벗어났는지를 제곱합으로 잰다.

그냥 (관찰−기대)를 더하면 +와 −가 상쇄돼 0이 되니, 제곱해서 크기만 본다. 기대로 나누는 건 상대적 심각도 보정. 이 값을 카이제곱 곡선 위에 놓고, 오른쪽 꼬리 넓이로 유의성을 판정한다.

인터랙티브 · 편향된 주사위 600번
0.06
카이제곱 분포 (자유도 5) 위에서 판정
χ² 통계량
11.07
임계값 (0.05)
p-value (꼬리 넓이)
주사위를 던져보세요.
Part 2 — 용도 ② 독립성 검정

두 분류가 관련 있는가 — 흡연 × 폐질환

사람들을 흡연 여부와 폐질환 여부로 나눠 센다. "둘이 무관하다면 기대되는 빈도"를 주변합으로 구하고, 실제 관찰이 거기서 얼마나 벗어났는지를 카이제곱으로 잰다. 값을 직접 바꿔보라.

인터랙티브 · 2×2 분할표 (값 입력)
폐질환 O폐질환 X
흡연 O
흡연 X
카이제곱 분포 (자유도 1) 위에서 판정
χ² 통계량
3.84
임계값 (0.05)
p-value (꼬리 넓이)
크래머 V (연관 강도)
값을 입력하면 자동으로 계산됩니다.
"유의하다"와 "얼마나"는 별개
카이제곱 검정은 관련 있나/없나만 답한다. 카이제곱 값은 표본이 크면 무조건 커지므로 — 연관의 크기는 표본크기로 보정한 크래머 V(0~1)로 본다. 같은 데이터라도 표본만 10배 늘리면 χ²는 10배가 되지만 크래머 V는 그대로다.
이항분포와의 연결
범주형 빈도는 "n번 시도해 몇 번"이라 이항(다항)분포를 따른다. n이 크면 이항분포가 정규분포에 근사 → 표준화하면 Z → 제곱합 → 카이제곱. 그래서 각 칸 기대빈도가 약 5 이상이어야 유효하고, 너무 작으면 피셔의 정확검정을 대신 쓴다.