Menu

F 분포는 무엇의 비율인가

f distribution · variance ratio & anova — 흔들리는 분산 추정치 둘의 비율, 그리고 오른쪽 꼬리 넓이(p-value)로 판정하는 법
흔들리는 분산 둘을 나눈 분포

표로만 외웠던 그 분포. 정체는 단순하다 — 카이제곱 두 개를 각자 자유도로 나눠 만든 흔들리는 분산 추정치 둘의 비율. 두 분산이 같은지 검정하고, ANOVA의 엔진이 된다.

Part 1 — 정체

F는 흔들리는 분산 추정치 둘의 비율

카이제곱을 봤다면 F는 거의 자동이다. 카이제곱을 자유도로 나누면 기댓값 1짜리 분산 추정치가 되고(E[χ²(k)]=k 니까), 유한 표본이라 1을 중심으로 흔들린다. F는 그 흔들리는 추정치 둘을 나눈 것이다.

인터랙티브 1 · χ²/df 는 1 주위로 흔들린다
5
실측 평균 (이론 = 1)
흔들림폭 (이론 √(2/df))
0
누적 개수
df를 바꿔가며 "+800 반복"을 눌러보라.

여기까지가 핵심 재료다. 모집단 분산은 고정값이라 흔들리지 않는다. 흔들리는 것은 "유한 표본으로 낸 추정치"다. df가 작으면 크게, 크면 조금 흔들린다(df=1이면 Z² 하나뿐이라 0 근처에서 치솟는다 — 카이제곱 자료의 그 발산이다). 이제 이런 흔들리는 추정치를 만들어 나눠보자.

Part 1 — 비율

둘을 나누면 F — 미지의 σ²는 약분된다

같은 모집단에서 나온 두 추정치라면 둘 다 같은 σ²를 재고 있으니, 비율은 σ²/σ² = 1 근처가 된다. 놀라운 점은 σ²가 얼마인지 몰라도 위아래에서 약분돼 사라진다는 것. 그래서 기준값을 몰라도 "둘이 같으냐"를 물을 수 있다.

인터랙티브 2 · 두 추정치를 나누면 F
8
12
최근 추출: —
실측 평균
이론 d₂/(d₂−2)
0
누적 개수
d₁, d₂를 바꿔가며 "+600 반복"을 눌러보라.
Part 2 — 쓰임

두 분산이 같은가 — F 검정

가장 직접적인 쓰임. 두 그룹의 표본분산을 나눠(관례상 큰 쪽/작은 쪽 → F≥1) F 곡선 위에 찍고, 오른쪽 꼬리 넓이가 p-value다. 두 분산이 같으면 F≈1이라 꼬리가 넓고, 한쪽이 크면 F가 커져 꼬리가 좁아진다.

인터랙티브 3 · 두 그룹의 분산 비교
10
10
30
F = 큰분산/작은분산
임계값 (0.05, 한쪽)
p-value (한쪽)
슬라이더로 두 그룹의 퍼짐을 다르게 만들어 보라.
※ "두 분산이 다른가"는 양방향 검정이라 위 p를 2배 한다. 또 F 검정은 정규성 가정에 민감하다(정규가 아니면 결과가 크게 틀어질 수 있다).
Part 3 — 가족과 쓰임

χ², t, 회귀, ANOVA와 한 가족

외웠던 표들이 왜 친척인지 — 전부 "흔들리는 분산"을 어떻게 조합하느냐의 차이다.

χ²는 F의 극한 — 분모를 정확히 알 때
분모 자유도를 무한대로 보내면 χ²(d₂)/d₂ → 1(큰수의 법칙)이라 분모의 흔들림이 사라진다. 그러면 d₁·F → χ²(d₁). 즉 분모 분산을 표본으로 추정하면 F, 정확히 알면 χ²로 돌아간다.
t와의 관계 — 제곱하면 F
t(k)² = F(1,k). t는 Z를 흔들리는 분산 √(χ²/k)로 나눈 것이라, 제곱하면 (χ²(1)/1)/(χ²(k)/k) 꼴의 F가 된다. 그래서 두 그룹 t검정을 제곱하면 F검정이고, ANOVA를 2군에 쓰면 t검정과 같아진다.
회귀 — 모델 전체가 유의한가
회귀에서 설명된 분산 / 잔차 분산이 F다. 모델 전체의 유의성, 그리고 변수를 더한 큰 모델이 작은 모델보다 나은지(내포모델 비교)를 F로 판정한다.
ANOVA — 여러 평균 비교의 엔진
그룹간 분산 / 그룹내 분산 = F. 평균이 벌어지면 그룹간 분산이 부풀어 F가 커진다 → "적어도 한 그룹의 평균이 다르다". 평균 비교를 분산의 비로 바꾸는 마술은 다음 자료(anova)에서 자세히.

한 줄로 꿰면 — χ²는 흔들리는 분산 추정치 하나를 고정 기준과 비교, F는 그 추정치 둘을 서로 비교(미지의 σ²는 약분), ANOVA는 그 F로 그룹간/그룹내를 놓아 평균 차이를 분산의 비로 검출한다.