동전을 스무 번 던졌더니 앞면이 열다섯 번 나왔습니다.
이 동전이 공정한가라는 질문을 어떻게 판정할까요. 앞면 열이 다섯보다 많으니 편향된 것 같기도 하고, 스무 번쯤은 흔들리는 것이 당연하니 우연 같기도 합니다. 눈짐작이 아니라 정해진 절차로 답을 내는 방법이 있습니다. 그것을 가설검정이라고 합니다. 지난 글이 손에 든 자료를 요약했다면, 이 글은 그 자료로 판정을 내리는 문장의 구조를 봅니다.
왜 "차이가 없다"에서 시작하는가
먼저 이상한 규약 하나에 익숙해져야 합니다. 판정은 "차이가 있다"가 아니라 "차이가 없다"를 가정한 채로 시작합니다.
이유는 이렇습니다. "차이가 없다"는 정확히 한 가지 상태입니다 — 동전이 공정하다면 앞면 확률은 정확히 입니다. 이 하나의 상태에서는 스무 번 던져 앞면 몇 번이 나올 확률을 정확히 계산할 수 있습니다. 반면 "차이가 있다"는 무수히 많은 상태입니다 — 앞면 확률이 일 수도 일 수도 일 수도 있고, 각각의 확률이 전부 다릅니다.
계산할 수 있는 쪽에서 시작한 다음, 관측이 그 쪽에서 나오기에는 너무 이상하면 그 가정을 버립니다. 그것이 가설검정의 전체 얼개입니다.
"차이가 없다"는 가정을 귀무가설이라 하고 으로 적습니다. 그것과 대비되는 "차이가 있다" 쪽은 대립가설이고 으로 적습니다. 동전의 예에서는
여기서 는 앞면이 나올 확률입니다.
검정통계량과 기각역
가설을 세웠으니 자료에서 하나의 수를 뽑아냅니다. 이 수를 검정통계량이라 합니다. 이 예에서는 그냥 앞면 개수 를 씁니다.
이 참이라면 의 분포를 지난 글까지 배운 것으로 정확히 알 수 있습니다. 앞면과 뒷면이 반반이므로
가운데 10에 봉우리가 있고 양쪽 끝으로 갈수록 낮아집니다. 관측된 15는 붉게 칠한 곳에 서 있고, 그 붉은 부분이 "관측만큼 극단적인 결과"입니다. 이 붉은 부분의 확률이 판정의 기준이 됩니다.
유의수준과 p값
얼마나 드물면 우연이 아니라고 할지를 미리 정해 둡니다. 그 기준값을 유의수준이라 하고 로 적습니다. 관례적으로 를 씁니다 — 스무 번에 한 번쯤은 우연이 아니라고 잘못 판정할 수 있음을 감수한다는 뜻입니다.
이제 관측된 값 이상으로 극단적인 결과가 아래에서 나올 확률을 계산합니다. 이 확률을 p값이라고 합니다.
동전의 예에서는 앞면이 열다섯 이상이 될 확률입니다.
이항계수 여섯 개를 손으로 더합니다.
p값 약 이 유의수준 보다 작습니다. 그러므로 을 기각합니다 — 이 동전은 공정하지 않다고 판정합니다.
절차 자체는 이렇게 다섯 걸음입니다. 한쪽 꼬리만 본 이 계산은 "앞면이 너무 많다"만 검사한 것이라 사실은 반대쪽 꼬리도 함께 봐야 정확하지만, 이 자료에서는 관측이 위쪽으로 치우쳤으므로 위쪽만으로도 뜻이 통합니다. 아래쪽 꼬리까지 더한 양측 p값은 약 로 여전히 미만입니다.
p값이 아닌 것 셋
여기까지가 정의이고, 정의만 지키면 됩니다. 그런데 p값에 자주 붙는 세 가지 오해가 있습니다. 셋 다 계산에는 없는 말입니다.
첫째, p값은 "귀무가설이 참일 확률"이 아닙니다. 방금 계산한 은 " 이 참이라면 이렇게 극단적인 자료가 나올 확률"이지, "이런 자료가 나왔으니 이 참일 확률"이 아닙니다. 조건과 결과의 방향이 뒤집혀 있습니다.
둘째, p값은 "효과의 크기"가 아닙니다. 표본을 크게 키우면 아주 작은 편향으로도 p값이 매우 작아집니다. p값이 작다는 것은 "우연 하나로는 설명하기 어렵다"는 뜻일 뿐, 그 편향이 크다는 뜻은 아닙니다. 얼마나 편향되어 있는지는 p값이 아니라 관측된 비율 자체가 말합니다.
셋째, p값은 "실험을 다시 하면 같은 결과가 나올 확률"이 아닙니다. 재현은 새 표본이 어떻게 흔들리는지의 문제이고, p값은 지금 이 하나의 표본에서 계산한 값입니다.
1종 오류와 2종 오류
판정을 내리는 이상 틀릴 수 있습니다. 틀리는 방식은 둘입니다.
1종 오류는 참인 귀무가설을 기각하는 것입니다 — 공정한 동전인데 편향되었다고 잘못 판정하는 것입니다. 1종 오류를 저지를 확률이 유의수준 입니다. 를 쓰면 실제로 이 참일 때 스무 번에 한 번쯤은 잘못 기각한다는 뜻입니다.
2종 오류는 거짓인 귀무가설을 기각하지 못하는 것입니다 — 편향된 동전을 공정하다고 놓치는 것입니다. 그 확률을 로 적고, 를 검정력이라 부릅니다.
이 둘은 맞바꿈 관계입니다. 를 줄이면(기각을 더 어렵게 만들면) 있는 차이도 놓치기 쉬워지므로 가 커집니다. 반대로 를 키우면 가 작아지지만 없는 차이를 있다고 하기 쉬워집니다. 어느 쪽을 얼마나 감수할지는 자료가 정하는 것이 아니라 문제에 따라 사람이 정합니다.
통계적 유의성은 크기가 아니다
동전 예에서 관측된 비율은 였고 공정한 와의 차이는 입니다. 스무 번짜리 실험에서는 이 정도 차이가 우연으로 설명되기 어려워 기각되었습니다.
만약 만 번을 던져 앞면이 번 나왔다면 어떨까요. 비율은 로 공정한 와의 차이가 밖에 안 됩니다. 그런데도 표본이 크기 때문에 p값은 매우 작아지고 이 기각됩니다. "편향이 있음"은 확인되었지만 그 편향은 실용적으로 거의 아무 뜻이 없습니다.
통계적 유의성과 실질적 크기는 다른 이야기입니다. p값은 앞의 것을 재고, 편향의 크기는 관측된 비율 자체가 잽니다. 둘을 늘 함께 적어야 합니다.
기각과 구간은 같은 계산을 두 방향으로 읽은 것이다
는 기각되었습니다. 그런데 만약 이었다면 어땠을까요. 이번엔 이 참이라 가정하고 를 다시 계산합니다.
은 보다 훨씬 큽니다(양측 검정이니 각 꼬리 기준을 로 잡습니다). 아래쪽 꼬리 도 훨씬 큽니다. 어느 쪽으로도 극단이 아니므로 은 기각되지 않습니다.
를 여러 값으로 바꿔 가며 같은 계산을 반복하면, 관측 이 있을 때 기각되지 않는 들의 범위가 나옵니다.
파란 곡선은 위쪽 꼬리 이고 주황 곡선은 아래쪽 꼬리 입니다. 두 곡선이 모두 이상인 구간이 기각되지 않는 범위이고, 이 자료에서는 대략 입니다. 는 위쪽 꼬리가 로 아래에 있어 이 범위 밖입니다 — 그래서 기각되었습니다.
즉 " 를 기각한다"는 판정과 " 가 대략 에서 사이에 있다고 말할 수 있다"는 진술이 같은 계산의 두 방향입니다. 이렇게 관측과 어울리는 값들의 범위를 구간으로 적는 방법이 따로 있고, 그것을 일반화하는 언어는 중급 21번 · 추정과 신뢰구간의 몫입니다. 이 글은 한 예제 안에서 검정과 구간이 이어져 있다는 사실만 확인하고 마칩니다.
여러 번 재면 우연히 통과하는 것이 생긴다
같은 자료로 검정 하나만 하면 1종 오류의 확률이 입니다. 그런데 검정을 스무 번, 백 번 반복하면 그중 몇은 우연히 아래로 떨어져 기각됩니다. 편향이 없어도 나타나는 이 문제는 실제 자료 분석에서 자주 부딪히는 자리이고, 이를 다루는 보정 기법은 중급 76번의 것입니다.
연습 문제
연습 1 — 이항계수로 p값 계산
이항계수 표입니다 — 필요할 때 참조합니다.
| 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | 10 | 45 | 120 | 210 | 252 | 210 | 120 | 45 | 10 | 1 |
공정한 동전을 열 번 던졌더니 앞면이 아홉 번 나왔습니다. 를 이 표로 계산하세요.
입니다.유의수준 아래에서 이 관측은 귀무가설 "동전이 공정하다"를 기각하는지 판정하세요(위쪽 한쪽만 봅니다).
p값 이 보다 작으므로 기각합니다. 이 동전은 공정하지 않다고 판정합니다.앞면이 여덟 번이었다면 어떨까요. 을 구하고 같은 유의수준으로 판정하세요.
입니다. 보다 크므로 기각하지 않습니다 — 열 번 중 여덟 번만으로는 공정성을 뒤집기에 부족합니다.
연습 2 — 정의 확인
어떤 계산 결과 p값이 이었습니다. 다음 셋 중 옳은 문장 하나를 고르세요.
- ① 귀무가설이 참일 확률이 이다.
- ② 귀무가설이 참이라면 관측만큼 극단적인 결과가 나올 확률이 이다.
- ③ 같은 실험을 반복하면 확률로 같은 결론이 나온다.
②가 정의입니다. ①은 조건의 방향이 뒤집혀 있고, ③은 재현 확률과 혼동한 것입니다.유의수준 를 로 낮추었을 때 1종 오류와 2종 오류는 각각 어떻게 되는지 한 줄로 답하세요.
1종 오류의 확률은 로 함께 줄어듭니다. 대신 기각이 더 어려워지므로 있는 차이를 놓치는 2종 오류는 늘어납니다.표본을 아주 크게 키우면 실제로는 미미한 차이도 유의하게 잡힙니다. 이때 "통계적으로 유의하다"와 "실질적으로 크다"의 차이를 한 문장으로 적으세요.
통계적 유의성은 우연으로 설명하기 어렵다는 뜻이고, 실질적 크기는 관측된 편향 자체가 얼마나 큰가입니다 — p값은 앞을, 관측된 비율은 뒤를 잽니다.
연습 3 — 다른 귀무가설 아래에서 계산
이고 앞면 확률이 인 동전에서 입니다. 계산기를 써도 됩니다.
일 때 를 구하세요. (본문에서 계산한 와 같아야 합니다 — 대칭이기 때문입니다.)
대칭이므로 입니다. 앞면과 뒷면을 바꿔 세면 두 확률이 같은 이유가 이것입니다.일 때 를 계산기로 구하면 약 입니다. 이 값은 보다 큰가요, 작은가요, 그리고 판정은 어떻게 되나요.
이므로 아래쪽 꼬리로 기각되지 않습니다. 위쪽 꼬리 도 크므로 이쪽으로도 기각되지 않습니다. 그러므로 은 관측 과 어울리는 값 중 하나입니다.본문 그림에서 는 왜 범위 밖이고 은 왜 범위 안인지 한 문장으로 적으세요.
에서는 위쪽 꼬리 이 아래로 떨어져 기각되고, 에서는 양쪽 꼬리가 모두 이상이라 기각되지 않습니다.
정리
- 귀무가설 은 "차이가 없다" 이고 이 하나의 상태에서 관측값의 분포를 정확히 계산할 수 있습니다. 판정은 이 계산 가능한 쪽에서 시작합니다.
- p값은 " 이 참이라면 관측만큼 극단적인 결과가 나올 확률" 입니다. 동전 20번에 앞면 15번이면 이 p값입니다.
- p값이 유의수준 미만이면 을 기각합니다. 는 관례일 뿐, 문제에 따라 다릅니다.
- p값은 셋이 아닙니다 — 가설이 참일 확률이 아니고, 효과의 크기가 아니고, 재현 확률이 아닙니다.
- 1종 오류는 참을 기각하는 것으로 확률이 , 2종 오류는 거짓을 놓치는 것으로 확률이 이고 가 검정력입니다. 둘은 맞바꿈 관계입니다.
- 통계적 유의성과 실질적 크기는 다릅니다 — 표본이 크면 아주 작은 차이도 유의해집니다.
- 기각과 구간은 같은 계산을 두 방향으로 읽은 것입니다. 이 예제에서는 관측 과 어울리는 의 범위가 대략 이었습니다.
다음 글부터는 수를 하나씩 다루던 자리에서 벗어나, 수를 직사각형으로 늘어놓은 새 대수 대상 하나를 세웁니다.
읽어주셔서 감사합니다. 😊

