수학

MATH / 초급 40번

기술통계: 평균·분산·분위수로 자료 뭉치를 요약하기

손에 든 숫자 뭉치를 몇 개의 수로 줄이는 법입니다. 평균이 넷이나 되는 이유부터 분산과 표준편차, 사분위수와 상자그림, 그리고 히스토그램의 칸 나누기가 결론을 바꾸는 자리까지 손으로 계산합니다.

PALDYN Team18 MIN READ

숫자 열두 개가 적힌 종이가 있습니다.

2, 4, 5, 7, 8, 8, 10, 10, 11, 13, 14, 162,\ 4,\ 5,\ 7,\ 8,\ 8,\ 10,\ 10,\ 11,\ 13,\ 14,\ 16

이 뭉치를 몇 개의 수로 줄여 말하고 싶습니다. 지난 글까지는 아직 일어나지 않은 일을 셌지만, 이번에는 이미 손에 든 숫자를 요약합니다. 그렇게 자료를 요약하는 것을 기술통계라고 합니다.

평균이 하나가 아니다

가운데쯤을 나타내는 수를 평균이라고 부릅니다. 그런데 무엇을 묻느냐에 따라 계산이 달라집니다.

산술평균은 전부 더해 개수로 나눈 것입니다. 위 자료라면

2+4+5+7+8+8+10+10+11+13+14+1612=10812=9\frac{2+4+5+7+8+8+10+10+11+13+14+16}{12} = \frac{108}{12} = 9

가중평균은 값마다 중요한 정도를 곱해 더한 것입니다. 중간고사 80점·기말고사 90점인데 기말이 60%를 차지한다면

80×0.4+90×0.6=32+54=8680\times0.4 + 90\times0.6 = 32 + 54 = 86

곱으로 쌓이는 것은 기하평균이다

주식이 첫해에 2배가 되고 둘째 해에 절반이 되었다고 합시다. 두 해 뒤에는 제자리입니다. 그런데 산술평균을 쓰면

2+0.52=1.25\frac{2 + 0.5}{2} = 1.25

해마다 1.25배씩이라면 두 해면 1.56251.5625 배가 되어야 합니다. 틀렸습니다.

배수처럼 곱해서 쌓이는 것은 곱한 뒤 제곱근을 씁니다.

2×0.5=1=1\sqrt{2 \times 0.5} = \sqrt{1} = 1

제자리가 맞습니다. nn 개를 모두 곱해 nn 제곱근을 취한 것을 기하평균이라고 합니다.

같은 거리를 다른 속도로 가면 조화평균이다

갈 때 60km/h, 올 때 40km/h로 같은 거리를 왕복했습니다. 평균 속도가 50km/h일까요.

왕복 도식과, 조화·기하·산술 세 평균이 수직선에 놓인 그림

편도가 120km라면 갈 때 2시간, 올 때 3시간이 걸립니다. 모두 240km를 5시간에 간 것이므로

2405=48 km/h\frac{240}{5} = 48\ \text{km/h}

느린 쪽에 시간을 더 많이 쓰기 때문에 느린 쪽으로 끌립니다. 이런 경우에는 역수의 산술평균을 구한 뒤 다시 뒤집습니다.

2160+140=2124=48\frac{2}{\frac{1}{60}+\frac{1}{40}} = \frac{2}{\frac{1}{24}} = 48

이것을 조화평균이라고 합니다.

세 평균에는 순서가 있습니다. 60과 40이라면 조화 48, 기하 2400≈48.99\sqrt{2400}\approx48.99, 산술 50입니다.

조화평균≤기하평균≤산술평균\text{조화평균} \le \text{기하평균} \le \text{산술평균}

17번 글에서 세운 a+b≥2aba+b \ge 2\sqrt{ab} 가 바로 오른쪽 부등호이고, 양변을 2로 나누면 산술평균이 기하평균 이상이라는 말이 됩니다. 셋이 같아지는 것은 두 수가 같을 때뿐입니다.

중앙값과 최빈값

자료를 크기순으로 늘어놓았을 때 한가운데 오는 값을 중앙값이라고 합니다. 개수가 짝수면 가운데 둘의 평균입니다. 위 자료는 여섯째가 8, 일곱째가 10이므로

8+102=9\frac{8+10}{2} = 9

산술평균과 같습니다. 좌우가 고르게 퍼져 있으면 둘이 겹칩니다.

가장 자주 나오는 값은 최빈값이라고 합니다. 위 자료에서는 8과 10이 두 번씩이라 최빈값이 둘입니다.

큰 값 하나가 들어오면

여기에 100 하나를 더해 봅시다.

100을 더하기 전과 후에 평균과 중앙값이 각각 얼마나 움직이는지 비교한 그림

새 평균은 108+10013=20813=16\dfrac{108+100}{13} = \dfrac{208}{13} = 16 이고, 새 중앙값은 열세 개 중 일곱째인 10입니다.

평균 중앙값
원래 9 9
100을 더한 뒤 16 10

평균은 7이나 밀렸는데 중앙값은 1밖에 안 움직였습니다. 평균은 모든 값을 더하므로 큰 값 하나가 통째로 들어오지만, 중앙값은 순서에서 한 칸 밀린 것이 전부이기 때문입니다.

한쪽으로 길게 늘어진 자료를 꼬리가 길다고 합니다. 소득이나 도시 인구가 그렇습니다. 꼬리가 길면 평균은 대다수가 겪는 값과 멀어지므로 중앙값을 함께 적어야 합니다.

흩어진 정도 — 분산과 표준편차

가운데를 알았으니 이번에는 얼마나 퍼져 있는가입니다.

각 값에서 평균을 뺀 것을 편차라고 합니다. 위 자료의 편차는 이렇습니다.

−7, −5, −4, −2, −1, −1, 1, 1, 2, 4, 5, 7-7,\ -5,\ -4,\ -2,\ -1,\ -1,\ 1,\ 1,\ 2,\ 4,\ 5,\ 7

편차를 그냥 더하면 안 됩니다 — 좌우가 상쇄되어 언제나 0이 나옵니다. 실제로 위의 열두 개를 더하면 0입니다. 부호를 없애려고 제곱해서 더합니다.

49+25+16+4+1+1+1+1+4+16+25+49=19249+25+16+4+1+1+1+1+4+16+25+49 = 192

이 제곱합을 개수로 나눈 것을 분산이라고 합니다.

분산=19212=16\text{분산} = \frac{192}{12} = 16

제곱했으니 단위도 제곱이 되어 그대로는 자료와 견주기 어렵습니다. 분산의 양의 제곱근을 표준편차라고 합니다.

표준편차=16=4\text{표준편차} = \sqrt{16} = 4

표준편차 4는 "값들이 평균 9에서 대체로 4쯤 떨어져 있다"는 말이고 자료와 단위가 같습니다.

확률변수에도 같은 식을 쓴다

38번 글의 기댓값 E[X]E[X] 를 평균 자리에 넣으면 같은 식이 확률변수에도 그대로 적용됩니다. 평균을 μ\mu 로 적습니다.

Var⁡(X)=E[(X−μ)2]\operatorname{Var}(X) = E[(X-\mu)^2]

괄호를 펼치면 계산하기 쉬운 모양이 나옵니다. 38번 글에서 결과만 적어 둔 기댓값의 선형성을 여기서 씁니다 — μ\mu 는 상수라 E[μ]=μE[\mu]=\mu 입니다.

E[X2−2μX+μ2]=E[X2]−2μ E[X]+μ2=E[X2]−μ2E[X^2 - 2\mu X + \mu^2] = E[X^2] - 2\mu\,E[X] + \mu^2 = E[X^2] - \mu^2

Var⁡(X)=E[X2]−μ2\operatorname{Var}(X) = E[X^2] - \mu^2

동전 세 번의 앞면 개수로 확인합니다. μ=1.5\mu=1.5 이고

E[X2]=0×18+1×38+4×38+9×18=248=3E[X^2] = 0\times\frac18 + 1\times\frac38 + 4\times\frac38 + 9\times\frac18 = \frac{24}{8} = 3

Var⁡(X)=3−1.52=3−2.25=0.75\operatorname{Var}(X) = 3 - 1.5^2 = 3 - 2.25 = 0.75

자료의 분산과 확률변수의 분산은 같은 식을 다른 대상에 쓴 것입니다. 왼쪽은 손에 든 숫자 열두 개의 흩어짐이고 오른쪽은 아직 나오지 않은 값의 흩어짐입니다.

한 가지만 덧붙여 둡니다. 자료의 분산을 계산할 때 nn 대신 n−1n-1 로 나누는 관례를 보게 될 텐데, 그것은 손에 든 자료로 더 큰 무리의 흩어짐을 짐작할 때 쓰는 것입니다. 왜 하나를 빼는지는 중급 21번 · 추정과 신뢰구간의 몫이고, 이 글은 손에 든 자료 자체를 요약하므로 nn 으로 나눕니다.

사분위수와 상자그림

평균과 표준편차는 값 하나가 크게 튀면 함께 흔들립니다. 순서만 보고 요약하는 방법도 있습니다.

자료를 크기순으로 늘어놓고 넷으로 나누는 세 지점을 사분위수라고 합니다. 가운데가 중앙값이고, 아래쪽 절반의 중앙값이 제1사분위수 Q1Q_1, 위쪽 절반의 중앙값이 제3사분위수 Q3Q_3 입니다.

위 자료의 아래쪽 여섯은 2,4,5,7,8,82,4,5,7,8,8 이므로 Q1=5+72=6Q_1 = \dfrac{5+7}{2} = 6 이고, 위쪽 여섯은 10,10,11,13,14,1610,10,11,13,14,16 이므로 Q3=11+132=12Q_3 = \dfrac{11+13}{2} = 12 입니다.

Q3Q_3 에서 Q1Q_1 을 뺀 것을 사분위범위라 하고 IQR로 적습니다.

IQR=12−6=6\text{IQR} = 12 - 6 = 6

가운데 절반이 이 6 안에 들어 있다는 뜻입니다.

자료 점 위에 상자와 수염을 그린 상자그림

이렇게 상자로 가운데 절반을, 선으로 나머지를 그린 그림을 상자그림이라고 합니다. 양옆으로 뻗은 선을 수염이라고 부릅니다.

같은 방식을 100등분한 것이 백분위수입니다. "상위 10%"라는 말이 90번째 백분위수를 가리킵니다.

이상치를 정하는 규칙은 임의적이다

동떨어져 있는 값을 이상치라고 합니다. 가장 널리 쓰이는 규칙은 이것입니다.

Q1−1.5×IQR미만,Q3+1.5×IQR초과Q_1 - 1.5\times\text{IQR} \quad\text{미만},\qquad Q_3 + 1.5\times\text{IQR} \quad\text{초과}

위 자료라면 6−9=−36-9=-3 미만이거나 12+9=2112+9=21 초과인 값입니다. 원래 열두 개에는 없고, 앞에서 더한 100은 여기 걸립니다.

그런데 1.5라는 수에 특별한 근거는 없습니다. 2.0으로 잡으면 경계가 −6-6 과 24로 넓어지고, 표준편차 3배를 쓰는 규칙도 있습니다. 어떤 값이 이상치인지는 자료가 아니라 규칙을 고른 사람이 정합니다. 그러니 이상치를 버렸다면 어느 규칙으로 버렸는지를 같이 적어야 합니다.

히스토그램 — 칸을 어떻게 나누느냐

자료를 구간으로 나누고 구간마다 몇 개가 들었는지를 막대로 그린 것을 히스토그램이라고 합니다.

같은 자료 열두 개를 칸 넓이 4, 2, 1로 각각 그린 히스토그램 셋

셋 다 같은 자료입니다. 그런데 칸을 넓게 잡으면 가운데가 볼록한 한 봉우리로 보이고, 좁게 잡으면 울퉁불퉁해지며, 더 좁게 잡으면 칸마다 0개나 1개라 모양이랄 것이 없어집니다.

칸의 개수는 자료가 아니라 그리는 사람이 정합니다. 그러니 히스토그램을 보고 "봉우리가 둘이다" 같은 결론을 내릴 때는 칸을 바꿔 보고도 그 결론이 남는지 확인해야 합니다.

축을 바꿔도 그림은 통째로 달라집니다. 값이 몇 배씩 벌어지는 자료를 그대로 그리면 작은 값들이 왼쪽 끝에 뭉쳐 아무것도 안 보이는데, 축의 눈금을 배수로 매기면 그것이 고르게 펼쳐집니다. 같은 자료가 전혀 다른 모양이 됩니다. 그 축을 읽고 그리는 법은 47번 · 자릿수와 오차의 몫입니다.

연습 문제

연습 1 — 여러 평균

  1. 자료 4, 6, 6, 8, 114,\ 6,\ 6,\ 8,\ 11 의 산술평균, 중앙값, 최빈값
    합이 35이므로 평균은 355=7\dfrac{35}{5}=7 입니다. 가운데는 셋째인 6이고, 두 번 나오는 6이 최빈값입니다.
  2. 갈 때 30km/h, 올 때 60km/h로 같은 거리를 왕복했을 때의 평균 속도
    조화평균입니다. 2130+160=2360=2120=40\dfrac{2}{\frac{1}{30}+\frac{1}{60}} = \dfrac{2}{\frac{3}{60}} = \dfrac{2}{\frac{1}{20}} = 40 km/h입니다. 산술평균 45가 아닙니다.
  3. 어떤 값이 첫해에 3배가 되고 둘째 해에 3분의 1이 되었을 때, 해마다의 평균 배수
    기하평균입니다. 3×13=1=1\sqrt{3\times\dfrac13}=\sqrt{1}=1 이므로 해마다 1배, 즉 제자리입니다.

연습 2 — 분산과 사분위수

  1. 자료 1, 3, 5, 7, 91,\ 3,\ 5,\ 7,\ 9 의 평균, 분산, 표준편차
    합이 25이므로 평균은 5입니다. 편차가 −4,−2,0,2,4-4,-2,0,2,4 이고 제곱합이 16+4+0+4+16=4016+4+0+4+16=40 이므로 분산은 405=8\dfrac{40}{5}=8, 표준편차는 8≈2.83\sqrt8\approx2.83 입니다.
  2. 자료 2, 3, 5, 6, 8, 9, 11, 142,\ 3,\ 5,\ 6,\ 8,\ 9,\ 11,\ 14 의 Q1Q_1, 중앙값, Q3Q_3, IQR
    여덟 개이므로 중앙값은 6+82=7\dfrac{6+8}{2}=7 입니다. 아래 넷 2,3,5,62,3,5,6 에서 Q1=3+52=4Q_1=\dfrac{3+5}{2}=4, 위 넷 8,9,11,148,9,11,14 에서 Q3=9+112=10Q_3=\dfrac{9+11}{2}=10 이고 IQR은 6입니다.
  3. 그 자료에서 1.5배 규칙으로 이상치 경계 두 개를 구하고, 걸리는 값이 있는지
    4−1.5×6=−54-1.5\times6=-5 와 10+1.5×6=1910+1.5\times6=19 입니다. 자료의 최솟값 2와 최댓값 14가 모두 그 사이이므로 이상치는 없습니다.

연습 3 — 확률변수의 분산

Var⁡(X)=E[X2]−μ2\operatorname{Var}(X)=E[X^2]-\mu^2 을 씁니다.

  1. 주사위 하나의 눈 XX 의 분산과 표준편차
    μ=3.5\mu=3.5 이고 E[X2]=1+4+9+16+25+366=916≈15.17E[X^2]=\dfrac{1+4+9+16+25+36}{6}=\dfrac{91}{6}\approx15.17 입니다. 분산은 15.17−12.25=2.9215.17-12.25=2.92, 표준편차는 약 1.71입니다.
  2. XX 가 0일 확률이 0.5, 10일 확률이 0.5일 때의 평균과 분산과 표준편차
    μ=0×0.5+10×0.5=5\mu = 0\times0.5+10\times0.5=5 이고 E[X2]=0×0.5+100×0.5=50E[X^2]=0\times0.5+100\times0.5=50 입니다. 분산은 50−25=2550-25=25, 표준편차는 5입니다.
  3. 자료 10, 20, 3010,\ 20,\ 30 에 각각 5를 더하면 평균과 분산이 각각 어떻게 되는지
    평균은 20에서 25로 5만큼 올라갑니다. 편차는 −10,0,10-10,0,10 으로 그대로이므로 분산은 2003≈66.7\dfrac{200}{3}\approx66.7 로 변하지 않습니다. 모두를 같은 만큼 옮기면 흩어진 정도는 그대로입니다.

정리

  • 산술평균은 더해서 나눈 것, 가중평균은 중요한 정도를 곱해 더한 것입니다. 곱으로 쌓이는 배수는 기하평균, 같은 거리를 다른 속도로 갈 때는 조화평균을 씁니다. 셋 사이에는 조화 ≤ 기하 ≤ 산술이 성립하고, 오른쪽 부등호가 17번 글의 a+b≥2aba+b\ge2\sqrt{ab} 입니다.
  • 중앙값은 한가운데 값, 최빈값은 가장 자주 나오는 값입니다. 큰 값 하나가 들어오면 평균은 9에서 16으로 밀리는데 중앙값은 9에서 10으로 그칩니다 — 꼬리가 긴 자료에서는 중앙값을 함께 적습니다.
  • 편차의 제곱합을 개수로 나눈 것이 분산, 그 제곱근이 표준편차입니다. 편차를 그냥 더하면 언제나 0이라 제곱합니다.
  • 같은 식을 확률변수에 쓰면 Var⁡(X)=E[(X−μ)2]=E[X2]−μ2\operatorname{Var}(X)=E[(X-\mu)^2]=E[X^2]-\mu^2 입니다. 자료의 분산과 확률변수의 분산은 같은 식을 다른 대상에 쓴 것입니다.
  • 사분위수는 순서로 넷을 가르는 세 지점이고 Q3−Q1Q_3-Q_1 이 IQR, 그것을 그린 것이 상자그림입니다. 이상치를 정하는 1.5배 규칙에 특별한 근거는 없으므로 어느 규칙을 썼는지 밝혀야 합니다.
  • 히스토그램은 칸을 어떻게 나누느냐가 그림을 통째로 바꿉니다. 축을 바꿔도 마찬가지입니다. 자료가 아니라 그리는 사람이 정하는 것이므로, 결론을 내리기 전에 칸을 바꿔 보고도 그 결론이 남는지 봅니다.

여기까지가 손에 든 자료를 있는 그대로 요약하는 일이었습니다. 다음 글은 한 걸음 더 나갑니다 — 요약한 값이 우연히 그렇게 나온 것인지 아닌지를 어떻게 따지는지 봅니다.


읽어주셔서 감사합니다. 😊

LATEST

수학의 최신 글

수학2026.09.07

양자화 오차: 격자 사상, 오차 분산, 이상치 채널

실수를 2^b개 격자에 사상할 때 오차의 분산이 왜 Δ²/12인지 유도하고, 그것이 비트당 6.02dB라는 SNR로 번역되는 과정을 실측과 대조했습니다. 이상치 하나가 나머지 값의 유효 비트를 어떻게 먹는지, 그리고 int4에서 성능이 무너지는 지점을 오차 예산으로 미리 계산하는 법까지.

중급18 MIN
수학2026.09.07

수치적으로 안정한 계산 패턴 모음

최댓값 빼기, 로그 공간, log1p·expm1, 분산의 두 공식, 정규화의 ε, fp32 누산, 역행렬 대신 solve — 프레임워크가 몰래 해 주는 일곱 가지를 하나씩 꺼내 각각 어떤 고장을 막는지 직접 재 봤습니다. 수식을 그대로 옮긴 코드가 왜 라이브러리보다 나쁜지에 대한 목록입니다.

중급22 MIN
수학2026.09.07

부동소수점은 어디서 새는가: 반올림, 상쇄, 더하는 순서

0.1 + 0.2가 0.3이 아닌 이유부터 시작해 머신 엡실론을 유도하고, 같은 16비트인데 fp16과 bf16이 서로 다른 지점에서 터지는 이유, 비슷한 수를 뺄 때 유효자리가 사라지는 파괴적 상쇄, 그리고 1,000만 개를 순서만 바꿔 더했을 때 오차가 백만 배 갈리는 실험까지 직접 재 봤습니다.

중급23 MIN