GCP ML Engineer 시험 노트개념 정리14 MIN
예측 모델 지표와 LLM-as-a-judge
정밀도·재현율·F1과 혼동 행렬, 임계값 조정, ROC AUC와 PR AUC, RMSE·MAE·MAPE를 직접 계산해 보고, 생성형 AI를 포인트와이즈·페어와이즈 LLM 심판으로 평가하는 법과 지표 고르기를 봅니다.
모델을 팀이 함께 관리하려면 「좋아졌다」를 같은 숫자로 말해야 합니다. 이번 노트는 시험 가이드가 협업 섹션에 함께 묶어 둔 평가 지표를 봅니다. 분류·회귀처럼 정답이 하나인 예측 모델의 지표와, 정답이 여럿일 수 있는 생성형 AI를 평가하는 방법이 두 축입니다. 시험은 지표의 정의를 묻기보다 「이 업무 조건에서 어느 지표를 봐야 하나」를 묻고, 간단한 계산을 하나씩 섞습니다.
혼동 행렬
네 칸
이진 분류 모델의 예측을 실제 정답과 맞대 네 칸으로 센 표가 혼동 행렬입니다. 양성을 양성으로 맞힌 것이 TP, 음성을 양성으로 잘못 짚은 것이 FP, 양성을 놓친 것이 FN, 음성을 음성으로 맞힌 것이 TN입니다. 아래 지표는 전부 이 네 칸으로 계산합니다.
사기 거래 탐지 모델이 거래 1,000건을 이렇게 판정했다고 합시다.
| 예측 사기 | 예측 정상 | |
|---|---|---|
| 실제 사기 | TP 40 | FN 20 |
| 실제 정상 | FP 10 | TN 930 |
정확도는 맞힌 비율이라 입니다. 97%면 좋아 보이지만, 모든 거래를 정상이라고만 답하는 모델도 가 나옵니다. 양성이 드문 문제에서 정확도가 쓸모없는 이유가 이것입니다.
임계값
모델은 대개 0과 1 사이 점수를 내고, 그 점수가 임계값을 넘으면 양성으로 판정합니다. 임계값은 학습이 정하는 값이 아니라 사람이 업무 비용을 보고 정하는 값입니다. 임계값을 올리면 확신이 큰 것만 양성이 되어 FP가 줄고 FN이 늘며, 내리면 반대입니다. 「모델을 다시 학습하지 않고 놓치는 사기를 줄여라」의 답이 임계값을 내리는 것입니다.
분류 지표
정밀도와 재현율
정밀도는 양성이라고 답한 것 중 실제 양성의 비율이고, 재현율은 실제 양성 중 모델이 잡아낸 비율입니다. 위 표로 계산하면 이렇습니다.
둘은 임계값을 사이에 두고 줄다리기를 합니다. 어느 쪽을 지킬지는 틀렸을 때의 비용이 정합니다.
| 업무 | 더 비싼 실수 | 지킬 지표 |
|---|---|---|
| 암 선별 검사 | 환자를 놓치는 것(FN) | 재현율 |
| 사기 탐지 후 계좌 정지 | 정상 고객을 막는 것(FP) | 정밀도 |
| 스팸 필터 | 중요한 메일을 버리는 것(FP) | 정밀도 |
| 결함 부품 검사 | 불량을 내보내는 것(FN) | 재현율 |
F1
F1은 정밀도와 재현율의 조화평균입니다. 둘 중 하나만 높으면 낮게 나오므로 한 숫자로 균형을 볼 때 씁니다.
산술평균이면 0.733이지만 조화평균은 작은 쪽으로 끌려갑니다. 정밀도 1.0에 재현율 0.01인 모델은 산술평균이 0.5를 넘어도 F1은 0.02 남짓입니다.
곡선 아래 넓이
ROC AUC
임계값을 0에서 1까지 옮기면서 혼동 행렬을 다시 세면 곡선이 하나 그려집니다. 가로축에 거짓 양성 비율, 세로축에 재현율을 두면 ROC 곡선이고, 그 아래 넓이가 ROC AUC입니다. 임의로 고른 양성 하나가 음성 하나보다 높은 점수를 받을 확률로 읽을 수 있어서, 임계값을 아직 정하지 않았을 때 모델끼리 순위를 매기는 데 씁니다. 0.5는 동전 던지기 수준입니다.
PR AUC
양성이 1%도 안 되는 문제에서는 TN이 거대해 거짓 양성 비율이 늘 작게 나오고, 그래서 ROC AUC가 실제보다 좋아 보입니다. 가로축을 재현율, 세로축을 정밀도로 바꾼 PR 곡선은 TN을 쓰지 않으므로 드문 양성을 얼마나 잘 잡는지가 그대로 드러납니다. 「클래스가 심하게 불균형하다」는 조건이 붙으면 답은 PR AUC입니다.
BigQuery ML로 만든 분류 모델이면 같은 값을 SQL로 꺼냅니다. ML.EVALUATE가 정밀도·재현율·F1·ROC AUC를 한 줄로 내고, ML.ROC_CURVE가 임계값별 값을 줄줄이 내줘 임계값을 고를 때 씁니다.
SELECT * FROM ML.EVALUATE(MODEL `proj.fraud.model`, TABLE `proj.fraud.test`, STRUCT(0.3 AS threshold));
SELECT threshold, recall, false_positive_rate FROM ML.ROC_CURVE(MODEL `proj.fraud.model`);
회귀 지표
MAE와 RMSE
예측값이 숫자이면 오차의 크기를 잽니다. 실제 판매량이 100, 200, 50이고 예측이 110, 180, 60이면 오차는 10, −20, 10입니다.
MAE는 오차의 절댓값 평균이고, RMSE는 오차를 제곱해 평균한 뒤 제곱근을 씌운 값입니다. 제곱이 큰 오차를 더 크게 키우므로 RMSE는 언제나 MAE 이상이고, 둘의 차이가 크면 큰 오차가 몇 개 섞여 있다는 뜻입니다. 큰 실수 한 번이 치명적인 업무면 RMSE를, 이상치에 휘둘리지 않는 평균적인 오차를 보려면 MAE를 씁니다.
MAPE
MAPE는 오차를 실제값으로 나눈 비율의 평균입니다.
단위가 없는 백분율이라 매장마다 규모가 다른 예측을 한 줄에 놓고 비교할 때 편합니다. 다만 실제값이 0이거나 0에 가까운 행이 있으면 나눗셈이 터지므로, 판매가 0인 날이 많은 상품에는 쓰지 않습니다.
생성형 AI 평가
LLM-as-a-judge
요약이나 답변처럼 정답이 여러 모양일 수 있는 출력은 혼동 행렬로 셀 수 없습니다. 그래서 다른 LLM에게 채점 기준을 주고 점수를 매기게 하는데, 이것을 LLM-as-a-judge라 부릅니다. 방식이 둘입니다.
| 포인트와이즈 | 페어와이즈 | |
|---|---|---|
| 보는 것 | 응답 하나 | 응답 둘을 나란히 |
| 결과 | 기준별 점수(예: 1~5) | 어느 쪽이 나은가, 승률 |
| 맞는 자리 | 절대 품질 감시, 기준 미달 걸러내기 | 프롬프트·모델 교체 전후 비교 |
포인트와이즈는 유창성·근거성 같은 기준마다 응답 하나에 점수를 줍니다. 페어와이즈는 후보 모델과 기준 모델의 응답을 함께 보여 주고 어느 쪽이 나은지 고르게 합니다. 100번 비교해 후보가 58번, 기준이 30번 이기고 12번 비겼다면 후보의 승률은 58%입니다. 「새 프롬프트가 지금 것보다 나은지 판단하라」는 페어와이즈의 자리입니다.
평가 서비스
플랫폼의 생성형 AI 평가 서비스는 데이터셋과 지표 목록을 받아 두 종류를 함께 돌립니다. 정답 문장과 겹치는 정도를 세는 계산 기반 지표와, 심판 모델이 채점하는 모델 기반 지표입니다.
from vertexai.evaluation import EvalTask, MetricPromptTemplateExamples
task = EvalTask(
dataset=eval_df, # prompt, response, reference 열
metrics=["exact_match", "rouge_l_sum", MetricPromptTemplateExamples.Pointwise.FLUENCY],
experiment="summary-eval",
)
result = task.evaluate()
print(result.summary_metrics)
experiment를 넘기면 결과가 08편의 Experiments에 실행으로 남아 팀이 같은 표에서 비교합니다.
지표 고르기
정답이 하나로 정해지는 추출·분류형 출력이면 정확 일치처럼 싼 계산 지표로 충분합니다. 정답 문장이 있지만 표현이 여럿일 수 있는 요약이면 ROUGE 같은 겹침 지표가 기준선이 되고, 정답 문장이 아예 없거나 어조·안전성처럼 겹침으로 못 재는 품질이면 LLM 심판을 씁니다. 심판도 모델이라 실수를 하므로 사람이 매긴 점수 일부와 대조해 심판을 먼저 믿을 만한지 확인하는 것이 순서입니다. 시험에서는 「참조 답이 없다」는 말이 모델 기반 지표를, 「모델 둘 중 고른다」는 말이 페어와이즈를 가리킵니다.
연습 문제
어떤 분류 모델의 결과가 TP 30, FP 20, FN 10, TN 940입니다. 정밀도·재현율·F1은?
정밀도 , 재현율 , F1 입니다.희귀 질환 선별 모델에서 환자를 놓치는 일을 줄이라는 요구가 왔습니다. 모델을 다시 학습할 시간은 없습니다. 알맞은 조치는?
① 임계값을 올린다
② 임계값을 내린다
③ 정확도를 기준으로 모델을 고른다
④ RMSE를 확인한다②. 임계값을 내리면 양성 판정이 늘어 FN이 줄고 재현율이 오릅니다. 대가로 FP가 늘어납니다.양성 비율이 0.3%인 데이터에서 두 모델을 비교하려 합니다. 가장 알맞은 지표는?
① 정확도
② ROC AUC
③ PR AUC
④ MAPE③. TN이 거대하면 ROC AUC가 부풀려집니다. PR AUC는 TN을 쓰지 않아 드문 양성을 잡는 능력이 그대로 드러납니다. ①은 전부 음성이라고만 답해도 99.7%입니다.실제값이 10, 20, 40, 50이고 예측값이 12, 18, 40, 46입니다. MAE·RMSE·MAPE는?
오차는 2, −2, 0, −4입니다. MAE는 , RMSE는 , MAPE는 , 곧 9.5%입니다.같은 수요 예측 모델의 MAE는 5인데 RMSE는 30입니다. 이 차이가 말하는 것은?
① 모델이 모든 행에서 고르게 조금씩 틀린다
② 큰 오차가 소수의 행에 몰려 있다
③ 실제값에 0이 있다
④ 계산이 잘못됐다②. 제곱이 큰 오차를 키우므로 몇 개의 큰 실수가 RMSE를 끌어올립니다. ①이면 두 값이 가깝습니다.고객 상담 요약 모델의 프롬프트를 바꾼 뒤 기존 프롬프트보다 나은지 판단하려 합니다. 참조 요약문은 없습니다. 알맞은 방법은?
① 정확 일치 지표
② 페어와이즈 LLM-as-a-judge로 두 응답을 비교한다
③ ROC AUC
④ MAE②. 참조가 없으니 겹침 지표를 못 쓰고, 두 프롬프트 중 고르는 일이라 나란히 비교하는 방식이 맞습니다.일부 상품은 판매량이 0인 날이 많습니다. 여러 상품의 예측 오차를 비교할 때 피해야 할 지표는?
① MAE
② RMSE
③ MAPE
④ 셋 다 괜찮다③. 실제값으로 나누므로 0인 날에 값이 정의되지 않거나 터집니다.

