완벽한 벤치마크를 기다리지 않고 30개의 질문으로 개선 루프를 시작합니다.
핵심 요약
- 대표 실패 사례부터 평가셋에 넣습니다.
- 정답뿐 아니라 반드시 포함할 근거를 기록합니다.
- 평가셋은 제품 변화와 함께 계속 갱신해야 합니다.
평가셋의 목적 정하기
평가셋은 모델의 일반 지식을 측정하는 시험지가 아니라 우리 시스템의 변화를 비교하는 기준입니다. 사용자가 실제로 묻는 질문과 현재 자주 실패하는 질문을 우선합니다.
한 행에 담을 정보
질문, 관련 문서, 기대 답변, 허용 가능한 표현 차이, 실패 유형을 함께 저장합니다. 근거가 여러 문서에 흩어진 질문과 답이 없는 질문도 포함해야 합니다.
- 질문과 질문 유형
- 근거 문서 ID
- 필수 사실과 금지할 추론
- 난이도와 실패 메모
작게 시작하고 버전 관리하기
처음부터 수백 개를 만들기보다 서로 다른 유형의 질문 30개로 시작해도 됩니다. 시스템 변경으로 새 실패가 발견될 때마다 사례를 추가하고, 평가 결과와 함께 버전을 기록합니다.

