RSS

DUOLABS AI 기능 탐구 17: 모델 품질을 반복 측정하는 평가 매트릭스

DUOLABS AI 기능 탐구 열일곱 번째 글은 같은 평가 항목으로 여러 모델의 답변을 만들고 점수와 근거를 비교하는 평가 매트릭스입니다.

모델 데모에서 인상적인 답변 하나를 얻는 것과 실제 서비스 품질을 유지하는 것은 다른 문제입니다. 모델, 프롬프트나 용어집을 바꿀 때 기존에 잘되던 작업이 망가지지 않았는지 같은 기준으로 반복 측정해야 합니다.

기능 직접 보기: DUOLABS AI 평가 매트릭스

이 화면은 평가 데이터와 결과를 방문자가 함께 사용하는 공개 데모입니다. 실제 고객 질문, 내부 정답, 미공개 정책이나 기밀 업무 데이터를 평가 이름과 입력에 사용하지 마세요. 다른 방문자가 평가 결과를 보거나 삭제할 수 있다고 가정해야 합니다.

평가 매트릭스는 모델과 케이스의 교차표입니다

사용자는 비교할 모델을 두 개에서 세 개까지 고릅니다. 시스템은 준비된 모든 평가 케이스를 각 모델에 실행하고, 행에는 케이스를 열에는 모델을 배치합니다.

              모델 A   모델 B   모델 C
정확성 케이스    92       78       85
형식 준수        88       95       74
요약             81       72       90

셀을 선택하면 모델 답변과 평가 근거, 처리 시간을 볼 수 있습니다. 열 평균은 전체 경향을 보여주고 레이더 차트는 모델별로 강한 유형과 약한 유형을 드러냅니다.

하나의 평균 점수만 보면 특정 업무에서 치명적인 약점이 가려질 수 있습니다. 전체 평균과 케이스별 분포를 함께 보는 이유입니다.

한 셀에는 생성과 채점 두 단계가 있습니다

평가 셀 하나는 먼저 대상 모델이 질문에 답하고, 이어서 별도의 LLM 채점자가 기대 요지와 실제 답변을 비교하는 방식으로 실행됩니다. 채점 결과는 0~100 점수, 통과·부분 일치·실패 판정과 한 문장 근거로 구조화됩니다.

모델 열 하나의 모든 셀이 끝나면 토큰, 시간과 채점 단계가 실행 트레이스에 하나의 평가 기록으로 정리됩니다. 셀마다 로그를 남겨 관측 화면을 과도하게 채우지 않으면서 모델별 평가 비용을 추적할 수 있습니다.

LLM 채점도 하나의 모델 판단입니다

LLM 채점은 주관적인 문장 품질을 빠르게 비교하는 데 유용하지만 절대적인 정답은 아닙니다.

  • 채점 모델과 대상 모델의 표현 취향이 비슷할 수 있음
  • 기대 요지가 불완전하면 올바른 답도 낮게 평가될 수 있음
  • 긴 답변이나 특정 위치의 정보에 편향될 수 있음
  • 같은 답변도 채점 실행마다 점수가 달라질 수 있음
  • 사실 검증이 필요한 내용을 그럴듯함으로 판단할 수 있음

중요한 평가는 정확 일치, 스키마 검증, 코드 실행, 검색 근거 확인 같은 결정적 지표와 사람 검토를 함께 사용해야 합니다. LLM 채점은 평가 체계의 한 축이지 유일한 심판이 아닙니다.

좋은 평가셋은 실제 실패를 대표합니다

평가 케이스는 쉬운 예제만 모으면 안 됩니다. 정상 입력과 함께 모호한 표현, 긴 문장, 누락 필드, 잘못된 전제, 공격적 지시와 경계값을 포함해야 합니다.

각 케이스에는 질문뿐 아니라 기대 요지, 필수 사실, 금지 행동과 허용 가능한 표현 차이를 명시하는 것이 좋습니다. 운영 중 발견한 실제 실패는 비식별화한 뒤 회귀 평가에 추가해 같은 문제가 다시 생기지 않게 합니다.

평가셋 자체도 버전으로 관리해야 합니다. 케이스가 바뀐 두 실행의 평균 점수를 그대로 비교하면 모델이 좋아진 것인지 시험이 쉬워진 것인지 알 수 없습니다.

점수보다 배포 기준이 중요합니다

평가를 운영에 연결하려면 “몇 점이면 좋은가”보다 배포를 막을 조건을 정해야 합니다.

  • 전체 평균이 기준 이하로 내려감
  • 개인정보 노출이나 금지 행동 케이스가 한 건이라도 실패함
  • 핵심 업무 케이스가 이전 버전보다 크게 하락함
  • 응답 시간이나 비용이 예산을 초과함
  • 사람 검토 표본에서 오류율이 한도를 넘음

모델·프롬프트 변경 전후 결과를 같은 평가셋으로 비교하고, 실패 셀을 검토한 뒤 단계적으로 배포해야 합니다.

공개 데모의 실행 범위

공개 데모에는 평가 실행을 최대 30개까지 저장할 수 있고, 전체 사용자가 실행하는 평가 셀은 분당 40회로 제한됩니다. 셀 하나마다 답변 생성과 LLM 채점이 이어지므로 모델과 케이스 수가 늘면 호출량도 빠르게 증가합니다.

DUOLABS AI 평가 매트릭스에서는 기존 공개 평가를 먼저 살펴보세요. 새 평가가 필요하다면 두 모델로 작게 시작하고, 결과 셀의 점수뿐 아니라 답변과 채점 근거를 함께 읽어야 합니다.

실서비스 평가는 보호된 데이터셋, 고정된 모델 설정, 반복 실행과 사람 검토를 사용해야 합니다. 측정 조건을 재현할 수 있을 때 점수가 의사결정 자료가 됩니다.

이전 글: DUOLABS AI 기능 탐구 16: AI 실행 과정을 추적하는 실행 트레이스

다음 글: DUOLABS AI 기능 탐구 18: 토큰과 비용을 운영 지표로 바꾸는 사용량 대시보드