기술 노트

생성형 AI 답변 품질 평가, 감이 아니라 숫자로 재는 법

생성형 AI 답변 품질 평가는 평가용 질문 세트, 나눠서 채점하는 기준, 바뀔 때마다 다시 재는 습관 세 가지로 시작합니다. 할루시네이션을 줄이는 방법과 보고하기 좋은 숫자까지 정리했습니다.

정밀 저울 양쪽에 반투명 판과 파란 추가 놓여 수평을 이룬 오브제
이 글의 목차
  1. 평가용 질문 세트부터 만듭니다
  2. 좋은 답을 기준별로 나눠 채점합니다
  3. 할루시네이션은 어디서 생기고 어떻게 줄이나
  4. 채점은 사람과 AI가 나눠 맡습니다
  5. 보고하기 좋은 숫자로 정리합니다
  6. 바꿀 때마다 같은 세트로 다시 잽니다
  7. 처음 2주는 이렇게 시작합니다
  8. 다음 단계

사내 문서 챗봇을 연 지 한 달이 지났습니다. 회의에서 임원이 묻습니다. "그래서 정확도가 몇 퍼센트야?" 몇 번 써 보니 대체로 맞고 가끔 틀린다는 것 말고는 할 말이 없습니다. 어떤 질문에서 틀리는지, 지난달보다 나아졌는지도 모릅니다.

생성형 AI의 답변 품질은 생각보다 어렵지 않게 숫자로 잴 수 있습니다. 이 글에서는 평가용 질문 세트를 만드는 법, 기준을 나눠 채점하는 법, AI에게 채점을 맡길 때 주의할 점, 할루시네이션을 줄이는 방법, 그리고 보고하기 좋은 숫자로 정리하는 법까지 순서대로 다룹니다.

평가용 질문 세트부터 만듭니다

평가의 출발점은 실제 사용자가 할 법한 질문 모음입니다. 처음부터 수천 개가 필요하지 않습니다. 50개에서 100개 정도면 큰 흐름을 보기에 충분하고, 사용 기록이 쌓이면서 늘려 가면 됩니다.

질문 종류 비중(예시) 어디서 가져오나 확인하는 것
자주 묻는 질문 50% 상담 기록, 사내 게시판, 담당자 메일 기본기
까다로운 질문 25% 문서 두 개를 함께 봐야 답할 수 있는 질문 근거를 엮는 힘
최근 바뀐 내용 15% 올해 개정된 규정, 새 제품 정보 옛 문서와 헷갈리지 않는지
답이 없는 질문 10% 문서에 근거가 없는 질문을 일부러 넣음 지어내지 않고 모른다고 하는지

질문마다 담당 부서가 모범 답안, 또는 답에 꼭 들어가야 할 내용을 적어 둡니다. 이 작업이 평가 전체에서 가장 손이 많이 가지만, 한 번 만들어 두면 이후 모든 판단의 기준이 됩니다. 사내 문서 검색 챗봇이라면 질문마다 근거가 되는 문서와 위치까지 적어 두면 좋습니다.

좋은 답을 기준별로 나눠 채점합니다

"좋은 답인가"를 한 번에 점수로 매기면 채점하는 사람마다 결과가 달라집니다. 기준을 나눠서 따로 채점하면 훨씬 일관됩니다.

기준 확인할 것 채점 방식
정확성 사실과 다른 내용이 없는가 맞음 / 일부 틀림 / 틀림
근거 충실도 답의 내용이 건넨 문서 안에 실제로 있는가 문장마다 근거 확인
완결성 꼭 들어가야 할 내용을 빠뜨리지 않았는가 필수 항목 중 몇 개 포함
거절 근거가 없을 때 모른다고 답하는가 예 / 아니오
형식 정해진 말투와 양식을 지켰는가 예 / 아니오

사내 문서를 찾아 답하는 RAG 방식이라면 검색 단계도 따로 재야 합니다. 답이 틀린 원인이 언어 모델이 아니라 엉뚱한 문서를 찾아온 데 있는 경우가 많기 때문입니다. 공개된 평가 도구인 Ragas는 이를 근거 충실도(faithfulness), 답변 관련성, 찾아온 문서의 정밀도(context precision)와 재현율(context recall) 같은 지표로 나눠 봅니다. 이름은 달라도 핵심은 같습니다. 검색이 맞았는지, 답이 근거에 충실한지를 따로 본다는 것입니다.

할루시네이션은 어디서 생기고 어떻게 줄이나

그럴듯하지만 틀린 답, 이른바 할루시네이션은 대개 세 곳에서 생깁니다. 필요한 문서를 못 찾았는데 답을 지어내는 경우, 찾은 문서를 잘못 읽고 섞는 경우, 질문 자체가 모호한 경우입니다. 줄이는 방법도 원인을 따라갑니다.

할루시네이션을 줄이는 기본 설정

  • 근거 문서에 없는 내용은 답하지 말고 모른다고 하라고 지시한다
  • 답변에 근거 문서와 그 위치를 함께 보여 준다
  • 옛 버전 문서는 검색 대상에서 빼거나 최신본을 먼저 보게 한다
  • 문서를 나누는 단위를 문서 종류(규정, 매뉴얼, 회의록)에 맞게 다르게 둔다
  • 질문이 모호하면 되묻도록 한다

특히 '모른다고 답하기'는 평가 세트의 '답이 없는 질문'으로 꼭 재야 합니다. 이 항목 점수가 낮으면 사용자는 틀린 답과 맞는 답을 구분할 방법이 없습니다. 검색 단계를 어떻게 설계하는지는 RAG 구축 가이드에서 더 자세히 다룹니다.

채점은 사람과 AI가 나눠 맡습니다

질문이 수백 개로 늘어나면 사람이 매번 다 채점하기 어렵습니다. 그래서 다른 언어 모델에게 채점을 맡기는 방식(LLM as a judge)이 널리 쓰입니다. 다만 이 방식에도 버릇이 있습니다. 관련 연구에 따르면 AI 채점자는 먼저 제시된 답을 더 좋게 보거나, 더 긴 답을 더 좋게 보거나, 자신이 만든 답을 후하게 보는 경향을 보였습니다.

그래서 이렇게 나눕니다.

  • 형식, 거절 여부, 필수 항목 포함처럼 기준이 분명한 항목은 AI에게 맡깁니다.
  • 정확성처럼 판단이 필요한 항목은 일부 표본을 사람이 함께 채점하고, 사람과 AI 채점이 얼마나 일치하는지 확인합니다.
  • 일치율이 낮은 항목은 채점 기준 설명을 고치거나 사람 채점으로 돌립니다.

자동 채점은 사람의 판단을 대신하는 장치가 아니라, 사람이 꼭 봐야 할 답을 골라 주는 장치로 쓰는 편이 안전합니다.

보고하기 좋은 숫자로 정리합니다

평가 결과는 버전마다 같은 질문 세트로 잰 점수를 나란히 두면 가장 잘 읽힙니다.

버전별 '맞음' 비율 단위: %

예시 수치입니다. 같은 평가 세트 80문항으로 버전마다 다시 잰 결과를 이렇게 보고합니다.

버전별 '맞음' 비율
처음 연 버전62%
1차 개선71%
2차 개선76%
3차 개선84%

여기에 질문 종류별 점수를 함께 보여 주면 다음에 무엇을 고칠지가 보입니다. 예를 들어 '최근 바뀐 내용' 점수만 낮다면 모델보다 문서 관리와 검색 대상을 손봐야 한다는 뜻입니다.

바꿀 때마다 같은 세트로 다시 잽니다

생성형 AI 시스템은 자주 바뀝니다. 모델을 바꾸고, 지시문을 고치고, 문서를 새로 넣습니다. 한 곳을 고쳐 어떤 질문이 좋아지면 다른 질문이 나빠지는 일도 흔합니다. 평가는 한 번 하고 끝내는 행사가 아니라, 무언가를 바꿀 때마다 같은 세트로 다시 재는 절차여야 합니다.

출시 뒤에는 실제 사용 기록도 함께 봅니다. 사용자가 누른 좋아요와 싫어요, 같은 질문을 바로 다시 묻는 경우, 근거 문서를 열어 본 비율이 좋은 신호입니다. 여기서 발견한 까다로운 질문을 평가 세트에 더하면 평가 기준이 점점 실제 업무에 가까워집니다.

처음 2주는 이렇게 시작합니다

평가 체계를 처음 만드는 팀이라면 거창하게 시작할 필요가 없습니다. 2주면 첫 숫자를 낼 수 있습니다.

  1. 1주차 앞부분. 업무 담당자와 함께 질문 50개를 모읍니다. 자주 묻는 질문을 먼저 채우고, 까다로운 질문과 답이 없는 질문을 일부러 섞습니다.
  2. 1주차 뒷부분. 질문마다 모범 답안이나 꼭 들어가야 할 내용을 적고, 근거 문서 위치를 표시합니다.
  3. 2주차 앞부분. 지금 운영 중인 챗봇에 질문을 그대로 넣고, 기준별로 사람이 직접 채점합니다. 이 숫자가 기준선입니다.
  4. 2주차 뒷부분. 틀린 질문을 원인별(검색 실패, 근거 오독, 질문 모호)로 나눠 보고, 가장 많은 원인 하나부터 고칩니다.

이렇게 만든 기준선이 있으면 이후의 모든 개선을 같은 잣대로 비교할 수 있습니다. 질문 세트는 엑셀 한 장으로 시작해도 충분합니다. 다만 고칠 때마다 날짜와 함께 사본을 남겨, 어떤 세트로 잰 점수인지 헷갈리지 않게 합니다.

자주 묻는 질문

평가용 질문은 몇 개가 적당한가요?

처음에는 50개에서 100개면 큰 흐름을 보기에 충분합니다. 질문 종류(자주 묻는 질문, 까다로운 질문, 최근 바뀐 내용, 답이 없는 질문)를 고르게 섞는 것이 개수보다 중요합니다.

정확도 몇 퍼센트면 출시해도 되나요?

업무에 따라 다릅니다. 틀린 답의 피해가 큰 업무일수록 기준을 높이고, 근거 표시와 모른다고 답하기가 제대로 되는지를 함께 봐야 합니다. 출시 기준은 시작 전에 업무 담당자와 숫자로 합의해 두는 것이 좋습니다.

AI에게 채점을 맡겨도 믿을 수 있나요?

기준이 분명한 항목은 대체로 쓸 만하지만, 긴 답을 후하게 보는 것 같은 버릇이 알려져 있습니다. 일부 표본은 사람이 함께 채점해 일치하는지 확인해야 합니다.

할루시네이션을 완전히 없앨 수 있나요?

완전히 없애기는 어렵습니다. 대신 근거가 없으면 모른다고 답하게 하고, 답마다 출처를 보여 주면 사용자가 틀린 답을 알아챌 수 있어 피해를 크게 줄일 수 있습니다.

다음 단계

품질을 재는 방법이 정해져 있으면 확대할지 결정하기도, 문제를 고치기도 쉬워집니다. 아직 시범 단계라면 성공 기준을 숫자로 정하는 일부터 시작해 보세요. 그 과정은 기업 AI 도입 방법에서, 사내 챗봇을 평가 체계와 함께 구축하는 방법은 AI 솔루션 소개에서 이어서 볼 수 있습니다.

공유 LinkedIn Facebook X

이 주제로 이야기를나눠 보고 싶으신가요

회사의 업무와 데이터에 맞춰 무엇부터 하면 좋을지 함께 살펴봅니다.