LLM Evals에 대해 알아야 할 모든 것

2 hours ago 1

700명 넘는 엔지니어와 PM에게 AI 평가를 가르쳐 온 Hamel Husain 팀이 강의에서 반복해서 받은 질문들을 모아 정리한 FAQ 문서 (2026년 7월에도 갱신 중)

무엇에 대한 문서인가

  • "AI 응답이 좋은지 나쁜지 어떻게 확인하나"에 대한 실무 답변 모음. 벤치마크 점수 얘기가 아니라, 내 제품이 내 사용자에게 내보내는 답을 검사하는 방법

어디서 시작하나

  • 평가 도구부터 사지 말고, 실제 사용 기록 20~50개를 사람이 직접 읽는 것부터 시작하라. 읽으면서 뭐가 잘못됐는지 손으로 적고, 비슷한 실패끼리 묶으면 그게 곧 평가 항목이 된다 (이 과정을 에러 분석이라고 부름)
  • 저자들 경험상 실제 프로젝트에서는 개발 시간의 60~80%가 여기에 들어간다

채점은 어떻게

  • 1~5점이 아니라 통과/실패 둘 중 하나로만 매겨라. 3점과 4점의 차이를 말로 정의할 수 없어서 채점자마다 점수가 달라지기 때문
  • 실패를 발견할 때마다 자동 채점기를 만들지는 마라. 프롬프트를 고치면 없어지는 실패는 그냥 고치고, 계속 반복되는 실패에만 채점기를 투자하라

데이터와 사람

  • 테스트 데이터를 AI로 만들 때 "테스트 질문 만들어줘"라고만 하면 뻔한 것만 나온다. 조건(사용자 유형·요청 종류·난이도)을 먼저 정하고 조합해서 시켜라
  • 채점 기준을 정하는 사람은 그 업무를 아는 전문가 1명이 제일 좋다. 외주는 대체로 실수 — 실패를 직접 보면서 배우는 과정이 끊긴다

그 외 자주 나오는 질문

  • "RAG는 죽었나" → 아니다. 죽었다는 건 특정 검색 방식(벡터 검색) 얘기고, 검색으로 자료를 찾아 답하게 하는 방식 자체는 여전히 필요하다
  • 모델을 바꾸면 좋아질 거라는 기대는 대체로 과대평가다. 바꾸기 전에 실패 기록을 읽고 모델이 진짜 원인인지 확인부터
  • 검토용 화면을 몇 시간 들여 직접 만들면 검토 속도가 10배쯤 빨라진다. 저자들이 꼽는 가장 수익 좋은 투자
Read Entire Article