700명 넘는 엔지니어와 PM에게 AI 평가를 가르쳐 온 Hamel Husain 팀이 강의에서 반복해서 받은 질문들을 모아 정리한 FAQ 문서 (2026년 7월에도 갱신 중)
무엇에 대한 문서인가
- "AI 응답이 좋은지 나쁜지 어떻게 확인하나"에 대한 실무 답변 모음. 벤치마크 점수 얘기가 아니라, 내 제품이 내 사용자에게 내보내는 답을 검사하는 방법
어디서 시작하나
- 평가 도구부터 사지 말고, 실제 사용 기록 20~50개를 사람이 직접 읽는 것부터 시작하라. 읽으면서 뭐가 잘못됐는지 손으로 적고, 비슷한 실패끼리 묶으면 그게 곧 평가 항목이 된다 (이 과정을 에러 분석이라고 부름)
- 저자들 경험상 실제 프로젝트에서는 개발 시간의 60~80%가 여기에 들어간다
채점은 어떻게
- 1~5점이 아니라 통과/실패 둘 중 하나로만 매겨라. 3점과 4점의 차이를 말로 정의할 수 없어서 채점자마다 점수가 달라지기 때문
- 실패를 발견할 때마다 자동 채점기를 만들지는 마라. 프롬프트를 고치면 없어지는 실패는 그냥 고치고, 계속 반복되는 실패에만 채점기를 투자하라
데이터와 사람
- 테스트 데이터를 AI로 만들 때 "테스트 질문 만들어줘"라고만 하면 뻔한 것만 나온다. 조건(사용자 유형·요청 종류·난이도)을 먼저 정하고 조합해서 시켜라
- 채점 기준을 정하는 사람은 그 업무를 아는 전문가 1명이 제일 좋다. 외주는 대체로 실수 — 실패를 직접 보면서 배우는 과정이 끊긴다
그 외 자주 나오는 질문
- "RAG는 죽었나" → 아니다. 죽었다는 건 특정 검색 방식(벡터 검색) 얘기고, 검색으로 자료를 찾아 답하게 하는 방식 자체는 여전히 필요하다
- 모델을 바꾸면 좋아질 거라는 기대는 대체로 과대평가다. 바꾸기 전에 실패 기록을 읽고 모델이 진짜 원인인지 확인부터
- 검토용 화면을 몇 시간 들여 직접 만들면 검토 속도가 10배쯤 빨라진다. 저자들이 꼽는 가장 수익 좋은 투자

3 weeks ago
31

![“창원 더위가 그대로 서울로…” 3연속경기 폭염취소 경험한 NC 불펜투수 김진호도 혀를 내둘렀다 [SD 잠실 리포트]](https://dimg.donga.com/wps/SPORTS/IMAGE/2026/08/04/134419674.1.jpg)
![임영웅, '차줌마' 차승원표 음식에 완밥.."최애 음식 바뀌었어"[산골총각 영웅][별별 TV]](https://image.starnewskorea.com/21/2026/08/2026080421455216993_1.jpg)
![[TODAY엔비디아]다음주 실적 발표 앞둔 기대감…UBS "예상치 상회"](https://image.edaily.co.kr/images/content/defaultimg.jpg)





![“민주 전대서 남은 건 박쥐, 볼콕, 신천지뿐…비전 없이 네거티브만”[정치를 부탁해]](https://dimg.donga.com/wps/NEWS/IMAGE/2026/08/05/134424747.1.jpg)

English (US) ·