HarnessTax: 코딩 에이전트에서 하네스는 얼마나 중요할까?

13 hours ago 4

7개 모델을 Claude Code, Codex CLI, Pi에 연결해 비교한 결과, 같은 모델이 비슷한 작업 성공률을 내면서도 토큰 비용은 최대 5배 차이가 났음 읽기, 쓰기, 편집, bash만 제공하는 단순한 하네스 Pi도 비용 대비 성공률에서 경쟁력을 보였으며, SWE-bench Lite에서 Claude Code는 공통 모델 기준 평균 약 2배 비쌌음 Claude Code의 첫 호출에 들어가는 초기 컨텍스트는 Pi의 10배 이상이었음. 긴 지침과 도구 설명이 비용을 늘릴 수 있지만, 총비용에는 캐싱과 출력량, 이후 호출도 영향을 줌 Anthropic과 OpenAI 모델의 12개 비교 중 9개에서 다른 공급사의 하네스가 가장 높은 관측 성공률을 기록해, 모델과 하네스를 같은 회사 제품으로 맞춘다고 최적 조합이 보장되지는 않았음 공개 벤치마크 2개에서 각각 30개 작업을 평가한 결과로, 사용자 피드백과 여러 세션이 이어지는 실제 개발에서도 같은 결과가 나온다는 뜻은 아님 연구 질문과 평가 범위 하네스(harness) 는 모델의 도구, 문맥, 작업 실행을 관리하는 소프트웨어 시스템으로, 코딩 에이전트 선택은 모델뿐 아니라 하네스까지 선택하는 일임 수백만 명이 코딩 에이전트를 사용하는 상황에서, 동일 모델에 다른 하네스를 연결하면 더 많은 작업을 해결하거나 비용을 줄일 수 있는지 평가함 모델 7개와 Claude Code, Codex CLI, Pi를 조합한 21개 구성을 다음 두 벤치마크에서 비교함 SWE-bench Lite Terminal-Bench 2.0 각 벤치마크에서 무작위로 뽑은 동일한 30개 작업을 사용하고, 조합별로 작업당 3회 실행해 시도 간 변동을 측정함 연구팀은 프로파일링 실행 추적을 공개할 예정임 실행 조건과 측정 방법 각 하네스의 기본 구성에서 시작해 추론 노력 수준을 높음으로 설정하고, 장기 실행 비용을 통제하기 위해 시도당 에이전트 턴을 100회로 제한함 턴 수와 추론 노력 설정은 각 하네스 자체 정의를 따르므로 완전히 동일한 단위는 아님 작업 성공 여부는 벤치마크의 공식 평가기로 판정함 비용과 성공률은 작업별 3회 시도의 평균을 구한 뒤, 30개 작업 전체 평균을 계산함 작업별 평균 30개를 복원 추출하는 부트스트랩을 10,000회 수행해 95% 신뢰구간을 추정함 토큰 비용은 2026년 9월 1일 기준 직접 API 가격표로 계산하고, 같은 모델에는 하네스와 무관하게 동일한 가격을 적용함 S...

Read Entire Article