코딩 에이전트 하네스 설계에 관한 실증 연구

1 week ago 21

동일한 실행 루프에서 계획 수립, 행동 인터페이스, 컨텍스트 관리를 바꿔 4개 모델과 2개 벤치마크의 176개 설정을 비교했으며, 각 구성요소의 효과는 모델 역량과 작업 유형, 컨텍스트 예산에 따라 달라짐 컨텍스트 관리의 주된 효과는 컨텍스트 초과로 인한 조기 종료를 막는 데 있으며, SWE-Bench Verified의 평균 성공률 이득은 32k에서 35.7%p였지만 128k에서는 2.7%p로 줄어듦 오래된 도구 출력을 먼저 생략하고 필요할 때 LLM으로 요약하는 T4 단계형 정책이 관리 전략 중 전반적으로 가장 좋은 비용 효율을 보였으며, 생략한 내용의 복구 기능은 거의 쓰이지 않고 일관된 정확도 향상도 없었음 명시적 계획 유지는 약한 모델에서는 비용을 더 쓰면서 성공률을 높였고, 강한 모델에서는 성공률이 소폭 낮아지는 대신 주로 수정 후 검증을 줄여 비용을 절감함 사전 정의 도구와 bash 전용 인터페이스의 우열은 셸 활용 능력과 작업 유형에 달려 있으며, 도구는 bash 활용이 약한 모델을 보완하지만 bash에 능숙한 모델은 여러 작업을 한 번의 호출에 묶어 비용을 크게 줄일 수 있음 하네스 전체가 아닌 구성요소를 비교하는 이유 코딩 하네스(harness) 는 모델의 역량을 장기 소프트웨어 엔지니어링 작업의 성과로 연결하는 소프트웨어 계층임 계획은 작업 진행 상태를 유지하고, 행동 인터페이스는 모델의 의도를 실행 가능한 작업으로 바꾸며, 컨텍스트 관리는 유한한 창에 남길 상호작용 이력을 결정함 모델을 고정해도 하네스를 바꾸면 성능이 크게 달라질 수 있음 기존의 완성형 하네스 비교만으로는 성능 차이가 계획, 도구 설계, 컨텍스트 관리 또는 모델과의 상호작용 중 어디에서 비롯되는지 분리하기 어려움 선행 비교에서는 Claude-Opus-4.5가 OpenHands에서, Claude-Sonnet-4.5가 SWE-Agent에서 가장 좋은 성능을 보여 모델별 하네스 선호가 달랐음 실험은 ReAct 실행 루프의 추론, 행동, 관찰 구조를 고정하고 세 구성요소만 변경함 권한 처리, 수정 후 진단, 반복 실패 감지 등은 공통 실행 기반으로 유지함 모델은 영구적인 최적화 대상이 아니라 역량과 상호작용 방식의 차이를 살피는 실험 대상으로 사용함 계획과 행동 인터페이스의 구현 및 비교 범위 계획 수립을 켜면 시스템 지침과 첫 턴 알림이 초기 계획을 요청하고, 모델은 update_plan으로 계획을 갱신함 계획은 대화 이력과 별도...

Read Entire Article