Real-SWE: 비공개 실무 기업 코드베이스에서 AI 모델을 평가하는 벤치마크

2 hours ago 2

Real-SWE는 실제 기업에서 사용 허가를 받은 비공개 프로덕션 코드베이스와 업무를 바탕으로, 코딩 에이전트가 소프트웨어 엔지니어의 실무를 수행할 수 있는지 평가함 모델 단독이 아니라 모델과 기본 하네스의 조합을 평가하며, 과제마다 8회 독립 실행한 평균 해결률은 Fable 5.1이 38.8%로 가장 높고 GPT-6 Astra가 33.8%로 뒤를 이음 과제는 짧은 지시에서 기업별 업무 규칙과 기존 구현을 찾아내는 능력을 요구함. 지시문 길이 중앙값은 1,742자지만 참조 솔루션이 수정한 파일 수 중앙값은 11개임 분석한 10개 과제 중 6개의 해결률이 15% 미만이며, 모든 과제를 해결한 모델은 없음. 가장 흔한 실패는 요구사항 누락임 10분 미만 실행도 71.4%가 실패해 짧은 실행에서도 어려움이 나타남. 실행 1회당 추정 비용은 모델에 따라 2.50~6.96달러임 비공개 기업 코드와 실제 업무를 평가하는 이유 Real-SWE의 각 과제는 실제 기업에서 사용 허가를 받은 비공개 프로덕션 코드베이스에 기반하며, 기존 제품의 맥락과 복잡성을 포함함 코드와 해법이 공개 인터넷에 없는 독점 시스템을 탐색해야 함 청구, 세금 계산, 고객 마이그레이션처럼 사업 운영에 직접 영향을 주고 여러 서비스에 걸칠 수 있는 업무를 수행함 회사마다 다른 업무 규칙과 코딩 관례를 이해하고 기존 시스템에 맞게 변경해야 함 전문가가 만들거나 합성한 과제도 잘 설계할 수 있지만, 실제 기업 엔지니어가 수행해야 하는 업무 그 자체는 아님. Real-SWE는 기반 코드 산출물과 지시문의 구체성이라는 두 축에서 차이를 둠 과제는 비공개 실무 코드베이스에서 착안하거나 실제 업무를 그대로 가져오며, 다음 세 가지 특성을 중시함 분포 외 과제: 인터넷에 없는 코드와 업무이므로 다른 AI 모델이 학습했을 가능성이 낮음. 실제 기업 토큰의 99%는 최첨단 모델에 공개되지 않은 상태임 경제적 가치가 있는 업무: 각 과제는 실제 지출과 직접 연결되고 급여를 받는 엔지니어에게 배정됐던 일임 기업별 엔지니어링 관례: 현재 모델은 회사의 코딩 패턴을 이해하는 데 약하고, 요구사항을 빠뜨리거나 가정을 검증하지 않는 경우가 잦음 코드베이스는 사용량이 많고, 탄탄한 엔지니어링 팀과 까다로운 프로덕션 워크로드를 가진 실제 기업을 중심으로 선별함 사용자 20만 명 이상이며 App Store 상위 100위에 든 Luma/Partiful 경쟁 서비스가 포함됨 은행 거래명세...

Read Entire Article