Cognition, Fable 5.1·GPT-Astra에 필적하는 코딩 모델 SWE-2 출시

4 hours ago 1

2.8조 매개변수 Kimi K3를 후속 학습한 SWE-2는 FrontierCode 1.1 Main에서 50.0%를 기록해 Fable 5.1과 0.9%p 차이를 보이면서도 비용은 64% 낮음 추론 노력 수준별로 기반 모델의 비용·성능 곡선 기울기에 맞춘 선형 비용 페널티를 적용해, 한 번의 강화학습 실행으로 모든 추론 노력 수준을 함께 학습함 SWE-2 medium은 FrontierCode에서 SWE-1.7보다 높은 점수를 얻으면서 평균 작업 단계는 58%, 비용은 81% 줄임. 다만 Terminal-Bench 4 점수는 27.3%로 Fable 5.1의 55.8%, GPT-6 Astra의 57.9%에 크게 못 미침 Devin Desktop과 CLI에서 출시 당일부터 사용할 수 있으며 Web과 Fusion에도 순차 적용 중임. medium은 단순·중간 난도 작업을 빠르게 처리하고, high와 max는 복잡한 작업의 계획·탐색·검증에 더 많은 노력을 들임 길이 가중 보상 기준값과 온라인 초안 모델 학습, 저정밀도 커널, 양자화 인지 학습을 결합해 SWE-1.7보다 거의 3배 큰 기반 모델에서도 비슷한 처리량·효율과 더 낮은 추론·학습 간 불일치를 달성함 출시와 벤치마크 성능 SWE-2는 에이전트 코딩용 강화학습을 이미 광범위하게 거친 Kimi K3를 기반으로 함 SWE-1.7의 학습 인프라와 방법을 확장해 처음으로 수조 매개변수 규모에서 강화학습을 수행함 여러 벤치마크에서 기반 모델보다 5~6%p 개선하며 비용·성능 곡선 전반을 끌어올림 FrontierCode 1.1 Main과 DeepSWE 1.1에서는 SWE-1.7과 Grok 4.6을 점수와 비용 양쪽에서 앞섬 GPT-5.6 Sol 및 Fable 5/5.1에 필적하는 성능을 더 낮은 가격으로 달성함 GPT-6 Astra와는 수%p 이내 차이를 보이며 비용은 약 4분의 1임 벤치마크별 점수는 SWE-2 / Kimi K3 / Grok 4.6 / Fable 5.1 / GPT-5.6 Sol / GPT-6 Astra / SWE-1.7 순서임 FrontierCode 1.1 Main: 50.0% / 44.2% / 48.0% / 50.9% / 47.5% / 53.3% / 42.0% DeepSWE 1.1: 73.0% / 68.5% / 67.5% / 67.4% / 72.7% / 74.1% / 37.7% Terminal-Bench 2.1: 92.8% / 88.3% / 88.4% / ...

Read Entire Article