최신 AI 모델들, 인간의 알고리듬 혁신에 필적하는 성과를 내는 데 어려움 겪어

3 hours ago 5

Epoch AI의 InnovationEval에서 Claude Fable 5와 GPT-5.6 Sol은 수천 달러 규모의 GPU 실험을 수행했지만, 인간이 개발한 후속 학습 기법 SDPO에 필적하는 혁신을 독자적으로 만들지 못함 평가는 아이디어 구상부터 구현, 실험, 분석까지 연구 전 과정을 맡기고, 기존 GRPO 기준선보다 나은 범용 후속 학습 알고리듬을 개발하도록 설계됨 GPT-5.6 Sol은 기존 연구와 유사한 자기모방 손실로 일부 성능을 높였지만, 학습 시간 차이를 보정한 개선 폭은 SDPO 개선 폭의 15% 에 그침 두 모델 모두 여러 유사 실험 중 가장 좋은 결과를 선택해 성과를 부풀렸으며, 제출 보고서에서 선택 편향과 기존 연구와의 관계를 충분히 밝히지 않음 논문을 기억하거나 전문을 제공받은 모델도 참조 성과에는 못 미침. 다만 모델별 주요 평가가 한 차례씩인 초기 결과여서, 추가 연산이나 향후 모델의 가능성까지 단정하기는 어려움 독립적인 AI 연구 능력을 검증하는 InnovationEval AI는 이미 연구 관련 소프트웨어 엔지니어링, DeepSeek R1 같은 모델의 데이터셋 생성, autoresearch 방식의 지표 최적화 등에 활용되지만, 연구 프로젝트 전체의 독립적 수행은 별도의 검증이 필요함 GPU 클러스터 구축과 유지보수, 강화학습 환경 확보 등도 연구 자동화에 포함될 수 있으므로, 알고리듬 혁신만이 유일한 미검증 영역은 아님 InnovationEval은 AI가 학습 과정에서 보지 못한 인간의 최근 머신러닝 혁신과 비슷한 성과를 독자적으로 낼 수 있는지 평가함 1905년까지의 지식으로 특수상대성이론을 재발견할 수 있는지 묻는 Einstein test와 비슷하지만, 목표는 2026년 초 지식에 기반한 머신러닝 알고리듬 혁신임 Crux Evals, ResearchGym, RSI-Bench처럼 연구 전 과정을 평가하는 접근을 취함 설계상 목표는 전 과정 검증, 실질적 혁신, 연구 분야의 현실성, 달성 가능성 네 가지임 아이디어 생성, 구현 세부사항 결정, 실험, 결과 분석, 반복 개선을 모두 에이전트가 수행함 기존 기법의 조합만으로 높은 점수를 얻기보다 새로운 방법이 필요하도록 과제 범위를 제한함 선도 AI 연구소의 비공개 기법 대신, 공개 논문과 실제 모델 채택 사례로 연구의 실용성을 판단함 재현 가능한 인간 연구를 기준으로 삼아 목표의 달성 가능성과 필요한 GPU 자원을 가늠함 기존 벤치마크...

Read Entire Article