ARC-AGI-3에서 인간의 행동 효율성을 넘어선 OpenAI GPT-6 Astra

2 hours ago 1

명시적 지시 없이 환경의 목표와 규칙을 추론하는 ARC-AGI-3 Semi-Private에서 Standard 하네스는 62.7%, Provider Adapter는 99.9%를 기록함 Standard의 Astra(max)는 $26,098, Provider Adapter의 Astra(high)는 $18,817이 들었으며, 높은 추론 수준일수록 행동·모델 호출·토큰이 줄어 비용도 대체로 낮아짐 Provider Adapter의 Astra(max)는 완료한 레벨의 96.0%에서 인간 중앙값보다 적은 행동을 사용했고, 레벨당 평균 행동 수도 51.7% 적었음 낯선 게임의 객체·좌표·규칙·계획을 즉석에서 만든 대수적 속기로 압축했으며, PRO-LONG에서는 파서·상태 모델·탐색 알고리듬·플래너와 게임별 소프트웨어까지 제작함 Provider Adapter는 불투명한 추론 상태와 압축 기능으로 높은 성능을 냈지만 Standard와 평가 조건이 다르며, 99.9%는 제한된 벤치마크의 포화일 뿐 AGI 달성의 증거는 아님 ARC-AGI-3가 측정하는 능력 ARC-AGI-3는 명시적 지시 없이 새롭고 추상적인 턴 기반 환경을 탐색하고, 목표를 추론하며, 내부 모델을 만들어 행동을 계획하는 에이전트 지능 벤치마크임 환경에는 핵심 지식 사전 요소만 포함되며, 통제된 인간 참가자 실험으로 난이도를 조정함 인간은 환경의 100%를 해결할 수 있음 ARC-AGI-3 과제를 직접 플레이할 수도 있음 ARC-AGI 시리즈는 현재 AI와 AGI 사이의 잔여 격차를 측정하며, AGI를 인간이 습득할 수 있는 어떤 기술이든 인간만큼 효율적으로 습득하는 시스템으로 정의함 3세대 벤치마크는 ARC-AGI-1과 ARC-AGI-2를 넘어 네 가지 요소를 평가함 탐색: 환경과 상호작용하며 필요한 정보를 능동적으로 획득함 모델링: 원시 관찰을 미래 상태와 결과를 예측할 수 있는 일반화된 모델로 바꿈 목표 설정: 희소한 보상만으로 목표 상태를 식별함 계획과 실행: 현재 상태에서 목표까지 경로를 만들고 새 정보에 맞춰 수정함 Astra의 점수와 비용 GPT-6 Astra는 Standard와 Provider Adapter 모두에서 최고 수준 점수를 기록했으며, 전체 결과와 리더보드가 공개돼 있음 Standard 하네스에서는 모델이 환경 전반에 걸쳐 유지할 가시적 메모를 직접 선택함 Astra(max)는 Semi-Private에서 62.7% 를 기록했고 비용은 $26...

Read Entire Article