GPT-6 Astra: 하네스가 곧 제품이다

2 hours ago 1

같은 GPT-6 Astra도 ARC-AGI-3의 동일한 High 추론 설정에서 하네스에 따라 54.8%와 99.9% 를 기록함. 즉, 장기 실행 에이전트는 모델뿐 아니라 메모리, 도구, 문맥 관리, 제어 루프를 합친 시스템으로 평가해야 함 요청 사이에 이전 추론 상태를 보존하고 긴 대화를 압축하는 하네스에서는 앞서 수행한 작업을 재활용할 수 있었으며, 평가 비용도 약 4만 700달러에서 1만 8,800달러로 줄어듦 별도로 제공되는 과거 문맥 검색, 비동기 도구 호출, 실행 중 지시 변경은 이전 요구사항을 찾고, 도구를 기다리는 동안 다른 일을 하며, 바뀐 요구를 반영하도록 도움 다만 과거 문맥 검색은 출시 당시 실험적 기능이며, 지시 변경이 이미 수행한 작업을 되돌리지는 않으므로 도구 실행 관리와 승인 경계는 애플리케이션이 책임져야 함 벤치마크 포화가 AGI를 입증하는 것은 아니며, 도입 전에는 공통 조건의 모델 비교와 실제 배포 시스템 평가를 구분해 실제 업무의 결과 품질, 오류 복구, 지연시간과 총비용을 확인하는 방식을 제안 AGI 판단에는 아직 증거가 부족함 OpenAI 사장 Greg Brockman은 출시 브리핑에서 최종 판단은 다른 이들에게 맡기면서도 “I think we're there”라고 말함 The Washington Post에 따르면 그는 Astra가 AGI에 해당한다고 믿음 OpenAI Charter는 AGI를 경제적으로 가치 있는 대부분의 작업에서 인간을 능가하는 고도로 자율적인 시스템으로 정의함 출시 벤치마크 하나만으로 이 조건을 입증할 수 없음 Astra가 대부분의 경제적 작업에서 인간을 안정적으로 능가한다는 증거는 아직 없음 OpenAI가 보고한 성능은 FrontierMath Tier 4 98%, ARC-AGI-3 99.9% 이며, 컴퓨터 사용·코딩 성능도 크게 향상됨 Astra가 브라우저, 개발 도구, 스프레드시트 등에서 더 적은 감독으로 작업하도록 추진함 Astra는 범용 디지털 작업자를 향한 유의미한 진전이지만, ‘pre-AGI’라는 명칭 역시 측정 가능한 기준을 주지 못함 ARC Prize는 Astra를 큰 진전으로 평가하면서도 ARC-AGI-3 포화는 AGI의 증거가 아님을 분명히 함 벤치마크는 결정론적 규칙을 가진 제한된 환경을 사용함 실제 업무는 더 복잡하며 에이전트의 실수에 따른 결과를 감당해야 함 99.9%는 모델 단독이 아니라 하네스를 포함한 결과임 에이전트 하네스(...

Read Entire Article