Artificial Analysis, AAII v4.2 발표 - 실제 업무 평가 강화, 비공개 테스트 확대

41 minutes ago 1

AI 모델의 종합 성능을 비교하는 Intelligence Index v4.2를 공개하며, 복잡한 업무 수행과 장문 문서 분석을 평가에 추가함 수천 개의 자료를 활용하는 에이전트 지식 업무와 여러 페이지에 흩어진 근거를 종합하는 전문 문서 추론을 평가하고, 상위 모델의 성능이 포화된 GPQA Diamond는 제외함 평가에 맞춰 모델을 최적화하는 편법을 줄이기 위해 비공개 테스트의 가중치를 20%에서 40%로 확대하고, 채점 오류와 실행 환경도 개선함 개편된 종합 지수에서는 Claude Fable 5.1이 선두, GPT-6 Astra가 뒤를 이으며 GPT-5.6 Sol보다 4점 높은 점수를 기록함 세부 평가에서는 Claude가 복잡한 지식 업무에서, GPT-6 Astra가 전문 문서 분석에서 앞섰으며, Astra는 상위권 모델 중 출력 토큰 대비 성능도 두드러짐 모델의 발전에 맞춰 평가 과제도 더 어렵게 Artificial Analysis는 2026년 1월 v4를 공개한 이후 8개월간 준비해 온 v5의 일부를 앞당겨 반영함 최근 주요 모델이 출시되는 동안 비교 기준을 안정적으로 유지하려고 업데이트를 미뤘지만, 상위 모델의 빠른 발전에 맞춰 중간 개편을 진행함 더 어렵고 현실적인 과제를 추가해 실제 활용 능력을 반영하고, 과학 추론 평가 GPQA Diamond는 성능이 포화돼 제외함 v5 개발은 계속 진행하며, 가까운 시일 내 추가적인 단계별 업데이트를 계획함 AA-Briefcase: 여러 자료와 연결된 과제를 처리하는 능력 AA-Briefcase는 업계 전문가가 설계한 복잡한 프로젝트를 통해 에이전트의 지식 업무 수행 능력을 평가함 각 프로젝트는 사람이 수 주에 걸쳐 수행할 분량으로, 서로 연결된 여러 과제와 수천 개의 원본 자료를 포함함 정해진 기준에 따른 채점과 결과물을 서로 비교하는 평가를 결합함 과제를 실제로 성공했는지, 분석의 품질은 어떤지, 결과물을 얼마나 잘 전달했는지를 함께 평가함 테스트 세트는 비공개로 유지함 Claude Fable 5.1과 Opus 5가 선두이며, GPT-6 Astra와 Muse Spark 1.3이 뒤를 이음 GPT-6 Astra는 GPT-5.6 Sol보다 약 85 Elo 높은 점수를 기록함 GDP.pdf: 긴 문서에서 근거를 빠짐없이 종합하는 능력 Surge AI가 만든 GDP.pdf는 10개 분야의 PDF 100개를 대상으로, 한 번의 요청에서 전문 문서를 분석하고 답하는 능력...

Read Entire Article