Anthropic Opus 5 출시

12 hours ago 2

Anthropic이 2026년 7월 24일, Claude Opus 5를 공개했습니다. Opus 티어의 "세대 교체급" 개선 모델로, Fable 5(프론티어 모델)에 근접한 지능을 절반 가격에 제공하는 것이 핵심 포지셔닝입니다. 핵심 요약 포지셔닝: Fable 5의 프론티어급 지능에 근접하면서 가격은 절반. Claude Max의 새 기본 모델이자 Claude Pro에서 사용 가능한 가장 강력한 모델로 지정됨. 벤치마크: Frontier-Bench, GDPval-AA 등 코딩·지식노동 평가에서 신규 SOTA 달성. 다만 사이버보안 작업에서는 여전히 Mythos 5(Anthropic 최상위 모델)에 뒤처짐. 코딩 성능: Frontier-Bench v0.1에서 전 모델 중 최고 성능, Opus 4.8 대비 2배 이상 향상(비용은 더 낮음). CursorBench 최고 효율 설정에서는 Fable 5 최고점 대비 0.5% 이내 차이를 절반 비용으로 달성. 지식노동/문제해결: ARC-AGI 3에서 차순위 모델 대비 3배 점수, Zapier AutomationBench에서 차순위 대비 약 1.5배 통과율, OSWorld 2.0(컴퓨터 사용 벤치마크)에서 Fable 5 최고 기록을 3분의 1 수준 비용으로 상회. 과학 연구: 생명과학 전 평가에서 Opus 4.8 대비 개선. 유기화학(분광 데이터로 분자구조 추론)에서 +10.2%p, 단백질 서열-기능 예측에서 +7.7%p. 작업 스타일: 자체 검증·반복 능력이 크게 강화됨. 시각 정보 없이 도면만으로 3D CAD 모델을 코드로 재구성하거나, 커뮤니티 패치가 놓친 근본 원인을 찾아 수정하는 등의 사례가 소개됨. 정렬(Alignment): 자체 행동 감사에서 역대 가장 정렬이 잘 된 모델로 평가됨. Opus 4.8, Sonnet 5, Fable 5보다 기만 행동 비율이 낮고, 비가역적 위험 행동 회피 능력도 최고 수준. 안전성: 생물학·공격적 사이버보안 분야에서는 Mythos 5보다 뒤처짐. 취약점 "탐지"는 Mythos 5와 비슷한 수준이지만 "익스플로잇 개발" 능력은 크게 낮음 (의도적으로 사이버 작업에 대한 학습을 배제한 결과). 안전장치: Fable 5 대비 사이버 분류기 개입이 약 85% 적음. 소스코드 취약점 탐지는 허용하되 바이너리 기반 스캐닝·침투테스트·익스플로잇 생성은 차단. 생물학 관련 요청 중 Fable 5에서 차단되던 것들이 이제 Opus 5로 라우팅됨. 가격...

Read Entire Article