Opus 5는 왜 함께 작업하기 더 불편하게 느껴지는가?

5 hours ago 4

Opus 5는 Opus 4.7·4.8보다 역량이 뛰어나고 벤치마크에서 Fable과 경쟁하지만, 실제 작업에서는 더 세밀한 감독이 필요해 이전 모델보다 불편하게 느껴짐 Opus 4.7·4.8과 Fable은 의도가 불분명하면 질문하고 계획을 임의로 재해석하지 않지만, Opus 5는 이러한 확인 절차가 부족함 Anthropic을 비롯한 최첨단 AI 연구소의 자기개선 AI 개발 목표와 높은 벤치마크 점수를 향한 압력이 이런 차이를 낳았을 가능성이 있음 벤치마크와 검증 가능한 보상 강화학습(RLVR)은 모호한 상황에서 과감하게 가정하는 모델을 선호하고, 설명이나 지시를 요청하며 멈추는 모델에는 불리하게 작용할 수 있음 실제 코딩에서는 의도·사업적 영향·예산 제약을 모두 전달하기 어려우므로, 임의로 최선의 추측을 실행하기보다 필요할 때 질문하는 에이전트가 더 적합함 역량과 협업 경험의 차이 Opus 5의 역량이 Opus 4.7·4.8보다 낮은 것은 아니며, 벤치마크에서도 Fable과 경쟁할 수준임 반면 Opus 4.7·4.8과 Fable은 다음과 같은 방식으로 협업 부담을 줄임 사용자의 의도가 불명확하면 멈추고 질문함 확인하지 않은 가정을 만들지 않음 허락 없이 사용자의 계획을 재해석하거나 수정하지 않음 Opus 5에서는 같은 수준의 신중한 확인을 기대하기 어려워 사용자가 작업을 세밀하게 감독해야 함 벤치마크와 현실 업무의 불일치 다음 두 가지 힘이 함께 작용했을 가능성이 있음 재귀적으로 스스로를 발전시켜 AGI·ASI에 도달할 수 있는 자기개선 AI를 만들려는 목표 벤치마크에서 높은 점수를 얻어야 한다는 압력 많은 벤치마크 과제는 불명확하거나 불공정하고 공략할 여지가 있지만, 좋은 과제라면 외부 정보나 출제자의 의도를 추측하지 않고도 자체적으로 해결할 수 있어야 함 정답이 하나일 필요는 없지만, 명백히 올바른 답은 모두 동일하게 평가해야 함 벤치마크나 RLVR 과제에 맞춰 모델을 선별·훈련하면 모호한 상황에서도 과감하고 대체로 올바른 가정을 내리는 성향이 강화될 수 있음 반대로 명확한 설명이나 지시를 요청하려고 멈추는 성향은 불리하게 평가될 수 있음 실제 코딩 에이전트에 전체 맥락과 의도, 사업적 영향, 예산 제약을 빠짐없이 제공하기는 거의 불가능함 모호함과 선택지가 필연적으로 남으므로 필요한 순간에 질문하는 행동이 중요함 현실에서는 모든 문제에 정답이나 정답 집합이 보장되지 않으며, 실제 결과가 걸렸다면 에이전트가 임...

Read Entire Article