Anthropic, Claude Code의 추론 노력 수준 축소를 A/B 테스트하는 것으로 보임

2 weeks ago 29
  • 서버 측 실험으로 Claude Code 2.1.236 이상의 일부 Fable 5 세션에서 추론 노력 척도가 낮아져 사용자마다 경험이 달라질 수 있음
  • 이전 Claude Code 버전과 Opus 5는 대상에서 제외되며, 클라이언트 버전이 실험 등록 조건으로 쓰이는 것으로 파악됨
  • 일부 사용자는 high를 선택해도 system<reasoning_effort>medium</reasoning_effort>이 삽입되거나 세션이 low reasoning으로 실행됐다고 보고함
  • 한 사용자는 최근 10일간 Fable의 품질이 나빠진 상황에서 토큰 비용 400달러를 썼다며, 높은 비용을 받고 낮은 추론 수준을 제공하는 것 아니냐고 비판함
  • 유료 설정의 동작을 알리지 않고 바꾸는 A/B 테스트는 출력 품질과 사용자별 일관성을 떨어뜨려 제품 신뢰를 훼손할 수 있음

서버 측 실험의 대상과 동작

  • 변경은 앱 자체가 아닌 서버 측에서 이뤄짐
    • Anthropic이 Claude Code 2.1.236 이상의 일부 Fable 5 세션을 실험에 등록함
    • 실험 대상에서는 추론 노력 척도가 축소되며, 모든 사용자가 같은 변화를 겪지는 않음
    • 이전 버전과 Opus 5는 영향을 받지 않음
  • high 설정이 평소의 low처럼 느껴진다면 테스트 그룹에 포함됐을 가능성이 있음
  • 클라이언트 버전이 등록 조건이라면 이전 버전으로 고정한 뒤 같은 프롬프트를 다시 실행해 결과를 비교할 수 있음

달라진 사용자 경험과 신뢰 문제

  • Fable Medium 세션이 low reasoning으로 실행된다는 표시가 확인됨
    • 다른 사용자는 high를 설정했는데도 응답에 system<reasoning_effort>medium</reasoning_effort>이 계속 추가됐다고 밝힘
  • 최근 10일간 Fable의 품질이 저하된 상태에서 400달러 상당의 토큰을 소모했다는 사례도 나옴
  • 사용자들이 우려하는 지점은 다음과 같음
    • high 비용을 내면서 실제로는 low 수준을 받는지 확인하기 어려움
    • 변경 로그에 관련 내용이 없어 유료 설정의 의미가 달라졌는지 파악하기 힘듦
    • 같은 설정에서도 사용자별 결과가 달라져 일관성이 떨어짐
    • 사용자가 알아차리기 전후로 Anthropic이 실험을 공개하는지가 신뢰에 영향을 줌
  • macOS 데스크톱 앱에서는 해당 상태를 질의하는 기능을 지원하지 않는다는 반응도 있음
Read Entire Article