LLM Ass Bench

3 days ago 13
  • LLM AssBench는 하나의 프롬프트로 여러 모델을 여러 날짜에 비교하는 LLM 벤치마크임
  • Claude 비교 항목에는 Opus, Fable, Sonnet, Haiku 계열의 여러 버전이 포함됨
  • GPT 비교 항목에는 Astra, Sol, Terra, Luna 계열과 GPT 5.5가 포함됨
  • Gemini 3.1 Pro Extended와 Grok 4.6 X-High도 비교 대상에 들어 있음
  • 한 항목에는 초기 거부 후 절충안에 동의했다는 메모가 있으나, 제공된 텍스트에는 실제 프롬프트나 모델 응답 본문이 없음

비교 구성

  • 하나의 프롬프트, 여러 모델, 여러 날짜를 기준으로 비교하는 구성이며, 각 모델 항목에 비교 기능이 있음
  • 제공된 텍스트에서는 모델명과 비교 날짜를 확인할 수 있으나, 실제 프롬프트와 응답 본문은 확인할 수 없음

모델별 비교 날짜

  • Claude 계열의 비교 항목은 다음과 같음
    • 2026년 9월 6일: Claude Fable 5.1 Max, Claude Opus 5 Max, Claude Sonnet 5 Max, Claude Haiku 4.5
    • 2026년 9월 15일: Claude Fable 5 Max, Claude Opus 4.7 Max, Claude Sonnet 4.5 Max
    • 2026년 9월 16일: Claude Opus 4.8 Max, Claude Opus 4.5 Max
    • 2026년 9월 22일: Claude Opus 5.5 Max
  • GPT 계열의 비교 항목은 다음과 같음
    • 2026년 9월 15일: GPT Astra 6 Ultra, GPT Sol 5.6 Ultra, GPT 5.5 Extra High, GPT Terra 5.6 Ultra, GPT Luna 5.6 Extra High
    • 2026년 9월 22일: GPT Sol 6 Ultra, GPT Luna 6 Extra High
  • Gemini 3.1 Pro Extended의 비교 날짜는 2026년 9월 15일이며, Grok 4.6 X-High는 2026년 9월 16일임

응답 관련 메모

  • 한 항목에 초기 거부 후 절충안 동의라는 메모가 있지만, 제공된 텍스트만으로는 거부한 요청이나 합의한 절충안의 내용을 알 수 없음
Read Entire Article