Kimi K3와 펠리컨 벤치마크에서 여전히 배울 수 있는 것

3 days ago 11
  • Moonshot AI가 공개한 Kimi K3는 2.8조 개 매개변수를 갖춘 자사 최고 성능 모델로, 웹사이트와 API에서 제공되며 오픈 가중치는 2026년 7월 27일까지 공개될 예정임
  • 자체 벤치마크에서는 Claude Opus 4.8 max와 GPT-5.5 high를 대체로 앞섰지만 Claude Fable 5와 GPT-5.6 Sol에는 뒤졌으며, Arena.ai Frontend Code arena에서는 1위에 오름
  • 입력 100만 토큰당 $3, 출력 100만 토큰당 $15로 중국 AI 연구소 모델 중 가장 비싸며, 펠리컨 SVG 하나를 생성하는 데 추론 토큰 13,241개를 포함한 출력 16,658토큰과 $0.25가 들었음
  • 자전거 타는 펠리컨 SVG 테스트는 오늘날 중요한 에이전트 도구 호출이나 장시간 대화에서의 도구 운용 신뢰성을 측정하지 못해 모델 간 종합 성능 비교에는 적합하지 않음
  • 그래도 동일한 간단한 프롬프트를 직접 실행하면 API 접근성과 비용, 추론량, SVG 유효성, 공간 인식, 비전 성능, 제품군 내 세대별 개선을 빠르게 살펴볼 수 있음

Kimi K3 공개와 성능

  • Moonshot AI는 Kimi K32.8조 개 매개변수를 갖춘 자사 최고 성능 모델로 공개함
    • 웹사이트와 API에서 이용할 수 있음
    • 오픈 가중치는 2026년 7월 27일까지 공개할 예정임
  • K3를 최초의 “오픈 3T급 모델”로 부르며, 2.8조 개를 3조 개로 반올림해 분류함
    • 기존 최대 규모로 거론된 DeepSeek V4 Pro는 1.6조 개 매개변수를 가짐
    • K3는 1조 개 매개변수인 Kimi K2.6보다 두 배 이상 큼
  • 자체 벤치마크에서는 Claude Opus 4.8 max와 GPT-5.5 high를 대체로 앞섰지만 Claude Fable 5와 GPT-5.6 Sol에는 뒤짐

외부 평가와 가격

  • Artificial Analysis 평가의 비공개 장기 지식 작업에서 종합 Elo 1,547을 기록함
    • Kimi K2.6보다 732점 높음
    • Claude Fable 5에 이어 2위임
  • 작업당 비용은 $0.94로 GPT-5.6 Sol의 $1.04와 비슷함
    • Claude Opus 4.8의 $1.80보다는 약 절반 수준임
    • 다른 오픈 가중치 모델보다는 비쌈
  • Artificial Analysis Intelligence Index에서 출력 토큰 사용량은 K2.6보다 21% 감소
  • Arena.ai Frontend Code arena에서는 Claude Fable 5를 넘어 1위에 오름
  • API 가격은 입력 100만 토큰당 $3, 출력 100만 토큰당 $15
    • Anthropic Claude Sonnet 제품군과 같은 수준임
    • 중국 AI 연구소가 공개한 모델 중 가장 비쌈
    • Kimi K2.6의 $0.95/$4에서 크게 인상됨

펠리컨 SVG 생성 실험

  • OpenRouter와 llm-openrouter 플러그인을 이용해 Generate an SVG of a pelican riding a bicycle 프롬프트를 실행함
  • 생성 과정에는 입력 95토큰과 출력 16,658토큰이 사용됨
    • 출력 중 13,241개가 추론 토큰이었음
    • 총비용은 $0.25였음
  • 이미지 입력도 지원하므로 생성된 SVG에 대체 텍스트 프롬프트를 적용함
    • 분석 결과는 빨간 스카프를 두른 흰 펠리컨과 빨간 자전거, 차선과 움직임 표시, 하늘·구름·태양·새·잔디·꽃을 정확히 포착함
    • 이미지 분석에는 입력 822토큰과 출력 243토큰, $0.006가 들었음

종합 벤치마크로서의 한계

  • 자전거 타는 펠리컨 SVG 테스트는 21개월 전 모델 비교의 어려움을 풍자하는 농담으로 시작했지만, 첫 1년 동안에는 실제 모델 품질과 의외로 높은 상관관계를 보였음
  • 현재는 그 상관관계가 대부분 사라짐
    • GPT-5.6과 Claude Fable 5가 만든 펠리컨은 GLM-5.2 결과보다 못함
    • 그러나 GLM-5.2를 Claude Fable급 모델로 보기는 어려움
  • 연구소가 이 테스트에 맞춰 모델을 훈련했다는 확신은 없음
    • 실제로 최적화했다면 훨씬 더 좋은 결과가 나와야 함
    • Gemini가 “동물이 탈것을 타는” 조합 전반에 최적화됐을 가능성은 남아 있음
  • 가장 큰 한계는 오늘날 모델에서 중요한 에이전트 도구 호출을 전혀 평가하지 못한다는 점임
    • 대화가 길어졌을 때 도구를 안정적으로 운용하는 능력도 측정하지 못함
    • 따라서 펠리컨 결과를 모델 간 종합 성능 비교에 사용해서는 안 됨

직접 실행하게 만드는 실험

  • 펠리컨 테스트는 새 모델을 실제로 호출하게 만드는 강제 장치로 기능함
    • 결과물이 나왔다는 것은 최소한 프롬프트 실행에 성공했다는 뜻임
    • 공식 API가 있으면 이를 사용함
    • 128GB M5 MacBook Pro에 들어갈 정도로 작은 오픈 가중치 모델은 llama.cpp, LM Studio, Ollama로 로컬 실행함
    • 새 API 키 없이 공식 API 프록시를 이용할 수 있어 OpenRouter를 자주 사용함
  • 대부분의 결과는 LLM CLI 도구로 생성하며, 이 과정에서 플러그인의 최신 모델 지원 여부도 확인하게 됨
  • 단일 SVG 프롬프트만으로도 모델의 비용·추론 방식·입력 처리 특성을 드러낼 수 있음

Kimi K3에서 드러난 특성

  • 현재 K3의 추론 노력 수준은 max 하나뿐이며, 응답 3,417토큰을 만드는 데 추론 토큰 13,241개를 소비함
    • 단순한 펠리컨 생성 비용이 $0.25에 달해 부담이 큼
  • 짧은 프롬프트가 입력 95토큰으로 계산된 점은 숨겨진 입력의 존재를 시사함
    • OpenAI 토크나이저는 같은 프롬프트를 10토큰으로 계산함
    • Anthropic 토큰 계산기는 Opus 4.6에서 10토큰, Opus 4.7에서 30토큰, Sonnet 5/Fable 5에서 25토큰으로 계산함
    • K3에 hi를 보냈을 때도 86토큰으로 집계돼 약 85토큰의 숨겨진 시스템 프롬프트가 있을 가능성이 있음
    • K3는 해당 시스템 프롬프트 공개 요청을 거부함
  • 생성된 SVG를 분석한 대체 텍스트 품질에서 비전 기능이 잘 작동함
  • K3에는 추론 노력 수준이 하나뿐이지만, 다른 모델에서는 동일 프롬프트를 여러 노력 수준으로 실행해 영향을 빠르게 비교할 수 있음

펠리컨 테스트가 여전히 알려주는 것

  • 새 모델에 프롬프트를 보내는 “Hello World” 실습으로 활용할 수 있음
  • 단순한 작업에 필요한 비용과 추론량을 대략 파악할 수 있음
  • 유효한 SVG 출력 여부와 기본적인 기하학·공간 인식을 살펴볼 수 있음
    • 특히 노트북에서 실행되는 소형 모델에서는 이 능력이 더 중요함
  • 같은 모델 제품군의 릴리스끼리는 여전히 비교할 가치가 있음
    • K3의 펠리컨은 Kimi 2.5보다 뚜렷하게 개선됨
  • 모델을 직접 사용해 봤다는 사실을 공유할 수 있으며, Hacker News에서는 새 모델 관련 댓글에 펠리컨 결과를 올리는 일이 하나의 전통처럼 자리 잡음
Read Entire Article