Mercury 2.5

2 hours ago 1

Inception이 고객 피드백과 실제 운영 실패 사례를 평가·학습에 반영한 Mercury 2.5를 출시함. 전작의 낮은 지연시간과 비용을 유지하면서 품질을 높임 Inception 기준 전작 대비 지능 40% 향상, 널리 사용되는 NVIDIA GPU에서 초당 1,107토큰을 제공함. 260K 토큰 컨텍스트, 추론 수준 조절, 병렬 도구 호출, 스키마에 맞춘 JSON 출력을 지원함 정가는 입력·출력 100만 토큰당 각각 0.20달러·0.75달러이며, 출시 시점에는 80% 할인된 0.04달러·0.15달러로 제공함 기존 Mercury 운영 사례에서 OpenCall은 모델 응답 지연시간 중앙값 약 170ms를 달성함. Augment Code는 품질을 유지하면서 컨텍스트 압축 지연시간을 82%, 비용을 90% 줄임 음성 에이전트용 Mercury Voice와 모델 선택용 Mercury Router도 프리뷰로 공개함. Mercury 모델은 Inception API, Baseten, OpenRouter에서 이용 가능하며, 더 큰 차기 모델은 수개월 내 출시를 목표로 학습 중임 Mercury 2.5의 성능과 실제 운영 사례 Mercury 2 출시 이후 수천 명의 개발자가 활용하고 수십 개 기업이 프로덕션에 도입했으며, 사용량은 10배 넘게 증가함 검색·음성·코딩 제품에서 지연시간에 민감한 작업에 사용 중임 고객 피드백과 운영 중 실패 사례를 바탕으로 평가를 정교화하고 학습의 초점을 조정했으며, Mercury 2.5는 이 개선 순환의 첫 결과물임 Inception에 따르면 Mercury 2.5는 자사에서 가장 성능이 높은 프로덕션 모델이자 시장에서 가장 성능이 높은 확산 언어 모델(dLLM) 임 회사가 파악한 범위에서는 지금까지 학습된 확산 언어 모델 중 가장 큰 모델임 회사 기준 전작 대비 지능이 40% 높아졌으며, GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, Claude Haiku 4.5 같은 비용 최적화형 프런티어 모델과 비슷한 수준임 널리 사용되는 NVIDIA GPU에서 초당 1,107토큰, 260K 토큰 컨텍스트를 제공함 추론 수준 조절, 병렬 도구 호출, 스키마에 맞춘 JSON 출력을 지원함 가격은 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 0.75달러임 출시 시점에는 80% 할인을 적용해 각각 0.04달러와 0.15달러로 제공함 검색 에이전트와 RAG 파이프라인에서는 검...

Read Entire Article