GPT-5.6 Sol을 초당 750토큰으로 가속하는 Ultrafast Mode

1 day ago 7

Cerebras와 OpenAI가 OpenAI API의 새 서비스 계층인 Ultrafast Mode를 일부 고객에게 제한 공개했으며, GPT-5.6 Sol에서 품질 저하 없이 초당 최대 750개 출력 토큰을 제공함 웨이퍼 크기 칩마다 44GB SRAM을 탑재해 모델 가중치의 이동 병목을 줄이고, 여러 웨이퍼에 배치된 모델 계층으로 토큰을 연속 전달함 Humanity’s Last Exam 2,500문항을 11시간 11분에 처리해 Claude Fable 5보다 약 7배 빠르면서 비슷한 정확도를 기록했으며, 보고된 출력 속도 기준으로도 Fable 5보다 11배, Opus 4.8 Fast보다 5배 빠름 GDP-Val에서는 기본 모드와 같은 품질을 유지하면서 종단 간 5.6배 속도 향상을 달성해 법률 문서, 금융 모델, 엔지니어링 보고서 같은 지식 노동의 처리 시간을 줄임 빠른 추론은 장애 원인 분석과 복구, 사이버 공격 탐지·대응, 실시간 에이전트 작업에 활용할 수 있으며, 이용 대상은 용량 증가에 맞춰 확대될 예정임 OpenAI API에서 시작하는 제한 공개 Cerebras와 OpenAI가 Ultrafast Mode를 OpenAI API에서 먼저 제공함 초기에는 일부 고객만 이용할 수 있으며, 용량이 늘어나는 대로 접근 범위를 확대할 예정임 Cerebras가 GPT-5.6 Sol Ultrafast의 추론 인프라를 담당함 최대 출력 속도는 초당 750개 토큰으로, 품질을 낮추지 않으면서 시간에 민감한 작업을 가속하는 서비스 계층임 속도와 모델 성능 사이의 절충 완화 모델의 크기와 지능이 커질수록 계산 및 데이터 이동 비용이 증가해 응답 시간이 느려짐 사용자는 고품질 결과를 오래 기다리거나, 짧은 시간 안에 낮은 품질의 결과를 받아야 했음 GPT-5.6 Sol Ultrafast는 높은 모델 성능을 유지하면서 매초가 중요한 제품과 작업 흐름의 응답 시간을 단축함 Artificial Analysis가 보고한 출력 속도와 비교하면 Fable 5보다 11배, Opus 4.8 Fast 모드보다 5배 빠름 Humanity’s Last Exam 처리 성능 Humanity’s Last Exam(HLE)은 화학·경제학·문학 등에서 일반적으로 박사급 전문성이 필요한 2,500개 문항으로 구성된 모델 벤치마크임 Cerebras 평가에서 GPT-5.6 Sol Ultrafast는 전체 문항을 11시간 11분에 처리함 Claude Fable 5는...

Read Entire Article