Qwen 3.8 27B, Cerebras에서 초당 1,500토큰으로 제공

2 hours ago 2

Cerebras가 공개 API에 Qwen 3.8 27B를 추가해, 270억 매개변수 모델의 출력을 약 초당 1,500토큰으로 생성할 수 있게 함 에이전트 코딩, 도구 사용, 리서치와 장시간 워크플로를 겨냥한 Dense 멀티모달 모델로 텍스트와 이미지 입력, 조절 가능한 추론을 지원함 무료 체험은 64K, 종량제는 128K 컨텍스트를 지원하며 스트리밍, 도구 호출, 병렬 도구 호출과 구조화 출력을 사용할 수 있음 공개 엔드포인트에는 프루닝하지 않은 원본 모델을 올리고, 저장 시 일부 가중치만 양자화하며 활성값, 어텐션과 KV 캐시는 완전 정밀도로 유지함 초당 1,500토큰은 출력 생성 속도이며 실제 처리량은 요금제별 토큰 한도와 도구 실행 시간에도 좌우되므로, 긴 코딩 작업에서는 빠른 출력이 곧 짧은 전체 작업 시간을 뜻하지는 않음 Qwen 3.8 27B의 특징 Alibaba의 270억 매개변수 Dense 모델로, Cerebras의 공유형 공개 엔드포인트에서 모델 ID qwen-3.8-27b로 호출함 텍스트뿐 아니라 이미지도 직접 입력할 수 있는 멀티모달 모델임 에이전트 코딩과 장시간 작업에 필요한 기능을 폭넓게 지원함 도구 호출과 병렬 도구 호출 JSON 및 구조화 출력 스트리밍 응답 추론 강도 조절 최대 32K 출력 공개 모델 카탈로그에서 안내하는 속도는 약 초당 1,500토큰이며, 컨텍스트 길이는 무료 64K, 유료 128K임 OpenAI 호환 API와 Cerebras Python/Node.js SDK로 사용할 수 있음 자동 프롬프트 캐싱 반복되는 시스템 프롬프트, 도구 정의와 대화 기록의 공통 앞부분을 자동으로 캐싱함 별도의 캐시 구간이나 헤더를 지정하지 않아도 모든 지원 요청에서 작동함 프롬프트를 128토큰 블록으로 나눠 앞부분이 일치하는 블록의 계산을 재사용함 캐시는 최소 5분 동안 보장되며 시스템 부하에 따라 최대 1시간 유지될 수 있음 첫 토큰이 달라지면 그 이후 블록까지 캐시를 사용하지 못하므로 고정 내용은 앞에, 시간이나 사용자별 값은 뒤에 두는 편이 좋음 prompt_cache_key에 대화나 워크플로 식별자를 넣으면 연속 요청을 같은 캐시로 보내도록 힌트를 줄 수 있음 캐시된 토큰은 새로 계산한 토큰과 같은 가격으로 청구되고 전체 분당 토큰 한도에도 포함됨 다만 새로 처리한 토큰에 적용되는 별도 한도에서는 제외되므로 처리 지연과 실질적인 수용량을 개선할 수 있음 원본 모델과 양자화 정책 Ce...

Read Entire Article