Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능
21 hours ago
7
- Qwen3.8 Max에 이어, 개인 장비에서 돌릴 수 있는 27B 모델도 Unsloth GGUF/NVFP4로 공개돼 로컬에서 바로 실행 가능
- 27B 밀집형(dense) 모델이면서 비전, 추론, 256K 컨텍스트를 지원하고, YaRN을 사용하면 컨텍스트를 1M까지 확장 가능
- 메모리 요구량은 2-bit 11~13GB / 3-bit 13~16GB / 4-bit 17~19GB / 6-bit 24GB / 8-bit 31GB / BF16 56GB
- 따라서 4-bit 기준으로는 24GB 메모리 Mac이나 고용량 GPU 데스크톱에서 현실적으로 로컬 실행할 수 있는 크기임
- Unsloth Desktop을 이용하면 macOS/Windows/Linux에서 모델 검색/다운로드/실행이 가능하고, RAM 오프로딩과 멀티 GPU도 자동 처리
- llama.cpp에서도 GGUF를 직접 실행할 수 있으며, NVFP4를 지원하지 않는 기존 GPU에서는 GGUF가 적합함
- NVIDIA RTX 50 계열 같은 Blackwell GPU에서는 NVFP4가 BF16보다 약 1.5배 빠르게 동작하며 24GB VRAM에서 실행 가능
- Thinking/Non-thinking을 모두 지원하고 reasoning_effort를 xhigh / medium / low로 조절해 추론 깊이와 비용을 선택할 수 있음
- 이전 대화의 thinking trace를 유지하는 Preserve Thinking, MTP 기반 빠른 추론, 개선된 도구 호출 파싱도 지원
- 코딩 성능도 Qwen3.6-27B보다 크게 올라 Terminal Bench 2.1은 63.4 → 73.0, SWE-bench Pro는 53.5 → 61.7
- LiveCodeBench v6도 83.9 → 90.3, 장시간 업무를 평가하는 CoWorkBench는 61.0 → 70.7로 상승
- 극단적으로 줄이면 IQ2_XXS가 약 9GB에서 원본 대비 82.5%의 정확도를 유지했다고 Unsloth가 측정했지만, 품질을 더 중시한다면 더 큰 양자화 버전을 선택할 수 있음
- 앞서 공개된 Qwen3.8-2.4T-A95B는 1-bit로 줄여도 397GB가 필요했던 것과 달리, 27B는 개인 장비에서 직접 돌려볼 수 있는 Qwen3.8 모델이라는 점이 가장 큰 차이
- 즉 최고 성능의 Qwen3.8 자체 호스팅이 목적이면 2.4T가 대상이지만, Mac/PC에서 코딩·비전·에이전트용 로컬 모델을 실제로 써보려면 27B가 훨씬 현실적임
-
Homepage
-
Tech blog
- Qwen3.8-27B, 17~19GB 메모리에서 4-bit 로컬 실행 가능