Bonsai 2 27B, 성능 98.2%를 유지하며 모델 크기를 5.9GB로 압축

2 hours ago 1

PrismML이 Qwen3.8 27B 기반의 3진 가중치 모델을 공개함. 전체 정밀도 모델보다 크기를 9배 이상 줄였으며, 종합 벤치마크 성능 98.2% 를 유지 가중치를 −1, 0, +1 세 값과 보정용 배율로 표현해 가중치당 실효 비트 수를 1.76비트로 낮춤 종합 83.9점으로 코딩과 수학 성능은 원본에 근접하고 지시 따르기는 이를 웃돌며, 이전 Bonsai 세대보다 추론과 비전, 장기 에이전트 작업 성능도 개선함 자체 측정 처리량은 RTX 5090에서 최대 143토큰/초, M5 Max에서 46.8토큰/초이며, 로컬 코딩 에이전트와 컴퓨터 사용 데모를 공개. 에너지 효율이 40% 높음 262K 토큰 컨텍스트와 텍스트/이미지 입력을 지원하고, CUDA와 MLX용 전용 저비트 커널로 실행하며 가중치는 Apache-2.0 라이선스로 공개 압축 방식과 이전 세대 대비 변화 Ternary Bonsai 2 27B는 두 달 전 공개한 첫 Bonsai 27B의 후속 모델로, 기반 모델을 Qwen3.8 27B로 변경함 추론, 코딩, 비전, 장기 에이전트 작업 성능을 개선하면서 작은 메모리 사용량, 높은 로컬 처리량, 에너지 효율을 유지함 전체 정밀도 모델 대비 성능 유지율은 이전 세대의 95%에서 98% 이상으로 높아짐 3진 가중치 {−1, 0, +1} 에 FP16 그룹별 스케일링을 결합하고, 저비트 표현을 언어 모델 전체에 적용함 가중치당 실효 비트 수는 1.76비트, 전체 모델 크기는 5.9GB임 크기는 전체 정밀도 모델의 9분의 1 미만이면서 종합 벤치마크 성능의 98.2%를 유지함 262K 토큰 컨텍스트 윈도와 멀티모달 텍스트/이미지 입력을 지원함 벤치마크 성능과 로컬 활용 사고 모드(thinking mode) 기준 종합 점수는 Ternary Bonsai 2 27B가 83.9점, Qwen3.8 27B가 85.4점, Qwen3.6 27B가 83.6점임 영역별 점수는 아래와 같으며, 수치는 Bonsai 2 / Qwen3.8 / Qwen3.6 순서임 에이전트 및 도구 호출: τ²-bench, BFCLv3에서 77.57 / 79.74 / 80.05점임 코딩: HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench에서 81.58 / 82.17 / 82.57점임 지시 따르기: IFBench, IFEval에서 82.66 / 81.25 / 74.53점임 지식 및 추론: MMLU-Redux, GP...

Read Entire Article