Husky - MLX보다 최대 4.5배 빠른 모델 특화 추론 엔진

4 days ago 15

여러 모델을 지원하는 대신 4B 모델 Woof 하나에 최적화한 애플 실리콘 추론 엔진으로, 메일/일정 관리/회의록 요약을 기기에서 처리하는 맥용 개인 AI 비서 앱 Underdog에 적용됨 M5 Max 비교에서 같은 가중치와 동일한 출력으로 16개 작업 모두 MLX보다 빠르게 실행했으며, Flash 사용 시 함수 수정에서 최대 730토큰/초와 약 4.5배 속도를 기록함 오타 수정이나 코드 편집에서는 입력에 이미 있는 텍스트를 다음 토큰 후보로 활용하고, 8개 토큰을 한꺼번에 검증해 결과를 바꾸지 않으면서 생성 속도를 높임 새 글이나 코드를 작성할 때는 소형 초안 모델인 Flash가 후보를 만들고 Woof가 검증하며, 새 함수 작성에서도 MLX 대비 약 3.5배 빠른 속도를 보임 모델 전용 GPU 연산과 메모리 배치로 불필요한 처리를 줄이고, 이전 대화의 계산 결과를 재사용해 후속 응답의 첫 토큰을 약 35ms 만에 출력함 Woof 하나에 맞춘 추론 엔진 Husky는 Underdog의 공개 4B 모델인 Woof만 실행하는 모델 특화 추론 엔진임 Apple silicon용으로 설계했으며, Underdog는 Mac과 iPhone에서 와이파이 없이도 실행 가능함 현재 Husky는 Mac용 Underdog에 적용돼 있음 속도의 핵심은 가중치를 더 빨리 읽는 것이 아니라 한 번 읽을 때 더 많은 토큰을 생성하는 데 있음 토큰 생성에는 Woof의 2.4GB 가중치를 통합 메모리에서 40개 GPU 코어로 읽어 들이는 과정이 필요하며, M5 Max에서 약 6ms가 걸림 MLX는 가중치 읽기당 토큰 1개를 생성하지만, Husky는 편집에서 평균 5.4개, Flash를 켠 글쓰기 예시에서는 2.7개를 유지함 시각화에 사용한 편집 예시는 MLX 159토큰/초, Husky 463토큰/초, Flash 사용 시 535토큰/초를 기록함 16개 작업의 처리량과 응답 지연 동일 Woof 가중치와 탐욕적 디코딩으로 이메일, 스레드 답장, 문체 수정, 계획, 메모, 통화 요약, 문서 질의, 청구서 JSON 변환, 표 변환, 코드 작성과 수정 등 16개 프롬프트 유형을 비교함 Flash 없이도 전 작업에서 MLX보다 1.02~3.9배 빨랐고, 편집에서는 1.8~3.9배 빨랐음 Flash 사용 시 전체 작업에서 1.3~4.5배 빨랐음 편집 작업에서는 프롬프트 재사용 효과가 컸음 함수 수정: MLX 163 → Husky 614 → Flash 730토큰...

Read Entire Article