SSD 4개에서 스트리밍해 MacBook Pro에서 Kimi K3(2.8T)를 초당 1토큰으로 실행

3 hours ago 3

ARGODRIVE Deltafin은 128GB 메모리의 M5 Max MacBook Pro 한 대에서 1.45TB의 전문가 가중치를 SSD 4개로부터 스트리밍해 2.8조 파라미터 Kimi K3를 실행하며, 512토큰 생성 구간에서 1.0015토큰/초를 기록함 전문가를 제거하거나 전문가 가중치를 재인코딩해 속도를 높이지 않고, 매 토큰에 라우팅된 16개 전문가를 모두 사용함. 소형 모델의 초안도 K3가 검증하며, 최종 토큰 결정권은 K3에만 있음 가장 큰 제약은 첫 토큰 대기 시간으로, 512토큰 프롬프트 처리에 약 375초가 걸림. 프리필에서 각 층의 전문가를 8번씩 다시 읽는 문제를 확인했지만 수정은 아직 구현하지 않음 SSD 1개는 4개 구성 속도의 약 52%, 2개 완전 미러 구성은 약 73%, 3개는 약 90%에 도달함. 전체 대역폭보다 각 층의 16개 읽기 중 가장 느린 읽기가 처리 속도를 좌우함 단일 네이티브 실행 파일로 CLI와 OpenAI 호환 서버를 제공하지만, 긴 대화는 짧은 완성 작업보다 훨씬 느림. 제품보다는 소비자 하드웨어에서 대형 모델 실행의 한계를 탐구하는 실험이며, 측정값도 반복 검증된 일반 성능으로 해석해서는 안 됨 M5 Max에서 측정한 성능과 병목 ARGODRIVE Deltafin은 엔진을 만든 gavamedia/deltafin의 포크이며, ARGODRIVE를 계측에 사용함 테스트 구성은 M5 Max, 메모리 128GB, SSD 4개이며 전문가 가중치 1.45TB를 저장장치에서 스트리밍함 실행 설정은 env.sh, 실행별 로그는 results/에 공개함 초안 모델 활성화 여부에 따라 생성 길이별 처리량이 달라짐 512토큰 생성: 비활성화 시 0.9232토큰/초, 활성화 시 1.0015토큰/초 128토큰 생성: 비활성화 시 0.9261토큰/초, 활성화 시 1.1252토큰/초 이슈 #15의 공개 17토큰 프롬프트: 활성화 시 3회 중앙값 0.9631토큰/초로, 업스트림의 해당 보고값은 0.684토큰/초임 512토큰 프롬프트의 첫 토큰까지 걸린 시간은 비활성화 시 약 376초, 활성화 시 약 375초임 측정 범위에 주의가 필요함: README는 각 수치를 정확히 명시한 프롬프트로 수행한 단일 콜드 실행 결과로 규정하며, 17토큰 항목에는 별도로 3회 중앙값을 표기함 정의, 모델 동일성의 범위, 정밀도 관련 조건은 벤치마크 README에서 확인할 수 있음 SSD 개수에 따른 확장성은 선...

Read Entire Article