M4 Pro Mac mini로 구축한 로컬 LLM 환경

2 hours ago 1

48GB RAM의 M4 Pro Mac mini를 상시 LLM 서버로 운영하며, 추론·에이전트 작업에는 Qwen3.6-35B-A3B, 간단한 대화에는 Gemma-4-E4B를 사용해 약 30분 만에 전체 환경을 구성함 로컬 실행으로 클라우드 API의 가격 변경, 사용량 제한, 예고 없는 모델 교체를 피하고, 민감한 코드와 데이터를 제3자 서버로 보내지 않으면서 비용을 하드웨어와 전기료 중심으로 예측할 수 있음 oMLX가 추론 서버를 맡고 Tailscale이 Mac mini·MacBook·iPhone을 사설망으로 연결해 Hermes·Apollo·Raycast·Pi가 같은 로컬 엔드포인트를 이용함 Qwen3.6-35B-A3B 4비트 모델은 약 20GB를 사용하면서 프롬프트 처리 325 tok/s, 토큰 생성 34 tok/s를 기록하고, Gemma-4-E4B는 약 2.4GB라 가벼운 작업에 적합함 로컬 모델이 GPT-5나 Claude Opus까지 필요하지 않은 일상 요청의 약 80% 를 맡고, 고성능 API 모델은 필요한 경우에만 병행하는 방식임 서버와 클라이언트 구성 48GB RAM을 탑재한 M4 Pro Mac mini에서 로컬 LLM 서버와 Hermes 에이전트 백엔드를 함께 실행함 모델과 기반 소프트웨어는 다음과 같이 구성함 Qwen3.6-35B-A3B-OptiQ-4bit: 추론이나 깊이 있는 처리가 필요한 주력 모델 Gemma-4-E4B-it-OptiQ-4bit: 간단한 대화, 서식 지정, 반복 작업용 경량 모델 oMLX: 추론 서버 Tailscale: Mac mini, iPhone, MacBook을 연결하는 tailnet 기기마다 용도에 맞는 클라이언트를 사용함 MacBook의 Hermes 데스크톱 앱과 iPhone의 Telegram으로 Hermes에 접근함 iOS에서는 Apollo로 짧은 질문을 처리함 Mac에서는 Raycast AI를 임시 작업에 활용함 코딩에는 Pi를 사용하며, 별도의 Pi 구성 글도 있음 클라우드 API 대신 로컬을 선택한 이유 클라우드 API는 공급자가 가격, 사용량 제한, 실제 제공 모델을 바꿀 수 있는 임대 환경임 월 200달러 구독 두 개의 한도를 정기적으로 소진했음 같은 모델도 시점에 따라 성능이 달라지거나 별도 공지 없이 저하되는 경험이 있었음 외부 API로 보낸 데이터가 어떻게 이용·판매·노출될지 알기 어려워 운영 보안 위험이 생김 민감한 코드, 고객 데이터, 독점 워크플로를...

Read Entire Article