Desert Ant Labs, 기기에서 직접 음성·이미지·텍스트를 처리하는 빠른 로컬 AI 모델 18개 공개

1 day ago 15

음성 인식, 녹음 음질 개선, 개인정보 가리기 등을 기기 안에서 처리하는 소형 특화 모델 18개를 공개함. 안정 버전 12개와 베타 6개로 구성 반복 작업마다 대형 모델 API를 호출하는 대신 작업에 맞는 작은 모델을 로컬에서 실행해, 서버 왕복과 호출당 비용 없이 데이터를 기기에 유지하는 방식임 영상 앱 Detail을 개발하며 늘어난 클라우드 비용과 바로 쓸 수 있는 로컬 모델의 부족을 겪은 팀이 직접 개발했으며, Dolby의 오디오 개선과 Claude Sonnet의 영상 클립 선별을 자체 모델로 대체함 자체 발표 기준 Voz는 iPhone에서 10분 오디오를 2초 만에 전사하고, 9MB 모델 Clear는 5분 녹음을 1초 만에 개선하며, 2MB 모델 Tongue는 세 단어로 84개 언어를 식별함 Swift/Kotlin/JavaScript SDK로 앱에 통합할 수 있으며, 모든 모델은 SDK별 월간 활성 기기 10만 대까지 무료로 제공하고 기기당 추론 횟수는 제한하지 않음 작업별 온디바이스 모델 18개 공개 Desert Ant Labs는 효율적인 지능의 출발점을 온디바이스에 두고, 오디오·비전·텍스트용 소형 특화 모델을 개발하는 유럽 AI 연구소임 첫 공개 모델은 안정 버전 12개와 베타 6개이며, 작업마다 전용 모델을 제공함 밀리초 단위 응답, 5년 된 휴대전화에서도 실행할 수 있는 크기, 매 프레임이나 키 입력마다 활용할 수 있는 속도를 내세움 토큰 비용이나 추론 속도에 제약받지 않고 제품의 모든 상호작용에 지능을 넣는 것이 목표임 모든 모델은 월간 활성 기기 10만 대까지 무료이며, 토큰이나 로그인 없이 사용할 수 있음 아래 대표 모델 외 나머지 14개를 포함한 전체 사양과 벤치마크는 모델 목록과 Hugging Face에서 확인할 수 있음 대표 모델과 공개 벤치마크 Voz는 iPhone에서 10분 오디오를 2초 만에 전사하며, 각 단어의 시작·종료 시각을 제공함 소개 수치상 Whisper보다 4.7배 빠름 M3 Ultra에서 연속 30분 오디오를 처리한 벤치마크의 실시간 대비 배속은 Voz 319배, Apple SpeechAnalyzer 78배, Whisper large-v3-turbo 50배임 iPhone 17 Pro에서는 실시간 대비 298배에 도달함 Clear는 9MB 오디오 개선 모델로, 5분짜리 노트북 녹음을 1초 만에 스튜디오 품질로 바꿀 수 있음 기기에서 음질 개선·마스터링·재인코딩을 수행함...

Read Entire Article