Cactus가 도구 호출, 기기 제어, 구조화 추출에 특화된 오픈 45M 파라미터 모델 Needle 2를 공개함. 단일 14MB 바이너리로 전체 세션을 28MB RAM에서 실행하며 Apache 2.0으로 배포함 함수와 타입 지정 인자를 연결하는 문제로 범위를 좁혀 수십억 파라미터 없이 작동함. 선언된 스키마에서 컴파일한 바이트 단위 문법으로 모든 출력 토큰을 제한하고, 신뢰도가 낮으면 재질문하거나 클라우드로 넘길 수 있음 Raspberry Pi 5에서 디코딩 500+ tokens/s, Meta Quest 3S·Apple Vision Pro에서 400~1,500 tokens/s, 200달러 미만 Samsung A-Series에서 300~700 tokens/s를 기록하며 ESP32-S3급 기기에서도 실행 가능함 공개 함수 호출 평가에서 230M~270M급 모델 및 Apple FM과 승패를 주고받음. Seal-Tools에서는 Needle 2가 앞섰지만, BFCL v4 전체 정확도는 42.6% 로 Apple FM 61.7%, LFM2.5 60.8%, FunctionGemma 46.1%보다 낮았음 모델·양자화·추론 엔진을 함께 설계해 토큰당 연산량을 70 MFLOPs로 줄임. 고정 256토큰 슬라이딩 창과 28MB RAM 상한을 적용해 저가형 기기와 외장 RAM을 갖춘 마이크로컨트롤러에서도 비공개·오프라인 제어가 가능함 공개 모델과 실행 환경 Needle 2는 도구 호출, 기기 사용, 구조화 추출을 위한 45M 파라미터 모델임 Simple Attention Network를 기반으로 함 Cactus Quants의 CQ2-bit로 압축해 전용 엔진에 포함함 모델·토크나이저·문법 컴파일러를 의존성 없는 단일 C++ 바이너리에 담음 주요 자원 사용량과 실행 속도는 다음과 같음 파일 크기: 14MB 세션 RAM: 최대 28MB Raspberry Pi 5 프리필: 800+ tokens/s Raspberry Pi 5 디코딩: 500+ tokens/s Meta Quest 3S·Apple Vision Pro: 400~1,500 tokens/s 200달러 미만 Samsung A-Series: 300~700 tokens/s 웨어러블, 로봇, 스마트홈, 스마트폰, 자동차용 Playground를 제공함 Apache 2.0 라이선스를 적용했으며 Hugging Face 가중치와 실행 저장소를 공개함 200달러 미만 온디바이스 하드웨어 공략 연결된...
Needle 2 - 스마트폰·웨어러블·스마트홈·로봇을 위한 14MB 에이전트 LLM
3 hours ago
5
Related
Hanami - Rails를 대체하는 Ruby 프레임워크
1 hour ago
0
Show GN: 프리터뷰 - 가입 없이 포트폴리오부터 채점해보는 AI 모의면접
1 hour ago
0
Show GN: 공공데이터 통합검색 x AI
2 hours ago
0
바겐세일은 끝난다
3 hours ago
2
Show GN: TLcube — 세 면의 휘도 순서에 데이터를 싣는 2.5D 바코드
3 hours ago
1
Show GN: 알뜰계산기를 소개합니다
4 hours ago
2
영국의 익명성 전쟁, 미국에 상륙
5 hours ago
2
Postgres 내부로 CDC를 밀어 넣은 방법
5 hours ago
2
Tips
click
Trending
Popular
필리핀 “中 관영매체, 필리핀인을 원숭이로 묘사…인종차별”
3 weeks ago
150
北핵실험 연구한 美학자, 中에 20개월째 구금…외교문제 비화
4 weeks ago
122
© Clint's Theme Park 2026. All rights are reserved










English (US) ·