Laya - Jev의 오픈소스 버전

1 week ago 22

Laya는 텍스트를 생성하는 대신 구조화된 질문에 선택지, 점수, 불리언 확률을 반환하는 비자기회귀형 의사결정 모델군으로, 여러 질문을 한 번의 순전파로 처리함 양방향 인코더 기반으로 단일 GPU에서 질문 하나를 32.8ms, 질문 10개를 배치 처리할 때 질문당 7.2ms에 평가하며, 코드와 가중치를 Apache 2.0으로 공개함 영어용, 다국어용, 업무 특화 체크포인트를 제공하고 문자 체계 기반 라우터로 입력을 분배함. 영어 모델은 읽지 못하는 문자에서도 높은 확신도를 반환하므로, 확신도만으로는 잘못된 모델 선택을 막기 어려움 공개 벤치마크 비교에서 AG News 정확도 0.950, typed-decisions 정확도 0.766을 기록했으나, 후자는 해당 벤치마크 학습 데이터로 미세조정한 결과이며 기본 모델의 제로샷 성능은 약 0.35임 선택지가 20개를 넘으면 성능이 저하되며, 신뢰할 수 있는 확률을 얻으려면 도메인별 온도 보정이 필요함. 질문 유형별 보정으로 기대 보정 오차를 0.466에서 0.081로 낮춤 개발 경위와 System 1 접근 출발점은 2025년 3월 공개한 판매 대화 의사결정 모델로, 시퀀스 표현에 PPO를 적용해 대화 턴별 전환 확률을 0.0~1.0으로 출력함 첫 논문, 모델 가중치, 공개 데이터셋, PyPI 패키지를 공개하고 Reddit 토론에 접근법을 공유함 2025년 9월에는 강화학습이 이끄는 스키마 기반 의사결정 프레임워크를 정식화한 두 번째 논문을 공개함 개발진은 TypeSafe AI의 Jev가 같은 비자기회귀형 의사결정 개념을 새로운 돌파구처럼 내세웠다는 불만에서 출발해, 기존 구조의 한계를 고친 범용 모델군 Laya를 개발함 개발진에 따르면 OpenAI에서 ChatGPT 공동 발명에 참여한 Diogo Almeida가 설립한 TypeSafe AI는 2026년 9월 Jev를 출시함 Jev는 기술 논문, 공개 가중치, 공개 학습 데이터셋 없이 출시됐으며, RLCD(Reinforcement Learning for Calibrated Decisions) 를 이용한 병렬 샘플링으로 확신도 분포와 스키마 선택을 출력함 Jev의 요금은 입력 100만 토큰당 0.042달러이며, 일반적인 응답 시간은 약 150ms임 System 1의 목표는 생성형 LLM을 호출하지 않고 단순하고 구조화된 판단을 즉시 수행하는 것임 지원 티켓 부서 배정, 피싱/스팸 판별, 탈옥/프롬프트 주입 탐지, 0~3단계...

Read Entire Article