Ollaya - 오픈소스 Jev 스타일 의사결정 모델을 위한 Ollama

5 hours ago 4

Ollaya는 텍스트나 JSON에 타입이 지정된 질문을 하고, 보정된 답을 로컬 하드웨어에서 얻는 오픈소스 의사결정 모델 실행 도구임 토큰을 순차 생성하지 않고 한 번의 순전파로 답하며, RTX 4090에서 Laya로 질문 5개를 처리하는 HTTP API 요청의 전체 소요 시간은 8~10ms임 TypeSafe API 호환 엔드포인트를 제공해 공식 TypeSafe Python SDK 0.7.1을 수정 없이 로컬 서버에 연결할 수 있음 Laya, decider, nli, gliclass 등 공개 가중치 모델을 지원하며, 선택형/점수형/예·아니요 질문과 다국어 처리에 사용할 수 있음 ONNX Runtime으로 CPU 또는 NVIDIA GPU에서 실행하며, 데이터를 로컬에서 처리하고 사용량 계량이나 토큰당 API 요금 없이 이용할 수 있음 로컬 실행, API 호환성과 보정된 응답 의사결정 모델은 토큰별 생성 없이 한 번의 순전파로 답을 산출함 Laya는 RTX 4090에서 질문 5개를 HTTP API로 처리할 때 전체 소요 시간이 8~10ms임 비교 대상인 호스팅 API TypeSafe Jev의 요청 시간 중앙값은 236~276ms임 /v1/systemone과 /v1/models 는 TypeSafe의 요청/응답 형식을 따르며, 공식 Python SDK 0.7.1과 호환됨 SDK의 기본 URL을 http://localhost:11435로 지정하고 모델을 laya로 설정할 수 있으며, API 키는 어떤 값이든 허용함 예시 요청은 고객 메시지를 invoice, refund, other 중 하나로 분류함 예시 응답은 선택 결과와 신뢰도, 선택지별 확률을 반환하며, 사용량은 입력 토큰 43개와 출력 토큰 0개임 확률 보정으로 임계값을 적용할 수 있는 확률을 제공함 온도 조정 후 Laya의 보정 오차(ECE)는 0.081, 비교 대상 Jev는 0.246임 개인정보 보호를 기본으로 하며 티켓, 이메일, 사용자 메시지를 데이터가 있는 환경에서 처리함 서버는 기본적으로 127.0.0.1에서 수신함 가중치는 모델 제작자의 Hugging Face 저장소에서 직접 가져오며, 특정 커밋에 고정하고 sha256으로 검증함 가중치를 재호스팅하지 않으며, 런타임은 Apache-2.0 라이선스임 하드웨어가 처리할 수 있는 만큼 실행할 수 있고 사용량 계량이나 API 청구가 없음 지원 모델과 실행 환경 Laya는 Convai Innovations의 ...

Read Entire Article