Show HN: Echo — 오픈 가중치 모델로 Fable 수준 결과를 3분의 1 비용에 달성

18 hours ago 8
  • Echo는 GLM-5.2, Kimi K2.7 등 여러 오픈 가중치 모델을 요청별로 조합해, 단일 모델에 모든 작업을 맡기는 방식의 한계를 보완함
  • 요청마다 연산량과 참여 모델을 정하고 결과 결합 방식까지 조정해, 간단한 프롬프트에는 적은 추론 자원을 사용함
  • 첫 평가 구성에서 풀의 최고 개별 모델을 일관되게 앞섰으며, Fable과 비슷한 종합 결과를 약 3분의 1 추론 비용으로 달성함
  • 전반적으로 약한 모델도 특정 문제나 조합에서는 유용할 만큼 능력이 상호 보완적이지만, 할당과 결합을 잘못 결정하는 사례도 남아 있음
  • 채팅 인터페이스와 OpenAI 호환 API를 공개했으며, 품질 측정이 더 어려운 코딩·에이전트 작업에서도 같은 접근법이 유효한지 시험 중임

모델 선택과 결과 결합

  • 초기 실험에서는 GLM-5.2, Kimi K2.7 등을 동일한 평가에 투입하고, 문제마다 유용한 모델과 적절한 출력 결합법을 사전에 안다고 가정해 결과를 측정함
    • 이 가상 시스템은 풀에 포함된 어떤 개별 모델보다도 훨씬 높은 성능을 냄
    • 결과를 확인한 뒤에야 좋은 결정을 식별할 수 있어 실제 배포에는 사용할 수 없으며, Echo는 사전 정보 없이도 그 이점의 일부를 회복하려는 시도임
  • 요청의 특성에 따라 필요한 연산량과 참여 모델, 결과 결합 방식을 선택함
    • 간단한 프롬프트에는 비교적 적은 추론을 할당함
    • 다른 문제에서는 여러 모델이 서로 다른 부분을 처리하도록 구성함
  • 모델들의 능력은 상호 보완적이어서, 전체 성능이 명확히 낮은 모델도 특정 문제나 조합에서는 매우 유용할 수 있음

평가 결과와 공개 테스트

  • 첫 평가 구성에서 최고 개별 모델보다 일관되게 높은 성능을 기록했으며, 비교 대상인 Fable과 대략 같은 종합 결과를 약 3분의 1 비용으로 달성함
  • 일부 요청에서는 연산 할당이나 모델 결합을 잘못 결정하며, 현재 이러한 실패 사례를 분석하고 있음
  • 코딩 및 에이전트 작업은 각 결정의 품질을 측정하기가 훨씬 어려워, 동일한 접근법이 유지되는지 별도로 시험 중임
  • 외부 테스트를 위해 Echo 채팅 인터페이스OpenAI 호환 API를 제공함
  • 작동 방식 소개 영상평가 방법론·개별 모델 결과·비용·현재 한계를 공개하고, 비정상적인 실패나 직관적이지 않은 자원 할당 사례에 대한 피드백을 요청함
Read Entire Article