노타, 초대형 AI 모델 최적화 기술력 입증…‘EMNLP 2026’ 논문 2편 채택

6 days ago 9

등록 2026-08-25 오전 8:48:43 수정 2026-08-25 오전 8:48:43 가 가 [이데일리 박정수 기자] AI 모델 경량화·최적화 기업 노타(486990)가 세계적인 인공지능(AI) 학술대회에서 초거대 언어모델(LLM) 최적화 기술력을 잇달아 인정받았다. 노타는 자연어처리(NLP) 분야 국제학술대회 ‘EMNLP 2026’에서 초거대 AI 모델 최적화 관련 논문 2편이 각각 메인 컨퍼런스와 파인딩스(Findings)에 채택됐다고 25일 밝혔다. 올해 EMNLP에는 약 1만8000편의 논문이 제출됐으며 메인 컨퍼런스 논문 채택률은 15.4%를 기록했다. EMNLP는 구글과 메타, 오픈AI 등 글로벌 빅테크와 주요 대학 연구진이 참여해 최신 자연어처리 연구 성과를 발표하는 학술대회다. 이번에 채택된 논문은 GPT 계열과 큐웬(Qwen), 키미(Kimi) 등 최신 LLM에 적용되고 있는 ‘전문가 혼합 모델(Mixture of Experts·MoE)’의 양자화 과정에서 발생하는 성능 저하 문제를 다뤘다. MoE는 입력에 따라 필요한 일부 전문가만 연산하는 구조지만 전체 모델을 메모리에 저장해야 해 실제 구동 과정에서는 상당한 GPU와 메모리가 필요하다. 양자화를 적용하면 필요한 자원을 줄일 수 있지만 수치 변화로 기존과 다른 전문가가 선택될 경우 모델의 답변 성능이 저하될 수 있다. 메인 컨퍼런스에 채택된 논문은 양자화가 이후 단계의 전문가 선택에 미치는 영향까지 반영하고 선택 경계에 있는 전문가의 순서를 보존하는 ‘MENDS-MoE’ 방법론을 제시했다. 3종의 MoE 모델을 대상으로 4비트와 3비트 양자화 실험을 진행한 결과 대부분의 평가 환경에서 비교 기술보다 높은 평균 정확도와 언어모델 성능을 기록했다. 파인딩스에 채택된 논문은 모든 전문가 선택 변화를 일률적으로 보정하는 대신 최종 답변에 영향을 미치는 변화에 최적화를 집중하는 ‘오페라(OPERA)’ 방법론을 제안했다. 두 연구 모두 양자화 이후에도 적절한 전문가 선택을 유지하면서 모델 성능 저하를 최소화하는 데 초점을 맞췄다. 노타는 앞서 지난 7월 열린 ICML 2026 ‘자원 적응형 파운데이션 모델 추론(AdaptFM)’ 워크숍의 ‘Efficient Qwen Competition’에서도 전 세계 약 40개 팀 가운데 3위를 차지했다. 오픈소스 LLM 큐웬 3.5-4B를 엔비디아 A10G GPU 한 장에서 구동하면서 모델 성능을 유지하고 기존 ...

Read Entire Article