GLM-5.3, 오픈 웨이트로 공개

1 week ago 20

GLM-5.3은 GLM-5.2와 동일한 기반 모델을 사용하며, 성능 향상은 모두 후속 학습에서 나옴 자체 Z.ai Code Bench에서 GLM-5.2보다 코딩 성능이 50% 향상됐고, Terminal Bench 3.0과 Agent's Last Exam에서 오픈소스 최고 수준을 기록함 후속 학습 규모를 늘리자 사이버 보안 역량이 예상보다 빠르게 발달해 CyberGym에서 최고 수준에 올랐고, 공격 단계가 깊어지는 벤치마크에서는 GLM-5.2 점수를 2배 이상 높임 Transformers, vLLM, SGLang 등 여러 추론 프레임워크와 Ascend NPU를 지원하며, OpenAI 호환 API나 Docker로 배포할 수 있음 사고 예산은 reasoning_effort의 low, high, max로 조절하며 기본값은 max이고, 채팅에서는 clear_thinking=true 를 명시해야 함 동일한 기반 모델, 확장된 후속 학습 GLM-5.3은 GLM-5.2와 같은 기반 모델을 사용하며, 모든 성능 향상은 후속 학습에서 발생함 복잡한 코딩과 장기 작업 수행 능력을 집중적으로 개선함 자체 Z.ai Code Bench에서 GLM-5.2보다 50% 향상됨 Terminal Bench 3.0과 Agent's Last Exam에서 오픈소스 최고 수준을 달성함 후속 학습을 확장하는 과정에서 사이버 보안 역량이 예상보다 빠르게 발달함 CyberGym에서 취약점 탐지 최고 수준을 기록함 공격 체인의 상위 단계로 갈수록 향상 폭이 커졌으며, ExploitGym과 ExploitBench에서 GLM-5.2를 2배 이상 앞섬 코딩·보안·에이전트 벤치마크 코딩 및 소프트웨어 엔지니어링 평가 결과는 다음과 같음 Terminal Bench 2.1: GLM-5.3은 88.2로 GLM-5.2의 81.0을 앞섰고, GPT-5.6 Sol은 88.8임 Terminal Bench 3.0: 28.3으로 GLM-5.2의 4.6, Kimi K3의 17.4, Opus 4.8의 21.1보다 높지만 Fable 5의 33.7과 GPT-5.6 Sol의 34.6보다 낮음 DeepSWE v1.1은 66.9, NL2Repo는 58.0, ProgramBench Almost Solved는 19.0, FrontierSWE는 78.1임 SWE-Marathon v1.1은 42.5, PostTrainBench는 39.8을 기록함 사이버 보안 평가에서는 CyberGym 84.5, Ex...

Read Entire Article