GLM-5.3: 계획에 없던 사이버 보안 능력을 갖추게 된 Z.ai의 코딩 모델
GLM-5.2에서 달라진 점, 에이전트에 중요한 벤치마크, 그리고 오픈 웨이트 공개가 단계적으로 이루어지는 이유

Z.ai는 2026년 8월 14일 GLM-5.3을 출시했습니다. 이번 포인트 릴리스는 이례적인 특징을 지닙니다. 베이스 모델은 GLM-5.2와 동일하지만 코딩 및 에이전트 성능 수치가 크게 향상되었고, 회사 측이 전혀 계획하지 않았다고 밝힌 사이버 보안 능력까지 갖추게 되었습니다. 실제로 무엇이 달라졌는지, AI 에이전트를 개발하는 데 중요한 벤치마크는 무엇인지, 그리고 오픈 웨이트가 아직 공개되지 않은 이유를 살펴봅니다.
GLM-5.3이란?
GLM-5.3은 Z.ai의 GLM 시리즈 중 최신 오픈 웨이트 모델로, 프론티어급 코딩 및 에이전틱(agentic) 모델로 자리매김하고 있습니다. 핵심 특징은 GLM-5.2와 동일한 7430억 파라미터 Mixture-of-Experts 베이스를 재사용한다는 점이며, 보고된 모든 성능 향상은 새로운 아키텍처가 아닌 확장된 *포스트 트레이닝(post-training)*에서 비롯됩니다(MarkTechPost).
쉽게 말해, Z.ai는 기존 모델을 더 많고 다양한 작업 환경에서 학습시키는 데 더 많은 컴퓨팅 자원을 투입했습니다. 이것이 전부입니다. 포스트 트레이닝만으로 오픈 웨이트 모델을 얼마나 발전시킬 수 있는지 추적하는 사람들에게 유용한 데이터 포인트가 됩니다.
GLM-5.3이 GLM-5.2보다 나아진 점
Z.ai는 이 방법론을 *환경 스케일링(environment scaling)*이라고 설명합니다. GLM-5.2가 트레이닝 스택을 도입했다면, GLM-5.3은 훨씬 더 많은 시뮬레이션된 전문 업무 환경에서 모델을 실행하는 데 더 많은 컴퓨팅을 투입합니다(Unite.AI).
이는 단순한 코딩 퍼즐이 아닙니다. 한 예시에서 모델은 ML 인프라 엔지니어의 환경에 투입됩니다. 컴퓨팅 클러스터, 내부 문서, 코드베이스, 실험 결과가 주어지고, 병목 현상을 진단하고 수정 사항을 구현하여 측정 가능한 성능 향상을 달성해야 합니다. 일부 작업은 숙련된 엔지니어가 며칠에 걸쳐 수행할 분량입니다. 이러한 환경을 대규모로 구축하기 위해 Z.ai는 실제 업무 패턴을 실행 가능한 장기 환경으로 변환하는 리서치 에이전트와, 각 작업이 실제로 해결 가능한지 검증하는 판정 에이전트를 활용합니다.
이 방식의 효과는 예상대로 나타납니다. 작업 기간이 길수록 성능 향상 폭이 커집니다.
GLM-5.3 코딩 벤치마크
아래 수치는 모두 벤더 자체 보고 기준입니다. GLM-5.2 대비 비교:
- Terminal-Bench 3.0: 4.6 → 28.3 — 장기 CLI 벤치마크에서 약 6배 향상.
- DeepSWE v1.1: 46.2 → 66.9.
- Agents' Last Exam (CLI): 23.8 → 28.5.
- GDPval-AA v2 (44개 직종 포괄): 1,769점 기록.
Z.ai 내부 Code Bench에서는 GLM-5.2 대비 약 50% 향상을 보고했으며, 주목할 만한 효율성 지표도 있습니다. GLM-5.3은 **작업당 약 50,000 출력 토큰으로 31.4%**를 기록한 반면, Claude Opus 4.8은 120,000 토큰을 사용해 29.5%를 달성했습니다. 훨씬 적은 토큰으로 더 많은 작업을 처리한 셈입니다. Claude Fable 5는 최대 노력 기준 39.5%로 해당 벤치마크 1위를 유지하고 있습니다(MarkTechPost).
솔직한 한계도 있습니다. 공개 벤치마크에서 GLM-5.3은 난이도 높은 코딩 평가 여러 항목에서 GPT-5.6 Sol과 Fable 5에 뒤처집니다. 또한 Code Bench는 비공개 벤치마크이므로 수치를 독립적으로 검증할 수 없습니다. Z.ai가 비공개를 유지하는 이유는 오염(contamination) 문제, 즉 공개 테스트 세트가 학습 데이터에 유입되는 것을 방지하기 위해서입니다.
Z.ai가 계획하지 않았다고 밝힌 사이버 보안 성능
이 부분이 GLM-5.3을 일반적인 모델 출시 뉴스 이상으로 주목받게 만든 요소입니다. Z.ai는 포스트 트레이닝에 취약점 발견 데이터를 추가하면서 모델이 개별 버그에 대한 추론 능력을 향상시킬 것으로 기대했습니다. 그런데 학습이 확장될수록 능력이 계속 복합적으로 발전하여, 모델이 완전한 익스플로잇 체인(exploitation chain) 전반에 걸친 일관된 계획을 수립하기 시작했습니다(SiliconRepublic).
수치가 이를 뒷받침하며, 벤치마크가 익스플로잇 체인의 깊은 단계에 위치할수록 향상 폭이 커지는 패턴이 동일하게 나타납니다.
- CyberGym (화이트박스 소스에서 버그 발견 및 검증): 77.2% → 84.5% — Mythos 5(83.8%)와 GPT-5.6 Sol(83.6%)을 근소하게 앞섬.
- ExploitBench (근본 원인 추론 및 실제 작동하는 익스플로잇): 24.4% → 54.4% — GLM-5.2 대비 두 배 이상 향상, 다만 Mythos 5(78.0%)에는 여전히 뒤처짐.
- ExploitGym (시간 예산 내 완료 작업 수): 2시간에 105개, 6시간에 130개 — GLM-5.2의 29개, 39개 대비 대폭 향상.
Z.ai는 또한 자사 모델이 실제 배포된 버그를 발견했다고 밝혔습니다. GLM-5.2 이후 269개 오픈소스 프로젝트에서 2,436개의 취약점을 발견했으며, 그 중 1,097개는 심각(critical) 또는 높음(high) 등급으로 커널, 브라우저 엔진, 네트워크 프로토콜에 걸쳐 있습니다. 가장 오래된 버그는 1981년으로 거슬러 올라간다고 합니다. 이 내용은 공개 보안 공개 원장(Security Disclosure Ledger)에 기록되며, 출시 시점에 53개의 CVE가 공개되었고 2,383개는 아직 엠바고 중입니다.
오픈 웨이트가 아직 공개되지 않은 이유
이 부분이 GLM-5.2의 방식과 달라진 점입니다. GLM-5.2의 웨이트는 출시 후 며칠 내에 Hugging Face에 공개되었습니다. GLM-5.3의 웨이트는 단계적으로 공개됩니다. 현재는 Z.ai API, GLM Coding Plan, ZCode를 통해서만 이용 가능하며, 안전성 평가 및 강화 작업을 거쳐 약 2주 후에 웨이트가 공개될 예정입니다(SiliconANGLE).
그 이유는 사이버 보안 결과와 직접적으로 연결됩니다. Z.ai는 예상보다 빠르게 공격적 보안 능력을 개발한 모델을 강화하는 작업을 진행 중입니다. 이는 안전성 검토를 이유로 공개가 보류된 첫 번째 GLM 릴리스입니다.
개발자들이 주목해야 할 API 수준의 변경 사항도 있습니다. GLM-5.3은 세 가지 사고 노력 수준(low, high, max)을 지원하며, 더 이상 사고 기능을 비활성화할 수 없습니다. 이전에 사고 기능을 꺼두고 앱을 운영했다면 호환성이 깨지는 변경 사항입니다.
AI 에이전트를 개발한다면 GLM-5.3이 의미하는 것
실용적인 시사점 몇 가지:
- 장기 코딩 에이전트가 핵심 강점입니다. 성능 향상은 단발성 완성이 아닌 다단계 CLI 작업과 레포지토리 규모의 작업, 즉 리팩터링, CI 트리아지, 장기 실행 에이전트 루프에 집중됩니다.
- 효율성이 헤드라인 점수만큼 중요합니다. 120K 토큰 대신 약 50K 토큰으로 동등한 작업을 처리하는 것은 하루 종일 실행되는 에이전트 워크로드에서 실질적인 비용 절감 요소입니다.
- 지금 바로 사용할 수 있지만, 모든 환경에서는 아닙니다. 스타트업은 Coding Plan이나 API를 통해 지금 도입할 수 있습니다. 데이터 레지던시나 벤더 검토 규정이 있는 팀은 웨이트 공개를 기다려야 합니다.
- 벤더 벤치마크는 출발점으로만 활용하세요. 가장 눈에 띄는 수치(내부 Code Bench, 하네스 내 사이버 점수)는 아직 독립적으로 검증되지 않았습니다. 2026년 8월 말로 예상되는 웨이트 공개 이후 외부 테스트가 시작될 것입니다.
GLM-5.3 같은 모델을 나만의 AI 인력으로 활용하기
GLM-5.3의 이야기는 결국 장기적이고 에이전틱한 작업, 즉 단일 프롬프트에 답하는 것이 아니라 다단계 작업을 처음부터 끝까지 실행하는 모델에 관한 것입니다. 이것이 바로 Eigent가 구축된 목적입니다. Eigent는 오픈소스 로컬 "Cowork" 데스크톱 앱으로, 이러한 모델을 실제 워크플로우를 위한 멀티 에이전트 인력으로 전환합니다. GitHub PR 검토부터 완전히 소유할 수 있는 셀프 호스팅 AI 코딩 에이전트 운영까지 가능합니다. 원하는 모델을 직접 가져오고, 작업은 내 컴퓨터에서 처리하세요. Eigent를 다운로드하고 오늘 바로 나만의 에이전트 워크플로우를 구축해 보세요.
Recent Posts

DeepSeek Harness: 모든 것이 플러그인인 오픈소스 에이전트 런타임
DeepSeek Harness v0.1이 개발자 프리뷰로 출시되었습니다. Cordis 기반의 오픈소스 MIT 라이선스 에이전트 런타임으로, 모델·도구·샌드박스·UI가 모두 플러그인으로 구성됩니다.

Grok 4.6 기능과 AI 에이전트 실제 활용 사례
Grok 4.6 기능과 활용 사례에 대한 실용적 분석: 장기 실행 에이전트, 코딩, 시각적 작업, 그리고 멀티 에이전트 AI 워크포스에서의 활용법.

Grok 4.6 vs Grok 4.5, GPT-5.6 Sol & Fable 5: 실제로 무엇이 달라지나
Grok 4.6 vs Grok 4.5, GPT-5.6 Sol, Fable 5: xAI가 실제로 확인한 내용, 아직 추측에 불과한 내용, 그리고 이번 포스트 트레이닝 전용 업그레이드가 넘어야 할 실제 벤치마크 기준.