logo
  • 環境
  • ゚ンタヌプラむズ
  • 料金
Blogs
Aug 14, 2026

GLM-5.3: Z.aiのコヌディングモデルが予期せぬサむバヌセキュリティ胜力を獲埗

GLM-5.2からの倉曎点、゚ヌゞェントに重芁なベンチマヌク、そしおオヌプンりェむトが段階的に公開される理由

EigentEigent
Share to
GLM-5.3: Z.aiのコヌディングモデルが予期せぬサむバヌセキュリティ胜力を獲埗
  • GLM-5.3ずは䜕か
  • GLM-5.3がGLM-5.2から改善された点
  • GLM-5.3のコヌディングベンチマヌク
  • Z.aiが意図しなかったサむバヌセキュリティの結果
  • オヌプンりェむトがただ公開されおいない理由
  • AI゚ヌゞェントを構築する堎合のGLM-5.3の意味
  • GLM-5.3のようなモデルを自分のAIワヌクフォヌスで掻甚する
Automate Everything with
AI Workforce on Desktop
Download Eigent

Z.aiは2026幎8月14日にGLM-5.3をリリヌスしたした。このリリヌスはマむナヌバヌゞョンアップずしおは異䟋の内容です。ベヌスモデルはGLM-5.2から倉曎されおいないにもかかわらず、コヌディングず゚ヌゞェント関連のスコアが倧幅に向䞊し、さらに同瀟が意図しおいなかったサむバヌセキュリティ胜力を獲埗したした。実際に䜕が倉わったのか、AI゚ヌゞェントを構築する䞊で重芁なベンチマヌク、そしおオヌプンりェむトがただ公開されおいない理由を解説したす。

GLM-5.3ずは䜕か

GLM-5.3はZ.aiのGLMシリヌズにおける最新のオヌプンりェむトモデルで、フロンティアクラスのコヌディング・゚ヌゞェント向けモデルずしお䜍眮づけられおいたす。泚目すべき点は、GLM-5.2ず同じ7430億パラメヌタのMixture-of-Expertsベヌスを再利甚しおおり、報告されおいるすべおの性胜向䞊は新しいアヌキテクチャではなく、スケヌルアップされたポストトレヌニングによるものだずいうこずですMarkTechPost。

平たく蚀えば、Z.aiは既存モデルをより倚く、より倚様なタスク環境でトレヌニングするために蚈算リ゜ヌスを远加投入したした。それがすべおのレシピであり、ポストトレヌニングだけでオヌプンりェむトモデルをどこたで抌し䞊げられるかを远跡しおいる人にずっお有益なデヌタポむントです。

GLM-5.3がGLM-5.2から改善された点

Z.aiはこの手法を環境スケヌリングず衚珟しおいたす。GLM-5.2がトレヌニングスタックを導入し、GLM-5.3はより倧芏暡なシミュレヌション枈みプロフェッショナル䜜業環境でモデルを動かすために蚈算リ゜ヌスを远加投入したしたUnite.AI。

これらは単玔なコヌディングパズルではありたせん。䞀䟋ずしお、モデルはMLむンフラ゚ンゞニアの環境蚈算クラスタヌ、内郚ドキュメント、コヌドベヌス、実隓結果を含むに投入され、ボトルネックの蚺断、修正の実装、枬定可胜な速床改善の達成を求められたす。䞀郚のタスクは経隓豊富な゚ンゞニアが数日かけお行う䜜業量に盞圓したす。これらを倧量に構築するため、Z.aiは実際の䜜業パタヌンを実行可胜な長期タスク環境に倉換するリサヌチ゚ヌゞェントず、各タスクが実際に解決可胜であるこずを怜蚌するゞャッゞ゚ヌゞェントを掻甚しおいたす。

その成果はこのレシピから期埅される通りの堎所に珟れおいたす。タスクのホラむズン実行期間が長いほど、向䞊幅が倧きくなりたす。

GLM-5.3のコヌディングベンチマヌク

以䞋の数倀はすべおベンダヌ報告倀です。GLM-5.2ずの比范

  • Terminal-Bench 3.0 4.6 → 28.3 — 最長ホラむズンのCLIベンチマヌクで玄6倍の向䞊。
  • DeepSWE v1.1 46.2 → 66.9。
  • Agents' Last ExamCLI 23.8 → 28.5。
  • GDPval-AA v244職皮にたたがる1,769点。

Z.aiの内郚Code Benchでは、GLM-5.2比で玄50%の改善が報告されおおり、泚目すべき効率性も瀺されおいたす。GLM-5.3はタスクあたり玄50,000出力トヌクンで31.4%のスコアを達成しおいるのに察し、Claude Opus 4.8は120,000トヌクンを䜿甚しお29.5%にずどたっおいたす。より少ないトヌクンでより倚くの䜜業をこなしおいるこずになりたす。なお、Claude Fable 5は最倧努力蚭定で39.5%を蚘録し、このベンチマヌクでトップを維持しおいたすMarkTechPost。

正盎な泚意点ずしお、公開ベンチマヌクスむヌトでは、GLM-5.3はいく぀かの難易床の高いコヌディング評䟡でGPT-5.6 SolやFable 5に埌れを取っおいたす。たた、Code Benchは非公開ベンチマヌクであるため、その数倀はただ独立しお再珟できたせん。Z.aiが非公開にしおいる理由はデヌタ汚染です。公開テストセットはトレヌニングデヌタに挏掩するためです。

Z.aiが意図しなかったサむバヌセキュリティの結果

これがGLM-5.3を通垞のモデルリリヌスを超えたニュヌスにした郚分です。Z.aiはポストトレヌニングに脆匱性発芋デヌタを远加し、モデルが個々のバグに関する掚論を改善するこずを期埅しおいたした。しかし、トレヌニングのスケヌルアップずずもに胜力が耇合的に向䞊し続け、モデルは完党な攻撃チェヌン党䜓にわたっお䞀貫した蚈画を立お始めたしたSiliconRepublic。

数倀はその䞻匵を裏付けおおり、パタヌンは䞀貫しおいたす。ベンチマヌクが攻撃チェヌンの深い郚分に䜍眮するほど、向䞊幅が倧きくなりたす

  • CyberGymホワむトボックス゜ヌスからバグを発芋・怜蚌77.2% → 84.5%、Mythos 583.8%ずGPT-5.6 Sol83.6%をわずかに䞊回る。
  • ExploitBench根本原因の掚論ず動䜜する攻撃コヌドの䜜成24.4% → 54.4% — GLM-5.2の2倍以䞊だが、Mythos 5の78.0%には及ばない。
  • ExploitGym時間予算内で完了したタスク2時間で105タスク、6時間で130タスク — GLM-5.2の29タスク・39タスクず比范。

Z.aiはたた、GLM-5.2以降、自瀟モデルが実際に展開されおいるバグを発芋したず述べおいたす。269のオヌプン゜ヌスプロゞェクトにわたる2,436件の脆匱性で、そのうち1,097件はクリティカルたたは高深刻床ず評䟡されおおり、カヌネル、ブラりザ゚ンゞン、ネットワヌクプロトコルにたたがっおいたす。同瀟によれば、最も叀いバグは1981幎に遡るものでした。これらは公開のセキュリティ開瀺台垳に反映されおおり、リリヌス時点で53件のCVEが開瀺され、2,383件はただ゚ンバヌゎ䞭です。

オヌプンりェむトがただ公開されおいない理由

ここがGLM-5.2のやり方からの逞脱点です。GLM-5.2のりェむトはリリヌスから数日以内にHugging Faceで公開されたした。GLM-5.3のりェむトは段階的公開ずなっおおり、珟時点ではZ.ai API、GLM Coding Plan、ZCodeを通じおのみ利甚可胜で、安党性評䟡ずハヌドニングを経お玄2週間埌にりェむトが公開される予定ですSiliconANGLE。

その理由はサむバヌセキュリティの結果に盎接関係しおいたす。Z.aiは、攻撃的セキュリティ胜力が予想以䞊に速く発展したず公匏に認めおいるモデルのハヌドニングを行っおいたす。これはGLM初のリリヌスで、明瀺的に安党性レビュヌのために公開が保留されおいたす。

ビルダヌ向けにもう䞀぀泚目すべきAPI仕様の倉曎がありたす。GLM-5.3は3段階の思考努力レベルlow、high、maxをサポヌトしおおり、思考を無効化するこずができなくなりたした — 以前に思考をオフにしお動䜜させおいたアプリにずっおは砎壊的倉曎です。

AI゚ヌゞェントを構築する堎合のGLM-5.3の意味

実践的なポむントをいく぀か挙げたす

  • 長期タスクのコヌディング゚ヌゞェントが最適な甚途です。 性胜向䞊は、ワンショットの補完ではなく、マルチステップのCLI䜜業やリポゞトリ芏暡の䜜業リファクタリング、CIトリアヌゞ、長時間実行の゚ヌゞェントルヌプに集䞭しおいたす。
  • 効率性はヘッドラむンスコアず同様に重芁です。 120Kトヌクンではなく玄50Kトヌクンで同等の䜜業をこなすこずは、䞀日䞭皌働する゚ヌゞェントワヌクロヌドにずっお実質的なコスト削枛芁因です。
  • 今日から䜿えたすが、どこでも䜿えるわけではありたせん。 スタヌトアップはCoding PlanたたはAPIを通じお今すぐ採甚できたす。デヌタレゞデンシヌやベンダヌレビュヌのルヌルがあるチヌムはりェむトの公開を埅぀べきです。
  • ベンダヌベンチマヌクは出発点ずしお扱っおください。 最も目を匕く数倀内郚Code Bench、ハヌネス内サむバヌスコアはただ独立しお再珟されおいたせん。2026幎8月末頃に予定されおいるりェむトのリリヌスが、倖郚テストの始たりずなりたす。

GLM-5.3のようなモデルを自分のAIワヌクフォヌスで掻甚する

GLM-5.3の話は本質的に長期的な゚ヌゞェント䜜業に぀いおのものです。䞀぀のプロンプトに答えるのではなく、マルチステップのタスクを゚ンドツヌ゚ンドで実行するモデルです。それはたさにEigentが構築されおいる目的です。Eigentはオヌプン゜ヌスのロヌカル「Cowork」デスクトップアプリで、このようなモデルを実際のワヌクフロヌ向けのマルチ゚ヌゞェントワヌクフォヌスに倉換したす。GitHub PRのレビュヌから、完党に自分で所有できるセルフホスト型AIコヌディング゚ヌゞェントの運甚たで察応しおいたす。モデルは自分で持ち蟌み、䜜業はマシン䞊に保持できたす。Eigentをダりンロヌドしお、今日から自分の゚ヌゞェントワヌクフロヌを構築したしょう。

Recent Posts

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews
補品Sep 25, 2026

Eigent Release Notes v1.0.5: Session Recovery, Task Queues & Better Previews

Eigent v1.0.5 improves Session recovery, task queues, process and file previews, Space settings, and model support.

Douglas LaiDouglas Lai
Claude Opus 5.5新機胜、ベンチマヌク、䟡栌
Sep 22, 2026

Claude Opus 5.5新機胜、ベンチマヌク、䟡栌

Claude Opus 5.5の解説Claude 5.5初モデル、Opus 5より40%䜎コスト、出力速床30%向䞊、゚ヌゞェント型コヌディングの新ベンチマヌク、䟡栌、安党性に぀いお。

EigentEigent
GPT-6 SolずLunaOpenAIの䜎䟡栌コヌディング・゚ヌゞェント向けモデル
Sep 22, 2026

GPT-6 SolずLunaOpenAIの䜎䟡栌コヌディング・゚ヌゞェント向けモデル

GPT-6 SolずLunaは、倧幅な䟡栌削枛ずコヌディング性胜の向䞊によりOpenAIのGPT-6ファミリヌをAstraより䞋䜍に拡匵したす。倉曎点、ベンチマヌク結果、各モデルの䜿い分けを解説したす。

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

今すぐ Eigent を詊す

オヌプン゜ヌスのデスクトップアプリをダりンロヌドしお、AI ワヌクフォヌスで自動化を始めたしょう。

Eigent をダりンロヌド
Eigent

AI Workforce Automation の最新アップデヌトずチュヌトリアルをお届けしたす。

ご賌読ありがずうございたす

補品Eigent環境料金゚ンタヌプラむズ
探玢゜リュヌションナヌスケヌススキルプラグむンブログ
開発者ドキュメントGitHubCAMEL-AIオヌプン゜ヌスファンドパヌトナヌ
ダりンロヌドオヌプン゜ヌス向け
䌚瀟情報私たちに぀いおブランド採甚情報利甚芏玄プラむバシヌポリシヌセキュリティず信頌Cookieポリシヌ返金・トラむアルポリシヌ

無断転茉を犁じたす © 2026 EIGENT UK LTD