GLM-5.3: نموذج الترميز من Z.ai الذي اكتسب مهارة أمن سيبراني غير مخطط لها
ما الذي تغيّر منذ GLM-5.2، والمعايير المهمة للوكلاء الذكيين، ولماذا يتم إصدار الأوزان المفتوحة على مراحل

أطلقت Z.ai GLM-5.3 في الرابع عشر من أغسطس 2026، وتبدو القصة غير اعتيادية بالنسبة لإصدار نقطي: النموذج الأساسي لم يتغير عن GLM-5.2، غير أن أرقام الترميز والوكلاء قفزت بشكل حاد — واكتسب النموذج مهارة في الأمن السيبراني لم تخطط لها الشركة قط. إليك ما الذي تغيّر فعلاً، والمعايير المهمة لمن يبني وكلاء الذكاء الاصطناعي، ولماذا لم تُصدر الأوزان المفتوحة بعد.
ما هو GLM-5.3؟
GLM-5.3 هو أحدث نموذج مفتوح الأوزان في سلسلة GLM من Z.ai، ويُقدَّم باعتباره نموذجاً حدودياً للترميز والعمل الوكيل. التفصيل الرئيسي: يعيد استخدام نفس البنية الأساسية لمزيج الخبراء بـ 743 مليار معامل الخاصة بـ GLM-5.2، وكل المكاسب المُبلَّغ عنها تأتي من التدريب اللاحق الموسَّع لا من بنية جديدة (MarkTechPost).
بعبارة بسيطة، أنفقت Z.ai قدرة حوسبة أكبر في تدريب النموذج الحالي على بيئات مهام أكثر وأكثر تنوعاً. هذه هي الوصفة بأكملها، وهي نقطة بيانات مفيدة لكل من يتابع مدى ما يمكن أن يحققه التدريب اللاحق وحده في نموذج مفتوح الأوزان.
كيف يتحسن GLM-5.3 على GLM-5.2
تصف Z.ai المنهجية بـ توسيع نطاق البيئة. قدّم GLM-5.2 مجموعة التدريب؛ أما GLM-5.3 فيُنفق قدرة حوسبة أكبر في تشغيل النموذج عبر مجموعة أكبر بكثير من بيئات العمل المهنية المحاكاة (Unite.AI).
هذه ليست ألغاز ترميز بسيطة. في أحد الأمثلة، يُوضع النموذج في بيئة مهندس بنية تحتية للتعلم الآلي — مع مجموعات الحوسبة والوثائق الداخلية وقواعد الأكواد ونتائج التجارب — ويتعين عليه تشخيص الاختناقات وتطبيق الإصلاحات وتحقيق تسريع قابل للقياس. تمثّل بعض المهام أياماً عديدة من العمل لمهندس متمرس. ولبناء هذه البيئات بحجم كبير، تستخدم Z.ai وكلاء بحث تحوّل أنماط العمل الحقيقية إلى بيئات طويلة الأمد قابلة للتشغيل، إضافةً إلى وكيل حكم يتحقق من أن كل مهمة قابلة للحل فعلاً.
تظهر النتيجة حيث تتوقعها من هذه الوصفة: كلما طال أفق المهمة، كان المكسب أكبر.
معايير الترميز في GLM-5.3
جميع الأرقام أدناه مُبلَّغ عنها من المورد. مقارنةً بـ GLM-5.2:
- Terminal-Bench 3.0: من 4.6 إلى 28.3 — قفزة بنحو 6 أضعاف على معيار CLI الأطول أمداً.
- DeepSWE v1.1: من 46.2 إلى 66.9.
- Agents' Last Exam (CLI): من 23.8 إلى 28.5.
- GDPval-AA v2 (يمتد عبر 44 مهنة): يسجّل 1,769.
على معيار Code Bench الداخلي لـ Z.ai، تُبلّغ الشركة عن تحسن بنسبة ~50% مقارنةً بـ GLM-5.2، مع قصة كفاءة تستحق الإشارة: يسجّل GLM-5.3 31.4% بنحو 50,000 رمز إخراج لكل مهمة، مقابل Claude Opus 4.8 بنسبة 29.5% باستخدام 120,000 رمز — عمل أكثر بعدد رموز أقل بكثير. لا يزال Claude Fable 5 يتصدر هذا المعيار بنسبة 39.5% عند أقصى جهد (MarkTechPost).
التحفظ الصادق: على المجموعات العامة، يتأخر GLM-5.3 عن GPT-5.6 Sol وFable 5 في عدة تقييمات ترميز أصعب. ولأن Code Bench معيار خاص، لا يمكن تكرار أرقامه بشكل مستقل بعد. حجة Z.ai للإبقاء عليه خاصاً هي التلوث — إذ تتسرب مجموعات الاختبار العامة إلى بيانات التدريب.
نتيجة الأمن السيبراني التي تقول Z.ai إنها لم تخطط لها
هذا هو الجزء الذي جعل GLM-5.3 خبراً يتجاوز دورة إطلاق النماذج المعتادة. أضافت Z.ai بيانات اكتشاف الثغرات إلى التدريب اللاحق متوقعةً أن يتحسن النموذج في التفكير حول الأخطاء الفردية. بدلاً من ذلك، استمرت القدرة في التراكم مع توسع التدريب، وبدأ النموذج في تشكيل خطط متماسكة عبر سلاسل استغلال كاملة (SiliconRepublic).
الأرقام تدعم هذا الادعاء، والنمط يتكرر — كلما كان المعيار أعمق في سلسلة الاستغلال، كانت القفزة أكبر:
- CyberGym (إيجاد الأخطاء والتحقق منها من المصدر الأبيض): من 77.2% إلى 84.5%، متجاوزاً Mythos 5 (83.8%) وGPT-5.6 Sol (83.6%).
- ExploitBench (التفكير في السبب الجذري مع استغلال فعّال): من 24.4% إلى 54.4% — أكثر من ضعف GLM-5.2، وإن كان لا يزال خلف Mythos 5 بنسبة 78.0%.
- ExploitGym (المهام المنجزة ضمن ميزانية زمنية): 105 مهام في ساعتين، و130 في ست ساعات — مقابل 29 و39 لـ GLM-5.2.
تقول Z.ai أيضاً إن نماذجها كشفت عن أخطاء حقيقية ومنشورة: 2,436 ثغرة عبر 269 مشروعاً مفتوح المصدر منذ GLM-5.2، منها 1,097 مصنّفة بخطورة حرجة أو عالية — تمتد عبر أنوية النظام ومحركات المتصفح وبروتوكولات الشبكة. أقدم خطأ، تقول الشركة، يعود إلى عام 1981. تُغذّي هذه النتائج سجل الإفصاح الأمني العام، مع الإفصاح عن 53 CVE عند الإطلاق و2,383 لا تزال تحت الحظر.
لماذا لم تُصدر الأوزان المفتوحة بعد
هنا يأتي الانحراف عن نهج GLM-5.2. وصلت أوزان GLM-5.2 إلى Hugging Face في غضون أيام من الإطلاق. أوزان GLM-5.3 مُدرَجة على مراحل: متاحة الآن فقط عبر Z.ai API وخطة GLM Coding وZCode، مع إصدار الأوزان بعد نحو أسبوعين من التقييم الأمني والتصليب (SiliconANGLE).
يرتبط السبب مباشرةً بنتيجة الأمن السيبراني: تعمل Z.ai على تصليب نموذج تصفه علناً بأنه طوّر قدرة أمنية هجومية أسرع مما توقعت. إنه أول إصدار GLM يُحجب صراحةً لمراجعة السلامة.
تغيير آخر على مستوى API يستحق الإشارة للمطورين: يدعم GLM-5.3 ثلاثة مستويات من جهد التفكير (منخفض، عالٍ، أقصى) ولم يعد يسمح بتعطيل التفكير — وهو تغيير جوهري إذا كان تطبيقك يعمل سابقاً مع إيقاف التفكير.
ما يعنيه GLM-5.3 لمن يبني وكلاء الذكاء الاصطناعي
بعض الاستنتاجات العملية:
- وكلاء الترميز طويلة الأمد هي النقطة المثلى. تتركز المكاسب على العمل متعدد الخطوات في CLI وعلى نطاق المستودعات — إعادة الهيكلة، وفرز CI، وحلقات الوكلاء طويلة الأمد — لا على الإكمالات الفردية.
- الكفاءة بنفس أهمية النتيجة الرئيسية. إنجاز عمل مماثل بـ ~50 ألف رمز بدلاً من 120 ألف هو رافعة تكلفة حقيقية لأعباء عمل الوكلاء التي تعمل طوال اليوم.
- يمكنك استخدامه اليوم، لكن ليس في كل مكان. يمكن للشركات الناشئة اعتماده الآن عبر خطة Coding أو API. يجب على الفرق ذات متطلبات إقامة البيانات أو مراجعة الموردين انتظار الأوزان.
- تعامل مع معايير الموردين كنقطة بداية. الأرقام الأكثر إثارة (Code Bench الداخلي، ونتائج الأمن السيبراني) لم تُكرَّر بشكل مستقل بعد. إصدار الأوزان، المتوقع في نهاية أغسطس 2026، هو متى تبدأ الاختبارات الخارجية.
ضع نموذجاً مثل GLM-5.3 في عمل قوتك العاملة من الذكاء الاصطناعي
قصة GLM-5.3 تدور في الحقيقة حول العمل الوكيل طويل الأمد — نماذج تُنجز مهام متعددة الخطوات من البداية إلى النهاية بدلاً من الإجابة على موجّه واحد. هذا بالضبط ما بُني من أجله Eigent: تطبيق سطح مكتب "Cowork" مفتوح المصدر ومحلي يحوّل نماذج كهذه إلى قوة عاملة متعددة الوكلاء لسير العمل الحقيقية — من مراجعة طلبات السحب في GitHub إلى تشغيل وكيل ترميز ذكاء اصطناعي مستضاف ذاتياً تمتلكه بالكامل. أحضر نموذجك الخاص، وابقِ العمل على جهازك. نزّل Eigent وابنِ سير عمل الوكلاء الخاصة بك اليوم.
Recent Posts

DeepSeek Harness: بيئة تشغيل الوكلاء مفتوحة المصدر حيث كل شيء إضافة قابلة للتوصيل
DeepSeek Harness v0.1 متاح الآن في معاينة المطورين. بيئة تشغيل وكلاء مفتوحة المصدر مرخصة بـ MIT ومبنية على Cordis حيث النماذج والأدوات وبيئات التشغيل المعزولة وواجهة المستخدم كلها إضافات قابلة للتوصيل.

قدرات Grok 4.6 وحالات الاستخدام الفعلية لوكلاء الذكاء الاصطناعي
نظرة عملية على قدرات Grok 4.6 وحالات استخدامه: الوكلاء طويلو الأمد، والبرمجة، والعمل المرئي، إضافةً إلى كيفية استخدامه ضمن قوة عمل متعددة الوكلاء.

Grok 4.6 مقابل Grok 4.5 وGPT-5.6 Sol وFable 5: ما الذي يتغير فعلاً
Grok 4.6 مقابل Grok 4.5 وGPT-5.6 Sol وFable 5: ما الذي أكدته xAI فعلاً، وما الذي لا يزال مجرد تكهنات، والمعيار الحقيقي الذي يجب أن يتجاوزه هذا التحديث القائم على ما بعد التدريب فحسب.