مهمة واحدة، نموذجان، والوكيل نفسه
أفضل طريقة لمقارنة نموذجين هي ألا تغيّر أي شيء آخر. لذلك فعلنا ذلك بالضبط: نفس مهمة طويلة الأفق، نفس الوكيل، نفس الأدوات. أعطينا GLM-5.1 وGLM-5.2 الملخص نفسه داخل إطار Eigent أحادي الوكيل، وراقبنا كيف خطط كل منهما، وبحث، وتحقق، وسلّم.
كانت المهمة عملًا حقيقيًا على مستوى محلل، لا مجرد معيار اختبار بسيط:
ابحث بعمق في 26 شركة عبر منظومة البنية التحتية للذكاء الاصطناعي — من تصميم السيليكون وتصنيع أشباه الموصلات وصولًا إلى منصات السحابة ومراكز البيانات التي تشغّل الذكاء الاصطناعي المتقدم — ثم ابنِ تقريرًا تفاعليًا.
هذه المهمة طويلة الأفق هي المكان الذي تبدأ فيه النماذج بالاختلاف فعليًا. فالمسألة ليست إجابة ذكية واحدة؛ بل عشرات القرارات الصغيرة المتتابعة على مدى تشغيل طويل: مدى عمق التخطيط، وعدد المصادر التي يمكن الوثوق بها، ومتى يجب التوقف عن البحث، وكمية التحقق المطلوبة قبل إعلان الانتهاء.
الموجّه
أرسلنا إلى كلا التشغيلين الموجّه نفسه، في وضع الوكيل الأحادي:
قم بإجراء بحث معمّق حول 26 شركة في منظومة البنية التحتية للذكاء الاصطناعي — وهو المسار الرئيسي الأكثر وضوحًا في سلسلة القيمة الكاملة للذكاء الاصطناعي. غطِّ القطاعات الفرعية الستة التالية (اختر شركات تمثيلية في كل منها، من القادة ذوي القيمة السوقية الكبيرة حتى اللاعبين الأصغر):
- مركز بيانات الذكاء الاصطناعي (بنية الحوسبة التحتية / التوسع الإنشائي)
- وحدات معالجة الرسوميات / شرائح الذكاء الاصطناعي (سيليكون التدريب والاستدلال، ASICs، الملكية الفكرية)
- الخوادم والشبكات والوحدات الضوئية (المبدلات، NICs، الربط الضوئي)
- الطاقة والتبريد السائل وتخزين الطاقة (إمدادات الطاقة، الإدارة الحرارية، إدارة الطاقة)
- سحابة الذكاء الاصطناعي / منصة الحوسبة (مزوّدو الحوسبة فائقة النطاق، سحابات GPU، منصات تأجير الحوسبة)
- المنظومة الداعمة (HBM / التغليف المتقدم، المصانع، الموصلات والمكونات الحيوية الأخرى)
لكل شركة، ابحث عن: اسم الشركة، القطاع الفرعي، المقر / الدولة؛ المنتجات الأساسية ودورها المحدد في سلسلة الذكاء الاصطناعي؛ عامة أم خاصة (الرمز + البورصة إذا كانت مدرجة؛ وإذا كانت خاصة، اذكر أحدث التقييم / جولة التمويل)؛ القيمة السوقية أو حجم التقييم (يُستخدم للترتيب)؛ التموضع وميزة الحماية (1–2 جمل)؛ العملاء / المنافسون الرئيسيون.
رتّب الشركات داخل كل قطاع فرعي من الأكبر إلى الأصغر، ونظّم العمل كله من الأعلى إلى الأسفل: من المشهد الكامل لمنظومة العتاد وصولًا إلى كل شركة على حدة.
الإخراج: أولًا أنشئ ai_infra_data.json منظمًا يحتوي على جميع الشركات الـ26، وتصنيفات القطاعات الفرعية الستة، وعلامة عام/خاص، ومصفوفة مقارنة عبر الشركات. ثم أنشئ تقرير HTML مصقولًا وتفاعليًا انطلاقًا من ذلك JSON — مخطط لمنظر المنظومة، وأقسام حسب القطاع، وبطاقات للشركات، وترميز لوني للعامة مقابل الخاصة، ومخطط ترتيب القيمة السوقية، وجدول مقارنة قابل للفرز / التصفية. تحقّق أولًا من دقة بيانات البحث (حالة الإدراج، الرموز، التقييمات — أحدث الأرقام، مع الاستشهاد بالمصادر)، ثم أنشئ التقرير.
الاستعداد للتنفيذ — GLM-5.2 خطط بعمق أكبر
ظهر أول اختلاف قبل أن يلمس أي من النموذجين الويب: في الخطة.
قسّم GLM-5.1 العمل إلى 4 خطوات. أما GLM-5.2 فوسّع الملخص نفسه إلى 6 خطوات — والأهم من ذلك أنه جعل "التحقق من الدقة" مهمة مستقلة بذاتها بدلًا من أن تكون خطوة عرضية. هكذا يحدد المحلل الدقيق نطاق المهمة: البحث، ثم إثبات البحث، ثم البناء.
نفس التعليمات. لكن حكم مختلف على مقدار الصرامة الذي تستحقه المهمة.
البحث — ضعف عدد المصادر
تحولت الخطط إلى جولات بحث مختلفة جدًا.
- GLM-5.1: حوالي 40 مصدرًا
- GLM-5.2: حوالي 82 مصدرًا — أي ما يقرب من ضعف البحث
ولم يكن الأمر مجرد عدد أكبر من الصفحات — بل صفحات موزعة بشكل أفضل. فبينما اعتمد GLM-5.1 بشكل كبير على موقع بيانات واحد، قام GLM-5.2 بالمراجعة المتقاطعة لكل رقم عبر الأخبار المالية، وإفصاحات الشركات، وقواعد بيانات السوق الخاصة: Reuters وBloomberg وCrunchbase وTechCrunch وغيرها.
مصدر واحد لا يكفي. بالنسبة للتقييمات، والرموز، وحالة الإدراج، تعامل GLM-5.2 مع الرقم الواحد على أنه فرضية يجب تأكيدها — لا حقيقة تُنسخ.
GLM-5.2 لم يجب أسرع فحسب. بل تعمق أكثر، مستخرجًا ضعف عدد الصفحات للتحقق من كل رقم.
تحقّق قبل الإنهاء
بما أن GLM-5.2 خصص التحقق كخطوة مستقلة، فقد نفّذها فعلًا — أعاد فحص حالة الإدراج، والرموز، والتقييمات وفق أحدث الأرقام قبل اعتمادها في التقرير. والنتيجة تقرير يثبت عمله بدلًا من أن يكتفي بادعائه.
النتيجة — بيانات أعمق، واستشهادات حقيقية
نفس المهمة. تسليمان مختلفان جدًا.
أنتج GLM-5.2:
- مخطط بيانات أغنى مع تحليل مميزة الحماية وتفاصيل التمويل وقائمة مصادر كاملة — كل ادعاء قابل للتتبع إلى مصدره.
- تقريرًا نهائيًا كان أغنى بنحو الضعف من GLM-5.1، سواء في البيانات أو البنية.
- مخرجات مشحونة على أنها موقع تفاعلي قابل للنشر بالكامل — وليس مجرد صفحة HTML ثابتة: مخطط لمنظر المنظومة، وأقسام حسب القطاع، وترميز لوني للعامة مقابل الخاصة، ومخطط ترتيب القيمة السوقية، وجدول مقارنة قابل للفرز / التصفية.
قدّم GLM-5.1 تقريرًا جيدًا وصحيحًا. أما GLM-5.2 فقدّم تقريرًا يمكنك تسليمه إلى لجنة استثمار.
لماذا هذا مهم
في مهمة قصيرة، تبدو النماذج القوية متشابهة تقريبًا. لكن في مهمة طويلة الأفق، تتراكم الفروقات. كل مصدر إضافي اختار GLM-5.2 قراءته، وكل رقم اختار التحقق منه مرتين، وقرار جعل التحقق خطوة أساسية — كلها تراكمت لتنتج نتيجة أفضل بشكل ملموس.
كان الإطار نفسه. وكانت الأدوات نفسها. المتغير الوحيد هو النموذج — وهذا بالضبط ما يجعل هذه قراءة عادلة لكيفية استدلال GLM-5.2 على المدى الطويل:
مصادر أكثر. حكم أدق. تقرير يثبت عمله.
جرّبه بنفسك
يتيح لك Eigent تبديل النموذج خلف إطار الوكيل الأحادي نفسه، بحيث يمكنك إجراء هذه المقارنة الدقيقة على مهمتك الخاصة:
- انتقل إلى الإعدادات → النماذج واختر أو أضف النموذج الذي تريد اختباره (GLM-5.1 أو GLM-5.2 أو أي نموذج يدعم استدعاء الدوال).
- بدّل المهمة إلى وضع الوكيل الأحادي.
- الصق موجّه البحث المعمّق أعلاه (أو ملخصك الخاص طويل الأفق).
- أرسله مرة واحدة لكل نموذج، ثم قارن بين الخطط، وأعداد المصادر، والتقارير النهائية جنبًا إلى جنب.
ما الذي يمكن تجربته بعد ذلك
أعد تشغيل الملخص نفسه لكن اشترط وجود 3 مصادر مستقلة على الأقل لكل تقييم، وضع علامة على أي شركة تختلف حولها المصادر.
وسّع نطاق العينة من 26 إلى 50 شركة، وأضف عمود "اعتماديات سلسلة التوريد" إلى مصفوفة المقارنة.
أنشئ ملخصًا تنفيذيًا من صفحة واحدة للتقرير النهائي بصيغة PDF، بالإضافة إلى عرض شرائح لمخطط ترتيب القيمة السوقية.
شغّل GLM-5.2 مقابل نموذج آخر على المهمة نفسها وأنتج تقرير فروق: أين اتفقا، وأين اختلفا، وأيهما كان أفضل من حيث المصادر.
نصائح للحصول على نتائج أفضل
- اجعل التحقق صريحًا. مطالبة النموذج بـ "التحقق من الدقة أولًا، ثم البناء" تغيّر السلوك بشكل ملموس — فقد حوّل GLM-5.2 هذه العبارة إلى خطوة تخطيط مستقلة.
- اطلب الاستشهادات داخل المخطط. اشتراط حقل
sourcesلكل شركة يفرض بحثًا قابلًا للتتبع بدلًا من التخمين الواثق. - افصل البيانات عن العرض. إنشاء
ai_infra_data.jsonقبل HTML يحافظ على قابلية إعادة توليد التقرير وعلى إمكانية تدقيق الحقائق. - استخدم وضع الوكيل الأحادي للاستدلال طويل الأفق. فهو يحتفظ بسياق المهمة الكامل في يد نموذج واحد، وهو بالضبط ما تريده عند مقارنة كيفية التخطيط والتصحيح الذاتي لدى نموذج على مدى تشغيل طويل.



