logo
  • 環境
  • 企業方案
  • 價格
DeveloperJun 16, 2026

長線任務:Eigent 上的 GLM-5.1 對比 GLM-5.2

EigentEigent
GLM-5.1 vs GLM-5.2 — 在 Eigent 單 agent harness 上進行的長線 AI 基礎設施研究
Automate Everything with
AI Workforce on Desktop
Download Eigent

一個任務,兩個模型,同一個 Agent

比較兩個模型最乾淨的方法,就是不改變其他任何因素。所以我們正是這樣做:相同的長線任務、相同的 agent、相同的工具。我們把 GLM-5.1 和 GLM-5.2 放進 Eigent 的 單 agent harness,看它們各自如何規劃、研究、驗證並交付成果。

這項工作是真正的分析師任務,而不是玩具式基準測試:

研究 AI 基礎設施堆疊中的 26 間公司——由晶片設計和半導體製造,一直到承載前沿 AI 的雲平台和數據中心——然後建立一份互動式報告。

像這樣的長線任務,才是真正拉開模型差距的地方。它不是一次聰明的回答,而是在長時間運行中串連起來的數十個小決策:規劃要多深入、信任多少來源、何時停止研究,以及在宣告完成前要驗證到什麼程度。

Prompt

我們在 單 agent 模式下,向兩次運行發送了相同的 prompt:

對 AI 基礎設施生態系中的 26 間公司進行深入研究——這是整個 AI 價值鏈中最確定的主線。涵蓋以下 6 個子行業(每個子行業挑選具代表性的公司,從大型領導者到較小玩家):

  • AI 數據中心(運算基礎設施/建設擴張)
  • GPU/AI 晶片(訓練與推理矽晶片、ASIC、IP)
  • 伺服器、網絡與光學模組(交換機、NIC、光互連)
  • 電力、液冷與儲能(電源、熱管理、能源管理)
  • AI 雲端/算力平台(超大規模雲服務商、GPU 雲、算力租賃平台)
  • 支援生態系(HBM/先進封裝、晶圓代工、連接器及其他關鍵零件)

每間公司需研究:公司名稱、子行業、總部/國家;核心產品及其在 AI 鏈中的具體角色;上市或私人公司(如已上市,列出股票代號+交易所;如屬私人公司,註明最新估值/融資輪次);市值或估值規模(用於排名);其在生態系中的定位與護城河(1–2 句);主要客戶/競爭對手。

在每個子行業內,按由大至小排序,並以由上而下的方式構建整體內容:從完整硬件生態全景到每間單獨公司。

**輸出:**首先生成結構化的 ai_infra_data.json,包含全部 26 間公司、6 個子行業分類、上市/私人標誌,以及跨公司比較矩陣。然後根據該 JSON 生成一份精緻、互動式的 HTML 報告——包括生態系全景圖、行業區塊、公司卡片、上市與私人顏色編碼、市值排名圖表,以及可排序/可篩選的比較表。先驗證研究資料的準確性(上市狀態、股票代號、估值——採用最新數據,並引用來源),然後再生成報告。

1準備執行 — GLM-5.2 規劃得更深入

在任何一個模型碰到網頁之前,第一個分歧就已經出現:在規劃上。

GLM-5.1 把工作拆成 4 個步驟。GLM-5.2 則把相同的 brief 擴展成 6 個步驟——而且值得注意的是,它把 「驗證準確性」 單獨列為一項專門任務,而不是順手做一下就算。這就是一位謹慎分析師對任務的切分方式:先研究,再證明研究結果,然後才開始構建。

相同指令。不同的是,對這項任務應該投入多少嚴謹度的判斷。

2研究 — 兩倍來源

規劃之後,兩次研究運行就明顯不同了。

  • GLM-5.1: 約 40 個來源
  • GLM-5.2: 約 82 個來源——大約是 2 倍研究量

而且不只是 更多 頁面,而是 分布得更好 的頁面。GLM-5.1 很大程度依賴單一數據網站;GLM-5.2 則交叉核對每個數字,來源涵蓋 財經新聞、公司文件及私人市場數據庫:Reuters、Bloomberg、Crunchbase、TechCrunch 等等。

單一來源不足夠。對於估值、股票代號和上市狀態,GLM-5.2 將單一數字視為需要驗證的假設——而不是可以直接抄寫的事實。

GLM-5.2 不只是回答得更快;它挖得更深,從兩倍的頁面中提取資訊,逐一驗證每個數字。

3先驗證,再完成

由於 GLM-5.2 將驗證獨立成一個步驟,它真的有去做——在把資料寫入報告前,再次核對上市狀態、股票代號及估值是否符合最新數據。結果是一份能證明自己工作過程的報告,而不是單純聲稱已完成。

4結果 — 更深入的資料、真實引用

同一個任務。兩份完全不同的交付成果。

GLM-5.2 產出的是:

  • 更豐富的 資料結構,具備專門的 護城河分析、融資細節,以及完整來源列表——每一項聲明都可追溯至來源。
  • 最終報告在資料和結構兩方面都比 GLM-5.1 的版本 幾乎豐富 2 倍。
  • 輸出以 完全可部署、互動式網站 的形式交付——不只是靜態 HTML 頁面:包括生態系全景圖、行業區塊、上市與私人顏色編碼、市值排名圖表,以及可排序/可篩選的比較表。

GLM-5.1 交付了一份穩妥且正確的報告。GLM-5.2 交付的是一份你可以直接呈交投資委員會的報告。

5為什麼這很重要

在短任務中,兩個能力相近的模型看起來幾乎一樣。但在 長線任務 中,差異會累積放大。GLM-5.2 每多讀一個來源、每多核對一個數字,以及把驗證設為首要步驟的決定,最終都疊加成一個可量化地更好的結果。

harness 是一樣的。工具是一样的。唯一的變數是模型——而這正正令這個比較,成為觀察 GLM-5.2 如何在長時間運行中推理的公平方式:

更多來源。更精準的判斷。一份能證明自己工作過程的報告。

6你也可以自己跑一次

Eigent 讓你可以在同一個單 agent harness 背後更換模型,因此你可以在自己的任務上重現這個比較:

  1. 前往 Settings → Models,選擇或新增你要測試的模型(GLM-5.1、GLM-5.2,或任何支援 function calling 的模型)。
  2. 將任務切換為 single-agent mode。
  3. 貼上上面的深度研究 prompt(或你自己的長線 brief)。
  4. 每個模型各執行一次,然後並排比較計劃、來源數量和最終報告。

7下一步可以試什麼

重新執行相同 brief,但要求每個估值至少有 3 個獨立來源,並標記任何來源出現分歧的公司。

將公司範圍由 26 間擴展到 50 間,並在比較矩陣中加入「供應鏈依賴」欄位。

以 PDF 形式生成最終報告的一頁式執行摘要,並附上市值排名圖表的簡報。

以同一任務讓 GLM-5.2 與另一個模型對比,並產出差異報告:它們在哪些地方一致、哪些地方不一致,以及哪一個的資料來源更好。

8提升結果的小貼士

  • 把驗證說清楚。 要求模型「先驗證準確性,再開始構建」,會明顯改變其行為——GLM-5.2 就把這句話變成了自己的一個規劃步驟。
  • 在 schema 中要求引用。 每間公司都要有 sources 欄位,能強迫模型做可追溯研究,而不是自信地猜測。
  • 把資料與呈現分開。 先生成 ai_infra_data.json 再生成 HTML,能令報告可重建,且事實可審核。
  • 長線推理請使用單 agent 模式。 它能把完整任務上下文交給同一個模型,這正是你在比較模型如何規劃及自我修正長時間任務時最需要的。

Other use cases

從收據及發票自動生成增值稅申報表

從收據及發票自動生成增值稅申報表

請處理「VAT」資料夾內所有收據及發票,包括相片、掃描 PDF 及數碼發票。最終輸出只應包含兩個檔案:(1) vat_return.xlsx — Excel 檔案應每張收據或發票佔一行,列出所有抽取欄位,顯示每個項目是否可申請增值稅回收,顯示每個合資格項目的可回收增值稅金額,包含不可回收項目的排除原因,清楚標示需要人工審核的項目,並包含顯示可回收增值稅總額的摘要工作表。(2) vat_return.html — 建立一個可直接開啟及與會計團隊分享的獨立 HTML 檔案。HTML 檔案應顯示所有增值稅回收項目、每個項目的可回收增值稅金額、被排除項目及其排除原因、需要人工審核的項目,以及可回收增值稅總額。切勿猜測任何不確定的資訊。

使用 Eigent 建立 10 款農曆新年 HTML5 遊戲

使用 Eigent 建立 10 款農曆新年 HTML5 遊戲

使用 HTML、CSS 同 JS(唔用任何 library)建立 10 款獨立而完整嘅遊戲,主題圍繞 2026 農曆新年(馬年)。遊戲必須有趣、原創、打磨完善、適合手機玩。包括計分、難度遞增、重新開始按鈕同流暢視覺效果。涵蓋:街機、解謎、無盡跑酷、反應、策略、記憶、雙人本地、放置、復古像素,以及 1 款實驗性遊戲。

用 Gemini 3.1 Pro 打造 3D 雪人兄弟平台遊戲

用 Gemini 3.1 Pro 打造 3D 雪人兄弟平台遊戲

打造一款現代 3D 橫向捲軸平台遊戲,靈感來自 Mario,並結合 Snow Bros 機制。玩家可以射出雪球飛彈去凍結怪物變成雪球,再踢走雪球以連鎖擊中其他敵人。包括計分系統、生命顯示、逐步提升難度,以及具備豐富 3D 分層場景嘅重新開始功能。

Automate everything with AI workforce on desktop
Download Eigent

立即試用 Eigent

下載開源桌面 app。你的 AI workforce,直接在你電腦上運行。

下載 Eigent
Eigent

獲取 AI workforce 自動化的最新更新、教學與版本消息。

產品Eigent環境定價企業方案
探索解決方案使用案例技能外掛網誌
開發者文件GitHubCAMEL-AIOpen Source Fund合作夥伴
下載適用於開源版
公司關於我們品牌招聘使用條款私隱政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 新版本已發佈!download