一個任務,兩個模型,同一個 Agent
比較兩個模型最乾淨的方法,就是不改變其他任何因素。所以我們正是這樣做:相同的長線任務、相同的 agent、相同的工具。我們把 GLM-5.1 和 GLM-5.2 放進 Eigent 的 單 agent harness,看它們各自如何規劃、研究、驗證並交付成果。
這項工作是真正的分析師任務,而不是玩具式基準測試:
研究 AI 基礎設施堆疊中的 26 間公司——由晶片設計和半導體製造,一直到承載前沿 AI 的雲平台和數據中心——然後建立一份互動式報告。
像這樣的長線任務,才是真正拉開模型差距的地方。它不是一次聰明的回答,而是在長時間運行中串連起來的數十個小決策:規劃要多深入、信任多少來源、何時停止研究,以及在宣告完成前要驗證到什麼程度。
Prompt
我們在 單 agent 模式下,向兩次運行發送了相同的 prompt:
對 AI 基礎設施生態系中的 26 間公司進行深入研究——這是整個 AI 價值鏈中最確定的主線。涵蓋以下 6 個子行業(每個子行業挑選具代表性的公司,從大型領導者到較小玩家):
- AI 數據中心(運算基礎設施/建設擴張)
- GPU/AI 晶片(訓練與推理矽晶片、ASIC、IP)
- 伺服器、網絡與光學模組(交換機、NIC、光互連)
- 電力、液冷與儲能(電源、熱管理、能源管理)
- AI 雲端/算力平台(超大規模雲服務商、GPU 雲、算力租賃平台)
- 支援生態系(HBM/先進封裝、晶圓代工、連接器及其他關鍵零件)
每間公司需研究:公司名稱、子行業、總部/國家;核心產品及其在 AI 鏈中的具體角色;上市或私人公司(如已上市,列出股票代號+交易所;如屬私人公司,註明最新估值/融資輪次);市值或估值規模(用於排名);其在生態系中的定位與護城河(1–2 句);主要客戶/競爭對手。
在每個子行業內,按由大至小排序,並以由上而下的方式構建整體內容:從完整硬件生態全景到每間單獨公司。
**輸出:**首先生成結構化的 ai_infra_data.json,包含全部 26 間公司、6 個子行業分類、上市/私人標誌,以及跨公司比較矩陣。然後根據該 JSON 生成一份精緻、互動式的 HTML 報告——包括生態系全景圖、行業區塊、公司卡片、上市與私人顏色編碼、市值排名圖表,以及可排序/可篩選的比較表。先驗證研究資料的準確性(上市狀態、股票代號、估值——採用最新數據,並引用來源),然後再生成報告。
準備執行 — GLM-5.2 規劃得更深入
在任何一個模型碰到網頁之前,第一個分歧就已經出現:在規劃上。
GLM-5.1 把工作拆成 4 個步驟。GLM-5.2 則把相同的 brief 擴展成 6 個步驟——而且值得注意的是,它把 「驗證準確性」 單獨列為一項專門任務,而不是順手做一下就算。這就是一位謹慎分析師對任務的切分方式:先研究,再證明研究結果,然後才開始構建。
相同指令。不同的是,對這項任務應該投入多少嚴謹度的判斷。
研究 — 兩倍來源
規劃之後,兩次研究運行就明顯不同了。
- GLM-5.1: 約 40 個來源
- GLM-5.2: 約 82 個來源——大約是 2 倍研究量
而且不只是 更多 頁面,而是 分布得更好 的頁面。GLM-5.1 很大程度依賴單一數據網站;GLM-5.2 則交叉核對每個數字,來源涵蓋 財經新聞、公司文件及私人市場數據庫:Reuters、Bloomberg、Crunchbase、TechCrunch 等等。
單一來源不足夠。對於估值、股票代號和上市狀態,GLM-5.2 將單一數字視為需要驗證的假設——而不是可以直接抄寫的事實。
GLM-5.2 不只是回答得更快;它挖得更深,從兩倍的頁面中提取資訊,逐一驗證每個數字。
先驗證,再完成
由於 GLM-5.2 將驗證獨立成一個步驟,它真的有去做——在把資料寫入報告前,再次核對上市狀態、股票代號及估值是否符合最新數據。結果是一份能證明自己工作過程的報告,而不是單純聲稱已完成。
結果 — 更深入的資料、真實引用
同一個任務。兩份完全不同的交付成果。
GLM-5.2 產出的是:
- 更豐富的 資料結構,具備專門的 護城河分析、融資細節,以及完整來源列表——每一項聲明都可追溯至來源。
- 最終報告在資料和結構兩方面都比 GLM-5.1 的版本 幾乎豐富 2 倍。
- 輸出以 完全可部署、互動式網站 的形式交付——不只是靜態 HTML 頁面:包括生態系全景圖、行業區塊、上市與私人顏色編碼、市值排名圖表,以及可排序/可篩選的比較表。
GLM-5.1 交付了一份穩妥且正確的報告。GLM-5.2 交付的是一份你可以直接呈交投資委員會的報告。
為什麼這很重要
在短任務中,兩個能力相近的模型看起來幾乎一樣。但在 長線任務 中,差異會累積放大。GLM-5.2 每多讀一個來源、每多核對一個數字,以及把驗證設為首要步驟的決定,最終都疊加成一個可量化地更好的結果。
harness 是一樣的。工具是一样的。唯一的變數是模型——而這正正令這個比較,成為觀察 GLM-5.2 如何在長時間運行中推理的公平方式:
更多來源。更精準的判斷。一份能證明自己工作過程的報告。
你也可以自己跑一次
Eigent 讓你可以在同一個單 agent harness 背後更換模型,因此你可以在自己的任務上重現這個比較:
- 前往 Settings → Models,選擇或新增你要測試的模型(GLM-5.1、GLM-5.2,或任何支援 function calling 的模型)。
- 將任務切換為 single-agent mode。
- 貼上上面的深度研究 prompt(或你自己的長線 brief)。
- 每個模型各執行一次,然後並排比較計劃、來源數量和最終報告。
下一步可以試什麼
重新執行相同 brief,但要求每個估值至少有 3 個獨立來源,並標記任何來源出現分歧的公司。
將公司範圍由 26 間擴展到 50 間,並在比較矩陣中加入「供應鏈依賴」欄位。
以 PDF 形式生成最終報告的一頁式執行摘要,並附上市值排名圖表的簡報。
以同一任務讓 GLM-5.2 與另一個模型對比,並產出差異報告:它們在哪些地方一致、哪些地方不一致,以及哪一個的資料來源更好。
提升結果的小貼士
- 把驗證說清楚。 要求模型「先驗證準確性,再開始構建」,會明顯改變其行為——GLM-5.2 就把這句話變成了自己的一個規劃步驟。
- 在 schema 中要求引用。 每間公司都要有
sources欄位,能強迫模型做可追溯研究,而不是自信地猜測。 - 把資料與呈現分開。 先生成
ai_infra_data.json再生成 HTML,能令報告可重建,且事實可審核。 - 長線推理請使用單 agent 模式。 它能把完整任務上下文交給同一個模型,這正是你在比較模型如何規劃及自我修正長時間任務時最需要的。



