同一個任務,兩個模型,同一個代理
比較兩個模型最乾淨的方法,就是不要改變其他任何條件。所以我們正是這麼做:同一個長時程任務、同一個代理、同一組工具。我們把 GLM-5.1 與 GLM-5.2 放進 Eigent 的 單代理架構 中,觀察每個模型如何規劃、研究、驗證並交付成果。
這項工作是真正的分析師任務,而不是玩具型基準測試:
研究 AI 基礎設施堆疊中的 26 家公司——從晶片設計與半導體製造,一路到支撐前沿 AI 的雲端平台與資料中心——然後建立一份互動式報告。
像這樣的長時程任務,才是真正區分模型能力的地方。它不是一個聰明答案,而是長時間執行中串連起來的數十個小決策:規劃要多深入、要信任多少來源、何時停止研究,以及在宣告完成前要驗證到什麼程度。
提示詞
我們用 單代理模式 向兩次執行送出相同的提示詞:
對 AI 基礎設施生態系中的 26 家公司進行深度研究——這是整個 AI 價值鏈中最確定的主線。涵蓋以下 6 個子領域(各自選出具代表性的公司,從大型領導者到較小玩家皆納入):
- AI 資料中心(運算基礎設施/建置)
- GPU/AI 晶片(訓練與推論矽晶片、ASIC、IP)
- 伺服器、網路與光模組(交換器、NIC、光互連)
- 電力、液冷與儲能(電源供應、散熱、能源管理)
- AI 雲端/算力平台(超大型雲端業者、GPU 雲、算力租賃平台)
- 支援生態系(HBM/先進封裝、晶圓代工、連接器與其他關鍵零組件)
針對每家公司,研究:公司名稱、子領域、總部/國家;核心產品及其在 AI 供應鏈中的具體角色;上市或未上市(若上市,提供代號+交易所;若未上市,註明最新估值/融資輪次);市值或估值規模(用於排序);在生態系中的定位與護城河(1–2 句);主要客戶/競爭對手。
在每個子領域內,依規模由大到小排名,並採由上而下的整體結構:從完整硬體生態系全景一路展開到每一家公司的細節。
輸出: 首先產生結構化的 ai_infra_data.json,包含全部 26 家公司、6 個子領域分類、上市/未上市旗標,以及跨公司比較矩陣。接著根據該 JSON 產生一份精緻、互動式的 HTML 報告——生態系全景圖、產業區塊、公司卡片、上市與未上市的色彩編碼、市值排名圖表,以及可排序/可篩選的比較表。先驗證研究資料的準確性(上市狀態、代號、估值——最新數據,並附來源引用),再產生報告。
執行前準備 — GLM-5.2 規劃得更深入
兩個模型的第一個分歧,甚至還沒碰到網頁就已經出現:出現在規劃階段。
GLM-5.1 把工作拆成 4 個步驟。GLM-5.2 則把同一份簡報擴充成 6 個步驟——而且值得注意的是,它把 「驗證準確性」 獨立成一個專門任務,而不是順手帶過。這就是審慎分析師在界定工作範圍時會做的事:先研究,再證明研究結果,最後再建置。
相同的指示。不同的是,對這項任務應該投入多少嚴謹度的判斷。
研究過程 — 來源數量翻倍
規劃很快就轉化成截然不同的研究流程。
- GLM-5.1: 約 40 個來源
- GLM-5.2: 約 82 個來源——大約是 2 倍研究量
而且不只是 更多 頁面,而是 分布更均衡 的頁面。GLM-5.1 很大程度仰賴單一資料網站;GLM-5.2 則交叉比對每個數字,來源涵蓋 財經新聞、公司申報文件與私人市場資料庫:Reuters、Bloomberg、Crunchbase、TechCrunch 等。
單一來源不夠。對於估值、代號與上市狀態,GLM-5.2 把單一數字視為需要驗證的假設,而不是可以直接複製的事實。
GLM-5.2 不只是回答得更快。它挖得更深,從兩倍數量的頁面中提取資訊,以驗證每個數字。
先驗證,再完成
因為 GLM-5.2 把驗證獨立成一步,它確實有做——在寫入報告前,重新檢查上市狀態、代號與估值是否符合最新數據。結果是一份能證明自己工作過程的報告,而不是只是在陳述結論。
結果 — 更深的資料,真實的引用
同樣的任務。兩份截然不同的交付成果。
GLM-5.2 產出了:
- 更豐富的 資料結構,包含獨立的 護城河分析、融資細節 與 完整來源清單——每一項主張都能追溯到來源。
- 一份在資料與結構上都幾乎比 GLM-5.1 豐富近 2 倍 的最終報告。
- 以 可直接部署的互動式網站 形式輸出——不只是靜態 HTML 頁面:生態系全景圖、產業區塊、上市/未上市色彩編碼、市值排名圖表,以及可排序/可篩選的比較表。
GLM-5.1 交付的是一份穩健且正確的報告。GLM-5.2 交付的是一份你可以直接拿去給投資委員會的報告。
為什麼這很重要
在短任務中,兩個能力相近的模型看起來差不多。但在長時程任務中,差異會不斷累積。GLM-5.2 額外閱讀的每一個來源、每一個它選擇再確認的數字,以及把驗證提升為第一級步驟的決定,最後都疊加成可量化地更好的結果。
架構相同。工具相同。唯一變數是模型——而這正是它成為一個公平觀察 GLM-5.2 在長時間推理中表現的原因:
更多來源。更銳利的判斷。以及一份能證明自己工作過程的報告。
你也可以自己執行
Eigent 允許你在相同的單代理架構下切換模型,因此你可以在自己的任務上重現這個比較:
- 前往 設定 → 模型,選擇或新增你想測試的模型(GLM-5.1、GLM-5.2,或任何支援 function calling 的模型)。
- 將任務切換為 單代理模式。
- 貼上上面的深度研究提示詞(或你自己的長時程簡報)。
- 針對每個模型各執行一次,然後並排比較規劃、來源數量與最終報告。
接下來可以嘗試的方向
重新執行同一份簡報,但要求每個估值至少有 3 個獨立來源,並標記出來源彼此不一致的公司。
將公司範圍從 26 家擴展到 50 家,並在比較矩陣中加入「供應鏈依賴」欄位。
為最終報告產生一頁式高階摘要 PDF,並另外輸出市場排名圖表的簡報投影片。
用 GLM-5.2 在同一個任務上對比另一個模型,並產出差異報告:哪些地方一致、哪些地方不同,以及哪一方的來源品質更好。
提升成果的技巧
- 讓驗證變得明確。 要求模型「先驗證準確性,再進行建置」會明顯改變行為——GLM-5.2 就把這句話轉化成了獨立的規劃步驟。
- 在資料結構中要求引用。 為每家公司強制加入
sources欄位,能迫使模型產出可追溯的研究,而不是自信但未經查證的猜測。 - 將資料與呈現分離。 在 HTML 之前先生成
ai_infra_data.json,可讓報告能重新產生,且事實可被稽核。 - 長時程推理使用單代理模式。 這能讓完整任務脈絡掌握在單一模型手中;而當你想比較模型在長時間執行中的規劃與自我修正能力時,這正是你要的。



