logo
  • 环境
  • 企业版
  • 价格
DeveloperJun 16, 2026

长程任务:Eigent 单智能体 Harness 中的 GLM-5.1 vs GLM-5.2

EigentEigent
GLM-5.1 vs GLM-5.2 — Eigent 单智能体 Harness 上的长程 AI 基础设施研究
Automate Everything with
AI Workforce on Desktop
Download Eigent

一项任务,两个模型,同一个智能体

比较两个模型最干净的方法,就是不改变其他任何条件。所以我们正是这样做的:同一项长程任务、同一个智能体、同一套工具。我们把相同的简报交给 Eigent 的 single-agent harness 中的 GLM-5.1 和 GLM-5.2,观察它们如何规划、研究、验证并交付成果。

这项工作是真正的分析师任务,而不是玩具型基准测试:

深入研究 AI 基础设施栈中的 26 家公司——从芯片设计和半导体制造,到支撑前沿 AI 运行的云平台和数据中心——然后构建一份交互式报告。

像这样的长程任务,正是模型真正分化的地方。它不是一个巧妙的答案,而是在很长运行过程中串联起来的许多小决策:规划要多深入、要信任多少来源、何时停止研究,以及在宣布完成之前要核验到什么程度。

提示词

我们在 single-agent mode 下向两个运行发送了相同的提示词:

对 AI 基础设施生态系统中的 26 家公司进行深入研究——这是整个 AI 价值链中最确定的主线。覆盖以下 6 个子行业(每个子行业选择具有代表性的公司,从大型龙头到较小参与者):

  • AI 数据中心(算力基础设施 / 建设扩张)
  • GPU / AI 芯片(训练与推理硅片、ASIC、IP)
  • 服务器、网络与光模块(交换机、NIC、光互连)
  • 电力、液冷与储能(电源、散热、能源管理)
  • AI 云 / 计算平台(超大规模云厂商、GPU 云、算力租赁平台)
  • 支撑生态(HBM / 先进封装、晶圆代工、连接器及其他关键组件)

对于每家公司,研究:公司名称、子行业、总部 / 国家;核心产品及其在 AI 链中的具体角色;上市或非上市(若上市,注明股票代码 + 交易所;若非上市,注明最新估值 / 融资轮次);市值或估值规模(用于排序);在生态中的定位与护城河(1–2 句);主要客户 / 竞争对手。

在每个子行业内按从大到小排序公司,并整体采用自上而下的结构:从完整的硬件生态全景到每一家单独公司。

输出: 首先生成结构化的 ai_infra_data.json,包含全部 26 家公司、6 个子行业分类、上市/非上市标记,以及跨公司比较矩阵。然后基于该 JSON 生成一份精美、交互式的 HTML 报告——生态全景图、行业分区、公司卡片、上市与非上市颜色编码、市值排名图表,以及可排序 / 可筛选的比较表。先验证研究数据的准确性(上市状态、股票代码、估值——最新数据并附引用来源),然后再生成报告。

1执行准备 —— GLM-5.2 规划更深入

在任何一个模型碰到网页之前,分歧就已经出现在计划里了。

GLM-5.1 将工作拆成了 4 个步骤。GLM-5.2 在相同简报的基础上扩展到了 6 个步骤——而且值得注意的是,它把 “验证准确性” 单独作为一项任务,而不是顺手带过。这正是严谨分析师对任务范围的划分方式:先研究,再证明研究,再构建。

相同的指令。不同的判断:这项任务值得投入多少严谨度。

2研究 —— 来源数量翻倍

计划很快变成了两种截然不同的研究过程。

  • GLM-5.1: 约 40 个来源
  • GLM-5.2: 约 82 个来源——研究量大约是 2 倍

而且这不只是“更多”页面,而是“分布更好”的页面。GLM-5.1 主要依赖单一数据网站,而 GLM-5.2 则通过 财经新闻、公司文件和私募市场数据库 对每个数据点进行交叉核验:Reuters、Bloomberg、Crunchbase、TechCrunch 等。

单一来源不够。对于估值、股票代码和上市状态,GLM-5.2 把单个数字视为需要确认的假设,而不是可以直接复制的事实。

GLM-5.2 不只是更快地给出答案;它还通过读取两倍数量的页面,深入核验每一个数据点。

3先验证,再完成

因为 GLM-5.2 将验证划分为独立步骤,它实际上真的做了——在提交报告之前重新核对上市状态、股票代码和估值是否与最新数据一致。结果是一份证明了自身工作过程的报告,而不是只做断言。

4结果 —— 更深的数据,真实的引用

同样的任务。两份截然不同的交付物。

GLM-5.2 生成了:

  • 更丰富的 数据架构,包含专门的 护城河分析、融资细节 和 完整来源列表——每一条结论都能追溯到来源。
  • 最终报告在数据和结构上都比 GLM-5.1 丰富近 2 倍。
  • 输出是一个可直接部署的交互式站点——而不仅仅是静态 HTML 页面:生态全景图、行业分区、上市与非上市颜色编码、市值排名图表,以及可排序 / 可筛选的比较表。

GLM-5.1 交付了一份扎实、正确的报告。GLM-5.2 交付的是一份你可以直接拿去给投资委员会看的报告。

5这件事为何重要

在短任务上,两个能力不错的模型看起来差不多。但在 长程任务 上,差异会不断累积。GLM-5.2 多读的每一条来源、每一个它选择复核的数据点,以及把验证设为一级步骤的决定,最终都叠加成了一个显著更好的结果。

harness 是相同的。工具是相同的。唯一变量是模型——而这正好让我们能够公平地看出 GLM-5.2 在长时间运行中的推理方式:

更多来源。更敏锐的判断。一份能证明自己工作的报告。

6你也可以运行

Eigent 允许你在同一个 single-agent harness 背后切换模型,因此你可以在自己的任务上运行这项完全相同的比较:

  1. 进入 Settings → Models,选择或添加你想测试的模型(GLM-5.1、GLM-5.2 或任何支持 function calling 的模型)。
  2. 将任务切换为 single-agent mode。
  3. 粘贴上面的深度研究提示词(或你自己的长程简报)。
  4. 每个模型运行一次,然后并排比较计划、来源数量和最终报告。

7接下来可以尝试什么

用同一份简报重新运行,但要求每个估值至少有 3 个独立来源,并标记任何来源不一致的公司。

将范围从 26 家扩展到 50 家,并在比较矩阵中增加一列“供应链依赖”。

为最终报告生成一页式 PDF 执行摘要,以及市值排名图表的幻灯片。

让 GLM-5.2 与另一模型在同一任务上对跑,并生成差异报告:它们在哪些地方一致、哪些地方不同,以及谁的来源更扎实。

8提升效果的技巧

  • 明确要求验证。 让模型“先验证准确性,再构建”会明显改变行为——GLM-5.2 把这句话转化成了自己的计划步骤。
  • 在 schema 中要求引用。 为每家公司要求一个 sources 字段,能强制输出可追溯的研究,而不是自信的猜测。
  • 将数据与展示分离。 先生成 ai_infra_data.json 再生成 HTML,可以让报告可重建、事实可审计。
  • 长程推理使用 single-agent mode。 这样整个任务上下文都掌握在一个模型手中,而这正是你在比较模型如何规划和自我纠正时最需要的。

Other use cases

收据和发票的自动化 VAT 申报

收据和发票的自动化 VAT 申报

请处理“VAT”文件夹中的所有收据和发票,包括照片、扫描的 PDF 和电子发票。最终输出应只包含两个文件:(1) vat_return.xlsx——Excel 文件应为每张收据或发票包含一行,列出所有提取字段,显示每一项是否符合 VAT 追回资格,显示每个符合条件项目的可追回 VAT 金额,包含不可追回项目的排除原因,清晰标记需要人工复核的项目,并包含一个显示可追回 VAT 总金额的汇总工作表。(2) vat_return.html——创建一个可直接打开并与财务团队共享的独立 HTML 文件。HTML 文件应显示所有 VAT 追回项目、每个项目的可追回 VAT 金额、被排除的项目及其排除原因、需要人工复核的项目,以及可追回 VAT 总金额。不要猜测任何不确定的信息。

使用 Eigent 同时构建 10 款中国新年 HTML5 游戏

使用 Eigent 同时构建 10 款中国新年 HTML5 游戏

使用 HTML、CSS 和 JS(不使用任何库)构建 10 款彼此独立且完整的游戏,主题均与 2026 年春节(马年)相关。游戏必须有趣、原创、打磨完善、适配移动端。包含计分、难度递增、重玩按钮和流畅视觉效果。覆盖:街机、解谜、无尽跑酷、反应、策略、记忆、双人本地、放置、复古像素,以及 1 款实验性游戏。

使用 Gemini 3.1 Pro 构建完整的 3D Snow Bros 平台游戏

使用 Gemini 3.1 Pro 构建完整的 3D Snow Bros 平台游戏

创建一款现代 3D 横向卷轴平台游戏,灵感来自 Mario,并结合 Snow Bros 机制。玩家可以发射雪球冻结怪物,将它们变成雪球后再踢飞,借此连锁击中其他敌人。包含计分系统、生命显示、动态难度和重开功能,以及丰富的 3D 分层环境。

Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD

Eigent 1.0 新版本发布!download