logo
  • 环境
  • 企业版
  • 价格
Blogs
教程|Nov 8, 2025

使用 Eigent 和 Gemini 3 Pro 运行企业级智能体

Eigent 借助 Gemini 3 Pro 实现真实场景下的企业浏览器自动化

EigentEigent
Share to
使用 Eigent 和 Gemini 3 Pro 运行企业级智能体
  • 摘要
  • 背景:什么是 Eigent,以及它如何支持 Gemini 3 Pro
  • Github 仓库与如何搭建 Eigent
  • 克隆仓库
  • 安装前端依赖
  • 返回根目录并运行开发模式
  • 技术实现:Eigent 全栈与 CAMEL Workforce 架构
  • Eigent 中的浏览器自动化架构
  • 使用 Eigent 浏览器自动化在**真实企业任务**中测试 Gemini 3 Pro
  • Gemini 3 Pro 如何提升任务表现
  • 结论与下一步
Automate Everything with
AI Workforce on Desktop
Download Eigent

摘要

在真实的企业环境中,许多内部工具、仪表盘和遗留系统完全运行在浏览器中,构成了日常业务运营的基础。为了自动化这些复杂系统,我们推出了 Eigent,这是一款开源的多智能体工作流应用,可在本地运行,并且可以从源码完整搭建,重点聚焦浏览器自动化——本质上,它就是面向企业工作流的 Eigent 开源协作助手。

在这篇文章中,我们将探讨 Eigent 如何借助 CAMEL 的 Workforce 架构和浏览器自动化来处理复杂的多步骤企业任务。我们还会深入了解 Gemini 3 Pro,分析它在三个真实企业任务中的表现,并考察其支持长周期、智能体式浏览器自动化场景高效运行的架构特性。

背景:什么是 Eigent,以及它如何支持 Gemini 3 Pro

Eigent 是一款运行在桌面端的开源多智能体工作流产品。它采用多智能体工作流架构,并由浏览器自动化、终端自动化和 MCP 等通用能力提供支持。这种设计使 Eigent 中的智能体能够像人类员工一样执行任务——在真实桌面环境中操作,而无需深度 API 集成或频繁重构工作流。

随着基础模型不断进步,将它们与 Eigent 的开源多智能体系统结合,可以让开发者和企业用户快速、高效地将 LLM 能力直接应用到真实业务场景中。这也是为什么 Eigent 在发布后立即集成了 Gemini 3 Pro。

在 Cloud Mode 中开始使用时,只需从顶部下拉菜单中选择 Gemini 3 Pro。或者,如果你更喜欢 Bring Your Own Key,可以前往 Eigent 的 Model Settings 页面,找到 Gemini 部分并输入你的 API key。将模型名称设置为 Gemini 3 Pro 后,即可开始使用。需要帮助?请查看我们关于 [配置你的 Google Gemini API key] 的指南。

如需逐步演示,请查看下面的视频教程。

Your browser does not support the video tag.

Github 仓库与如何搭建 Eigent

GitHub Repository: https://github.com/eigent-ai/eigent

快速开始:环境搭建

运行 Eigent 有两种方式:使用预编译的桌面应用立即上手,或者搭建开发环境来查看代码并自定义智能体。

方式 A:零配置桌面应用

适合想要立即开始自动化任务、无需接触代码的用户:

  1. 从 官方网站 下载客户端。
  2. 安装 .dmg (macOS)或 .exe (Windows)。
  3. 启动应用——本地后端会自动运行。

方式 B:开发者搭建

如需访问源码并在本地运行系统进行开发,请按以下步骤操作:

1. 前置条件 确保已安装 Node.js(v18-22)和 Python。

2. 克隆并安装

# 克隆仓库
git clone https://github.com/eigent-ai/eigent.git
cd eigent

# 安装前端依赖
npm install

3. 运行应用

# 返回根目录并运行开发模式
npm run dev

运行后,你可以在设置中直接配置你的 LLM 提供方(Gemini 3 Pro 等)。如需了解更详细的配置、进阶功能和故障排查信息,请参阅我们的 官方文档。

技术实现:Eigent 全栈与 CAMEL Workforce 架构

Eigent 系统概览

Eigent 是一款 local-first 的桌面应用,由 CAMEL Workforce 作为核心引擎驱动,支持多智能体编排。该系统采用解耦的全栈架构,完全运行在用户本地基础设施之上。这种设计严格保障了数据主权,消除了与云端智能体执行相关的隐私风险。

1. 前端

用户界面作为智能体配置和工作流监控的控制平面。前端基于 React 和 TypeScript 构建,运行在 Electron 框架之内。

关键技术组件包括:

  • 状态管理:使用 Zustand 处理临时应用状态,确保高效的响应性。
  • 可视化编排:集成 React Flow,用于可视化智能体工作区并跟踪实时智能体执行。
  • 通信:前端通过安全的本地 HTTP 请求与后端通信。

2. 后端

核心逻辑位于本地 Python 服务器中,使用 FastAPI 和 Uvicorn,作为 CAMEL 多智能体框架的宿主环境。

  • 运行时环境:后端运行在 Python 3.10+ 上,由 uv 管理,以实现高性能依赖解析和环境隔离。
  • 持久化层:通过 SQLModel/SQLAlchemy ORM 连接 PostgreSQL,为审计日志、工作流历史和智能体状态提供稳定的结构化数据存储。
  • 多智能体框架:CAMEL 框架负责智能体编排逻辑(例如 workforce),并与大语言模型(LLMs)交互,无论是远程模型(如 Gemini)还是本地模型(如通过 vLLM),用于智能体运行。CAMEL 框架还提供了丰富的工具包,例如浏览器工具包、终端工具包、文档生成工具包。

CAMEL Workforce:一种受组织结构启发的多智能体系统

Eigent 的核心是 CAMEL Workforce,这是一个多智能体系统,旨在通过去中心化协作来解决复杂的真实世界任务。该系统采用严格的 Producer-Consumer 模式,并通过异步消息通道来高效管理依赖图。

1. 智能体角色

  • Coordinator Agent:作为主要调度器。它维护全局状态,并根据可用性和能力将子任务分配给特定 worker。
  • Task Agent:负责将高层目标进行语义拆解,分解为可执行的原子单元。
  • Worker Agent:作为专门的执行单元。Worker agent 接收原子级子任务,并使用领域特定工具执行它们。

2. 异步通信:TaskChannel

协调层与执行层之间的解耦通过 TaskChannel 实现。这个异步消息队列可以在不阻塞主执行线程的情况下管理任务分发。

执行流程:

  1. Workforce 发起任务。
  2. Worker 节点轮询待分配任务。
  3. 完成后,结果会回传。

3. 动态 DAG 构建

企业工作流很少是线性的。CAMEL Workforce 实现了一种动态有向无环图(Directed Acyclic Graph, DAG)构建机制。当收到高层提示词时(例如 "Create Travel Plan"),Task Agent 会将该目标拆解为离散节点。

系统会显式映射依赖关系,使调度器能够:

  • 并行执行相互独立的节点(例如 Search Flight Ticket 和 Search Hotel 可并行运行)。
  • 在依赖节点的前置节点达到 DONE 状态之前,阻塞这些依赖节点。

4. 容错机制

鉴于 LLM 的非确定性,Eigent 将失败视为预期的状态迁移,而不是致命异常。该架构实现了一个稳健的恢复机制,采用以下策略:

  • RETRY:在同一 worker 上重新执行子任务,以处理临时性错误。
  • REPLAN:Task Agent 根据失败日志修改原始子任务,然后重新入队。
  • REASSIGN:将子任务从当前 worker 迁移给具有兼容技能集的其他智能体。
  • DECOMPOSE:如果任务因过于复杂而失败,则递归拆解为更小的子任务。

CAMEL Workforce.png

Eigent 中的浏览器自动化架构

然而,只有当多智能体工作流架构与日益强大的通用能力(例如浏览器自动化)结合时,才能真正释放企业自动化的潜力。这也是为什么我们强调构建能够直接在真实业务环境中运行的智能体,而不是仅仅依赖僵化的 API 集成。

Eigent 采用双层架构,将浏览器控制与智能体编排分离:

  • TypeScript 层 负责所有浏览器交互。它利用原生 Playwright API 执行 DOM 操作、捕获结构化快照、生成 SoM 截图、检测遮挡,并在 JavaScript 运行时中直接处理高级浏览器逻辑。由于 Playwright 原生基于 TypeScript 构建,这一层可访问前沿特性,如 _snapshotForAI(),并确保更好的性能、可靠性和开发体验。
  • Python 层 负责 AI 编排。它管理 LLM 调用、智能体决策和任务规划。这种分离使 Python 能够专注于智能体逻辑,而 Python 生态在 AI 和工作流编排方面具有优势。
  • 两层通过 WebSocket 异步通信,从而实现非阻塞操作。Python 发送浏览器操作请求,TypeScript 执行这些请求并返回结果。对最终用户而言,这一交互是透明的,并支持并发任务执行。

这种架构提升了性能,增强了元素交互的精确性,并实现了动态 DOM 过滤、视口感知快照以及浏览器内 SoM 渲染等高级能力。它避免了仅使用 Python 实现时的局限性,例如高延迟、对浏览器内部结构访问受限,以及复杂的图像处理逻辑。通过将浏览器任务委托给原生执行上下文,Eigent 为基于智能体的企业自动化奠定了稳固基础。

在企业自动化场景中的多智能体执行过程中,基于浏览器的自动化在流程可见性方面具有天然优势。每一步都透明、可检查且易于调试,因此对于复杂且不断演进的工作流而言更具实用性。

CAMEL Browser.png

使用 Eigent 浏览器自动化在真实企业任务中测试 Gemini 3 Pro

我们使用 Gemini 3 Pro 对 Eigent 进行了测试,借助 Eigent 浏览器自动化能力来自动化销售流程。智能体的任务是自动化真实销售周期中的各个阶段,包括 Lead Capture & Creation、Qualification & Pipeline Management、Quotation、Negotiation、Closing 和 Product Management。

在多次实验运行中,Gemini 3 Pro 持续展现出三项关键优势:

  1. 能够很好地处理复杂页面结构,包括 iframe 和嵌套元素: 即使在复杂布局中,它也能可靠地找到正确的内容和按钮。
  2. 会检查自己的操作以保持准确,并缩短步骤: 它使用反馈循环来纠正错误,并确保任务真正完成。
  3. 高效且灵活地使用工具: 它避免不必要的步骤,并且知道在需要时如何智能组合工具。

示例任务 1:

Identify all B2B companies in the Y Combinator Winter and Summer 2025 batch whose industry focus is related to Marketing. After you obtain the full company list, independently investigate each company’s product information in detail and consolidate all findings into a clean, well-structured CSV file.

这个任务展示了智能体处理迭代式导航和动态数据提取的能力。不同于简单的单页抓取,这一工作流要求智能体先与 Y Combinator 目录交互,应用特定过滤条件(Batch、Industry、B2B 标签),然后执行“列表到详情”的模式。

这里的挑战在于保持上下文:智能体必须进入各个公司简介,提取特定产品信息,然后返回主列表,同时不能丢失当前位置或重复条目。Gemini 3 Pro 成功编排了这一循环,解析多样化的落地页布局,并在无需人工干预的情况下,将非结构化信息规范化为整洁的 CSV 格式。

Your browser does not support the video tag.

示例任务 2:

The salesforce.com - 200 Widgets deal is progressing well. Move it from 'Needs Analysis' to 'Proposal' stage, and click “Mark as Current Stage’ and go click "Contact Roles" and give me the contact name and Phone number. Back to Opportunities page edit this Next Step as “book a meeting with + the contact name and phone number.”

这个浏览器自动化任务对标准模型来说具有挑战性。首先,它必须在 Salesforce 首页上定位相关的 Opportunity。其次,它需要更新该 Opportunity 的阶段,跳转到特定页面并检索联系人信息,最后还要修改该信息中的 'Next Step' 字段。

因此,对于这个任务,需要展示稳定的长周期任务执行能力、对复杂任务的深入理解、合理的任务规划,以及在 Salesforce 环境中执行稳定跨页面操作的能力。

Your browser does not support the video tag.

此外,通过定量拆解(例如,将每一步动作映射到页面区域、跟踪失败/重试次数),我们可以将浏览器动作参考与快照中的元素逐项对应起来。这使我们能够更深入地分析 Gemini 3 Pro 在工具调用和浏览器动作准确性与有效性方面的表现:

RunTotal Browser ActionsOther Actions UsedSequence CharacteristicsImplication
1st run23None紧凑序列(open → type → repeated clicks → snapshot → click → visit_page → click …)。同一控件没有重复点击/输入。单向推进,冗余较低。
2nd run18note / screenshots在 open 之后包含多次 click/snapshot 以到达目标区域;后续引入 append_note/create_note/browser_get_page_snapshot 进行状态记录与确认。浏览器动作更少;辅助工具被用作外部记忆与验证。
3rd run15None以多次 open/visit_page 开始,随后连续 click,最后一次 type。无辅助工具;无重试/回滚。动作链最精简。

基于这三次运行结果,我们可以看到 Gemini 3 Pro 在长周期浏览器任务场景中展现出很强的鲁棒性和可审计性。

  • 执行流程: 它能够根据解析后的任务目标和环境状态,可靠地规划执行路径。
  • 稳定性与鲁棒性: 当前任务浏览器页面包含多达 13 层嵌套,但 Gemini 3 Pro 在任务执行过程中依然保持了低重试率、无死循环。
  • 效率: 三组日志显示,几乎没有冗余工具调用,也从未出现多次点击或重复输入。这种效率结合灵活的辅助工具(Note/Screenshot),带来了更少且更稳定的浏览器动作。

示例任务 3:

“ I’m preparing for my monthly sales review. Please go into my forecast, find the opportunity under the Global Media account that’s in the Commit stage, and update its Close Date to November 26th. ”

如果我们进一步增加任务中网页的复杂度会怎样?

下面这个任务设置在 Salesforce Forecast 页面上。Forecast 页面用于销售团队进行统计和概览;它的浏览器页面极其复杂,在一次快照中约有 4,763 个元素。经过多层解码后,快照包含 1,222 行,最大嵌套深度为 18 层,平均深度约为 14.33。这意味着该页面不仅元素数量高,而且还具有极深的层级结构:List → List Item → Link/Button → Icon → Paragraph/Grid Row 等多层嵌套。

Salesforce Forecasts Webpage

Salesforce Forecasts Webpage

在我们的测试中,Gemini 3 在三次运行中都完美地完成了该任务。它需要具备在如此密集、深度嵌套的页面中正确更新字段的能力,同时仍能成功锁定目标 Opportunity(Global Media 180 Widgets)并完成 Close Date 更新,这证明了 Gemini 3 Pro 在浏览器使用场景中的强大解析、路径规划和稳定执行能力。

Gemini 3 Pro 如何提升任务表现

Gemini 3 Pro 是面向自治企业智能体的一种均衡选择。在我们的真实任务中,它始终能够以很高的可靠性处理长周期、基于浏览器的工作流。结合其良好的成本性能比,它为企业环境中扩展基于智能体的自动化提供了一个实用选项。

“状态连续性”优势(Thought Signatures) 我们观察到的主要技术差异化点是 Gemini 3 Pro 对 Thought Signatures 的实现。在传统 LLM 交互中,模型完全依赖会话历史文本来在轮次之间重建上下文。在复杂、长周期的工作流中,这有时会导致“上下文漂移”,即智能体在多次浏览器交互后失去对原始意图的把握。Gemini 3 Pro 通过在每一步后返回 thoughtSignature 来解决这一问题,thoughtSignature 是其内部推理状态的加密表示。

对 Eigent 的影响

当我们的智能体执行顺序任务时(例如先“Check flight status”,再“Book Taxi”),这个签名会被回传给模型。在我们的测试中,这一机制帮助智能体在多步骤函数调用过程中保持更好的逻辑连续性,与同类模型相比,降低了工作流后期的逻辑错误率。

长周期规划中的鲁棒性

企业自动化通常需要在不确定性中前进——处理登录界面、加载状态或意外弹窗。

Gemini 3 Pro 在更长会话(10+ 步)中表现出很强的韧性。这与它在 Vending-Bench 2 等基准上的表现一致,后者用于评估长周期规划能力。

对于普通查询,顶级模型之间的性能差距可能并不明显。然而,在以状态保持和错误恢复为核心的 Agentic Automation 中,Gemini 3 Pro 目前为 Eigent 平台提供了可靠的基础。它通过 Thought Signatures 保留“推理状态”的能力,使其成为复杂、多步骤企业工作流的务实选择。

结论与下一步

通过这篇博客,我们探讨了由 CAMEL 的多智能体工作流架构和浏览器级能力驱动的 Eigent,如何为部署能够真正进入企业系统内部运行的 AI 智能体创建生产级环境。通过将工具层自治与用户可覆盖的工作流结合,系统保持了可控、可观察和可审计性,这些都是任何面向 B2B 部署的关键属性。

我们还展示了当 Gemini 3 Pro 集成到 Eigent 中时,如何在推理能力、稳定性和成本效益之间取得理想平衡。它在架构上与多智能体执行高度契合,尤其是通过 Thought Signatures 等特性,使其特别适合企业场景中常见的高风险、长周期工作流。

展望未来,我们将继续:

  • 在真实企业部署中暴露失败案例,识别当前基础模型在状态跟踪、错误恢复或工具对齐方面表现不足的任务模式。
  • 建立标准化的企业浏览器自动化基准,收集真实的企业自动化任务场景,包括电子邮件客户端、消息系统、文档、浏览器 UI 以及 ERP/CRM 平台。
  • 构建面向浏览器企业工作流的强化学习环境,通过基于任务的奖励、轨迹跟踪和长周期行为分析,为智能体提供强化学习支持。

Eigent 完全开源,我们欢迎开发者、研究人员和企业团队前来探索、扩展并贡献:

👉 GitHub: https://github.com/eigent-ai/eigent

👉 加入我们的 Discord 社区: https://discord.camel-ai.org

Recent Posts

Cursor 替代品(免费且开源):属于你自己的工作空间
Jul 23, 2026

Cursor 替代品(免费且开源):属于你自己的工作空间

在 SpaceX 收购事件后,正在寻找免费开源 Cursor 替代品?对比成本、自托管、模型选择和数据驻留方案,并了解迁移路径。

EigentEigent
Claude Record a Skill:通过屏幕录制教 Claude 学习工作流
Jul 22, 2026

Claude Record a Skill:通过屏幕录制教 Claude 学习工作流

Claude 的 Record a skill 功能可将屏幕录制转化为可复用的技能。了解其工作原理、访问权限、设置步骤及使用限制。

EigentEigent
Cursor Router 详解:以更低成本实现前沿级代码质量
Jul 22, 2026

Cursor Router 详解:以更低成本实现前沿级代码质量

Cursor Router 自动为每个编程请求选择最佳模型,在保持前沿质量的同时降低成本。了解其工作原理、三种模式及相关权衡。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即体验 Eigent

下载开源桌面应用,在本地用 AI 工作团队开始自动化。

下载 Eigent
Eigent

获取关于 AI 员工自动化的最新更新和教程。

产品Eigent环境定价企业版
探索解决方案使用场景技能插件博客
开发者文档GitHubCAMEL-AI开源基金合作伙伴
下载开源版
公司关于我们品牌加入我们使用条款隐私政策安全与信任Cookie 政策退款与试用政策

保留所有权利 © 2026 EIGENT UK LTD

Eigent 1.0 新版本发布!download