logo
  • 環境
  • 企業方案
  • 價格方案
Blogs
教學|Nov 8, 2025

使用 Eigent 與 Gemini 3 Pro 執行企業級代理程式

Eigent 搭配 Gemini 3 Pro 的真實企業瀏覽器自動化

EigentEigent
Share to
使用 Eigent 與 Gemini 3 Pro 執行企業級代理程式
  • 摘要
  • 背景:什麼是 Eigent,以及它如何支援 Gemini 3 Pro
  • Github 儲存庫與如何設置 Eigent
  • Clone the repository
  • Install frontend dependencies
  • Return to root and run dev mode
  • 內部運作:Eigent 全端與 CAMEL Workforce 架構
  • Eigent 中的瀏覽器自動化架構
  • 使用 Eigent 瀏覽器自動化測試 Gemini 3 Pro 在 **真實企業任務** 中的表現
  • Gemini 3 Pro 如何提升任務表現
  • 結論與下一步
Automate Everything with
AI Workforce on Desktop
Download Eigent

摘要

在真實的企業環境中,許多內部工具、儀表板與舊系統都完全在瀏覽器中運作,構成日常業務營運的基礎。為了自動化這些複雜系統,我們推出 Eigent,這是一個可在本機執行、可從原始碼完整設置的開源多代理工作團隊應用程式,並且高度聚焦於瀏覽器自動化——本質上,它就是你在企業工作流程中的 Eigent 開源同事。

在這篇文章中,我們將探討 Eigent 如何結合 CAMEL 的 Workforce 架構與瀏覽器自動化來處理複雜的多步驟企業任務。我們也會深入介紹 Gemini 3 Pro,分析它在三個真實企業任務上的表現,並檢視其能在長時程、agentic 瀏覽器自動化情境中有效運作的架構特性。

背景:什麼是 Eigent,以及它如何支援 Gemini 3 Pro

Eigent 是一個在你的桌面上執行的開源多代理工作團隊產品。它採用多代理工作團隊架構,並由瀏覽器自動化、終端機自動化與 MCP 等通用能力提供支援。這種設計讓 Eigent 中的代理程式能像人類工作者一樣執行任務——在真實桌面環境中運作,而不需要深度 API 整合或持續重新配置工作流程。

隨著基礎模型持續進步,將它們與 Eigent 的開源多代理系統整合,能讓開發者與企業使用者快速且有效地把 LLM 能力直接應用到真實世界的使用情境。因此,Eigent 在 Gemini 3 Pro 發布後立即完成整合。

要在 Cloud Mode 中開始使用,只需從頂部下拉選單選擇 Gemini 3 Pro。或者,如果你偏好 Bring Your Own Key,請前往 Eigent 的 Model Settings 頁面,找到 Gemini 區塊並輸入你的 API key。當模型名稱設為 Gemini 3 Pro 後,你就可以開始了。需要協助嗎?請參考我們的 [設定你的 Google Gemini API key] 指南。

若要逐步操作,請查看下方的影片教學。

Your browser does not support the video tag.

Github 儲存庫與如何設置 Eigent

GitHub Repository: https://github.com/eigent-ai/eigent

快速開始:設置環境

你有兩種方式執行 Eigent:使用預先編譯好的桌面應用程式以便立即使用,或是設置開發環境來檢視程式碼並自訂代理程式。

選項 A:「零設定」桌面應用程式

適合希望立即開始自動化任務、且不想碰程式碼的使用者:

  1. 從 官方網站 下載用戶端。
  2. 安裝 .dmg (macOS)或 .exe (Windows)。
  3. 啟動應用程式——本機後端會自動啟動。

選項 B:開發者設置

若要存取原始碼並在本機執行系統以進行開發,請依照以下步驟:

1. 必要條件 請確認你已安裝 Node.js(v18-22)與 Python。

2. 複製並安裝

# Clone the repository
git clone https://github.com/eigent-ai/eigent.git
cd eigent

# Install frontend dependencies
npm install

3. 執行應用程式

# Return to root and run dev mode
npm run dev

啟動後,你可以直接在設定中配置你的 LLM 供應商(Gemini 3 Pro 等)。若想了解更詳細的設定、進階功能與疑難排解,請參考我們的 官方文件。

內部運作:Eigent 全端與 CAMEL Workforce 架構

Eigent 系統概覽

Eigent 是一個以本機優先(local-first)的桌面應用程式,具備多代理協調能力,並以 CAMEL Workforce 作為核心引擎。此系統採用解耦的全端架構,完全運行於使用者的本機基礎設施上。這種設計嚴格確保資料主權,消除了與雲端端代理程式執行相關的隱私風險。

1. 前端

使用者介面作為代理程式配置與工作流程監控的控制平面。以 React 與 TypeScript 建構,並運行於 Electron 框架中。

主要技術元件包括:

  • 狀態管理:使用 Zustand 處理暫時性的應用程式狀態,確保高效的反應性。
  • 視覺化編排:整合 React Flow 來視覺化代理工作區,以追蹤即時的代理執行狀態。
  • 通訊:前端透過安全的本機 HTTP 請求與後端通訊。

2. 後端

核心邏輯位於本機 Python 伺服器中,使用 FastAPI 與 Uvicorn,作為 CAMEL 多代理框架的宿主環境。

  • 執行環境:後端運行於 Python 3.10+,並由 uv 管理,以實現高效能的依賴解析與環境隔離。
  • 持久層:透過 SQLModel/SQLAlchemy ORM 介接的 PostgreSQL,為稽核日誌、工作流程歷史與代理狀態提供穩健的結構化資料儲存。
  • 多代理框架:CAMEL 框架負責代理協調邏輯(例如 workforce),並與大型語言模型(LLMs)互動,無論是遠端(例如 Gemini)或本機(例如透過 vLLM)來執行代理。CAMEL 框架也提供豐富的工具組,例如 browser toolkit、terminal toolkit、document generation toolkit。

CAMEL Workforce:受組織結構啟發的多代理系統

Eigent 的核心是 CAMEL Workforce,一個以分散式協作解決複雜真實任務而設計的多代理系統。此系統使用嚴格的 Producer-Consumer pattern(生產者-消費者模式),並透過非同步訊息通道來高效管理依賴關係圖。

1. 代理角色

  • Coordinator Agent:作為主要派發者。它維護全域狀態,並根據可用性與能力將子任務分配給特定工作者。
  • Task Agent:負責將高層目標在語意上拆解為可執行的原子單元。
  • Worker Agent:作為專門的執行單元。Worker agents 會接收原子子任務,並使用領域專用工具執行它們。

2. 非同步通訊:TaskChannel

協調層與執行層之間的解耦,是透過 TaskChannel 達成的。這個非同步訊息佇列可在不阻塞主要執行執行緒的情況下管理任務分配。

執行流程:

  1. Workforce 啟動一個任務。
  2. Worker 節點輪詢分派。
  3. 完成後,結果會回傳。

3. 動態 DAG 建構

企業工作流程很少是線性的。CAMEL Workforce 實作了一套動態 Directed Acyclic Graph (DAG)(有向無循環圖) 建構機制。當收到高層提示(例如 "Create Travel Plan")時,Task Agent 會將此目標拆解為離散節點。

系統會明確映射依賴關係,讓排程器可以:

  • 平行執行彼此獨立的節點(例如,Search Flight Ticket 與 Search Hotel 可同時執行)。
  • 在相依節點的前驅節點進入 DONE 狀態之前,先阻擋其執行。

4. 容錯機制

鑑於 LLM 的非決定性特性,Eigent 將失敗視為預期中的狀態轉移,而非致命例外。此架構透過以下策略實作了穩健的 recovery mechanism(恢復機制):

  • RETRY:在相同 worker 上重新執行子任務,以處理暫時性錯誤。
  • REPLAN:Task Agent 會根據失敗日誌修改原始子任務,然後再將子任務重新排入佇列。
  • REASSIGN:將子任務從目前 worker 轉移到具備相容技能組的另一個代理程式。
  • DECOMPOSE:如果任務因過於複雜而失敗,則會遞迴地將其拆解為更小的子任務。

CAMEL Workforce.png

Eigent 中的瀏覽器自動化架構

然而,只有將多代理工作團隊架構與像瀏覽器自動化這樣持續增強的通用能力結合,才能真正解鎖企業級自動化。這就是為什麼我們強調打造能直接在真實商業環境中運作的代理程式,而不是只依賴僵化的 API 整合。

Eigent 採用兩層式架構,將瀏覽器控制與代理協調分離:

  • TypeScript 層 負責所有瀏覽器互動。它利用原生 Playwright API 執行 DOM 操作、擷取結構化快照、產生 SoM 截圖、偵測遮擋,並直接在 JavaScript 執行環境中處理進階瀏覽器邏輯。由於 Playwright 原生以 TypeScript 建構,這一層能使用如 _snapshotForAI() 等前沿功能,並確保更好的效能、可靠性與開發體驗。
  • Python 層 負責 AI 協調。它管理 LLM 呼叫、代理決策與任務規劃。這種分離讓 Python 能專注於代理邏輯,而 Python 生態系在 AI 與工作流程協調方面表現出色。
  • 兩層透過 WebSocket 非同步通訊,實現非阻塞操作。Python 發送瀏覽器操作請求,TypeScript 執行後回傳結果。這個互動對終端使用者是透明的,並支援並行任務執行。

這種架構提升了效能,增強了元素互動的精準度,並支援動態 DOM 篩選、視窗區域感知快照與瀏覽器內 SoM 渲染等進階能力。它避免了僅以 Python 實作的限制,例如高延遲、對瀏覽器內部結構的存取受限,以及複雜的影像處理邏輯。透過將瀏覽器任務委派給原生執行環境,Eigent 為基於代理程式的企業自動化奠定了穩健基礎。

在企業自動化情境中的多代理執行過程中,基於瀏覽器的自動化在流程可視性方面具有天然優勢。每一步都透明、可檢視且易於除錯,讓複雜且持續變動的工作流程更具實用性。

CAMEL Browser.png

使用 Eigent 瀏覽器自動化測試 Gemini 3 Pro 在 真實企業任務 中的表現

我們已使用 Eigent 與 Gemini 3 Pro 測試了 Eigent 瀏覽器自動化能力 來自動化銷售流程。代理程式的任務是自動處理真實銷售週期中的各個階段,包括 Lead Capture & Creation、Qualification & Pipeline Management、Quotation、Negotiation、Closing 與 Product Management。

在多次實驗執行中,Gemini 3 Pro 一貫展現出三個關鍵優勢:

  1. 能良好處理複雜頁面結構,包括 iframe 與巢狀元素: 即使在複雜版面中,也能可靠地找到正確內容與按鈕。
  2. 會自我檢查操作以保持準確與縮短步驟: 它使用回饋迴圈來修正錯誤,並確保任務確實正確完成。
  3. 工具使用高效且彈性: 它避免不必要的步驟,並在需要時懂得聰明地組合工具。

示例任務 1:

請找出 Y Combinator 2025 冬季與夏季批次中,產業重點與 Marketing 相關的所有 B2B 公司。取得完整公司清單後,請獨立深入調查每家公司的產品資訊,並將所有發現整理成一個乾淨、結構良好的 CSV 檔案。

這個任務展示了代理程式處理迭代式導覽與動態資料擷取的能力。不同於簡單的單頁爬取,這個工作流程要求代理程式先與 Y Combinator 目錄互動以套用特定篩選條件(Batch、Industry、B2B tag),然後執行「清單到詳情(List-to-Detail)」模式。

這裡的挑戰在於維持上下文:代理程式必須深入各公司個別頁面擷取特定產品細節,然後回到主清單且不失去位置或重複條目。Gemini 3 Pro 成功協調了這個迴圈,解析多樣化的落地頁版面,並在沒有人工介入的情況下,將非結構化資訊標準化為乾淨的 CSV 格式。

Your browser does not support the video tag.

示例任務 2:

salesforce.com - 200 Widgets 這筆交易進展順利。請將它從 'Needs Analysis' 階段移到 'Proposal' 階段,並點擊 “Mark as Current Stage’ 然後前往點擊 "Contact Roles" 並提供聯絡人姓名與電話號碼。回到 Opportunities 頁面,將這個 Next Step 編輯為 “book a meeting with + 聯絡人姓名和電話號碼。”

這項瀏覽器自動化任務對標準模型來說頗具挑戰。首先,它必須在 Salesforce 首頁找到相關的 Opportunity。其次,它需要更新 Opportunity 的階段,導覽到特定頁面並取得聯絡資訊,最後再修改該資訊中的 'Next Step' 欄位。

因此,對這個任務而言,需要展現穩定的長時程任務表現、對複雜任務的深度理解、邏輯性的任務規劃,以及在 Salesforce 環境中執行穩定跨頁操作的能力。

Your browser does not support the video tag.

此外,透過量化拆解(例如將每個步驟的動作對應到頁面區域、追蹤失敗/重試次數),我們可以逐項將瀏覽器動作參照與快照中的元素對齊。這讓我們能更深入分析 Gemini 3 Pro 在工具呼叫與瀏覽器操作上的準確性與有效性:

執行次數瀏覽器總動作數使用的其他動作序列特徵意涵
第 1 次執行23無精簡序列(open → type → 重複點擊 → snapshot → click → visit_page → click …)。沒有在同一個控制項上重複點擊/輸入。以低冗餘的一次性流程前進。
第 2 次執行18note / screenshots為到達目標區域,在 open 之後有多次 click/snapshot 步驟;後續加入 append_note/create_note/browser_get_page_snapshot 作為狀態記錄與確認。瀏覽器動作較少;輔助工具作為外部記憶與驗證手段。
第 3 次執行15無先是多次 open/visit_page,接著持續 click,最後一次 type。沒有輔助工具;沒有重試/回滾。動作鏈最為精簡。

根據這三次執行結果,我們可以看到 Gemini 3 Pro 在長時程瀏覽器任務情境中展現出高度的穩健性與可稽核性。

  • 執行流程: 它能根據解析後的任務目標與環境狀態,可靠地規劃執行路徑。
  • 穩定性與健壯性: 目前的任務瀏覽器頁面包含多達 13 層巢狀結構,但 Gemini 3 Pro 在任務執行期間仍維持 低重試、無無限迴圈。
  • 效率: 三組日誌顯示 幾乎沒有冗餘的工具呼叫,也從未出現多次點擊或重複輸入。這種效率,加上彈性的輔助工具(Note/Screenshot),帶來了 更少且更穩定的瀏覽器動作。

示例任務 3:

“ 我正在準備每月銷售檢討。請進入我的 forecast,找出 Global Media 帳戶下處於 Commit 階段的 opportunity,並將它的 Close Date 更新為 November 26th。 ”

如果我們在任務中提高網頁的複雜度,會如何?

以下任務設定在 Salesforce Forecast 頁面上。Forecast 頁面供銷售團隊用於統計與概覽;其瀏覽器頁面極為複雜,在單一快照中約有 4,763 個元素。經過多層解碼後,快照包含 1,222 行,最大巢狀深度為 18 層,平均深度約 14.33。這表示該頁面不僅元素數量龐大,還具有深層的階層結構:像是 List → List Item → Link/Button → Icon → Paragraph/Grid Row 這類多層結構。

Salesforce Forecasts Webpage

Salesforce Forecasts Webpage

在我們的測試中,Gemini 3 連續三次都完美執行了這項任務。它需要能在如此密集、極度巢狀的頁面中正確更新欄位,同時仍能成功鎖定目標 opportunity(Global Media 180 Widgets)並完成 Close Date 更新,這證明了 Gemini 3 Pro 在 browser-use 情境下具備強健的解析、路徑規劃與穩定執行能力。

Gemini 3 Pro 如何提升任務表現

Gemini 3 Pro 是自主企業代理程式中一個平衡度很高的選擇。在我們的真實任務中,它持續以高度可靠性處理長時程、基於瀏覽器的工作流程。再加上其具吸引力的成本效益比,它成為在企業環境中擴展基於代理程式自動化的實用方案。

「狀態延續」優勢(Thought Signatures) 我們觀察到的主要技術差異化因素,是 Gemini 3 Pro 對 Thought Signatures 的實作。在傳統 LLM 互動中,模型完全依賴對話歷史文字來重建各輪之間的上下文。在複雜、長時程的工作流程中,這有時會導致「上下文漂移」,即代理程式在多次瀏覽器互動後失去對原始意圖的追蹤。Gemini 3 Pro 透過在每個步驟後回傳 thoughtSignature 來解決這個問題,這是一種其內部推理狀態的加密表示。

對 Eigent 的影響

當我們的代理程式執行連續任務(例如「檢查航班狀態」接著「預訂計程車」)時,這個簽章會回傳給模型。在我們的測試中,這種機制幫助代理程式在多步驟 function calls 中維持更好的邏輯連貫性,相較於同類模型,降低了工作流程後段的邏輯錯誤率。

長時程規劃的穩健性

企業自動化經常需要在不確定性中前進——處理登入畫面、載入狀態或意外彈出視窗。

Gemini 3 Pro 在較長的 sessions(10+ steps)中展現出高度韌性。這與它在如 Vending-Bench 2 這類基準上的表現一致,該基準評估的是長時程規劃能力。

對一般查詢而言,頂尖模型之間的效能差距或許並不明顯。然而,在 state maintenance 與 error recovery 至關重要的 Agentic Automation 中,Gemini 3 Pro 目前為 Eigent 平台提供了可靠的基礎。它透過 Thought Signatures 保留「推理狀態」的能力,使其成為處理複雜多步驟企業工作流程的務實選擇。

結論與下一步

透過這篇文章,我們探討了 Eigent 如何在 CAMEL 的多代理工作團隊架構 與 瀏覽器層能力 的驅動下,建立一個可用於正式生產環境的 AI 代理程式部署平台,這些代理程式能真正操作企業系統。透過將工具層級的自主性與使用者可覆寫的工作流程結合,系統仍能保持可控、可觀察且可稽核,這些都是任何面向 B2B 的部署所不可或缺的關鍵特性。

我們也展示了 Gemini 3 Pro 在整合進 Eigent 後,如何同時提供理想的推理能力、穩定性與成本效益。其與多代理執行的架構對齊,特別是透過 Thought Signatures 等功能,使它非常適合企業使用案例中常見的高風險、長時程工作流程。

展望未來,我們將持續:

  • 在真實企業部署中呈現失敗案例,找出目前基礎模型在狀態追蹤、錯誤恢復或工具 grounding 上表現較弱的任務模式。
  • 建立標準化的企業瀏覽器自動化基準測試,蒐集包含電子郵件用戶端、即時通訊系統、文件、瀏覽器 UI 與 ERP/CRM 平台等在內的真實企業自動化任務情境。
  • 打造瀏覽器式企業工作流程的強化學習環境,透過任務獎勵、軌跡追蹤與長時程行為分析,讓代理程式能進行強化學習。

Eigent 完全開源,我們邀請開發者、研究人員與企業團隊一同探索、擴充並貢獻:

👉 GitHub: https://github.com/eigent-ai/eigent

👉 加入我們的 Discord 社群:https://discord.camel-ai.org

Recent Posts

Cursor 替代方案(免費且開源):屬於你的工作空間
Jul 23, 2026

Cursor 替代方案(免費且開源):屬於你的工作空間

在 SpaceX 收購案後,尋找免費開源的 Cursor 替代方案?比較成本、自架部署、模型選擇與資料存放地點,並了解遷移路徑。

EigentEigent
Claude Record a Skill:用螢幕錄影教 Claude 學習工作流程
Jul 22, 2026

Claude Record a Skill:用螢幕錄影教 Claude 學習工作流程

Claude 的 Record a skill 功能可將螢幕錄影轉換為可重複使用的技能。了解其運作方式、適用方案、設定步驟及使用限制。

EigentEigent
Cursor Router 完整解析:以更低成本實現頂尖程式碼品質
Jul 22, 2026

Cursor Router 完整解析:以更低成本實現頂尖程式碼品質

Cursor Router 自動為每個程式開發請求選擇最佳模型,在維持頂尖品質的同時降低成本。了解其運作原理、三種模式及相關取捨。

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

立即體驗 Eigent

下載開源桌面應用,在本地以 AI 工作團隊開始自動化。

下載 Eigent
Eigent

掌握 AI 工作團隊自動化的最新更新與教學內容。

產品Eigent環境價格方案企業方案
探索解決方案使用情境技能插件部落格
開發者文件GitHubCAMEL-AI開源基金合作夥伴
下載開源版
公司關於我們品牌招募使用條款隱私權政策安全與信任Cookie 政策退款與試用政策

版權所有 © 2026 EIGENT UK LTD

Eigent 1.0 全新版本發佈!download