Eigent と Gemini 3 Pro でエンタープライズエージェントを実行する
Gemini 3 Pro を活用した Eigent の実世界エンタープライズ向けブラウザ自動化

要約
実際のエンタープライズ環境では、多くの社内ツール、ダッシュボード、レガシーシステムが完全にブラウザ上で動作しており、日々の業務の基盤となっています。こうした複雑なシステムを自動化するために、私たちは Eigent を導入します。これは、ローカルで動作し、ソースから完全にセットアップできるオープンソースのマルチエージェント・ワークフォースアプリケーションで、ブラウザ自動化に強くフォーカスしており、エンタープライズワークフローにおける Eigent のオープンソースの共同作業者 のような役割を果たします。
本記事では、Eigent が CAMEL の Workforce アーキテクチャとブラウザ自動化を活用して、複雑な多段階のエンタープライズタスクをどのように処理するかを解説します。また、Gemini 3 Pro にも焦点を当て、実世界のエンタープライズタスク 3 件での性能を分析し、長期的なエージェント型ブラウザ自動化シナリオで有効に動作できるようにするアーキテクチャ上の特徴を検証します。
背景: Eigent とは何か、そして Gemini 3 Pro をどう支援するか
Eigent は、デスクトップ上で動作するオープンソースのマルチエージェント・ワークフォース製品です。ブラウザ自動化、ターミナル自動化、MCP などの汎用機能に支えられたマルチエージェントのワークフォースアーキテクチャで構築されています。この設計により、Eigent 内のエージェントは、人間の作業者のように、深い API 統合や継続的なワークフロー再設定を必要とせず、実際のデスクトップ環境でタスクを実行できます。
基盤モデルが進化し続ける中、Eigent のオープンソース・マルチエージェントシステムと組み合わせることで、開発者やエンタープライズユーザーは LLM の能力を実世界のユースケースに迅速かつ効果的に適用できます。そのため、Eigent はリリース直後に Gemini 3 Pro を統合しました。
Cloud Mode を使って始めるには、上部のドロップダウンから Gemini 3 Pro を選択するだけです。あるいは、Bring Your Own Key を使いたい場合は、Eigent の Model Settings ページに移動し、Gemini セクションを見つけて API キーを入力してください。モデル名が Gemini 3 Pro に設定されれば、準備完了です。ヘルプが必要ですか? [Google Gemini API キーの設定] に関するガイドをご覧ください。
手順を追った解説については、下の動画チュートリアルをご覧ください。
GitHub リポジトリと Eigent のセットアップ方法
GitHub リポジトリ: https://github.com/eigent-ai/eigent
クイックスタート: 環境のセットアップ
Eigent を実行する方法は 2 通りあります。すぐに使える事前コンパイル済みのデスクトップアプリを使う方法と、コードを確認してエージェントをカスタマイズするために開発環境をセットアップする方法です。
オプション A: 「ゼロ設定」デスクトップアプリ
コードに触れずにすぐにタスクの自動化を始めたいユーザー向けです。
- 公式サイト からクライアントをダウンロードします。
.dmg(macOS)または.exe(Windows)をインストールします。- アプリを起動すると、ローカルバックエンドが自動的に起動します。
オプション B: 開発者向けセットアップ
ソースコードにアクセスし、開発用にローカルでシステムを実行するには、次の手順に従ってください。
1. 前提条件 Node.js (v18-22) と Python がインストールされていることを確認します。
2. クローンとインストール
# リポジトリをクローン
git clone https://github.com/eigent-ai/eigent.git
cd eigent
# フロントエンド依存関係をインストール
npm install
3. アプリケーションを実行
# ルートに戻って dev モードで実行
npm run dev
起動後は、設定画面から LLM プロバイダー(Gemini 3 Pro など)を直接設定できます。設定、高度な機能、トラブルシューティングに関する詳細は、公式ドキュメント を参照してください。
内部構造: Eigent のフルスタックと CAMEL Workforce アーキテクチャ
Eigent システム概要
Eigent は、CAMEL Workforce をコアエンジンとして駆動する、マルチエージェントのオーケストレーションを備えた local-first のデスクトップアプリケーションです。このシステムは、ユーザーのローカルインフラ上で完全に動作する疎結合のフルスタックアーキテクチャを実装しています。この設計によりデータ主権が厳格に確保され、クラウド上で動作するエージェント実行に伴うプライバシーリスクを排除します。
1. フロントエンド
ユーザーインターフェースは、エージェント設定とワークフロー監視のための制御プレーンとして機能します。React と TypeScript で構築され、Electron フレームワーク上で動作します。
主要な技術コンポーネントは次のとおりです。
- ステート管理: 一時的なアプリケーション状態の処理に Zustand を採用し、効率的なリアクティビティを確保します。
- ビジュアルオーケストレーション: React Flow を統合し、エージェントのワークスペースを可視化してリアルタイムの実行状況を追跡します。
- 通信: フロントエンドは安全なローカル HTTP リクエストを介してバックエンドと通信します。
2. バックエンド
中核ロジックは、CAMEL のマルチエージェントフレームワークのホスト環境として機能する、FastAPI と Uvicorn を利用したローカル Python サーバーにあります。
- 実行環境: バックエンドは Python 3.10+ 上で動作し、uv により高性能な依存関係解決と環境分離を管理します。
- 永続化レイヤー: SQLModel/SQLAlchemy ORM を介して接続された PostgreSQL が、監査ログ、ワークフロー履歴、エージェント状態のための堅牢な構造化データ保存を提供します。
- マルチエージェントフレームワーク: CAMEL フレームワークは、エージェントオーケストレーションロジック(例: workforce)を処理し、リモート(例: Gemini)またはローカル(例: vLLM 経由)の Large Language Models(LLM)と連携してエージェントを実行します。CAMEL フレームワークは、ブラウザ toolkit、ターミナル toolkit、ドキュメント生成 toolkit などの豊富なツールキットも提供します。
CAMEL Workforce: 組織構造に着想を得たマルチエージェントシステム
Eigent の中心には CAMEL Workforce があり、これは分散協調によって複雑な実世界のタスクを解決するために設計されたマルチエージェントシステムです。このシステムは、非同期メッセージチャネルによって仲介される厳格な Producer-Consumer パターンを採用し、依存関係グラフを効率的に管理します。
1. エージェントの役割
- Coordinator Agent: 主なディスパッチャーとして機能します。グローバル状態を維持し、可用性と能力に基づいて特定の worker にサブタスクを割り当てます。
- Task Agent: 高レベルの目標を実行可能な原子的単位へ意味的に分解する責務を担います。
- Worker Agent: 専門的な実行ユニットとして機能します。Worker エージェントは原子的なサブタスクを受け取り、ドメイン固有のツールを使って実行します。
2. 非同期通信: TaskChannel
調整レイヤーと実行レイヤーの分離は TaskChannel によって実現されます。この非同期メッセージキューは、メインの実行スレッドをブロックせずにタスク配布を管理します。
実行フロー:
- Workforce がタスクを開始します。
- Worker ノードが割り当てをポーリングします。
- 完了後、結果が送り返されます。
3. 動的 DAG 構築
エンタープライズワークフローは、ほとんど直線的ではありません。CAMEL Workforce は、動的な Directed Acyclic Graph(DAG)構築メカニズムを実装しています。高レベルのプロンプト(例: "Create Travel Plan")を受け取ると、Task Agent はこの目標を個別のノードに分解します。
このシステムは依存関係を明示的にマッピングし、スケジューラが次を行えるようにします。
- 独立したノードを並列実行する(例: Search Flight Ticket と Search Hotel を同時実行)。
- 依存するノードは、前提ノードが
DONE状態に達するまでブロックする。
4. フォールトトレラント機構
LLM の非決定性を踏まえ、Eigent は失敗を致命的な例外ではなく、想定された状態遷移として扱います。このアーキテクチャは、次の戦略を用いた堅牢なリカバリーメカニズムを実装しています。
- RETRY: 一時的なエラーに対処するため、同じ worker 上でサブタスクを再実行します。
- REPLAN: Task Agent が失敗ログに基づいて元のサブタスクを修正し、その後で再キューイングします。
- REASSIGN: サブタスクを現在の worker から、互換性のあるスキルセットを持つ別のエージェントへ移行します。
- DECOMPOSE: タスクが過度な複雑さのために失敗した場合、再帰的により小さなサブタスクへ分解します。

Eigent におけるブラウザ自動化アーキテクチャ
しかし、マルチエージェントのワークフォースアーキテクチャが真のエンタープライズ自動化を実現するのは、ブラウザ自動化のような汎用機能の高まりと組み合わさったときだけです。だからこそ私たちは、厳格な API 統合だけに依存するのではなく、実際のビジネス環境の中で直接動作できるエージェントを構築することを重視しています。
Eigent は、ブラウザ制御とエージェントオーケストレーションを分離した 2 層アーキテクチャを採用しています。
- TypeScript 層 は、すべてのブラウザ操作を担当します。ネイティブの Playwright API を活用して DOM 操作、構造化スナップショットの取得、SoM スクリーンショットの生成、オクルージョンの検出、そして高度なブラウザロジックを JavaScript ランタイム内で直接処理します。Playwright は TypeScript でネイティブに構築されているため、この層は
_snapshotForAI()のような最先端機能にアクセスでき、より高いパフォーマンス、信頼性、開発者体験を実現します。 - Python 層 は AI オーケストレーションを担当します。LLM 呼び出し、エージェントの意思決定、タスク計画を管理します。この分離により、Python はエージェントロジックに集中でき、Python エコシステムが強みを持つ AI とワークフローオーケストレーションを最大限に活用できます。
- 2 つの層は WebSocket を介して非同期に通信し、ノンブロッキングな操作を可能にします。Python がブラウザ操作リクエストを送り、TypeScript がそれを実行して結果を返します。このやり取りはエンドユーザーには透過的で、並行タスク実行をサポートします。
このアーキテクチャは、パフォーマンスを向上させ、要素操作の精度を高め、動的 DOM フィルタリング、ビューポート認識スナップショット、ブラウザ内 SoM レンダリングのような高度な機能を実現します。これにより、高レイテンシー、ブラウザ内部への限定的なアクセス、複雑な画像処理ロジックといった Python のみの実装の制約を回避します。ブラウザタスクをネイティブな実行コンテキストへ委譲することで、Eigent はエージェントベースのエンタープライズ自動化のための堅牢な基盤を確立します。
エンタープライズ自動化シナリオにおけるマルチエージェント実行では、ブラウザベースの自動化がプロセスの可視性において自然な優位性を持ちます。すべてのステップが透明で、検査可能で、デバッグしやすいため、複雑で変化の激しいワークフローに対してはるかに実用的です。

Eigent のブラウザ自動化で 実世界のエンタープライズタスク における Gemini 3 Pro をテストする
私たちは Eigent のブラウザ自動化機能を使って、Gemini 3 Pro で営業プロセスを自動化するテストを行いました。エージェントに課したタスクは、Lead Capture & Creation、Qualification & Pipeline Management、Quotation、Negotiation、Closing、Product Management を含む、実世界の営業サイクルのさまざまな段階を自動化することです。
実験ラン全体を通じて、Gemini 3 Pro は一貫して 3 つの重要な強みを示しました。
- iframe やネストされた要素を含む複雑なページ構造をうまく処理できる: 複雑なレイアウトでも、適切なコンテンツやボタンを確実に見つけられます。
- 自分の操作を確認して精度と短いステップを維持する: フィードバックループを使ってミスを修正し、タスクが本当に正しく完了したことを確認します。
- ツールを効率的かつ柔軟に使う: 不要なステップを避け、必要に応じてツールを賢く組み合わせる方法を理解しています。
サンプルタスク 1:
Y Combinator の Winter と Summer 2025 バッチに属し、業種が Marketing に関連するすべての B2B 企業を特定してください。全企業リストを取得したら、各社の製品情報を独自に詳細調査し、すべての結果を整理された CSV ファイルにまとめてください。
このタスクは、反復的なナビゲーションと動的なデータ抽出を扱うエージェントの能力を示しています。単純な単一ページのスクレイピングとは異なり、このワークフローでは、まず Y Combinator ディレクトリに対して特定のフィルター(Batch、Industry、B2B タグ)を適用し、その後に "List-to-Detail" パターンを実行する必要があります。
ここでの課題はコンテキストの維持です。エージェントは各企業プロファイルに入り、特定の製品詳細を抽出した後、位置を失ったり重複エントリを作成したりすることなく、メインリストに戻らなければなりません。Gemini 3 Pro はこのループをうまくオーケストレーションし、多様なランディングページのレイアウトを解析し、非構造化情報を手作業なしで整然とした CSV 形式に正規化しました。
サンプルタスク 2:
salesforce.com の 200 Widgets という案件は順調に進んでいます。これを 'Needs Analysis' から 'Proposal' ステージへ移し、「Mark as Current Stage」をクリックし、その後 "Contact Roles" をクリックして、連絡先名と電話番号を教えてください。Opportunities ページに戻って、この Next Step を「book a meeting with + 連絡先名と電話番号」に編集してください。
このブラウザ自動化タスクは、標準的なモデルにとって難題です。まず、Salesforce のホームページで該当する Opportunity を見つける必要があります。次に、Opportunity のステージを更新し、特定のページに移動して連絡先情報を取得し、最後にその情報内の 'Next Step' フィールドを修正する必要があります。
したがって、このタスクでは、安定した長期タスク性能、複雑なタスクへの深い理解、論理的なタスク計画、そして Salesforce 環境内で安定したクロスページ操作を実行する能力を示すことが求められます。
さらに、定量的な分解(例: 各ステップのアクションをページ領域に対応付ける、失敗/再試行回数を追跡する)を通じて、ブラウザアクションの参照をスナップショット内の要素と 1 つずつ対応させることができます。これにより、ツール呼び出しとブラウザ操作の精度および有効性に関する Gemini 3 Pro の性能を、より深く分析できます。
| 実行 | 総ブラウザアクション数 | 使用したその他のアクション | シーケンスの特徴 | 含意 |
|---|---|---|---|---|
| 1 回目 | 23 | なし | コンパクトなシーケンス(open → type → repeated clicks → snapshot → click → visit_page → click …)。 | 同じコントロールに対する繰り返しクリックや入力がない。低冗長な一方向進行。 |
| 2 回目 | 18 | note / screenshots | 目的の領域に到達するため open 後に複数の click/snapshot ステップを使用し、その後 append_note/create_note/browser_get_page_snapshot を導入して状態の記録と確認を行う。 | ブラウザアクションが少なく、補助ツールを外部メモリと検証に利用している。 |
| 3 回目 | 15 | なし | 複数の open/visit_page で始まり、その後は連続した click と最後の type のみ。 | 補助ツールなし、巻き戻しなし。最も効率化されたアクションチェーン。 |
3 回の実行結果に基づくと、Gemini 3 Pro は長期的なブラウザタスクシナリオにおいて高い堅牢性と監査可能性を示していることが分かります。
- 実行フロー: パースされたタスク目標と環境状態から、実行経路を信頼性高く計画できます。
- 安定性と堅牢性: 現在のタスクのブラウザページには最大 13 層のネストがありましたが、それでも Gemini 3 Pro はタスク実行中に 再試行が少なく、無限ループもありませんでした。
- 効率性: 3 セットのログでは ほとんど冗長なツール呼び出しがなく、複数回のクリックや繰り返し入力も見られませんでした。この効率性と、Note/Screenshot のような柔軟な補助ツールが組み合わさることで、より少なく、より安定したブラウザ操作 が実現しました。
サンプルタスク 3:
“ 毎月の営業レビューの準備をしています。forecast に入り、Global Media アカウント配下の Commit ステージにある opportunity を見つけ、その Close Date を November 26th に更新してください。 ”
タスク内の Web ページの複雑さをさらに上げたらどうなるでしょうか?
以下のタスクは Salesforce Forecast ページ上で実行されます。Forecast ページは営業チームが統計や概要の確認に使用するもので、ブラウザページは非常に複雑です。1 回のスナップショットで約 4,763 個の要素 があり、多段階のデコード後、スナップショットには最大 18 層 のネスト深度と、平均約 14.33 の深度を持つ 1,222 行 が含まれます。つまり、このページは要素数が多いだけでなく、List → List Item → Link/Button → Icon → Paragraph/Grid Row のような多層構造を持つ、深くネストした階層でもあります。

Salesforce Forecasts Webpage
私たちのテストでは、Gemini 3 はこのタスクを 3 回すべて完璧に実行しました。このような密集した深いネストを持つページ内でフィールドを正しく更新しつつ、ターゲットの opportunity (Global Media 180 Widgets) を確実に特定し、Close Date の更新を完了できたことは、Gemini 3 Pro の堅牢なパース能力、経路計画能力、ブラウザ利用シナリオにおける安定した実行能力の証明となります。
Gemini 3 Pro がタスク性能をどう向上させるか
Gemini 3 Pro は、自律的なエンタープライズエージェントにとってバランスの取れた選択肢として際立っています。私たちの実世界タスクでは、長期的なブラウザベースのワークフローを一貫して高い信頼性で処理しました。優れたコストパフォーマンス比と組み合わせることで、エンタープライズ環境でエージェントベースの自動化を拡張するための実用的な選択肢となります。
「状態の継続性」の利点(Thought Signatures) 私たちが確認した主要な技術的差別化要因は、Gemini 3 Pro の Thought Signatures 実装です。従来の LLM インタラクションでは、モデルはターン間のコンテキストを再構築するために会話履歴のテキストに完全に依存します。複雑で長期的なワークフローでは、これが「コンテキストドリフト」につながることがあり、エージェントが複数回のブラウザ操作の後に元の意図を見失う場合があります。Gemini 3 Pro はこれに対し、各ステップ後に内部推論状態を暗号化した表現である thoughtSignature を返すことで対処します。
Eigent への影響
私たちのエージェントが順次タスク(例: "Check flight status" の後に "Book Taxi")を実行する際、この署名はモデルに返されます。テストでは、この仕組みにより、マルチステップの関数呼び出し中にエージェントがより良い論理的一貫性を維持でき、同種のモデルと比べてワークフロー後半でのロジックエラー率が低下しました。
長期計画における堅牢性
エンタープライズ自動化では、ログイン画面、読み込み状態、予期しないポップアップなど、未知の状況を乗り越える必要が頻繁にあります。
Gemini 3 Pro は、より長いセッション(10 ステップ以上)で高い耐性を示しました。これは、長期計画を評価する Vending-Bench 2 のようなベンチマークにおける性能とも一致しています。
標準的な問い合わせでは、最上位モデル間の性能差はほとんど無視できるかもしれません。しかし、状態保持とエラー回復が最重要となる Agentic Automation では、Gemini 3 Pro は現在、Eigent プラットフォームにとって信頼できる基盤を提供します。Thought Signatures により「推論状態」を保持できる能力は、複雑な多段階のエンタープライズワークフローにとって実用的な選択肢となります。
結論と次のステップ
このブログを通じて、Eigent が CAMEL のマルチエージェント・ワークフォースアーキテクチャ と ブラウザレベルの機能 によって、実際にエンタープライズシステム内で動作できる AI エージェントを展開するための本番レベルの環境をどのように構築しているかを紹介しました。ツールレベルの自律性と、ユーザーが上書き可能なワークフローを組み合わせることで、このシステムは制御可能で、可観測で、監査可能なものになります。これらは、B2B 向けデプロイメントにおいて不可欠な特性です。
また、Gemini 3 Pro を Eigent に統合した場合、推論能力、安定性、コスト効率の理想的なバランスが得られることも示しました。特に Thought Signatures のような機能により、マルチエージェント実行とのアーキテクチャ的な整合性が高く、エンタープライズユースケースに典型的な高リスク・長期ワークフローに非常に適しています。
今後も、私たちは次の取り組みを進めています。
- 実世界のエンタープライズ導入における失敗ケースの可視化: 現在の基盤モデルが、状態追跡、エラー回復、ツールの根拠付けで苦戦するタスクパターンを特定します。
- 標準化されたエンタープライズ向けブラウザ自動化ベンチマークの確立: メールクライアント、メッセージングシステム、ドキュメント、ブラウザ UI、ERP/CRM プラットフォームなど、現実的なエンタープライズ自動化タスクを収集します。
- ブラウザベースのエンタープライズワークフロー向け強化学習環境の構築: タスクベースの報酬、軌跡追跡、長期行動分析を通じて、エージェントの強化学習を可能にします。
Eigent は完全にオープンソースです。開発者、研究者、エンタープライズチームの皆さまに、ぜひ探索、拡張、貢献していただきたいと考えています。
👉 GitHub: https://github.com/eigent-ai/eigent
👉 Discord コミュニティに参加: https://discord.camel-ai.org
Recent Posts

Cursorの代替ツール(無料・オープンソース):あなたが所有するワークスペース
SpaceXによる買収後、無料でオープンソースのCursor代替ツールをお探しですか?コスト・セルフホスティング・モデル選択・データ保管場所を比較し、移行手順も解説します。

Claude スキルの録画機能:画面録画でワークフローをClaudeに教える方法
Claudeの「スキルを録画」機能は、画面録画を再利用可能なスキルに変換します。仕組み、アクセス権限、セットアップ手順、制限事項について解説します。

Cursor Routerとは:フロンティア品質のコーディングをより低コストで実現
Cursor Routerは各コーディングリクエストに最適なモデルを自動選択し、フロンティア品質を維持しながらコストを削減します。仕組み、3つのモード、トレードオフを解説します。