logo
  • Ambientes
  • Empresas
  • Preços
Blogs
Tutorial|Nov 8, 2025

Execute Agentes Enterprise com Eigent e Gemini 3 Pro

Automação de Navegador Enterprise no Mundo Real com Eigent e Gemini 3 Pro

EigentEigent
Share to
Execute Agentes Enterprise com Eigent e Gemini 3 Pro
  • Resumo
  • Contexto: O que é o Eigent e como ele suporta o Gemini 3 Pro
  • Repositório GitHub e como configurar o Eigent
  • Clone the repository
  • Install frontend dependencies
  • Return to root and run dev mode
  • Nos Bastidores: stack completa do Eigent e arquitetura Workforce do CAMEL
  • Arquitetura de Automação de Navegador no Eigent
  • Testar Gemini 3 Pro em **Tarefas Enterprise Reais** com a automação de navegador do Eigent
  • Como o Gemini 3 Pro Melhora o Desempenho das Tarefas
  • Conclusão e Próximos Passos
Automate Everything with
AI Workforce on Desktop
Download Eigent

Resumo

Em ambientes enterprise reais, muitas ferramentas internas, painéis e sistemas legados operam totalmente no navegador, formando a espinha dorsal das operações diárias do negócio. Para automatizar esses sistemas complexos, apresentamos Eigent, uma aplicação open source de workforce multiagente que roda localmente e pode ser configurada بالكامل a partir do código-fonte, com forte foco em automação de navegador — atuando essencialmente como seu cowork open source do Eigent para fluxos de trabalho enterprise.

Neste post, exploramos como o Eigent aproveita a arquitetura Workforce do CAMEL e a automação de navegador para lidar com tarefas empresariais complexas e multi-etapas. Também analisamos mais de perto o Gemini 3 Pro, avaliando seu desempenho em três tarefas enterprise reais e examinando os recursos arquiteturais que permitem sua atuação em cenários de automação de navegador agentic de longo horizonte.

Contexto: O que é o Eigent e como ele suporta o Gemini 3 Pro

Eigent é um produto open source de workforce multiagente que roda no seu desktop. Ele foi construído com uma arquitetura de workforce multiagente, suportada por habilidades gerais como automação de navegador, automação de terminal e MCPs. Esse design permite que os agentes no Eigent executem tarefas de forma muito semelhante a trabalhadores humanos — operando em ambientes reais de desktop, sem a necessidade de integrações profundas com APIs ou reconfiguração constante de fluxos de trabalho.

À medida que os modelos de base continuam avançando, integrá-los ao sistema multiagente open source do Eigent permite que desenvolvedores e usuários enterprise apliquem capacidades de LLM diretamente em casos de uso do mundo real de forma rápida e eficaz. É por isso que o Eigent integrou o Gemini 3 Pro imediatamente após o lançamento.

Para começar no Cloud Mode, basta selecionar Gemini 3 Pro no menu suspenso superior. Como alternativa, se preferir Bring Your Own Key, navegue até a página de Model Settings no Eigent, localize a seção Gemini e insira sua chave de API. Assim que o nome do modelo for definido como Gemini 3 Pro, você estará pronto para começar. Precisa de ajuda? Confira nosso guia sobre [configurando sua chave da Google Gemini API].

Para um passo a passo, assista ao tutorial em vídeo abaixo.

Seu navegador não suporta a tag de vídeo.

Repositório GitHub e como configurar o Eigent

Repositório GitHub: https://github.com/eigent-ai/eigent

Início Rápido: Configurando o Ambiente

Você tem duas formas de executar o Eigent: usando o aplicativo desktop pré-compilado para uso imediato ou configurando o ambiente de desenvolvimento para inspecionar o código e personalizar os agentes.

Opção A: O aplicativo desktop "Zero-Config"

Para usuários que querem começar a automatizar tarefas imediatamente sem tocar em código:

  1. Baixe o cliente no Site Oficial.
  2. Instale o .dmg (macOS) ou .exe (Windows).
  3. Inicie o aplicativo — o backend local será iniciado automaticamente.

Opção B: Configuração para Desenvolvedores

Para acessar o código-fonte e executar o sistema localmente para desenvolvimento, siga estas etapas:

1. Pré-requisitos Certifique-se de ter Node.js (v18-22) e Python instalados.

2. Clonar e Instalar

# Clone the repository
git clone https://github.com/eigent-ai/eigent.git
cd eigent

# Install frontend dependencies
npm install

3. Executar a Aplicação

# Return to root and run dev mode
npm run dev

Depois de estar em execução, você pode configurar seus provedores de LLM (Gemini 3 Pro, etc.) diretamente nas configurações. Para informações mais detalhadas sobre configuração, recursos avançados e solução de problemas, consulte nossa Documentação Oficial.

Nos Bastidores: stack completa do Eigent e arquitetura Workforce do CAMEL

Visão Geral do Sistema Eigent

Eigent constitui uma aplicação desktop local-first com orquestração multiagente, alimentada pelo CAMEL Workforce como seu mecanismo principal. O sistema implementa uma arquitetura desacoplada de stack completo que opera inteiramente na infraestrutura local do usuário. Esse design garante rigorosamente a soberania dos dados, eliminando os riscos de privacidade associados à execução de agentes na nuvem.

1. O Frontend

A interface do usuário serve como o plano de controle para configuração de agentes e monitoramento de fluxos de trabalho. Construída com React e TypeScript dentro de um framework Electron.

Os principais componentes técnicos incluem:

  • Gerenciamento de Estado: Zustand é empregado para lidar com o estado transitório da aplicação, garantindo reatividade eficiente.
  • Orquestração Visual: React Flow é integrado para visualizar o workspace do agente e acompanhar a execução em tempo real.
  • Comunicação: O frontend se comunica com o backend por meio de requisições HTTP locais seguras.

2. O Backend

A lógica central reside em um servidor Python local que utiliza FastAPI e Uvicorn, atuando como ambiente hospedeiro para o framework multiagente CAMEL.

  • Ambiente de Execução: O backend roda em Python 3.10+, gerenciado por uv para resolução de dependências de alto desempenho e isolamento de ambiente.
  • Camada de Persistência: PostgreSQL, acessado via ORM SQLModel/SQLAlchemy, fornece armazenamento estruturado robusto para logs de auditoria, histórico de fluxos de trabalho e estados dos agentes.
  • Framework Multiagente: O framework CAMEL lida com a lógica de orquestração de agentes (por exemplo, workforce), fazendo interface com Large Language Models (LLMs), sejam remotos (por exemplo, Gemini) ou locais (por exemplo, via vLLM) para execução dos agentes. O framework CAMEL também oferece um rico conjunto de toolkits, como browser toolkit, terminal toolkit e document generation toolkit.

CAMEL Workforce: Um Sistema Multiagente Inspirado em Estruturas Organizacionais

No coração do Eigent está o CAMEL Workforce, um sistema multiagente projetado para resolver tarefas complexas do mundo real por meio de cooperação descentralizada. O sistema utiliza um padrão rigoroso de Producer-Consumer, mediado por um canal de mensagens assíncrono para gerenciar grafos de dependência com eficiência.

1. Funções dos Agentes

  • Coordinator Agent: Funciona como o despachante principal. Ele mantém o estado global e distribui subtarefas para trabalhadores específicos com base na disponibilidade e capacidade.
  • Task Agent: Responsável pela decomposição semântica de objetivos de alto nível em unidades atômicas e executáveis.
  • Worker Agent: Serve como a unidade especializada de execução. Os agentes workers consomem subtarefas atômicas e as executam usando ferramentas específicas do domínio.

2. Comunicação Assíncrona: o TaskChannel

O desacoplamento entre a camada de coordenação e a camada de execução é alcançado por meio do TaskChannel. Essa fila de mensagens assíncrona gerencia a distribuição de tarefas sem bloquear a thread principal de execução.

Fluxo de Execução:

  1. O workforce inicia uma tarefa.
  2. Os nós worker verificam atribuições.
  3. Ao concluir, os resultados são enviados de volta.

3. Construção Dinâmica de DAG

Fluxos de trabalho enterprise raramente são lineares. O CAMEL Workforce implementa um mecanismo dinâmico de construção de Directed Acyclic Graph (DAG). Quando um prompt de alto nível é recebido (por exemplo, "Criar Plano de Viagem"), o Task Agent decompõe esse objetivo em nós discretos.

O sistema mapeia explicitamente as dependências, permitindo que o agendador:

  • Execute nós independentes em paralelo (por exemplo, Pesquisar Passagem Aérea e Pesquisar Hotel executam simultaneamente).
  • Bloqueie nós dependentes até que seus predecessores atinjam o estado DONE.

4. Mecanismo Tolerante a Falhas

Dada a natureza não determinística dos LLMs, o Eigent trata falhas como transições de estado esperadas, e não como exceções fatais. A arquitetura implementa um mecanismo robusto de recuperação utilizando as seguintes estratégias:

  • RETRY: Reexecuta a subtarefa no mesmo worker para lidar com erros transitórios.
  • REPLAN: O Task Agent modifica a subtarefa original com base no log da falha antes de colocá-la novamente na fila.
  • REASSIGN: A subtarefa é migrada do worker atual para um agente diferente com um conjunto de habilidades compatível.
  • DECOMPOSE: Se uma tarefa falhar devido a complexidade excessiva, ela é dividida recursivamente em subtarefas menores.

CAMEL Workforce.png

Arquitetura de Automação de Navegador no Eigent

Ainda assim, uma arquitetura de workforce multiagente só consegue liberar automação enterprise real quando combinada com a crescente força de capacidades de uso geral, como automação de navegador. É por isso que enfatizamos a criação de agentes que possam operar diretamente em ambientes empresariais reais, em vez de depender apenas de integrações rígidas com APIs.

O Eigent adota uma arquitetura em duas camadas que separa o controle do navegador da orquestração dos agentes:

  • A camada TypeScript é responsável por todas as interações com o navegador. Ela aproveita as APIs nativas do Playwright para executar operações DOM, capturar snapshots estruturados, gerar screenshots SoM, detectar obstruções e lidar com lógica avançada de navegador diretamente no runtime JavaScript. Como o Playwright é nativamente construído em TypeScript, essa camada ganha acesso a recursos de ponta como _snapshotForAI() e garante melhor desempenho, confiabilidade e ergonomia para desenvolvedores.
  • A camada Python lida com a orquestração de IA. Ela gerencia chamadas de LLM, tomada de decisão dos agentes e planejamento de tarefas. Essa separação permite que o Python se concentre na lógica dos agentes, área em que o ecossistema Python se destaca em IA e orquestração de fluxos de trabalho.
  • As duas camadas se comunicam assíncronamente via WebSocket, permitindo operações sem bloqueio. O Python envia solicitações de operações do navegador, o TypeScript as executa e retorna os resultados. A interação é transparente para o usuário final e suporta execução concorrente de tarefas.

Essa arquitetura melhora o desempenho, aumenta a precisão das interações com elementos e possibilita capacidades avançadas como filtragem dinâmica de DOM, snapshots com awareness do viewport e renderização SoM dentro do navegador. Ela evita as limitações de implementações apenas em Python, como alta latência, acesso limitado aos detalhes internos do navegador e lógica complexa de processamento de imagens. Ao delegar as tarefas do navegador ao contexto nativo de execução, o Eigent garante uma base robusta para automação enterprise baseada em agentes.

Durante a execução multiagente em cenários de automação enterprise, a automação baseada em navegador oferece uma vantagem natural em visibilidade de processo. Cada etapa é transparente, inspecionável e fácil de depurar, tornando-a muito mais prática para fluxos de trabalho complexos e em evolução.

CAMEL Browser.png

Testar Gemini 3 Pro em Tarefas Enterprise Reais com a automação de navegador do Eigent

Testamos o Eigent com o Gemini 3 Pro para automatizar processos de vendas usando os recursos de automação de navegador do Eigent. As tarefas dos agentes são automatizar várias etapas do ciclo de vendas do mundo real, incluindo Lead Capture & Creation, Qualification & Pipeline Management, Quotation, Negotiation, Closing e Product Management.

Ao longo das execuções experimentais, o Gemini 3 Pro demonstra consistentemente três pontos fortes principais:

  1. Lida bem com estruturas de página complexas, incluindo iframes e elementos aninhados: consegue encontrar com confiabilidade o conteúdo e os botões corretos, mesmo em layouts complexos.
  2. Verifica suas próprias ações para manter a precisão e encurtar etapas: usa um loop de feedback para corrigir erros e garantir que a tarefa realmente seja concluída corretamente.
  3. Usa ferramentas de forma eficiente e flexível: evita etapas desnecessárias e sabe como combinar ferramentas de maneira inteligente quando necessário.

Tarefa de exemplo 1:

Identifique todas as empresas B2B na turma de inverno e verão de 2025 do Y Combinator cujo foco de setor esteja relacionado a Marketing. Depois de obter a lista completa de empresas, investigue de forma independente as informações do produto de cada empresa em detalhes e consolide todos os resultados em um arquivo CSV limpo e bem estruturado.

Esta tarefa demonstra a capacidade do agente de lidar com navegação iterativa e extração dinâmica de dados. Diferentemente de um scraping simples de uma única página, esse fluxo de trabalho exige que o agente primeiro interaja com o diretório do Y Combinator para aplicar filtros específicos (Batch, Industry, tag B2B) e então execute um padrão "List-to-Detail".

O desafio aqui é manter o contexto: o agente precisa entrar nos perfis individuais das empresas para extrair detalhes específicos do produto e, depois, voltar à lista principal sem perder sua posição ou duplicar entradas. O Gemini 3 Pro orquestra esse loop com sucesso, analisando layouts diversos de páginas de destino e normalizando as informações não estruturadas em um formato CSV limpo, sem intervenção manual.

Seu navegador não suporta a tag de vídeo.

Tarefa de exemplo 2:

O negócio salesforce.com - 200 Widgets está avançando bem. Mova-o do estágio 'Needs Analysis' para 'Proposal' e clique em “Mark as Current Stage’ e vá em clique em "Contact Roles" e me dê o nome do contato e o número de telefone. Volte para a página Opportunities e edite este Next Step como “book a meeting with + o nome do contato e o número de telefone.”

Esta tarefa de automação de navegador apresenta um desafio para modelos padrão. Primeiro, ele precisa localizar a Opportunity relevante na página inicial do Salesforce. Segundo, precisa atualizar o estágio da Opportunity, navegar até a página específica e recuperar as informações de contato e, por fim, modificar o campo 'Next Step' dentro dessas informações.

Portanto, para essa tarefa, é necessário demonstrar desempenho estável em tarefas de longo horizonte, compreensão profunda de tarefas complexas, planejamento lógico de tarefas e a capacidade de executar operações estáveis e entre páginas dentro do ambiente Salesforce.

Seu navegador não suporta a tag de vídeo.

Além disso, por meio de uma análise quantitativa (por exemplo, mapeando a ação de cada etapa para regiões da página, acompanhando contagens de falhas/repetições), podemos alinhar a referência de ações do navegador com os elementos nos snapshots item a item. Isso permite uma análise mais profunda do desempenho do Gemini 3 Pro em relação à precisão e eficácia de chamadas de ferramentas e ações de navegador:

ExecuçãoTotal de Ações no NavegadorOutras Ações UsadasCaracterísticas da SequênciaImplicação
1ª execução23NenhumaSequência compacta (open → type → cliques repetidos → snapshot → click → visit_page → click …).Sem cliques/digitações repetidos no mesmo controle. Progressão unidirecional com baixa redundância.
2ª execução18note / screenshotsMúltiplas etapas de click/snapshot após open para alcançar a área-alvo; mais tarde introduz append_note/create_note/browser_get_page_snapshot para registro de estado e confirmação.Menos ações no navegador; ferramentas auxiliares são usadas como memória externa e para validação.
3ª execução15NenhumaComeça com múltiplos open/visit_page, depois cliques contínuos e uma digitação final.Sem ferramentas auxiliares; sem retries/rollback. Cadeia de ações mais enxuta.

Com base nos três resultados de execução, podemos ver que o Gemini 3 Pro demonstra alta robustez e auditabilidade em cenários de tarefas de navegador de longo horizonte.

  • Fluxo de Execução: Mostra planejamento confiável do caminho de execução a partir do objetivo da tarefa analisado e do estado do ambiente.
  • Estabilidade e Robustez: A página atual da tarefa no navegador continha até 13 camadas de aninhamento, ainda assim o Gemini 3 Pro manteve baixas repetições, sem loops infinitos durante a execução da tarefa.
  • Eficiência: Os três conjuntos de logs mostraram quase nenhuma chamada de ferramenta redundante, e nunca exibiram múltiplos cliques ou entradas repetidas. Essa eficiência, combinada com ferramentas auxiliares flexíveis (Note/Screenshot), resultou em ações de navegador mais poucas e mais estáveis.

Tarefa de exemplo 3:

“ Estou me preparando para minha revisão mensal de vendas. Por favor, entre na minha forecast, encontre a oportunidade sob a conta Global Media que está no estágio Commit e atualize sua Close Date para November 26th. ”

E se aumentarmos a complexidade da página na tarefa?

A tarefa a seguir foi definida em uma página Salesforce Forecast. A página Forecast é usada por equipes de vendas para estatísticas e visão geral; sua página no navegador é extremamente complexa, com aproximadamente 4.763 elementos em um único snapshot. Após a decodificação em múltiplos níveis, o snapshot contém 1.222 linhas com profundidade máxima de aninhamento de 18 camadas e profundidade média de aproximadamente 14.33. Isso significa que a página não apenas tem um alto número de elementos, mas também apresenta uma hierarquia profundamente aninhada: estruturas em múltiplas camadas como List → List Item → Link/Button → Icon → Paragraph/Grid Row.

Salesforce Forecasts Webpage

Salesforce Forecasts Webpage

Nos nossos testes, o Gemini 3 executou essa tarefa perfeitamente nas três vezes. Ele precisa da capacidade de atualizar corretamente campos dentro de uma página tão densa e altamente aninhada, enquanto ainda consegue identificar com sucesso a oportunidade-alvo (Global Media 180 Widgets) e concluir a atualização da Close Date, o que serve como prova das robustas capacidades de parsing, planejamento de caminho e execução estável do Gemini 3 Pro em cenários de browser-use.

Como o Gemini 3 Pro Melhora o Desempenho das Tarefas

O Gemini 3 Pro se destaca como uma escolha equilibrada para agentes enterprise autônomos. Em nossas tarefas do mundo real, ele lida de forma consistente com fluxos de trabalho baseados em navegador e de longo horizonte com alto grau de confiabilidade. Combinado com sua relação custo-benefício favorável, ele representa uma opção prática para escalar automação baseada em agentes em ambientes enterprise.

A vantagem da "Continuidade de Estado" (Thought Signatures) O principal diferencial técnico que observamos é a implementação de Thought Signatures pelo Gemini 3 Pro. Em interações tradicionais com LLMs, o modelo depende inteiramente do texto do histórico da conversa para reconstruir seu contexto entre turnos. Em fluxos de trabalho complexos e de longo horizonte, isso pode ocasionalmente levar a "context drift", em que um agente perde o rumo da intenção original após múltiplas interações com o navegador. O Gemini 3 Pro resolve isso retornando uma thoughtSignature, que é uma representação criptografada de seu estado interno de raciocínio, após cada etapa.

Impacto no Eigent

Quando nossos agentes executam tarefas sequenciais (por exemplo, "Verificar status do voo" seguido de "Reservar táxi"), essa signature é enviada de volta ao modelo. Em nossos testes, esse mecanismo ajudou o agente a manter uma continuidade lógica melhor durante chamadas de função em várias etapas, reduzindo a taxa de erros lógicos nas fases posteriores do fluxo de trabalho em comparação com modelos pares.

Robustez no Planejamento de Longo Horizonte

A automação enterprise frequentemente exige navegar pela incerteza — lidando com telas de login, estados de carregamento ou pop-ups inesperados.

O Gemini 3 Pro mostrou alta resiliência em sessões mais longas (10+ etapas). Isso está alinhado com seu desempenho em benchmarks como o Vending-Bench 2, que avalia planejamento de longo horizonte.

Para consultas padrão, a diferença de desempenho entre modelos de ponta pode ser insignificante. No entanto, em Agentic Automation, onde a manutenção de estado e a recuperação de erros são fundamentais, o Gemini 3 Pro atualmente oferece uma base confiável para a plataforma Eigent. Sua capacidade de preservar o "estado de raciocínio" por meio de Thought Signatures o torna a escolha pragmática para fluxos de trabalho enterprise complexos e multi-etapas.

Conclusão e Próximos Passos

Ao longo deste blog, exploramos como o Eigent, impulsionado pela arquitetura workforce multiagente do CAMEL e por capacidades em nível de navegador, cria um ambiente de nível de produção para implantar agentes de IA que realmente conseguem operar dentro de sistemas enterprise. Ao combinar autonomia em nível de ferramenta com fluxos de trabalho que podem ser sobrepostos pelo usuário, o sistema permanece controlável, observável e auditável, que são as propriedades críticas para qualquer implantação voltada a B2B.

Também demonstramos como o Gemini 3 Pro, quando integrado ao Eigent, oferece um equilíbrio ideal entre capacidade de raciocínio, estabilidade e custo-benefício. Seu alinhamento arquitetural com a execução multiagente, especialmente por meio de recursos como Thought Signatures, o torna particularmente adequado para fluxos de trabalho de alto risco e longo horizonte típicos de casos de uso enterprise.

Olhando para frente, continuamos a:

  • Expor casos de falha em implantações enterprise no mundo real, identificando padrões de tarefas em que modelos de base atuais enfrentam dificuldades com rastreamento de estado, recuperação de erros ou grounding de ferramentas.
  • Estabelecer um benchmark padronizado de automação de navegador enterprise, coletando cenários realistas de tarefas de automação enterprise incluindo clientes de e-mail, sistemas de mensagens, documentos, interfaces de navegador e plataformas ERP/CRM.
  • Construir um ambiente de reinforcement learning (aprendizado por reforço) para fluxos de trabalho enterprise baseados em navegador, permitindo aprendizado por reforço para agentes por meio de recompensas baseadas em tarefas, rastreamento de trajetórias e análise de comportamento de longo horizonte.

O Eigent é totalmente open source, e convidamos desenvolvedores, pesquisadores e equipes enterprise a explorar, विस्तार e contribuir:

👉 GitHub: https://github.com/eigent-ai/eigent

👉 Junte-se à nossa comunidade no Discord: https://discord.camel-ai.org

Recent Posts

Claude Tag: O Teammate de IA Sempre Ativo da Anthropic para o Slack
Jun 29, 2026

Claude Tag: O Teammate de IA Sempre Ativo da Anthropic para o Slack

Aprenda o que é o Claude Tag, como o @Claude funciona nos canais do Slack e como o teammate de IA sempre ativo da Anthropic apoia o trabalho em equipe e a automação.

Douglas LaiDouglas Lai
Tutorial do Claude em Hong Kong: Interface, Prompts e Conteúdo em Cantonês
SetorJun 24, 2026

Tutorial do Claude em Hong Kong: Interface, Prompts e Conteúdo em Cantonês

Um tutorial prático do Claude para usuários de Hong Kong: passo a passo da interface, modelos de prompt para cantonês e chinês tradicional, dicas de programação e uma alternativa gratuita.

Douglas LaiDouglas Lai
Como Usar Claude em Hong Kong: Um Guia Completo
SetorJun 24, 2026

Como Usar Claude em Hong Kong: Um Guia Completo

IPs de Hong Kong não conseguem acessar o Claude.ai? Este guia explica o motivo, mostra soluções com VPN e verificação por telefone, a opção AWS para empresas e uma alternativa gratuita.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Experimente o Eigent hoje

Baixe o app desktop open source e comece a automatizar com uma força de trabalho de IA na sua máquina.

Baixar Eigent
Eigent

Receba as últimas novidades e tutoriais sobre automação de workforce com IA.

ProdutoEigentAmbientesPreçosEmpresarial
ExplorarSoluçõesCasos de usoHabilidadesPluginsBlog
DesenvolvedoresDocumentaçãoGitHubCAMEL-AIFundo Open SourceParceiro
BaixarPara código aberto
EmpresaSobre nósMarcaCarreirasTermos de usoPolítica de privacidadeSegurança e confiançaPolítica de cookiesPolítica de reembolso e teste

Todos os direitos reservados © 2026 EIGENT UK LTD

Nova versão do Eigent 1.0 lançada!download