Ejecuta agentes empresariales con Eigent y Gemini 3 Pro
Automatización de navegador empresarial en el mundo real de Eigent con Gemini 3 Pro

Resumen
En entornos empresariales reales, muchas herramientas internas, paneles de control y sistemas heredados funcionan بالكامل en el navegador, constituyendo la base de las operaciones diarias del negocio. Para automatizar estos sistemas complejos, presentamos Eigent, una aplicación open source de workforce multiagente que se ejecuta localmente y puede configurarse por completo desde el código fuente, con un fuerte enfoque en la automatización del navegador; en esencia, funciona como tu compañero de trabajo open source de Eigent para flujos empresariales.
En esta publicación, exploraremos cómo Eigent aprovecha la arquitectura Workforce de CAMEL y la automatización del navegador para gestionar tareas empresariales complejas de varios pasos. También analizaremos Gemini 3 Pro en detalle, evaluando su rendimiento en tres tareas empresariales reales y examinando las características arquitectónicas que le permiten funcionar de manera eficaz en escenarios de automatización de navegador agentic de largo recorrido.
Contexto: qué es Eigent y cómo admite Gemini 3 Pro
Eigent es un producto open source de workforce multiagente que se ejecuta en tu escritorio. Está construido con una arquitectura de workforce multiagente, respaldada por capacidades generales como automatización del navegador, automatización de terminal y MCPs. Este diseño permite que los agentes de Eigent realicen tareas de forma muy parecida a los trabajadores humanos: operando en entornos de escritorio reales, sin necesidad de integraciones profundas con API ni de reconfiguración constante de los flujos de trabajo.
A medida que los modelos fundacionales siguen avanzando, integrarlos con el sistema multiagente open source de Eigent permite a desarrolladores y usuarios empresariales aplicar capacidades de LLM directamente a casos de uso reales de forma rápida y eficaz. Por eso Eigent integró Gemini 3 Pro inmediatamente después de su lanzamiento.
Para empezar en Cloud Mode, simplemente selecciona Gemini 3 Pro en el menú desplegable superior. Como alternativa, si prefieres Bring Your Own Key, ve a la página de Model Settings en Eigent, localiza la sección Gemini e introduce tu clave API. Una vez que el nombre del modelo esté configurado como Gemini 3 Pro, estarás listo para comenzar. ¿Necesitas ayuda? Consulta nuestra guía sobre [configuring your Google Gemini API key].
Para una guía paso a paso, mira el tutorial en video a continuación.
Repositorio de Github y cómo configurar Eigent
Repositorio de GitHub: https://github.com/eigent-ai/eigent
Inicio rápido: configuración del entorno
Tienes dos formas de ejecutar Eigent: usando la app de escritorio precompilada para uso inmediato, o configurando el entorno de desarrollo para inspeccionar el código y personalizar los agentes.
Opción A: La app de escritorio "Zero-Config"
Para usuarios que quieren empezar a automatizar tareas de inmediato sin tocar código:
- Descarga el cliente desde el Sitio web oficial.
- Instala el
.dmg(macOS) o.exe(Windows). - Inicia la app: el backend local se inicia automáticamente.
Opción B: Configuración para desarrolladores
Para acceder al código fuente y ejecutar el sistema localmente con fines de desarrollo, sigue estos pasos:
1. Requisitos previos Asegúrate de tener instalados Node.js (v18-22) y Python.
2. Clonar e instalar
# Clone the repository
git clone https://github.com/eigent-ai/eigent.git
cd eigent
# Install frontend dependencies
npm install
3. Ejecutar la aplicación
# Return to root and run dev mode
npm run dev
Una vez en ejecución, puedes configurar tus proveedores de LLM (Gemini 3 Pro, etc.) directamente en los ajustes. Para obtener información más detallada sobre la configuración, las funciones avanzadas y la solución de problemas, consulta nuestra Documentación oficial.
Bajo el capó: stack completo de Eigent y arquitectura Workforce de CAMEL
Visión general del sistema de Eigent
Eigent constituye una aplicación de escritorio local-first con orquestación multiagente, impulsada por CAMEL Workforce como motor central. El sistema implementa una arquitectura desacoplada de stack completo que opera totalmente en la infraestructura local del usuario. Este diseño garantiza estrictamente la soberanía de los datos, eliminando los riesgos de privacidad asociados con la ejecución de agentes en la nube.
1. El frontend
La interfaz de usuario sirve como plano de control para la configuración de agentes y la supervisión del flujo de trabajo. Está construida con React y TypeScript dentro de un marco Electron.
Los componentes técnicos clave incluyen:
- Gestión de estado: Zustand se utiliza para manejar el estado transitorio de la aplicación, asegurando una reactividad eficiente.
- Orquestación visual: React Flow se integra para visualizar el espacio de trabajo de los agentes y seguir la ejecución en tiempo real.
- Comunicación: El frontend se comunica con el backend mediante solicitudes HTTP locales seguras.
2. El backend
La lógica central reside en un servidor Python local que utiliza FastAPI y Uvicorn, y actúa como entorno host para el framework multiagente CAMEL.
- Entorno de ejecución: El backend se ejecuta en Python 3.10+, gestionado por uv para una resolución de dependencias de alto rendimiento y aislamiento del entorno.
- Capa de persistencia: PostgreSQL, conectado mediante SQLModel/SQLAlchemy ORM, proporciona un almacenamiento estructurado y sólido para registros de auditoría, historial de flujos de trabajo y estados de los agentes.
- Framework multiagente: El framework CAMEL gestiona la lógica de orquestación de agentes (p. ej., workforce), interactuando con Large Language Models (LLMs), ya sean remotos (p. ej., Gemini) o locales (p. ej., mediante vLLM) para la ejecución de agentes. El framework CAMEL también ofrece un amplio conjunto de toolkits como browser toolkit, terminal toolkit y document generation toolkit.
CAMEL Workforce: un sistema multiagente inspirado en las estructuras organizativas
En el corazón de Eigent se encuentra CAMEL Workforce, un sistema multiagente diseñado para resolver tareas complejas del mundo real mediante cooperación descentralizada. El sistema utiliza un estricto patrón Producer-Consumer, mediado por un canal de mensajes asíncrono para gestionar eficientemente los grafos de dependencias.
1. Roles de los agentes
- Agente coordinador: Funciona como el despachador principal. Mantiene el estado global y asigna subtareas a trabajadores específicos según su disponibilidad y capacidad.
- Agente de tareas: Se encarga de la descomposición semántica de objetivos de alto nivel en unidades atómicas y ejecutables.
- Agente trabajador: Sirve como la unidad de ejecución especializada. Los agentes trabajadores consumen subtareas atómicas y las ejecutan utilizando herramientas específicas del dominio.
2. Comunicación asíncrona: TaskChannel
La desacoplación entre la capa de coordinación y la capa de ejecución se logra mediante TaskChannel. Esta cola de mensajes asíncrona gestiona la distribución de tareas sin bloquear el hilo principal de ejecución.
Flujo de ejecución:
- Workforce inicia una tarea.
- Los nodos trabajadores consultan asignaciones.
- Al completarse, los resultados se devuelven.
3. Construcción dinámica de DAG
Los flujos de trabajo empresariales rara vez son lineales. CAMEL Workforce implementa un mecanismo dinámico de construcción de Directed Acyclic Graph (DAG). Cuando se recibe un prompt de alto nivel (p. ej., "Crear plan de viaje"), el Agente de Tareas descompone este objetivo en nodos discretos.
El sistema mapea explícitamente las dependencias, permitiendo que el programador:
- Ejecute nodos independientes en paralelo (p. ej., Buscar billete de avión y Buscar hotel se ejecutan de forma concurrente).
- Bloquee los nodos dependientes hasta que sus predecesores alcancen un estado
DONE.
4. Mecanismo tolerante a fallos
Dada la naturaleza no determinista de los LLMs, Eigent trata los fallos como transiciones de estado esperadas y no como excepciones fatales. La arquitectura implementa un sólido mecanismo de recuperación utilizando las siguientes estrategias:
- RETRY: Vuelve a ejecutar la subtarea en el mismo trabajador para gestionar errores transitorios.
- REPLAN: El Agente de Tareas modifica la subtarea original según el registro de fallo antes de volver a encolarla.
- REASSIGN: La subtarea se migra del trabajador actual a otro agente con un conjunto de habilidades compatible.
- DECOMPOSE: Si una tarea falla debido a una complejidad excesiva, se divide recursivamente en subtareas más pequeñas.

Arquitectura de automatización del navegador en Eigent
Sin embargo, una arquitectura de workforce multiagente solo puede desbloquear una automatización empresarial real cuando se combina con la creciente potencia de capacidades de propósito general como la automatización del navegador. Por eso hacemos hincapié en construir agentes que puedan operar directamente dentro de entornos empresariales reales en lugar de depender únicamente de integraciones API rígidas.
Eigent adopta una arquitectura de dos capas que separa el control del navegador de la orquestación de agentes:
- La capa TypeScript es responsable de todas las interacciones con el navegador. Aprovecha las APIs nativas de Playwright para realizar operaciones DOM, capturar snapshots estructurados, generar capturas SoM, detectar oclusiones y gestionar lógica avanzada del navegador directamente dentro del runtime de JavaScript. Como Playwright está construido de forma nativa en TypeScript, esta capa obtiene acceso a funciones de vanguardia como
_snapshotForAI()y garantiza mejor rendimiento, fiabilidad y ergonomía para desarrolladores. - La capa Python gestiona la orquestación de IA. Administra llamadas a LLM, la toma de decisiones de los agentes y la planificación de tareas. Esta separación permite que Python se centre en la lógica de agentes, donde el ecosistema Python destaca en IA y orquestación de flujos de trabajo.
- Las dos capas se comunican de forma asíncrona mediante WebSocket, lo que permite operaciones no bloqueantes. Python envía solicitudes de operaciones del navegador, TypeScript las ejecuta y devuelve los resultados. La interacción es transparente para el usuario final y admite la ejecución concurrente de tareas.
Esta arquitectura mejora el rendimiento, aumenta la precisión de las interacciones con elementos y habilita capacidades avanzadas como el filtrado dinámico del DOM, snapshots conscientes del viewport y renderizado SoM dentro del navegador. Evita las limitaciones de las implementaciones solo en Python, como la alta latencia, el acceso limitado a los internos del navegador y la lógica compleja de procesamiento de imágenes. Al delegar las tareas del navegador al contexto de ejecución nativo, Eigent garantiza una base sólida para la automatización empresarial basada en agentes.
Durante la ejecución multiagente en escenarios de automatización empresarial, la automatización basada en navegador ofrece una ventaja natural en la visibilidad del proceso. Cada paso es transparente, inspeccionable y fácil de depurar, lo que la hace mucho más práctica para flujos de trabajo complejos y en evolución.

Probar Gemini 3 Pro en tareas empresariales del mundo real con la automatización del navegador de Eigent
Hemos probado Eigent con Gemini 3 Pro para automatizar procesos de ventas usando las capacidades de automatización del navegador de Eigent. Las tareas para los agentes consisten en automatizar varias etapas del ciclo de ventas real, incluidas Captura y creación de leads, Calificación y gestión del pipeline, Cotización, Negociación, Cierre y Gestión de productos.
A lo largo de las ejecuciones experimentales, Gemini 3 Pro muestra de forma consistente tres fortalezas clave:
- Gestiona bien estructuras de página complejas, incluidos iframes y elementos anidados: puede encontrar de manera fiable el contenido y los botones correctos, incluso en diseños complejos.
- Verifica sus propias acciones para mantener la precisión y acortar pasos: utiliza un ciclo de retroalimentación para corregir errores y asegurarse de que la tarea realmente se complete correctamente.
- Usa las herramientas de forma eficiente y flexible: evita pasos innecesarios y sabe cómo combinar herramientas de forma inteligente cuando es necesario.
Tarea de ejemplo 1:
Identifica todas las empresas B2B en los lotes Winter y Summer 2025 de Y Combinator cuyo enfoque de industria esté relacionado con Marketing. Después de obtener la lista completa de empresas, investiga de forma independiente la información del producto de cada empresa en detalle y consolida todos los hallazgos en un archivo CSV limpio y bien estructurado.
Esta tarea demuestra la capacidad del agente para gestionar navegación iterativa y extracción dinámica de datos. A diferencia del scraping simple de una sola página, este flujo de trabajo requiere que el agente interactúe primero con el directorio de Y Combinator para aplicar filtros específicos (Batch, Industry, etiqueta B2B) y luego ejecute un patrón de "Lista a detalle".
El reto aquí es mantener el contexto: el agente debe entrar en los perfiles individuales de cada empresa para extraer detalles específicos del producto y después volver a la lista principal sin perder su lugar ni duplicar entradas. Gemini 3 Pro orquesta con éxito este bucle, analizando diversos diseños de páginas de destino y normalizando la información no estructurada en un formato CSV limpio sin intervención manual.
Tarea de ejemplo 2:
El acuerdo salesforce.com - 200 Widgets va avanzando bien. Muévelo de la etapa 'Needs Analysis' a 'Proposal', y haz clic en “Mark as Current Stage’ y luego haz clic en "Contact Roles" y dame el nombre del contacto y el número de teléfono. Vuelve a la página Opportunities y edita este Next Step como “book a meeting with + el nombre del contacto y el número de teléfono.”
Esta tarea de automatización del navegador presenta un desafío para los modelos estándar. Primero, debe localizar la Opportunity relevante en la página principal de Salesforce. Segundo, necesita actualizar la etapa de la Opportunity, navegar a la página específica y recuperar la información de contacto, y finalmente modificar el campo 'Next Step' dentro de esa información.
Por lo tanto, para esta tarea, es necesario demostrar un rendimiento estable en tareas de largo recorrido, una comprensión profunda de tareas complejas, planificación lógica de tareas y la capacidad de ejecutar operaciones estables entre páginas dentro del entorno de Salesforce.
Además, mediante un desglose cuantitativo (p. ej., asignando la acción de cada paso a regiones de la página, rastreando los recuentos de fallo/reintento), podemos alinear la referencia de acciones del navegador con los elementos en los snapshots elemento por elemento. Esto permite un análisis más profundo del rendimiento de Gemini 3 Pro en cuanto a la precisión y eficacia de las llamadas a herramientas y las acciones del navegador:
| Ejecución | Total de acciones del navegador | Otras acciones usadas | Características de la secuencia | Implicación |
|---|---|---|---|---|
| 1.ª ejecución | 23 | Ninguna | Secuencia compacta (open → type → clics repetidos → snapshot → click → visit_page → click …). | No hay clics ni escritura repetidos sobre el mismo control. Progresión unidireccional con baja redundancia. |
| 2.ª ejecución | 18 | note / screenshots | Múltiples pasos de click/snapshot después de open para alcanzar el área objetivo; más tarde introduce append_note/create_note/browser_get_page_snapshot para registro y confirmación del estado. | Menos acciones del navegador; las herramientas auxiliares se usan como memoria externa y para validación. |
| 3.ª ejecución | 15 | Ninguna | Comienza con múltiples open/visit_page, luego clics continuos y una escritura final. | Sin herramientas auxiliares; sin reintentos/retrocesos. Cadena de acciones más optimizada. |
Con base en los tres resultados de ejecución, podemos ver que Gemini 3 Pro demuestra alta robustez y capacidad de auditoría en escenarios de tareas de navegador de largo recorrido.
- Flujo de ejecución: Muestra una planificación fiable del camino de ejecución a partir del objetivo de la tarea analizado y del estado del entorno.
- Estabilidad y robustez: La página actual de la tarea en el navegador contenía hasta 13 capas de anidamiento, y aun así Gemini 3 Pro mantuvo bajos reintentos y ningún bucle infinito durante la ejecución de la tarea.
- Eficiencia: Los tres conjuntos de registros mostraron casi ninguna llamada redundante a herramientas, y nunca exhibieron clics múltiples ni entradas repetidas. Esta eficiencia, combinada con herramientas auxiliares flexibles (Note/Screenshot), dio como resultado acciones de navegador más escasas y más estables.
Tarea de ejemplo 3:
“Estoy preparándome para mi revisión mensual de ventas. Por favor, entra en mi forecast, encuentra la opportunity bajo la cuenta Global Media que esté en la etapa Commit, y actualiza su Close Date al 26 de noviembre.”
¿Qué pasa si aumentamos la complejidad de la página web en la tarea?
La siguiente tarea está configurada en una página de Salesforce Forecast. La página Forecast es utilizada por los equipos de ventas para estadísticas y visión general; su página de navegador es extremadamente compleja, con aproximadamente 4.763 elementos en un solo snapshot. Después de una decodificación multinivel, el snapshot contiene 1.222 líneas con una profundidad máxima de anidamiento de 18 capas y una profundidad media de aproximadamente 14,33. Esto significa que la página no solo tiene un alto número de elementos, sino que también presenta una jerarquía profundamente anidada: estructuras multinivel como List → List Item → Link/Button → Icon → Paragraph/Grid Row.

Salesforce Forecasts Webpage
En nuestras pruebas, Gemini 3 ejecutó esta tarea a la perfección las tres veces. Necesita la capacidad de actualizar correctamente campos dentro de una página tan densa y altamente anidada, mientras sigue enfocándose con éxito en la opportunity objetivo (Global Media 180 Widgets) y completa la actualización de Close Date, lo que sirve como prueba de las sólidas capacidades de análisis, planificación de ruta y ejecución estable de Gemini 3 Pro en escenarios de browser-use.
Cómo Gemini 3 Pro mejora el rendimiento de las tareas
Gemini 3 Pro destaca como una opción bien equilibrada para agentes empresariales autónomos. En nuestras tareas del mundo real, gestiona de forma consistente flujos de trabajo de navegador de largo recorrido con un alto grado de fiabilidad. Combinado con su favorable relación coste-rendimiento, presenta una opción práctica para escalar la automatización basada en agentes en entornos empresariales.
La ventaja de la "continuidad de estado" (Thought Signatures) El principal diferenciador técnico que observamos es la implementación de Thought Signatures por parte de Gemini 3 Pro. En las interacciones tradicionales con LLM, el modelo depende por completo del texto del historial de conversación para reconstruir su contexto entre turnos. En flujos de trabajo complejos y de largo recorrido, esto puede provocar ocasionalmente "deriva de contexto", donde un agente pierde el hilo de la intención original después de múltiples interacciones con el navegador. Gemini 3 Pro aborda esto devolviendo un thoughtSignature, que es una representación cifrada de su estado interno de razonamiento, después de cada paso.
Impacto en Eigent
Cuando nuestros agentes ejecutan tareas secuenciales (p. ej., "Comprobar estado del vuelo" seguido de "Reservar taxi"), esta firma se devuelve al modelo. En nuestras pruebas, este mecanismo ayudó al agente a mantener una mejor continuidad lógica durante llamadas a funciones de varios pasos, reduciendo la tasa de errores lógicos en las etapas posteriores del flujo de trabajo en comparación con modelos pares.
Robustez en la planificación de largo recorrido
La automatización empresarial a menudo requiere navegar por la incertidumbre: gestionar pantallas de inicio de sesión, estados de carga o ventanas emergentes inesperadas.
Gemini 3 Pro mostró una alta resiliencia en sesiones más largas (más de 10 pasos). Esto se alinea con su rendimiento en benchmarks como Vending-Bench 2, que evalúa la planificación de largo recorrido.
Para consultas estándar, la diferencia de rendimiento entre los modelos de primer nivel puede ser insignificante. Sin embargo, en la automatización agentic, donde el mantenimiento del estado y la recuperación ante errores son primordiales, Gemini 3 Pro ofrece actualmente una base fiable para la plataforma Eigent. Su capacidad para preservar el "estado de razonamiento" mediante Thought Signatures lo convierte en la opción pragmática para flujos empresariales complejos y de varios pasos.
Conclusión y próximos pasos
A través de este blog, exploramos cómo Eigent, impulsado por la arquitectura de workforce multiagente de CAMEL y las capacidades a nivel de navegador, crea un entorno de grado de producción para desplegar agentes de IA que realmente pueden operar dentro de sistemas empresariales. Al combinar autonomía a nivel de herramientas con flujos de trabajo que el usuario puede sobrescribir, el sistema sigue siendo controlable, observable y auditable, que son las propiedades críticas para cualquier despliegue orientado a B2B.
También demostramos cómo Gemini 3 Pro, cuando se integra en Eigent, ofrece un equilibrio ideal entre capacidad de razonamiento, estabilidad y rentabilidad. Su alineación arquitectónica con la ejecución multiagente, especialmente a través de funciones como Thought Signatures, lo hace particularmente adecuado para flujos de trabajo de alto riesgo y largo recorrido, típicos de los casos de uso empresariales.
De cara al futuro, seguimos trabajando en:
- Exponer casos de fallo en despliegues empresariales del mundo real, identificando patrones de tareas en los que los modelos fundacionales actuales tienen dificultades con el seguimiento de estado, la recuperación ante errores o el grounding de herramientas.
- Establecer un benchmark estandarizado de automatización del navegador empresarial, recopilando escenarios realistas de tareas de automatización empresarial que incluyan clientes de correo, sistemas de mensajería, documentos, UIs del navegador y plataformas ERP/CRM.
- Construir un entorno de reinforcement learning para flujos de trabajo empresariales basados en navegador, habilitando reinforcement learning para agentes mediante recompensas basadas en tareas, seguimiento de trayectorias y análisis de comportamiento de largo recorrido.
Eigent es completamente open source, e invitamos a desarrolladores, investigadores y equipos empresariales a explorar, extender y contribuir:
👉 GitHub: https://github.com/eigent-ai/eigent
👉 Únete a nuestra comunidad de Discord: https://discord.camel-ai.org
Recent Posts

Claude Tag: el compañero de IA siempre activo de Anthropic para Slack
Descubre qué es Claude Tag, cómo funciona @Claude en los canales de Slack y cómo el compañero de IA siempre activo de Anthropic apoya el trabajo en equipo y la automatización.

Tutorial de Claude Hong Kong: Interfaz, prompts y contenido en cantonés
Un tutorial práctico de Claude para usuarios de Hong Kong: recorrido por la interfaz, plantillas de prompts para cantonés y chino tradicional, consejos de programación y una alternativa gratuita.

Cómo usar Claude en Hong Kong: guía completa
¿Las IP de Hong Kong no pueden acceder a Claude.ai? Esta guía explica por qué, recorre soluciones con VPN y verificación por teléfono, la opción de AWS para empresas y una alternativa gratuita.