Una Tarea, Dos Modelos, el Mismo Agente
La forma más limpia de comparar dos modelos es no cambiar nada más. Así que hicimos exactamente eso: la misma tarea de largo alcance, el mismo agente, las mismas herramientas. Entregamos a GLM-5.1 y GLM-5.2 el mismo briefing dentro del single-agent harness de Eigent y observamos cómo cada uno planificó, investigó, verificó y entregó.
El trabajo era una tarea real de analista, no un benchmark de juguete:
Investiga 26 empresas de la cadena de infraestructura de IA — desde el diseño de silicio y la fabricación de semiconductores hasta las plataformas de nube y los centros de datos que ejecutan IA de frontera — y luego crea un informe interactivo.
Una tarea de largo alcance como esta es donde realmente se separan los modelos. No es una sola respuesta ingeniosa; son docenas de pequeñas decisiones encadenadas durante una ejecución larga: cuán profundo planificar, cuántas fuentes confiar, cuándo dejar de investigar y cuánto verificar antes de declarar terminado.
El Prompt
Enviamos a ambas ejecuciones el mismo prompt, en modo single-agent:
Realiza una investigación en profundidad de 26 empresas del ecosistema de infraestructura de IA, el hilo principal más claro de toda la cadena de valor de la IA. Cubre los siguientes 6 subsectores (elige empresas representativas en cada uno, desde líderes de gran capitalización hasta actores más pequeños):
- Centro de datos de IA (infraestructura de cómputo / despliegue)
- GPU / chips de IA (silicio para entrenamiento e inferencia, ASICs, IP)
- Servidores, redes y módulos ópticos (switches, NIC, interconexión óptica)
- Energía, refrigeración líquida y almacenamiento de energía (fuente de alimentación, térmica, gestión energética)
- Nube de IA / plataforma de cómputo (hiperescaladores, nubes de GPU, plataformas de alquiler de cómputo)
- Ecosistema de apoyo (HBM / empaquetado avanzado, foundry, conectores y otros componentes críticos)
Para cada empresa, investiga: nombre de la empresa, subsector, sede / país; productos principales y su función específica en la cadena de IA; pública o privada (ticker + bolsa si cotiza; si es privada, indica la valoración / ronda de financiación más reciente); capitalización bursátil o tamaño de valoración (para el ranking); posicionamiento y ventaja competitiva (1–2 frases); clientes / competidores clave.
Clasifica las empresas dentro de cada subsector de mayor a menor, y estructura todo de arriba abajo: desde el panorama completo del ecosistema de hardware hasta cada empresa individual.
Salida: primero genera un ai_infra_data.json estructurado con las 26 empresas, las 6 clasificaciones de subsector, una bandera de pública/privada y una matriz de comparación entre empresas. Luego genera un informe HTML pulido e interactivo a partir de ese JSON: diagrama de panorama del ecosistema, secciones por sector, tarjetas de empresa, codificación por color pública-vs-privada, un gráfico de ranking por capitalización bursátil y una tabla de comparación ordenable/filtrable. Verifica primero la exactitud de los datos de investigación (estado de cotización, tickers, valoraciones — cifras más recientes, con fuentes citadas), y luego genera el informe.
Prepararse para Ejecutar — GLM-5.2 Planifica con Más Profundidad
La primera divergencia apareció antes de que cualquiera de los modelos tocara la web: en el plan.
GLM-5.1 dividió el trabajo en 4 pasos. GLM-5.2 amplió el mismo briefing a 6 pasos — y, de forma reveladora, convirtió "verificar la exactitud" en su propia tarea dedicada en lugar de algo secundario. Así es como un analista cuidadoso delimita el trabajo: investigar, luego probar la investigación, luego construir.
Mismas instrucciones. Distinto criterio sobre cuánta rigurosidad merece la tarea.
La Investigación — El Doble de Fuentes
Los planes se convirtieron en ejecuciones de investigación muy diferentes.
- GLM-5.1: ~40 fuentes
- GLM-5.2: ~82 fuentes — aproximadamente 2× la investigación
Y no se trató solo de más páginas — fueron páginas mejor distribuidas. Mientras GLM-5.1 dependía en gran medida de un único sitio de datos, GLM-5.2 cruzó cada cifra con noticias financieras, registros de empresa y bases de datos de mercado privado: Reuters, Bloomberg, Crunchbase, TechCrunch y más.
Una sola fuente no basta. Para valoraciones, tickers y estado de cotización, GLM-5.2 trató cada número como una hipótesis por confirmar, no como un hecho para copiar.
GLM-5.2 no solo respondió más rápido. Cavó más profundo, extrayendo el doble de páginas para verificar cada cifra.
Verificar Antes de Terminar
Como GLM-5.2 había reservado la verificación como su propio paso, realmente lo hizo — volviendo a comprobar el estado de cotización, los tickers y las valoraciones con las cifras más recientes antes de incorporarlas al informe. El resultado es un informe que demuestra su trabajo en lugar de afirmarlo.
El Resultado — Datos Más Profundos, Citas Reales
Misma tarea. Dos entregables muy distintos.
GLM-5.2 produjo:
- Un esquema de datos más rico con análisis dedicado de moat, detalles de financiación y una lista completa de fuentes — cada afirmación trazable hasta su origen.
- Un informe final que fue casi 2× más rico que el de GLM-5.1 tanto en datos como en estructura.
- Una salida entregada como un sitio totalmente desplegable e interactivo — no solo una página HTML estática: diagrama del ecosistema, secciones por sector, codificación por color pública-vs-privada, un gráfico de ranking por capitalización bursátil y una tabla de comparación ordenable/filtrable.
GLM-5.1 entregó un informe sólido y correcto. GLM-5.2 entregó uno que podrías presentar a un comité de inversión.
Por Qué Esto Importa
En una tarea corta, dos modelos capaces se ven bastante parecidos. En una tarea de largo alcance, las diferencias se acumulan. Cada fuente extra que GLM-5.2 decidió leer, cada cifra que decidió volver a comprobar y la decisión de hacer de la verificación una etapa de primera clase se sumaron hasta producir un resultado mediblemente mejor.
El harness era idéntico. Las herramientas eran idénticas. La única variable era el modelo — y eso es exactamente lo que hace que esto sea una lectura justa de cómo razona GLM-5.2 durante una ejecución larga:
Más fuentes. Mejor juicio. Un informe que demuestra su trabajo.
Pruébalo Tú Mismo
Eigent te permite cambiar el modelo detrás del mismo single-agent harness, así que puedes ejecutar esta comparación exacta en tu propia tarea:
- Ve a Configuración → Modelos y selecciona o añade el modelo que quieras probar (GLM-5.1, GLM-5.2 o cualquier modelo con function calling).
- Cambia la tarea a modo single-agent.
- Pega el prompt de investigación profunda anterior (o tu propio briefing de largo alcance).
- Envíalo una vez por modelo y luego compara los planes, el número de fuentes y los informes finales lado a lado.
Qué Probar Después
Vuelve a ejecutar el mismo briefing pero exige al menos 3 fuentes independientes por valoración, y marca cualquier empresa donde las fuentes discrepen.
Amplía el universo de 26 a 50 empresas y añade una columna de "dependencia de la cadena de suministro" a la matriz de comparación.
Genera un resumen ejecutivo de una página del informe final en PDF, además de una presentación de diapositivas del gráfico de ranking por capitalización bursátil.
Ejecuta GLM-5.2 contra otro modelo en la misma tarea y produce un informe diff: en qué coincidieron, en qué discreparon y cuál tuvo mejor sourcing.
Consejos para Obtener Mejores Resultados
- Haz explícita la verificación. Pedirle al modelo que "verifique primero la exactitud, luego construya" cambia de forma medible su comportamiento — GLM-5.2 convirtió esa línea en su propio paso de planificación.
- Exige citas en el esquema. Pedir un campo
sourcespor empresa fuerza una investigación trazable en lugar de suposiciones seguras. - Separa los datos de la presentación. Generar
ai_infra_data.jsonantes del HTML mantiene el informe regenerable y los hechos auditables. - Usa el modo single-agent para el razonamiento de largo alcance. Mantiene todo el contexto de la tarea en manos de un solo modelo, que es exactamente lo que quieres cuando comparas cómo un modelo planifica y se autocorrige durante una ejecución larga.



