Uma Tarefa, Dois Modelos, o Mesmo Agente
A forma mais limpa de comparar dois modelos é não mudar mais nada. Então foi exatamente isso que fizemos: mesma tarefa de longo horizonte, mesmo agente, mesmas ferramentas. Entregamos o mesmo briefing ao GLM-5.1 e ao GLM-5.2 dentro do single-agent harness da Eigent e observamos como cada um planejou, pesquisou, verificou e entregou.
O trabalho era uma verdadeira atividade de analista, não um benchmark de brinquedo:
Pesquisar 26 empresas em toda a stack de infraestrutura de IA — do design de silício e da fabricação de semicondutores até as plataformas em nuvem e os data centers que executam IA de fronteira — e então construir um relatório interativo.
Uma tarefa de longo horizonte como essa é onde os modelos realmente se distinguem. Não é uma resposta genial; são dezenas de pequenas decisões encadeadas ao longo de uma execução longa: quão profundamente planejar, quantas fontes confiar, quando parar de pesquisar e quanto verificar antes de declarar concluído.
O Prompt
Enviamos a ambas as execuções o mesmo prompt, em modo single-agent:
Faça uma pesquisa aprofundada sobre 26 empresas do ecossistema de infraestrutura de IA — o principal fio condutor mais certo de toda a cadeia de valor da IA. Cubra os seguintes 6 subsegmentos (escolha empresas representativas em cada um, de líderes de grande capitalização até participantes menores):
- Data Center de IA (infraestrutura de computação / expansão)
- GPU / Chips de IA (silício para treinamento e inferência, ASICs, IP)
- Servidores, Rede e Módulos Ópticos (switches, NICs, interconexão óptica)
- Energia, Resfriamento Líquido e Armazenamento de Energia (fonte de alimentação, térmica, gestão de energia)
- Cloud de IA / Plataforma de Computação (hyperscalers, GPU clouds, plataformas de aluguel de computação)
- Ecossistema de Suporte (HBM / empacotamento avançado, foundry, conectores e outros componentes críticos)
Para cada empresa, pesquise: nome da empresa, subsegmento, sede / país; produtos principais e seu papel específico na cadeia de IA; pública ou privada (ticker + bolsa se listada; se privada, informe a avaliação / rodada de captação mais recente); valor de mercado ou tamanho da avaliação (usado para ranqueamento); posicionamento e moat (1–2 frases); principais clientes / concorrentes.
Classifique as empresas dentro de cada subsegmento da maior para a menor, e estruture tudo de forma top-down: do panorama completo do ecossistema de hardware até cada empresa individual.
Saída: Primeiro gere um ai_infra_data.json estruturado com todas as 26 empresas, as 6 classificações de subsegmentos, uma flag público/privado e uma matriz de comparação entre empresas. Depois gere um relatório HTML refinado e interativo a partir desse JSON — diagrama do panorama do ecossistema, seções por setor, cards de empresas, codificação por cor público-vs-privado, um gráfico de ranqueamento por valor de mercado e uma tabela de comparação ordenável/filtrável. Verifique primeiro a precisão dos dados da pesquisa (status de listagem, tickers, avaliações — cifras mais recentes, fontes citadas), e só então gere o relatório.
Prepare-se para Executar — GLM-5.2 Planeja com Mais Profundidade
A primeira divergência apareceu antes de qualquer modelo tocar a web: no plano.
O GLM-5.1 dividiu o trabalho em 4 etapas. O GLM-5.2 expandiu o mesmo briefing para 6 etapas — e, de forma reveladora, fez de "verificar precisão" sua própria tarefa dedicada, em vez de algo a ser feito de passagem. É assim que um analista cuidadoso delimita o trabalho: pesquisar, depois provar a pesquisa, depois construir.
Mesmas instruções. Julgamento diferente sobre quanta rigorosidade a tarefa merece.
A Pesquisa — O Dobro de Fontes
Os planos se transformaram em execuções de pesquisa muito diferentes.
- GLM-5.1: ~40 fontes
- GLM-5.2: ~82 fontes — cerca de 2× a pesquisa
E não era apenas mais páginas — eram páginas melhor distribuídas. Enquanto o GLM-5.1 se apoiava fortemente em um único site de dados, o GLM-5.2 cruzou cada número com notícias financeiras, documentos corporativos e bases de dados de mercado privado: Reuters, Bloomberg, Crunchbase, TechCrunch e mais.
Uma fonte não basta. Para avaliações, tickers e status de listagem, o GLM-5.2 tratou um único número como uma hipótese a confirmar — não como um fato a copiar.
O GLM-5.2 não apenas respondeu mais rápido. Ele aprofundou a pesquisa, recorrendo ao dobro de páginas para verificar cada cifra.
Verificar Antes de Finalizar
Como o GLM-5.2 havia separado a verificação em sua própria etapa, ele de fato a executou — rechecando status de listagem, tickers e avaliações contra as cifras mais recentes antes de incorporá-las ao relatório. O resultado é um relatório que demonstra seu trabalho em vez de apenas afirmá-lo.
O Resultado — Dados Mais Profundos, Citações Reais
Mesma tarefa. Entregáveis muito diferentes.
O GLM-5.2 produziu:
- Um esquema de dados mais rico com análise dedicada de moat, detalhes de captação e uma lista completa de fontes — cada afirmação rastreável até sua origem.
- Um relatório final quase 2× mais rico que o do GLM-5.1, tanto em dados quanto em estrutura.
- Uma entrega em formato de site totalmente implantável e interativo — não apenas uma página HTML estática: diagrama do panorama do ecossistema, seções por setor, codificação por cor público-vs-privado, gráfico de ranqueamento por valor de mercado e tabela de comparação ordenável/filtrável.
O GLM-5.1 entregou um relatório sólido e correto. O GLM-5.2 entregou algo que você poderia levar a um comitê de investimento.
Por Que Isso Importa
Em uma tarefa curta, dois modelos capazes parecem quase iguais. Em uma tarefa de longo horizonte, as diferenças se acumulam. Cada fonte extra que o GLM-5.2 escolheu ler, cada cifra que escolheu checar novamente e a decisão de tornar a verificação uma etapa de primeira classe se somaram em um resultado visivelmente melhor.
O harness era idêntico. As ferramentas eram idênticas. A única variável era o modelo — e é exatamente isso que torna esta uma leitura justa de como o GLM-5.2 raciocina em uma execução longa:
Mais fontes. Julgamento mais afiado. Um relatório que prova seu trabalho.
Execute Você Mesmo
A Eigent permite trocar o modelo por trás do mesmo single-agent harness, para que você possa executar esta comparação exata na sua própria tarefa:
- Vá para Settings → Models e selecione ou adicione o modelo que você quer testar (GLM-5.1, GLM-5.2 ou qualquer modelo com function calling).
- Mude a tarefa para single-agent mode.
- Cole o prompt de deep research acima (ou seu próprio briefing de longo horizonte).
- Envie uma vez para cada modelo e compare os planos, a contagem de fontes e os relatórios finais lado a lado.
O Que Testar a Seguir
Execute novamente o mesmo briefing, mas exija pelo menos 3 fontes independentes por avaliação e sinalize qualquer empresa em que as fontes divergem.
Amplie o universo de 26 para 50 empresas e adicione uma coluna de "dependência da cadeia de suprimentos" à matriz de comparação.
Gere um resumo executivo de uma página do relatório final em PDF, além de um deck de slides do gráfico de ranqueamento por valor de mercado.
Execute o GLM-5.2 contra outro modelo na mesma tarefa e produza um relatório diff: onde concordaram, onde divergiram e qual teve melhor sourcing.
Dicas para Melhores Resultados
- Torne a verificação explícita. Pedir ao modelo para "verificar a precisão primeiro, depois construir" muda de forma mensurável o comportamento — o GLM-5.2 transformou essa linha em sua própria etapa de planejamento.
- Exija citações no esquema. Requerer um campo
sourcespor empresa força pesquisa rastreável em vez de suposições confiantes. - Separe dados da apresentação. Gerar
ai_infra_data.jsonantes do HTML mantém o relatório regenerável e os fatos auditáveis. - Use modo single-agent para raciocínio de longo horizonte. Isso mantém o contexto completo da tarefa nas mãos de um único modelo, exatamente o que você quer ao comparar como um modelo planeja e se autocorrige ao longo de uma execução longa.



