Trouver la cause profonde des échecs du CI ML en quelques minutes avec Gemini 3.5 Flash
Déboguer un pipeline d'entraînement ML cassé est un travail lent et fastidieux. Vous extrayez les logs de deux exécutions CI différentes, les comparez aux valeurs de référence, fouillez l'historique des commits pour trouver la régression, puis rédigez un rapport expliquant ce qui s'est mal passé et pourquoi, pendant que votre équipe attend. Ce cas d'utilisation automatise toute cette investigation.
En combinant la compétence ml-failure-audit avec le modèle Gemini 3.5 Flash de Google et l'API Gemini Agent comme moteur de raisonnement distant, la main-d'œuvre multi-agent d'Eigent peut auditer un échec de CI de bout en bout : récupérer les logs, extraire les valeurs de référence, retracer les preuves, déléguer l'analyse lourde et produire des livrables structurés, le tout à partir d'une seule requête.
Sélectionnez Gemini 3.5 Flash comme modèle
Allez dans Settings → Agents → Model et sélectionnez Gemini 3.5 Flash dans la liste des modèles cloud. Si vous préférez utiliser vos propres identifiants API, apportez votre propre clé Gemini en la saisissant sous Settings → API Keys → Gemini.
Gemini 3.5 Flash est optimisé pour une inférence rapide et économique sur les tâches à long contexte, exactement ce qu'exige l'analyse des logs CI.
Activez l'API Gemini Agent comme sous-agent distant
Allez dans Settings → Agents → Remote Agents et activez Gemini Agent API. Cela enregistre Gemini Agent comme sous-agent appelable dans la main-d'œuvre d'Eigent.
Une fois activé, votre agent Developer peut déléguer directement au Gemini Agent les tâches de raisonnement coûteuses en calcul, comme l'analyse des causes profondes sur des centaines de lignes de logs, au lieu de tout traiter en un seul appel au modèle. Cela vous donne une configuration à deux niveaux : les agents locaux d'Eigent gèrent l'orchestration et l'utilisation des outils, tandis que Gemini Agent gère le raisonnement approfondi.
Téléchargez la compétence ml-failure-audit
Rendez-vous dans Settings → Agents → Skills et téléchargez le package de compétence ml-failure-audit. Vous pouvez également consulter le Skill Hub: ml-failure-audit pour les détails de la compétence et les étapes d'installation. La compétence définit comment Eigent doit aborder les audits d'échec CI : quels artefacts collecter, quelles comparaisons exécuter, quelles preuves rassembler et comment structurer le rapport final.
Une fois téléchargée, n'importe quel agent de la main-d'œuvre peut invoquer cette compétence lors du traitement de tâches d'audit ML.
Envoyez votre tâche à Eigent
Une fois tout configuré, saisissez votre prompt de tâche dans le chat d'Eigent :
Suivez la compétence {{ml-failure-audit}} et utilisez un sous-agent distant pour terminer les sous-tâches complexes.
Veuillez auditer cet échec du CI de golden metric pour le pré-entraînement MIMO VLM de Megatron-LM. Je vous fournis un checkout local NVIDIA/Megatron-LM au commit <your-commit-sha> ainsi que les artefacts CI que j'ai joints (par exemple, les logs d'une exécution réussie et d'une exécution échouée). La charge de travail en échec est une vérification de convergence frozen start sur 8 GPU avec sequence packing, une taille de batch globale de 32, une longueur totale de séquence packée de 3200, un buffer de packing de 4 et 100 itérations d'entraînement.
Veuillez déterminer si l'échec est une véritable régression de la convergence/correctness du modèle ou un problème de métrique/politique de gating. Utilisez le code de comparaison des valeurs de référence du dépôt et les logs CI comme preuves. N'exécutez pas à nouveau l'entraînement GPU.
Produisez answer.json à la racine du dépôt avec source_refs, extracted_facts, calculations, final_answer et validation. Produisez également un answer.md concis.
Incluez l'URL du dépôt, votre checkout du commit cible et joignez les artefacts CI que vous souhaitez comparer. Eigent commence immédiatement à planifier l'investigation.
Installez la compétence ml-failure-audit avant d'exécuter ce prompt.
Apportez vos propres entrées : remplacez <your-commit-sha> par le commit que vous souhaitez auditer, vérifiez cette révision dans votre espace de travail et joignez vos propres artefacts CI (par exemple, logs d'exécution réussie versus échouée, captures stderr ou sortie de job CI exportée). Vous pouvez adapter l'exemple Megatron-LM à n'importe quel dépôt et à n'importe quel échec que vous examinez.
L'agent Coordinator planifie et attribue la tâche
L'agent Coordinator d'Eigent lit le prompt et le décompose en un plan d'audit structuré. Il identifie les phases clés (récupération des logs, extraction des données, traçage des preuves et génération du rapport) et confie l'enquête complète à un agent Developer.
Le Coordinator ne se contente pas de déléguer aveuglément : il transmet la référence de la compétence, le contexte du dépôt et les artefacts de logs CI afin que l'agent Developer commence avec tout ce dont il a besoin.
L'agent Developer charge la compétence et récupère les logs
La première action de l'agent Developer consiste à charger la compétence ml-failure-audit, en lisant ses instructions pour comprendre la méthodologie d'audit.
Il exécute ensuite 4 commandes en parallèle pour récupérer les données des logs CI, en extrayant simultanément les deux logs d'échec et toutes les métadonnées pertinentes. L'exécution parallèle des outils signifie que la phase de collecte de données se termine en une fraction du temps qu'elle prendrait séquentiellement.
Extraire les valeurs de référence et retracer le commit de correctif
Une fois les logs en main, l'agent Developer exécute un script Python pour extraire les valeurs de référence : les métriques d'entraînement attendues, les courbes de perte ou les chiffres de benchmark qu'une exécution CI réussie devrait produire. Il compare ensuite ces éléments aux valeurs enregistrées dans les logs d'échec afin d'identifier précisément où et de combien les choses ont divergé.
Ensuite, l'agent Developer recherche dans l'historique des commits de Megatron-LM pour trouver le commit de correctif, la modification de code spécifique la plus susceptible d'être responsable de la régression. Ce commit sert de preuve concrète dans le rapport d'audit, en donnant aux examinateurs un lien direct entre l'échec observé et la modification de code sous-jacente.
Déléguer le raisonnement approfondi à Gemini Agent
Une fois les preuves brutes assemblées (diffs de logs, comparaisons des valeurs de référence et commit tracé), l'agent Developer appelle Gemini Agent pour effectuer l'étape de raisonnement lourd.
Gemini Agent analyse tout le contexte : ce qui a changé dans le code, comment ce changement a affecté le comportement d'entraînement et quelle est la cause profonde la plus probable. Quelques minutes plus tard, il renvoie un rapport d'audit complet et structuré couvrant le diagnostic de l'échec, les facteurs contributifs et la correction recommandée.
L'agent Developer rédige les rapports d'audit finaux
L'agent Developer prend l'analyse de Gemini Agent et rédige deux livrables dans l'espace de travail :
-
answer.json: un enregistrement d'audit lisible par machine avec des champs structurés pour le type d'échec, la cause profonde, les métriques affectées, le commit de preuve et la résolution recommandée. Utile pour les pipelines automatisés, les systèmes de tickets ou les tableaux de bord CI. -
answer.md: un résumé d'audit concis et lisible par l'humain couvrant ce qui a échoué, pourquoi cela a échoué, les preuves et les prochaines étapes. Prêt à être collé dans un commentaire de PR, un fil Slack ou un rapport d'incident.
Les deux fichiers sont écrits directement dans le dossier de l'espace de travail et sont immédiatement accessibles.
Pourquoi ce workflow est important
Les échecs du CI ML sont notoirement difficiles à déboguer parce que le signal est noyé dans un flux de logs dense et que la cause profonde se trouve souvent à plusieurs commits de distance du symptôme. Ce workflow y répond avec trois capacités fonctionnant de concert :
- La récupération parallèle des logs élimine le goulot d'étranglement séquentiel consistant à récupérer les artefacts un par un.
- L'extraction des valeurs de référence basée sur Python applique une comparaison numérique précise au lieu de s'appuyer sur la correspondance de motifs ou l'inspection manuelle.
- Gemini Agent comme sous-agent de raisonnement délègue l'étape d'inférence la plus complexe à un modèle optimisé pour cela, en gardant l'orchestration légère et l'analyse approfondie.
Le résultat est un audit de cause profonde qui demanderait à un ingénieur 30 à 60 minutes de travail concentré, livré en quelques minutes, avec une trace d'artefacts structurée.
Que tester ensuite
Une fois votre premier audit terminé, étendez le workflow avec des prompts de suivi comme :
Exécutez le même audit sur les trois échecs CI les plus récents et comparez les causes profondes.
Après avoir trouvé le commit de correctif, ouvrez un ticket GitHub avec le rapport d'audit prérempli.
Programmez un déclencheur nocturne pour auditer tout nouvel échec CI et publier answer.md sur Slack.
Remplacez le modèle par un autre, essayez Gemini 3.5 Pro pour une analyse plus approfondie ou Gemini Flash Lite pour un délai d'exécution plus rapide.
Conseils pour de meilleurs résultats
- Joignez explicitement vos artefacts CI. La compétence ml-failure-audit fonctionne mieux lorsque vous fournissez le checkout du commit ainsi que les logs ou exports à comparer (par exemple, une exécution réussie et une exécution échouée).
- Incluez l'URL du dépôt. L'agent Developer l'utilise pour rechercher dans l'historique des commits le commit de correctif. Un lien direct vers le dépôt permet d'économiser une étape de recherche.
- Précisez vos fichiers de sortie. Demander à la fois
answer.jsonetanswer.mdindique à l'agent Developer de produire les deux formats, utile si vous avez besoin d'une sortie lisible par machine pour un pipeline CI et d'une sortie lisible par l'humain pour votre équipe. - Utilisez Gemini Agent pour les tâches de raisonnement lourdes. Le schéma de sous-agent distant fonctionne mieux lorsque les agents locaux gèrent la collecte des données et que Gemini Agent gère la synthèse. Évitez de l'appeler pour des recherches simples que l'utilisation locale des outils peut traiter plus rapidement.



