logo
  • Environnements
  • Entreprise
  • Tarifs
DeveloperMay 19, 2026

Auditer les échecs du CI ML avec Gemini 3.5 Flash sur Eigent

Regina BaiRegina Bai
Auditer les échecs du CI ML avec Gemini 3.5 Flash et Gemini Agent sur Eigent
Automate Everything with
AI Workforce on Desktop
Download Eigent

Trouver la cause profonde des échecs du CI ML en quelques minutes avec Gemini 3.5 Flash

Déboguer un pipeline d'entraînement ML cassé est un travail lent et fastidieux. Vous extrayez les logs de deux exécutions CI différentes, les comparez aux valeurs de référence, fouillez l'historique des commits pour trouver la régression, puis rédigez un rapport expliquant ce qui s'est mal passé et pourquoi, pendant que votre équipe attend. Ce cas d'utilisation automatise toute cette investigation.

En combinant la compétence ml-failure-audit avec le modèle Gemini 3.5 Flash de Google et l'API Gemini Agent comme moteur de raisonnement distant, la main-d'œuvre multi-agent d'Eigent peut auditer un échec de CI de bout en bout : récupérer les logs, extraire les valeurs de référence, retracer les preuves, déléguer l'analyse lourde et produire des livrables structurés, le tout à partir d'une seule requête.

1Sélectionnez Gemini 3.5 Flash comme modèle

Allez dans Settings → Agents → Model et sélectionnez Gemini 3.5 Flash dans la liste des modèles cloud. Si vous préférez utiliser vos propres identifiants API, apportez votre propre clé Gemini en la saisissant sous Settings → API Keys → Gemini.

Gemini 3.5 Flash est optimisé pour une inférence rapide et économique sur les tâches à long contexte, exactement ce qu'exige l'analyse des logs CI.

2Activez l'API Gemini Agent comme sous-agent distant

Allez dans Settings → Agents → Remote Agents et activez Gemini Agent API. Cela enregistre Gemini Agent comme sous-agent appelable dans la main-d'œuvre d'Eigent.

Une fois activé, votre agent Developer peut déléguer directement au Gemini Agent les tâches de raisonnement coûteuses en calcul, comme l'analyse des causes profondes sur des centaines de lignes de logs, au lieu de tout traiter en un seul appel au modèle. Cela vous donne une configuration à deux niveaux : les agents locaux d'Eigent gèrent l'orchestration et l'utilisation des outils, tandis que Gemini Agent gère le raisonnement approfondi.

3Téléchargez la compétence ml-failure-audit

Rendez-vous dans Settings → Agents → Skills et téléchargez le package de compétence ml-failure-audit. Vous pouvez également consulter le Skill Hub: ml-failure-audit pour les détails de la compétence et les étapes d'installation. La compétence définit comment Eigent doit aborder les audits d'échec CI : quels artefacts collecter, quelles comparaisons exécuter, quelles preuves rassembler et comment structurer le rapport final.

Une fois téléchargée, n'importe quel agent de la main-d'œuvre peut invoquer cette compétence lors du traitement de tâches d'audit ML.

4Envoyez votre tâche à Eigent

Une fois tout configuré, saisissez votre prompt de tâche dans le chat d'Eigent :

Suivez la compétence {{ml-failure-audit}} et utilisez un sous-agent distant pour terminer les sous-tâches complexes.

Veuillez auditer cet échec du CI de golden metric pour le pré-entraînement MIMO VLM de Megatron-LM. Je vous fournis un checkout local NVIDIA/Megatron-LM au commit <your-commit-sha> ainsi que les artefacts CI que j'ai joints (par exemple, les logs d'une exécution réussie et d'une exécution échouée). La charge de travail en échec est une vérification de convergence frozen start sur 8 GPU avec sequence packing, une taille de batch globale de 32, une longueur totale de séquence packée de 3200, un buffer de packing de 4 et 100 itérations d'entraînement.

Veuillez déterminer si l'échec est une véritable régression de la convergence/correctness du modèle ou un problème de métrique/politique de gating. Utilisez le code de comparaison des valeurs de référence du dépôt et les logs CI comme preuves. N'exécutez pas à nouveau l'entraînement GPU.

Produisez answer.json à la racine du dépôt avec source_refs, extracted_facts, calculations, final_answer et validation. Produisez également un answer.md concis.

Incluez l'URL du dépôt, votre checkout du commit cible et joignez les artefacts CI que vous souhaitez comparer. Eigent commence immédiatement à planifier l'investigation.

Installez la compétence ml-failure-audit avant d'exécuter ce prompt.

Apportez vos propres entrées : remplacez <your-commit-sha> par le commit que vous souhaitez auditer, vérifiez cette révision dans votre espace de travail et joignez vos propres artefacts CI (par exemple, logs d'exécution réussie versus échouée, captures stderr ou sortie de job CI exportée). Vous pouvez adapter l'exemple Megatron-LM à n'importe quel dépôt et à n'importe quel échec que vous examinez.

5L'agent Coordinator planifie et attribue la tâche

L'agent Coordinator d'Eigent lit le prompt et le décompose en un plan d'audit structuré. Il identifie les phases clés (récupération des logs, extraction des données, traçage des preuves et génération du rapport) et confie l'enquête complète à un agent Developer.

Le Coordinator ne se contente pas de déléguer aveuglément : il transmet la référence de la compétence, le contexte du dépôt et les artefacts de logs CI afin que l'agent Developer commence avec tout ce dont il a besoin.

6L'agent Developer charge la compétence et récupère les logs

La première action de l'agent Developer consiste à charger la compétence ml-failure-audit, en lisant ses instructions pour comprendre la méthodologie d'audit.

Il exécute ensuite 4 commandes en parallèle pour récupérer les données des logs CI, en extrayant simultanément les deux logs d'échec et toutes les métadonnées pertinentes. L'exécution parallèle des outils signifie que la phase de collecte de données se termine en une fraction du temps qu'elle prendrait séquentiellement.

7Extraire les valeurs de référence et retracer le commit de correctif

Une fois les logs en main, l'agent Developer exécute un script Python pour extraire les valeurs de référence : les métriques d'entraînement attendues, les courbes de perte ou les chiffres de benchmark qu'une exécution CI réussie devrait produire. Il compare ensuite ces éléments aux valeurs enregistrées dans les logs d'échec afin d'identifier précisément où et de combien les choses ont divergé.

Ensuite, l'agent Developer recherche dans l'historique des commits de Megatron-LM pour trouver le commit de correctif, la modification de code spécifique la plus susceptible d'être responsable de la régression. Ce commit sert de preuve concrète dans le rapport d'audit, en donnant aux examinateurs un lien direct entre l'échec observé et la modification de code sous-jacente.

8Déléguer le raisonnement approfondi à Gemini Agent

Une fois les preuves brutes assemblées (diffs de logs, comparaisons des valeurs de référence et commit tracé), l'agent Developer appelle Gemini Agent pour effectuer l'étape de raisonnement lourd.

Gemini Agent analyse tout le contexte : ce qui a changé dans le code, comment ce changement a affecté le comportement d'entraînement et quelle est la cause profonde la plus probable. Quelques minutes plus tard, il renvoie un rapport d'audit complet et structuré couvrant le diagnostic de l'échec, les facteurs contributifs et la correction recommandée.

9L'agent Developer rédige les rapports d'audit finaux

L'agent Developer prend l'analyse de Gemini Agent et rédige deux livrables dans l'espace de travail :

  • answer.json : un enregistrement d'audit lisible par machine avec des champs structurés pour le type d'échec, la cause profonde, les métriques affectées, le commit de preuve et la résolution recommandée. Utile pour les pipelines automatisés, les systèmes de tickets ou les tableaux de bord CI.

  • answer.md : un résumé d'audit concis et lisible par l'humain couvrant ce qui a échoué, pourquoi cela a échoué, les preuves et les prochaines étapes. Prêt à être collé dans un commentaire de PR, un fil Slack ou un rapport d'incident.

Les deux fichiers sont écrits directement dans le dossier de l'espace de travail et sont immédiatement accessibles.

10Pourquoi ce workflow est important

Les échecs du CI ML sont notoirement difficiles à déboguer parce que le signal est noyé dans un flux de logs dense et que la cause profonde se trouve souvent à plusieurs commits de distance du symptôme. Ce workflow y répond avec trois capacités fonctionnant de concert :

  • La récupération parallèle des logs élimine le goulot d'étranglement séquentiel consistant à récupérer les artefacts un par un.
  • L'extraction des valeurs de référence basée sur Python applique une comparaison numérique précise au lieu de s'appuyer sur la correspondance de motifs ou l'inspection manuelle.
  • Gemini Agent comme sous-agent de raisonnement délègue l'étape d'inférence la plus complexe à un modèle optimisé pour cela, en gardant l'orchestration légère et l'analyse approfondie.

Le résultat est un audit de cause profonde qui demanderait à un ingénieur 30 à 60 minutes de travail concentré, livré en quelques minutes, avec une trace d'artefacts structurée.

11Que tester ensuite

Une fois votre premier audit terminé, étendez le workflow avec des prompts de suivi comme :

Exécutez le même audit sur les trois échecs CI les plus récents et comparez les causes profondes.

Après avoir trouvé le commit de correctif, ouvrez un ticket GitHub avec le rapport d'audit prérempli.

Programmez un déclencheur nocturne pour auditer tout nouvel échec CI et publier answer.md sur Slack.

Remplacez le modèle par un autre, essayez Gemini 3.5 Pro pour une analyse plus approfondie ou Gemini Flash Lite pour un délai d'exécution plus rapide.

12Conseils pour de meilleurs résultats

  • Joignez explicitement vos artefacts CI. La compétence ml-failure-audit fonctionne mieux lorsque vous fournissez le checkout du commit ainsi que les logs ou exports à comparer (par exemple, une exécution réussie et une exécution échouée).
  • Incluez l'URL du dépôt. L'agent Developer l'utilise pour rechercher dans l'historique des commits le commit de correctif. Un lien direct vers le dépôt permet d'économiser une étape de recherche.
  • Précisez vos fichiers de sortie. Demander à la fois answer.json et answer.md indique à l'agent Developer de produire les deux formats, utile si vous avez besoin d'une sortie lisible par machine pour un pipeline CI et d'une sortie lisible par l'humain pour votre équipe.
  • Utilisez Gemini Agent pour les tâches de raisonnement lourdes. Le schéma de sous-agent distant fonctionne mieux lorsque les agents locaux gèrent la collecte des données et que Gemini Agent gère la synthèse. Évitez de l'appeler pour des recherches simples que l'utilisation locale des outils peut traiter plus rapidement.

Other use cases

Déclaration de TVA automatisée à partir de reçus et de factures

Déclaration de TVA automatisée à partir de reçus et de factures

Veuillez traiter tous les reçus et factures du dossier "VAT", y compris les photos, les PDF scannés et les factures numériques. Le résultat final doit inclure uniquement deux fichiers : (1) vat_return.xlsx — le fichier Excel doit contenir une ligne par reçu ou facture, lister tous les champs extraits, indiquer si chaque élément est éligible à la récupération de TVA, afficher le montant de TVA récupérable pour chaque élément éligible, inclure la raison d’exclusion pour les éléments non récupérables, signaler clairement les éléments nécessitant une vérification manuelle, et inclure une feuille récapitulative affichant le montant total de TVA récupérable. (2) vat_return.html — créer un fichier HTML autonome qui peut être ouvert directement et partagé avec l’équipe comptable. Le fichier HTML doit afficher tous les éléments de récupération de TVA, le montant de TVA récupérable pour chaque élément, les éléments exclus et les raisons de l’exclusion, les éléments nécessitant une vérification manuelle, ainsi que le montant total de TVA récupérable. Ne devinez aucune information incertaine.

Tâche à long horizon : GLM-5.1 vs GLM-5.2 sur Eigent

Tâche à long horizon : GLM-5.1 vs GLM-5.2 sur Eigent

Menez une recherche approfondie sur 26 entreprises de l'écosystème d'infrastructure IA — le fil conducteur principal le plus certain de toute la chaîne de valeur de l'IA. Couvrez ces 6 sous-secteurs (choisissez des entreprises représentatives dans chacun, des leaders à grande capitalisation jusqu'aux acteurs plus petits) : centre de données IA (infrastructure de calcul / déploiement) ; GPU / puces IA (silicium d'entraînement et d'inférence, ASIC, IP) ; serveurs, réseau et modules optiques (switches, NIC, interconnexions optiques) ; alimentation, refroidissement liquide et stockage d'énergie (alimentation électrique, thermique, gestion de l'énergie) ; cloud IA / plateforme de calcul (hyperscalers, clouds GPU, plateformes de location de calcul) ; écosystème de soutien (HBM / packaging avancé, fonderie, connecteurs et autres composants critiques). Pour chaque entreprise, recherchez : nom de l'entreprise, sous-secteur, siège / pays ; produits principaux et rôle spécifique dans la chaîne IA ; public ou privé (ticker + bourse si coté ; si privé, indiquer la dernière valorisation / levée de fonds) ; capitalisation boursière ou taille de la valorisation (utilisée pour le classement) ; positionnement et avantage concurrentiel dans l'écosystème (1 à 2 phrases) ; principaux clients / concurrents. Ordre : au sein de chaque sous-secteur, classez du plus grand au plus petit (par capitalisation boursière / valorisation). Structurez l'ensemble de manière descendante : de l'ensemble du paysage de l'écosystème matériel jusqu'à chaque entreprise individuelle. Exigences de sortie : générez d'abord un fichier de données structuré ai_infra_data.json — contenant les 26 entreprises avec les champs ci-dessus, les 6 classifications de sous-secteurs, un indicateur public/privé et une matrice de comparaison croisée entre entreprises (sous-secteur × dimensions clés). Générez ensuite un rapport HTML soigné à partir de ce JSON : incluez un paysage de l'écosystème / diagramme en couches, des sections par secteur, des cartes d'entreprises, un indicateur visuel clair pour public vs privé (étiquettes ou code couleur), un graphique de classement par capitalisation boursière et un tableau de comparaison triable/filtrable. Rendez le design professionnel, dense en informations et interactif. Vérifiez d'abord l'exactitude des données de recherche (statut de cotation, tickers, valorisations — utilisez les chiffres les plus récents et citez les sources), puis générez le rapport. Envoyez la tâche en mode single-agent.

Créer 10 jeux HTML5 du Nouvel An chinois avec Eigent

Créer 10 jeux HTML5 du Nouvel An chinois avec Eigent

Créez 10 jeux distincts et COMPLETS sur des thèmes liés au Nouvel An chinois 2026 (Cheval) en HTML, CSS et JS (sans bibliothèques). Les jeux doivent être amusants, originaux, soignés et adaptés aux mobiles. Incluez un système de score, une difficulté progressive, des boutons de redémarrage et des visuels fluides. Couvrez : arcade, puzzle, endless runner, réaction, stratégie, mémoire, 2 joueurs en local, idle, pixel art rétro et 1 jeu expérimental.

Automate everything with AI workforce on desktop
Download Eigent

Essayez Eigent dès aujourd’hui

Téléchargez l’application de bureau open source. Votre workforce IA, exécutée sur votre machine.

Télécharger Eigent
Eigent

Recevez les dernières mises à jour, tutoriels et versions sur l’automatisation de la workforce IA.

ProduitEigentEnvironnementsTarifsEntreprise
ExplorerSolutionsCas d’usageCompétencesPluginsBlogs
DéveloppeursDocumentationGitHubCAMEL-AIOpen Source FundPartenaire
TéléchargementPour open source
EntrepriseÀ propos de nousMarqueCarrièresConditions d’utilisationPolitique de confidentialitéSécurité et confiancePolitique relative aux cookiesPolitique de remboursement et d’essai

Tous droits réservés © 2026 EIGENT UK LTD

Nouvelle version d’Eigent 1.0 publiée !download