Root Cause von ML-CI-Fehlern in Minuten mit Gemini 3.5 Flash finden
Das Debugging einer fehlerhaften ML-Trainingspipeline ist langsame, mühsame Arbeit. Sie ziehen Logs aus zwei verschiedenen CI-Läufen, vergleichen sie mit Golden Values, durchforsten den Commit-Verlauf, um die Regression zu finden, und schreiben dann einen Bericht, der erklärt, was schiefgelaufen ist und warum, während Ihr Team wartet. Dieser Anwendungsfall automatisiert die gesamte Untersuchung.
Durch die Kombination der ml-failure-audit-Skill mit Googles Gemini-3.5-Flash-Modell und der Gemini Agent API als Remote-Reasoning-Engine kann Eigents Multi-Agent-Belegschaft einen CI-Fehler End-to-End prüfen: Logs abrufen, Referenzwerte extrahieren, Beweise nachverfolgen, die aufwendige Analyse delegieren und strukturierte Ergebnisse liefern – alles aus einer einzigen Eingabeaufforderung.
Wählen Sie Gemini 3.5 Flash als Ihr Modell
Gehen Sie zu Einstellungen → Agents → Modell und wählen Sie Gemini 3.5 Flash aus der Cloud-Modellliste. Wenn Sie Ihre eigenen API-Anmeldedaten verwenden möchten, bringen Sie Ihren eigenen Gemini-Schlüssel mit, indem Sie ihn unter Einstellungen → API Keys → Gemini eingeben.
Gemini 3.5 Flash ist für schnelle, kosteneffiziente Inferenz bei Aufgaben mit langem Kontext optimiert – genau das, was die Analyse von CI-Logs erfordert.
Aktivieren Sie die Gemini Agent API als Remote-Sub-Agent
Gehen Sie zu Einstellungen → Agents → Remote Agents und aktivieren Sie die Gemini Agent API. Dadurch wird der Gemini Agent als aufrufbarer Sub-Agent innerhalb von Eigents Workforce registriert.
Sobald sie aktiviert ist, kann Ihr Developer Agent rechenintensive Reasoning-Aufgaben, wie die Root-Cause-Analyse über Hunderte von Logzeilen hinweg, direkt an den Gemini Agent übergeben, statt alles in einem einzigen Modellaufruf zu verarbeiten. Dadurch erhalten Sie ein zweistufiges Setup: Eigents lokale Agents übernehmen Orchestrierung und Tool-Nutzung, während der Gemini Agent tiefgehendes Reasoning übernimmt.
Laden Sie die ml-failure-audit Skill hoch
Gehen Sie zu Einstellungen → Agents → Skills und laden Sie das Skill-Paket ml-failure-audit hoch. Sie können auch den Skill Hub: ml-failure-audit durchsuchen, um die Skill-Details und Installationsschritte zu sehen. Die Skill definiert, wie Eigent CI-Fehler-Audits angehen soll: welche Artefakte gesammelt werden, welche Vergleiche auszuführen sind, welche Beweise zu erfassen sind und wie der finale Bericht strukturiert wird.
Sobald sie hochgeladen ist, kann jeder Agent in der Workforce diese Skill bei ML-Audit-Aufgaben aufrufen.
Senden Sie Ihre Aufgabe an Eigent
Wenn alles konfiguriert ist, geben Sie Ihre Aufgabenanfrage in Eigents Chat ein:
Folgen Sie der {{ml-failure-audit}}-Skill und verwenden Sie einen Remote-Sub-Agenten, um komplexe Teilaufgaben abzuschließen.
Bitte prüfen Sie diesen Megatron-LM MIMO VLM Pretraining-Golden-Metric-CI-Fehler. Ich stelle Ihnen einen lokalen NVIDIA/Megatron-LM-Checkout auf Commit <your-commit-sha> und die angehängten CI-Artefakte zur Verfügung (zum Beispiel Logs von erfolgreichen und fehlgeschlagenen Läufen). Die fehlgeschlagene Workload ist ein 8-GPU Frozen-Start-Convergence-Check mit Sequence Packing, globaler Batch-Size 32, einer gesamten gepackten Sequenzlänge von 3200, Packing Buffer 4 und 100 Trainingsiterationen.
Bitte entscheiden Sie, ob der Fehler eine echte Regression der Modellkonvergenz/Korrektheit oder ein Problem mit der Metrik-/Gating-Policy ist. Verwenden Sie den Golden-Value-Vergleichscode des Repos und die CI-Logs als Beweise. Führen Sie kein GPU-Training erneut aus.
Erstellen Sie answer.json im Repo-Root mit source_refs, extracted_facts, calculations, final_answer und validation. Erstellen Sie außerdem ein prägnantes answer.md.
Fügen Sie die Repository-URL, Ihren Ziel-Commit-Checkout hinzu und hängen Sie die CI-Artefakte an, die verglichen werden sollen. Eigent beginnt sofort mit der Planung der Untersuchung.
Installieren Sie die ml-failure-audit-Skill, bevor Sie diese Eingabeaufforderung ausführen.
Bringen Sie Ihre eigenen Eingaben mit: Ersetzen Sie <your-commit-sha> durch den Commit, der geprüft werden soll, checken Sie diese Revision in Ihrem Workspace aus und hängen Sie Ihre eigenen CI-Artefakte an (zum Beispiel Logs von erfolgreichen vs. fehlgeschlagenen Läufen, stderr-Captures oder exportierte CI-Job-Ausgaben). Sie können das Megatron-LM-Beispiel auf jedes beliebige Repo und jeden Fehler anpassen, den Sie untersuchen.
Der Coordinator Agent plant und weist die Aufgabe zu
Eigents Coordinator Agent liest die Eingabeaufforderung und zerlegt sie in einen strukturierten Audit-Plan. Er identifiziert die wichtigsten Phasen (Log-Abruf, Datenextraktion, Beweisverfolgung und Berichtserstellung) und weist die vollständige Untersuchung einem Developer Agent zu.
Der Coordinator delegiert nicht einfach blind: Er reicht die Skill-Referenz, den Repo-Kontext und die CI-Log-Artefakte weiter, damit der Developer Agent mit allem beginnt, was er braucht.
Der Developer Agent lädt die Skill und ruft die Logs ab
Die erste Aktion des Developer Agent ist das Laden der ml-failure-audit-Skill, um ihre Anweisungen zu lesen und die Audit-Methodik zu verstehen.
Dann führt er 4 Befehle parallel aus, um die CI-Log-Daten zu holen und die beiden Fehler-Logs sowie relevante Metadaten gleichzeitig abzurufen. Parallele Tool-Ausführung bedeutet, dass die Datenerfassungsphase in einem Bruchteil der Zeit abgeschlossen wird, die sie sequenziell benötigen würde.
Golden Values extrahieren und den Fix-Commit nachverfolgen
Mit den Logs in der Hand führt der Developer Agent ein Python-Skript aus, um die Golden-Referenzwerte zu extrahieren: die erwarteten Trainingsmetriken, Loss-Kurven oder Benchmark-Zahlen, die ein erfolgreicher CI-Lauf erzeugen sollte. Anschließend vergleicht er diese mit den in den fehlgeschlagenen Logs aufgezeichneten Werten, um genau zu identifizieren, wo und um wie viel die Abweichung auftrat.
Als Nächstes durchsucht der Developer Agent den Commit-Verlauf von Megatron-LM, um den Fix-Commit zu finden – die spezifische Codeänderung, die am ehesten für die Regression verantwortlich ist. Dieser Commit dient als konkreter Beweis im Audit-Bericht und liefert Prüfern einen direkten Zusammenhang zwischen dem beobachteten Fehler und der zugrunde liegenden Codeänderung.
Tiefes Reasoning an den Gemini Agent delegieren
Sobald die Rohbeweise zusammengestellt sind (Log-Diffs, Golden-Value-Vergleiche und der nachverfolgte Commit), ruft der Developer Agent den Gemini Agent auf, um den schweren Reasoning-Schritt durchzuführen.
Der Gemini Agent analysiert den vollständigen Kontext: was sich im Code geändert hat, wie sich diese Änderung auf das Trainingsverhalten ausgewirkt hat und was die wahrscheinlichste Root Cause ist. Wenige Minuten später gibt er einen vollständigen, strukturierten Audit-Bericht zurück, der die Fehlerdiagnose, beitragende Faktoren und die empfohlene Behebung abdeckt.
Der Developer Agent schreibt die finalen Audit-Berichte
Der Developer Agent übernimmt die Analyse des Gemini Agent und schreibt zwei Ergebnisse in den Workspace:
-
answer.json: ein maschinenlesbarer Audit-Datensatz mit strukturierten Feldern für den Fehlertyp, die Root Cause, betroffene Metriken, den Beweis-Commit und die empfohlene Lösung. Nützlich für automatisierte Pipelines, Ticket-Systeme oder CI-Dashboards. -
answer.md: eine prägnante, menschenlesbare Audit-Zusammenfassung darüber, was fehlgeschlagen ist, warum es fehlgeschlagen ist, welche Beweise vorliegen und was als Nächstes zu tun ist. Bereit zum Einfügen in einen PR-Kommentar, einen Slack-Thread oder einen Incident-Bericht.
Beide Dateien werden direkt in den Workspace-Ordner geschrieben und sind sofort zugänglich.
Warum dieser Workflow wichtig ist
ML-CI-Fehler sind notorisch schwer zu debuggen, weil das Signal in dichtem Log-Output verborgen ist und die Root Cause oft mehrere Commits vor dem Symptom liegt. Dieser Workflow begegnet dem mit drei Fähigkeiten, die zusammenwirken:
- Parallele Log-Abrufe beseitigen den sequentiellen Engpass, Artefakte nacheinander zu holen.
- Python-basierte Golden-Value-Extraktion wendet einen präzisen numerischen Vergleich an, statt sich auf Pattern Matching oder manuelle Inspektion zu verlassen.
- Gemini Agent als Reasoning-Sub-Agent lagert den komplexesten Inferenzschritt an ein dafür optimiertes Modell aus und hält Orchestrierung leichtgewichtig und Analyse tiefgehend.
Das Ergebnis ist ein Root-Cause-Audit, das für eine Ingenieurin oder einen Ingenieur 30–60 Minuten konzentrierter Arbeit erfordern würde, aber in wenigen Minuten mit einem strukturierten Artefaktpfad geliefert wird.
Was Sie als Nächstes ausprobieren können
Sobald Ihr erstes Audit abgeschlossen ist, erweitern Sie den Workflow mit Folgeeingaben wie:
Führen Sie denselben Audit gegen die drei jüngsten CI-Fehler aus und vergleichen Sie die Root Causes.
Öffnen Sie nach dem Finden des Fix-Commits ein GitHub-Issue mit dem vorbefüllten Audit-Bericht.
Planen Sie einen nächtlichen Trigger, um neue CI-Fehler zu prüfen und answer.md in Slack zu posten.
Tauschen Sie ein anderes Modell ein, probieren Sie Gemini 3.5 Pro für tiefere Analyse oder Gemini Flash Lite für schnellere Durchlaufzeiten.
Tipps für bessere Ergebnisse
- Hängen Sie Ihre CI-Artefakte explizit an. Die ml-failure-audit-Skill funktioniert am besten, wenn Sie den Commit-Checkout plus die Logs oder Exporte bereitstellen, die verglichen werden sollen (zum Beispiel ein erfolgreicher Lauf und ein fehlgeschlagener Lauf).
- Fügen Sie die Repo-URL hinzu. Der Developer Agent verwendet sie, um den Commit-Verlauf nach dem Fix-Commit zu durchsuchen. Ein direkter Link zum Repository spart einen Suchschritt.
- Geben Sie Ihre Ausgabedateien an. Wenn Sie sowohl
answer.jsonals auchanswer.mdanfordern, weist das den Developer Agent an, beide Formate zu erzeugen – nützlich, wenn Sie maschinenlesbare Ausgaben für eine CI-Pipeline und menschenlesbare Ausgaben für Ihr Team benötigen. - Verwenden Sie den Gemini Agent für Reasoning-intensive Aufgaben. Das Remote-Sub-Agent-Muster funktioniert am besten, wenn lokale Agents die Datenerfassung übernehmen und der Gemini Agent die Synthese. Vermeiden Sie ihn für einfache Nachschlagen, die lokale Tool-Nutzung schneller erledigen kann.



