logo
  • Umgebungen
  • Enterprise
  • Preise
DeveloperMay 19, 2026

ML-CI-Fehler mit Gemini 3.5 Flash auf Eigent prüfen

Regina BaiRegina Bai
ML-CI-Fehler mit Gemini 3.5 Flash und dem Gemini Agent auf Eigent prüfen
Automate Everything with
AI Workforce on Desktop
Download Eigent

Root Cause von ML-CI-Fehlern in Minuten mit Gemini 3.5 Flash finden

Das Debugging einer fehlerhaften ML-Trainingspipeline ist langsame, mühsame Arbeit. Sie ziehen Logs aus zwei verschiedenen CI-Läufen, vergleichen sie mit Golden Values, durchforsten den Commit-Verlauf, um die Regression zu finden, und schreiben dann einen Bericht, der erklärt, was schiefgelaufen ist und warum, während Ihr Team wartet. Dieser Anwendungsfall automatisiert die gesamte Untersuchung.

Durch die Kombination der ml-failure-audit-Skill mit Googles Gemini-3.5-Flash-Modell und der Gemini Agent API als Remote-Reasoning-Engine kann Eigents Multi-Agent-Belegschaft einen CI-Fehler End-to-End prüfen: Logs abrufen, Referenzwerte extrahieren, Beweise nachverfolgen, die aufwendige Analyse delegieren und strukturierte Ergebnisse liefern – alles aus einer einzigen Eingabeaufforderung.

1Wählen Sie Gemini 3.5 Flash als Ihr Modell

Gehen Sie zu Einstellungen → Agents → Modell und wählen Sie Gemini 3.5 Flash aus der Cloud-Modellliste. Wenn Sie Ihre eigenen API-Anmeldedaten verwenden möchten, bringen Sie Ihren eigenen Gemini-Schlüssel mit, indem Sie ihn unter Einstellungen → API Keys → Gemini eingeben.

Gemini 3.5 Flash ist für schnelle, kosteneffiziente Inferenz bei Aufgaben mit langem Kontext optimiert – genau das, was die Analyse von CI-Logs erfordert.

2Aktivieren Sie die Gemini Agent API als Remote-Sub-Agent

Gehen Sie zu Einstellungen → Agents → Remote Agents und aktivieren Sie die Gemini Agent API. Dadurch wird der Gemini Agent als aufrufbarer Sub-Agent innerhalb von Eigents Workforce registriert.

Sobald sie aktiviert ist, kann Ihr Developer Agent rechenintensive Reasoning-Aufgaben, wie die Root-Cause-Analyse über Hunderte von Logzeilen hinweg, direkt an den Gemini Agent übergeben, statt alles in einem einzigen Modellaufruf zu verarbeiten. Dadurch erhalten Sie ein zweistufiges Setup: Eigents lokale Agents übernehmen Orchestrierung und Tool-Nutzung, während der Gemini Agent tiefgehendes Reasoning übernimmt.

3Laden Sie die ml-failure-audit Skill hoch

Gehen Sie zu Einstellungen → Agents → Skills und laden Sie das Skill-Paket ml-failure-audit hoch. Sie können auch den Skill Hub: ml-failure-audit durchsuchen, um die Skill-Details und Installationsschritte zu sehen. Die Skill definiert, wie Eigent CI-Fehler-Audits angehen soll: welche Artefakte gesammelt werden, welche Vergleiche auszuführen sind, welche Beweise zu erfassen sind und wie der finale Bericht strukturiert wird.

Sobald sie hochgeladen ist, kann jeder Agent in der Workforce diese Skill bei ML-Audit-Aufgaben aufrufen.

4Senden Sie Ihre Aufgabe an Eigent

Wenn alles konfiguriert ist, geben Sie Ihre Aufgabenanfrage in Eigents Chat ein:

Folgen Sie der {{ml-failure-audit}}-Skill und verwenden Sie einen Remote-Sub-Agenten, um komplexe Teilaufgaben abzuschließen.

Bitte prüfen Sie diesen Megatron-LM MIMO VLM Pretraining-Golden-Metric-CI-Fehler. Ich stelle Ihnen einen lokalen NVIDIA/Megatron-LM-Checkout auf Commit <your-commit-sha> und die angehängten CI-Artefakte zur Verfügung (zum Beispiel Logs von erfolgreichen und fehlgeschlagenen Läufen). Die fehlgeschlagene Workload ist ein 8-GPU Frozen-Start-Convergence-Check mit Sequence Packing, globaler Batch-Size 32, einer gesamten gepackten Sequenzlänge von 3200, Packing Buffer 4 und 100 Trainingsiterationen.

Bitte entscheiden Sie, ob der Fehler eine echte Regression der Modellkonvergenz/Korrektheit oder ein Problem mit der Metrik-/Gating-Policy ist. Verwenden Sie den Golden-Value-Vergleichscode des Repos und die CI-Logs als Beweise. Führen Sie kein GPU-Training erneut aus.

Erstellen Sie answer.json im Repo-Root mit source_refs, extracted_facts, calculations, final_answer und validation. Erstellen Sie außerdem ein prägnantes answer.md.

Fügen Sie die Repository-URL, Ihren Ziel-Commit-Checkout hinzu und hängen Sie die CI-Artefakte an, die verglichen werden sollen. Eigent beginnt sofort mit der Planung der Untersuchung.

Installieren Sie die ml-failure-audit-Skill, bevor Sie diese Eingabeaufforderung ausführen.

Bringen Sie Ihre eigenen Eingaben mit: Ersetzen Sie <your-commit-sha> durch den Commit, der geprüft werden soll, checken Sie diese Revision in Ihrem Workspace aus und hängen Sie Ihre eigenen CI-Artefakte an (zum Beispiel Logs von erfolgreichen vs. fehlgeschlagenen Läufen, stderr-Captures oder exportierte CI-Job-Ausgaben). Sie können das Megatron-LM-Beispiel auf jedes beliebige Repo und jeden Fehler anpassen, den Sie untersuchen.

5Der Coordinator Agent plant und weist die Aufgabe zu

Eigents Coordinator Agent liest die Eingabeaufforderung und zerlegt sie in einen strukturierten Audit-Plan. Er identifiziert die wichtigsten Phasen (Log-Abruf, Datenextraktion, Beweisverfolgung und Berichtserstellung) und weist die vollständige Untersuchung einem Developer Agent zu.

Der Coordinator delegiert nicht einfach blind: Er reicht die Skill-Referenz, den Repo-Kontext und die CI-Log-Artefakte weiter, damit der Developer Agent mit allem beginnt, was er braucht.

6Der Developer Agent lädt die Skill und ruft die Logs ab

Die erste Aktion des Developer Agent ist das Laden der ml-failure-audit-Skill, um ihre Anweisungen zu lesen und die Audit-Methodik zu verstehen.

Dann führt er 4 Befehle parallel aus, um die CI-Log-Daten zu holen und die beiden Fehler-Logs sowie relevante Metadaten gleichzeitig abzurufen. Parallele Tool-Ausführung bedeutet, dass die Datenerfassungsphase in einem Bruchteil der Zeit abgeschlossen wird, die sie sequenziell benötigen würde.

7Golden Values extrahieren und den Fix-Commit nachverfolgen

Mit den Logs in der Hand führt der Developer Agent ein Python-Skript aus, um die Golden-Referenzwerte zu extrahieren: die erwarteten Trainingsmetriken, Loss-Kurven oder Benchmark-Zahlen, die ein erfolgreicher CI-Lauf erzeugen sollte. Anschließend vergleicht er diese mit den in den fehlgeschlagenen Logs aufgezeichneten Werten, um genau zu identifizieren, wo und um wie viel die Abweichung auftrat.

Als Nächstes durchsucht der Developer Agent den Commit-Verlauf von Megatron-LM, um den Fix-Commit zu finden – die spezifische Codeänderung, die am ehesten für die Regression verantwortlich ist. Dieser Commit dient als konkreter Beweis im Audit-Bericht und liefert Prüfern einen direkten Zusammenhang zwischen dem beobachteten Fehler und der zugrunde liegenden Codeänderung.

8Tiefes Reasoning an den Gemini Agent delegieren

Sobald die Rohbeweise zusammengestellt sind (Log-Diffs, Golden-Value-Vergleiche und der nachverfolgte Commit), ruft der Developer Agent den Gemini Agent auf, um den schweren Reasoning-Schritt durchzuführen.

Der Gemini Agent analysiert den vollständigen Kontext: was sich im Code geändert hat, wie sich diese Änderung auf das Trainingsverhalten ausgewirkt hat und was die wahrscheinlichste Root Cause ist. Wenige Minuten später gibt er einen vollständigen, strukturierten Audit-Bericht zurück, der die Fehlerdiagnose, beitragende Faktoren und die empfohlene Behebung abdeckt.

9Der Developer Agent schreibt die finalen Audit-Berichte

Der Developer Agent übernimmt die Analyse des Gemini Agent und schreibt zwei Ergebnisse in den Workspace:

  • answer.json: ein maschinenlesbarer Audit-Datensatz mit strukturierten Feldern für den Fehlertyp, die Root Cause, betroffene Metriken, den Beweis-Commit und die empfohlene Lösung. Nützlich für automatisierte Pipelines, Ticket-Systeme oder CI-Dashboards.

  • answer.md: eine prägnante, menschenlesbare Audit-Zusammenfassung darüber, was fehlgeschlagen ist, warum es fehlgeschlagen ist, welche Beweise vorliegen und was als Nächstes zu tun ist. Bereit zum Einfügen in einen PR-Kommentar, einen Slack-Thread oder einen Incident-Bericht.

Beide Dateien werden direkt in den Workspace-Ordner geschrieben und sind sofort zugänglich.

10Warum dieser Workflow wichtig ist

ML-CI-Fehler sind notorisch schwer zu debuggen, weil das Signal in dichtem Log-Output verborgen ist und die Root Cause oft mehrere Commits vor dem Symptom liegt. Dieser Workflow begegnet dem mit drei Fähigkeiten, die zusammenwirken:

  • Parallele Log-Abrufe beseitigen den sequentiellen Engpass, Artefakte nacheinander zu holen.
  • Python-basierte Golden-Value-Extraktion wendet einen präzisen numerischen Vergleich an, statt sich auf Pattern Matching oder manuelle Inspektion zu verlassen.
  • Gemini Agent als Reasoning-Sub-Agent lagert den komplexesten Inferenzschritt an ein dafür optimiertes Modell aus und hält Orchestrierung leichtgewichtig und Analyse tiefgehend.

Das Ergebnis ist ein Root-Cause-Audit, das für eine Ingenieurin oder einen Ingenieur 30–60 Minuten konzentrierter Arbeit erfordern würde, aber in wenigen Minuten mit einem strukturierten Artefaktpfad geliefert wird.

11Was Sie als Nächstes ausprobieren können

Sobald Ihr erstes Audit abgeschlossen ist, erweitern Sie den Workflow mit Folgeeingaben wie:

Führen Sie denselben Audit gegen die drei jüngsten CI-Fehler aus und vergleichen Sie die Root Causes.

Öffnen Sie nach dem Finden des Fix-Commits ein GitHub-Issue mit dem vorbefüllten Audit-Bericht.

Planen Sie einen nächtlichen Trigger, um neue CI-Fehler zu prüfen und answer.md in Slack zu posten.

Tauschen Sie ein anderes Modell ein, probieren Sie Gemini 3.5 Pro für tiefere Analyse oder Gemini Flash Lite für schnellere Durchlaufzeiten.

12Tipps für bessere Ergebnisse

  • Hängen Sie Ihre CI-Artefakte explizit an. Die ml-failure-audit-Skill funktioniert am besten, wenn Sie den Commit-Checkout plus die Logs oder Exporte bereitstellen, die verglichen werden sollen (zum Beispiel ein erfolgreicher Lauf und ein fehlgeschlagener Lauf).
  • Fügen Sie die Repo-URL hinzu. Der Developer Agent verwendet sie, um den Commit-Verlauf nach dem Fix-Commit zu durchsuchen. Ein direkter Link zum Repository spart einen Suchschritt.
  • Geben Sie Ihre Ausgabedateien an. Wenn Sie sowohl answer.json als auch answer.md anfordern, weist das den Developer Agent an, beide Formate zu erzeugen – nützlich, wenn Sie maschinenlesbare Ausgaben für eine CI-Pipeline und menschenlesbare Ausgaben für Ihr Team benötigen.
  • Verwenden Sie den Gemini Agent für Reasoning-intensive Aufgaben. Das Remote-Sub-Agent-Muster funktioniert am besten, wenn lokale Agents die Datenerfassung übernehmen und der Gemini Agent die Synthese. Vermeiden Sie ihn für einfache Nachschlagen, die lokale Tool-Nutzung schneller erledigen kann.

Other use cases

Automatisierte Umsatzsteuervoranmeldung aus Belegen und Rechnungen

Automatisierte Umsatzsteuervoranmeldung aus Belegen und Rechnungen

Bitte verarbeiten Sie alle Belege und Rechnungen im Ordner "VAT", einschließlich Fotos, gescannter PDFs und digitaler Rechnungen. Die finale Ausgabe soll nur zwei Dateien enthalten: (1) vat_return.xlsx — die Excel-Datei soll eine Zeile pro Beleg oder Rechnung enthalten, alle extrahierten Felder auflisten, anzeigen, ob jeder Eintrag für den Vorsteuerabzug berechtigt ist, den abziehbaren Vorsteuerbetrag für jeden berechtigten Eintrag anzeigen, den Ausschlussgrund für nicht abziehbare Einträge enthalten, Einträge, die manuell geprüft werden müssen, deutlich markieren und ein Zusammenfassungsblatt mit dem gesamten abziehbaren Vorsteuerbetrag enthalten. (2) vat_return.html — erstellen Sie eine eigenständige HTML-Datei, die direkt geöffnet und mit dem Buchhaltungsteam geteilt werden kann. Die HTML-Datei soll alle Vorsteuerabzugspositionen, den abziehbaren Vorsteuerbetrag für jeden Eintrag, ausgeschlossene Einträge und die Gründe für den Ausschluss, Einträge mit erforderlicher manueller Prüfung sowie den gesamten abziehbaren Vorsteuerbetrag anzeigen. Raten Sie bei unsicheren Informationen nicht.

Langfristige Aufgabe: GLM-5.1 vs. GLM-5.2 auf Eigent

Langfristige Aufgabe: GLM-5.1 vs. GLM-5.2 auf Eigent

Führe eine tiefgehende Recherche zu 26 Unternehmen im KI-Infrastruktur-Ökosystem durch — dem sichersten zentralen Strang der gesamten KI-Wertschöpfungskette. Decke diese 6 Teilsektoren ab (wähle in jedem repräsentative Unternehmen aus, von Large-Cap-Führern bis zu kleineren Playern): KI-Rechenzentrum (Compute-Infrastruktur / Ausbau); GPU / KI-Chips (Training- & Inference-Silizium, ASICs, IP); Server, Netzwerke & optische Module (Switches, NICs, optische Verbindungen); Stromversorgung, Flüssigkeitskühlung & Energiespeicherung (Stromversorgung, Thermik, Energiemanagement); KI-Cloud / Compute-Plattform (Hyperscaler, GPU-Clouds, Compute-Rental-Plattformen); Unterstützendes Ökosystem (HBM / Advanced Packaging, Foundry, Steckverbinder und andere kritische Komponenten). Recherchiere für jedes Unternehmen: Unternehmensname, Teilsektor, Hauptsitz / Land; Kernprodukte und seine spezifische Rolle in der KI-Kette; börsennotiert oder privat (Ticker + Börse, falls gelistet; falls privat, nenne die neueste Bewertung / Finanzierungsrunde); Marktkapitalisierung oder Bewertungsgröße (für das Ranking); Positionierung und Burggraben im Ökosystem (1–2 Sätze); wichtige Kunden / Wettbewerber. Reihenfolge: Innerhalb jedes Teilsektors von groß nach klein ranken (nach Marktkapitalisierung / Bewertung). Strukturiere alles von oben nach unten: von der gesamten Hardware-Ökosystem-Landschaft bis hin zu jedem einzelnen Unternehmen. Ausgabeanforderungen: Erstelle zuerst eine strukturierte Datendatei ai_infra_data.json — mit allen 26 Unternehmen samt den oben genannten Feldern, den 6 Teilsektor-Klassifizierungen, einem Public/Private-Flag und einer übergreifenden Vergleichsmatrix (Teilsektor × Schlüsseldimensionen). Erstelle dann aus diesen JSON-Daten einen ausgefeilten HTML-Bericht: inklusive Ökosystem-Landschafts-/Schichtdiagramm, Sektorsektionen, Unternehmenskarten, einer klaren visuellen Kennzeichnung für börsennotiert vs. privat (Tags oder Farbcodierung), eines Charts zur Marktkapitalisierungs-Rangfolge und einer sortier-/filterbaren Vergleichstabelle. Gestalte das Design professionell, informationsdicht und interaktiv. Verifiziere die Forschungsdaten zuerst auf Korrektheit (Listing-Status, Ticker, Bewertungen — nutze die neuesten Zahlen und zitiere Quellen), und erstelle dann den Bericht. Sende die Aufgabe im Single-Agent-Modus.

10 chinesische Neujahrs-HTML5-Spiele mit Eigent erstellen

10 chinesische Neujahrs-HTML5-Spiele mit Eigent erstellen

Erstellen Sie 10 separate und VOLLSTÄNDIGE Spiele mit Themen rund um das chinesische Neujahr 2026 (Pferd) in HTML, CSS und JS (keine Bibliotheken). Die Spiele müssen unterhaltsam, originell, ausgefeilt und mobilfreundlich sein. Enthalten sein sollen Punktesysteme, steigender Schwierigkeitsgrad, Neustart-Schaltflächen und flüssige Grafiken. Abgedeckt werden sollen: Arcade, Puzzle, Endless Runner, Reaktion, Strategie, Memory, lokaler 2-Spieler-Modus, Idle, Retro-Pixel und 1 experimentelles Spiel.

Automate everything with AI workforce on desktop
Download Eigent

Teste Eigent noch heute

Lade die Open-Source-Desktop-App herunter. Deine KI-Belegschaft, die auf deinem Rechner läuft.

Eigent herunterladen
Eigent

Erhalte die neuesten Updates, Tutorials und Releases rund um die Automatisierung von KI-Belegschaften.

ProduktEigentUmgebungenPreiseUnternehmen
EntdeckenLösungenAnwendungsfälleFähigkeitenPluginsBlogs
EntwicklerDokuGitHubCAMEL-AIOpen Source FundPartner
HerunterladenFür Open Source
UnternehmenÜber unsMarkeKarriereNutzungsbedingungenDatenschutzerklärungSicherheit & VertrauenCookie-RichtlinieRückerstattungs- & Testrichtlinie

Alle Rechte vorbehalten © 2026 EIGENT UK LTD

Eigent 1.0 Neue Version veröffentlicht !download