logo
  • Środowiska
  • Dla firm
  • Cennik
DeveloperMay 19, 2026

Audyt awarii ML CI z Gemini 3.5 Flash w Eigent

Regina BaiRegina Bai
Audyt awarii ML CI z Gemini 3.5 Flash i agentem Gemini w Eigent
Automate Everything with
AI Workforce on Desktop
Download Eigent

Znajdź przyczynę źródłową awarii ML CI w kilka minut z Gemini 3.5 Flash

Debugowanie uszkodzonego pipeline’u treningu ML to powolna, żmudna praca. Pobierasz logi z dwóch różnych uruchomień CI, porównujesz je z wartościami golden, przeszukujesz historię commitów, aby znaleźć regresję, a potem piszesz raport wyjaśniający, co poszło nie tak i dlaczego, podczas gdy Twój zespół czeka. Ten przypadek użycia automatyzuje całe to dochodzenie.

Łącząc umiejętność ml-failure-audit z modelem Gemini 3.5 Flash od Google oraz Gemini Agent API jako zdalnym silnikiem rozumowania, wieloagentowa siła robocza Eigent może przeprowadzić audyt awarii CI od początku do końca: pobierając logi, wyodrębniając wartości referencyjne, śledząc dowody, delegując ciężką analizę i generując ustrukturyzowane rezultaty — wszystko z jednego promptu.

1Wybierz Gemini 3.5 Flash jako model

Przejdź do Settings → Agents → Model i wybierz Gemini 3.5 Flash z listy modeli w chmurze. Jeśli wolisz używać własnych danych uwierzytelniających API, dodaj własny klucz Gemini, wpisując go w Settings → API Keys → Gemini.

Gemini 3.5 Flash jest zoptymalizowany pod kątem szybkiej, ekonomicznej inferencji (wnioskowania) w zadaniach z długim kontekstem — dokładnie tego, czego wymaga analiza logów CI.

2Włącz Gemini Agent API jako zdalnego subagenta

Przejdź do Settings → Agents → Remote Agents i włącz Gemini Agent API. To rejestruje agenta Gemini jako wywoływalnego subagenta wewnątrz siły roboczej Eigent.

Po włączeniu Twój Agent Developer może przekazywać zadania obliczeniowo intensywnego rozumowania, takie jak analiza przyczyny źródłowej w setkach linii logów, bezpośrednio do agenta Gemini, zamiast przetwarzać wszystko w jednym wywołaniu modelu. Daje to dwupoziomową konfigurację: lokalne agenty Eigent obsługują orkiestrację i użycie narzędzi, a agent Gemini zajmuje się głębokim rozumowaniem.

3Prześlij umiejętność ml-failure-audit

Przejdź do Settings → Agents → Skills i prześlij pakiet umiejętności ml-failure-audit. Możesz też przeglądać Skill Hub: ml-failure-audit, aby zobaczyć szczegóły umiejętności i kroki instalacji. Umiejętność definiuje, jak Eigent powinien podejść do audytów awarii CI: jakie artefakty zebrać, jakie porównania uruchomić, jakie dowody zgromadzić i jak ustrukturyzować końcowy raport.

Po przesłaniu dowolny agent w siłach roboczych może wywołać tę umiejętność podczas obsługi zadań audytu ML.

4Przekaż swoje zadanie do Eigent

Gdy wszystko jest skonfigurowane, wpisz prompt zadania do czatu Eigent:

Follow the {{ml-failure-audit}} skill, and use remote sub agent to finish complex subtasks.

Please audit this Megatron-LM MIMO VLM pretraining golden metric CI failure. I am giving you a local NVIDIA/Megatron-LM checkout at commit <your-commit-sha> and the CI artifacts I attached (for example, passing and failing run logs). The failing workload is an 8-GPU frozen start convergence check using sequence packing, global batch size 32, total packed sequence length 3200, packing buffer 4, and 100 training iterations.

Please decide whether the failure is a real model convergence/correctness regression or a metric/gating policy issue. Use the repo's golden value comparison code and the CI logs as evidence. Do not rerun GPU training.

Produce answer.json in the repo root with source_refs, extracted_facts, calculations, final_answer, and validation. Also produce a concise answer.md.

Include the repository URL, your target commit checkout, and attach the CI artifacts you want compared. Eigent immediately begins planning the investigation.

Zainstaluj ml-failure-audit przed uruchomieniem tego promptu.

Własne dane wejściowe: zastąp <your-commit-sha> commitem, który chcesz zaudytować, przełącz się na tę rewizję w swoim workspace i dołącz własne artefakty CI (na przykład logi z udanego i nieudanego uruchomienia, zrzuty stderr lub wyeksportowany output zadania CI). Możesz dostosować przykład Megatron-LM do dowolnego repozytorium i awarii, którą analizujesz.

5Agent Koordynator planuje i przydziela zadanie

Agent Koordynator w Eigent odczytuje prompt i rozbija go na ustrukturyzowany plan audytu. Identyfikuje kluczowe fazy (pobieranie logów, ekstrakcję danych, śledzenie dowodów i generowanie raportu) i przydziela całe dochodzenie Agentowi Developer.

Koordynator nie deleguje po prostu w ciemno: przekazuje referencję do umiejętności, kontekst repozytorium i artefakty logów CI, aby Agent Developer startował ze wszystkim, czego potrzebuje.

6Agent Developer ładuje umiejętność i pobiera logi

Pierwszą czynnością Agenta Developera jest załadowanie umiejętności ml-failure-audit, aby odczytać jej instrukcje i zrozumieć metodologię audytu.

Następnie uruchamia 4 polecenia równolegle, aby pobrać dane logów CI, równocześnie pobierając dwa logi awarii i wszelkie istotne metadane. Równoległe wykonywanie narzędzi sprawia, że faza zbierania danych kończy się w ułamku czasu potrzebnego przy sekwencyjnym podejściu.

7Wyodrębnij wartości golden i prześledź commit z poprawką

Mając logi, Agent Developer uruchamia skrypt Pythona, aby wyodrębnić referencyjne wartości golden: oczekiwane metryki treningowe, krzywe loss lub liczby benchmarkowe, które powinno wygenerować udane uruchomienie CI. Następnie porównuje je z wartościami zapisanymi w logach nieudanego uruchomienia, aby dokładnie ustalić, gdzie i o ile nastąpiło odchylenie.

Następnie Agent Developer przeszukuje historię commitów Megatron-LM, aby znaleźć commit z poprawką, czyli konkretną zmianę kodu, która najprawdopodobniej odpowiada za regresję. Ten commit służy jako konkret dowodowy w raporcie audytu, dając recenzentom bezpośredni związek między zaobserwowaną awarią a leżącą u jej podstaw zmianą kodu.

8Deleguj głębokie rozumowanie do agenta Gemini

Gdy surowe dowody zostaną zebrane (diffy logów, porównania wartości golden i prześledzony commit), Agent Developer wywołuje agenta Gemini, aby wykonał ciężki etap rozumowania.

Agent Gemini analizuje pełny kontekst: co zmieniło się w kodzie, jak ta zmiana wpłynęła na zachowanie treningu i jaka jest najbardziej prawdopodobna przyczyna źródłowa. Kilka minut później zwraca kompletny, ustrukturyzowany raport audytu obejmujący diagnozę awarii, czynniki przyczyniające się do problemu oraz zalecane rozwiązanie.

9Agent Developer zapisuje końcowe raporty audytu

Agent Developer bierze analizę agenta Gemini i zapisuje dwa rezultaty do workspace:

  • answer.json: czytelny maszynowo rekord audytu z ustrukturyzowanymi polami dla typu awarii, przyczyny źródłowej, dotkniętych metryk, commitu z dowodem i zalecanego rozwiązania. Przydatne dla zautomatyzowanych pipeline’ów, systemów ticketowych lub dashboardów CI.

  • answer.md: zwięzłe, czytelne dla człowieka podsumowanie audytu obejmujące to, co zawiodło, dlaczego zawiodło, jakie są dowody i co zrobić dalej. Gotowe do wklejenia do komentarza PR, wątku Slack lub raportu incydentu.

Oba pliki są zapisywane bezpośrednio w folderze workspace i są natychmiast dostępne.

10Dlaczego ten workflow ma znaczenie

Awaryjne przypadki ML CI są notorycznie trudne do debugowania, ponieważ sygnał jest ukryty w gęstym outputcie logów, a przyczyna źródłowa często znajduje się kilka commitów wcześniej niż symptom. Ten workflow rozwiązuje to trzema działającymi razem możliwościami:

  • Równoległe pobieranie logów eliminuje sekwencyjne wąskie gardło polegające na pobieraniu artefaktów po jednym.
  • Ekstrakcja wartości golden oparta na Pythonie stosuje precyzyjne porównanie numeryczne zamiast polegać na dopasowywaniu wzorców lub ręcznej inspekcji.
  • Gemini Agent jako subagent rozumowania odciąża najbardziej złożony etap inferencji do modelu zoptymalizowanego pod ten cel, utrzymując orkiestrację lekką, a analizę głęboką.

Rezultatem jest audyt przyczyny źródłowej, który zająłby inżynierowi 30–60 minut skoncentrowanej pracy, dostarczony w kilka minut, z ustrukturyzowanym śladem artefaktów.

11Co wypróbować dalej

Gdy Twój pierwszy audyt będzie gotowy, rozszerz workflow o kolejne prompty, takie jak:

Uruchom ten sam audyt dla trzech najnowszych awarii CI i porównaj przyczyny źródłowe.

Po znalezieniu commitu z poprawką otwórz problem w GitHubie z wstępnie uzupełnionym raportem audytu.

Zaplanuj nocny trigger do audytu wszystkich nowych awarii CI i opublikuj answer.md w Slacku.

Zamień model na inny, wypróbuj Gemini 3.5 Pro dla głębszej analizy albo Gemini Flash Lite dla szybszego czasu realizacji.

12Wskazówki dla lepszych wyników

  • Dołącz swoje artefakty CI wprost. Umiejętność ml-failure-audit działa najlepiej, gdy podasz checkout commitu wraz z logami lub eksportami, które chcesz porównać (na przykład udane uruchomienie i nieudane uruchomienie).
  • Uwzględnij URL repozytorium. Agent Developer używa go do przeszukania historii commitów w poszukiwaniu commitu z poprawką. Bezpośredni link do repozytorium oszczędza krok wyszukiwania.
  • Określ pliki wyjściowe. Poproszenie o zarówno answer.json, jak i answer.md mówi Agentowi Developerowi, aby wygenerował oba formaty, co jest przydatne, jeśli potrzebujesz wyniku czytelnego maszynowo dla pipeline’u CI i wyniku czytelnego dla ludzi dla Twojego zespołu.
  • Używaj agenta Gemini do zadań wymagających głębokiego rozumowania. Wzorzec zdalnego subagenta działa najlepiej, gdy lokalne agenty zajmują się zbieraniem danych, a agent Gemini syntezą. Unikaj wywoływania go do prostych wyszukiwań, które lokalne narzędzia mogą obsłużyć szybciej.

Other use cases

Zautomatyzowane rozliczenie VAT z paragonów i faktur

Zautomatyzowane rozliczenie VAT z paragonów i faktur

Przetwórz wszystkie paragony i faktury w folderze „VAT”, w tym zdjęcia, skanowane pliki PDF i cyfrowe faktury. Wynik końcowy powinien zawierać tylko dwa pliki: (1) vat_return.xlsx — plik Excela powinien zawierać jeden wiersz na każdy paragon lub fakturę, listę wszystkich wyodrębnionych pól, informację, czy każda pozycja kwalifikuje się do odzyskania VAT, kwotę VAT do odzyskania dla każdej kwalifikującej się pozycji, powód wykluczenia dla pozycji niepodlegających odzyskaniu, wyraźne oznaczenie pozycji wymagających ręcznej weryfikacji oraz arkusz podsumowania pokazujący łączną kwotę VAT do odzyskania. (2) vat_return.html — utwórz samodzielny plik HTML, który można otworzyć bezpośrednio i udostępnić zespołowi księgowemu. Plik HTML powinien pokazywać wszystkie pozycje odzysku VAT, kwotę VAT do odzyskania dla każdej pozycji, pozycje wykluczone i powody wykluczenia, pozycje wymagające ręcznej weryfikacji oraz łączną kwotę VAT do odzyskania. Nie zgaduj żadnych niepewnych informacji.

Długohoryzontowe zadanie: GLM-5.1 vs GLM-5.2 w Eigent

Długohoryzontowe zadanie: GLM-5.1 vs GLM-5.2 w Eigent

Przeprowadź dogłębne badanie 26 firm z ekosystemu infrastruktury AI — najbardziej pewnego głównego nurtu całego łańcucha wartości AI. Obejmij te 6 podsektorów (wybierz reprezentatywne firmy w każdym z nich, od liderów o dużej kapitalizacji po mniejszych graczy): Centrum danych AI (infrastruktura obliczeniowa / rozbudowa); GPU / chipy AI (silicon do treningu i inferencji, ASIC, IP); Serwery, sieci i moduły optyczne (switches, NIC, połączenia optyczne); Zasilanie, chłodzenie cieczą i magazynowanie energii (zasilanie, termika, zarządzanie energią); Chmura AI / platforma obliczeniowa (hyperscalers, chmury GPU, platformy wynajmu mocy obliczeniowej); Ekosystem wspierający (HBM / zaawansowane pakowanie, foundry, złącza i inne krytyczne komponenty). Dla każdej firmy zbadaj: nazwę firmy, podsektor, siedzibę / kraj; kluczowe produkty i jej konkretną rolę w łańcuchu AI; publiczna czy prywatna (ticker + giełda, jeśli notowana; jeśli prywatna, podaj najnowszą wycenę / rundę finansowania); kapitalizację rynkową lub wycenę (do rankingu); pozycjonowanie i przewagę konkurencyjną w ekosystemie (1–2 zdania); kluczowych klientów / konkurentów. Kolejność: w obrębie każdego podsektora uporządkuj od największej do najmniejszej (według kapitalizacji rynkowej / wyceny). Zbuduj całość od góry do dołu: od pełnego krajobrazu ekosystemu sprzętowego do każdej pojedynczej firmy. Wymagania wyjściowe: najpierw wygeneruj uporządkowany plik danych ai_infra_data.json — zawierający wszystkie 26 firm z powyższymi polami, 6 klasyfikacji podsektorów, flagę publiczna/prywatna oraz macierz porównawczą między firmami (podsektor × kluczowe wymiary). Następnie wygeneruj dopracowany raport HTML na podstawie tego JSON-a: uwzględnij diagram krajobrazu ekosystemu / warstwowy, sekcje sektorowe, karty firm, czytelny wizualny wskaźnik firm publicznych i prywatnych (tagi lub kodowanie kolorami), wykres rankingu kapitalizacji rynkowej oraz sortowalną/filtrowalną tabelę porównawczą. Zaprojektuj całość profesjonalnie, gęsto informacyjnie i interaktywnie. Najpierw zweryfikuj dokładność danych badawczych (status notowań, tickery, wyceny — użyj najnowszych wartości i cytuj źródła), a dopiero potem wygeneruj raport. Przekaż zadanie w trybie pojedynczego agenta.

Zbuduj 10 gier HTML5 na Chiński Nowy Rok z Eigent

Zbuduj 10 gier HTML5 na Chiński Nowy Rok z Eigent

Zbuduj 10 oddzielnych i KOMPLETNYCH gier o tematyce związanej z Chińskim Nowym Rokiem 2026 (Koń) w HTML, CSS i JS (bez bibliotek). Gry muszą być zabawne, oryginalne, dopracowane i przyjazne dla urządzeń mobilnych. Uwzględnij system punktacji, rosnący poziom trudności, przyciski restartu i płynne efekty wizualne. Obejmij: arcade, puzzle, endless runner, reakcję, strategię, pamięć, lokalny tryb 2-osobowy, idle, retro pixel oraz 1 grę eksperymentalną.

Automate everything with AI workforce on desktop
Download Eigent

Wypróbuj Eigent już dziś

Pobierz open-source’ową aplikację desktopową. Twoja SI workforce, działająca na Twoim komputerze.

Pobierz Eigent
Eigent

Otrzymuj najnowsze aktualizacje, poradniki i wydania dotyczące automatyzacji SI workforce.

ProduktEigentŚrodowiskaCennikDla firm
OdkrywajRozwiązaniaPrzypadki użyciaUmiejętnościWtyczkiBlogi
DeweloperzyDokumentacjaGitHubCAMEL-AIFundusz Open SourcePartner
PobierzDla open source
FirmaO nasBrandKarieraWarunki korzystaniaPolityka prywatnościBezpieczeństwo i zaufaniePolityka plików cookiePolityka zwrotów i wersji próbnej

Wszelkie prawa zastrzeżone © 2026 EIGENT UK LTD

Wydano nową wersję Eigent 1.0!download