logo
  • 환경
  • 엔터프라이즈
  • 요금제
DeveloperMay 19, 2026

Gemini 3.5 Flash로 Eigent에서 ML CI 실패 감사하기

Regina BaiRegina Bai
Eigent에서 Gemini 3.5 Flash와 Gemini Agent로 ML CI 실패 감사하기
Automate Everything with
AI Workforce on Desktop
Download Eigent

Gemini 3.5 Flash로 몇 분 만에 ML CI 실패의 근본 원인 찾기

손상된 ML 학습 파이프라인을 디버깅하는 일은 느리고 지루합니다. 두 개의 서로 다른 CI 실행에서 로그를 가져와 golden values와 비교하고, 회귀를 찾기 위해 커밋 기록을 뒤지며, 무엇이 왜 잘못되었는지 설명하는 보고서를 작성해야 하는 동안 팀은 기다리고 있습니다. 이 사용 사례는 그 전체 조사 과정을 자동화합니다.

ml-failure-audit 스킬을 Google의 Gemini 3.5 Flash 모델과 원격 추론 엔진으로서의 Gemini Agent API와 결합함으로써, Eigent의 멀티 에이전트 워크포스는 로그 가져오기, 기준값 추출, 증거 추적, 무거운 분석 위임, 구조화된 산출물 생성까지 CI 실패를 처음부터 끝까지 감사할 수 있습니다. 모든 과정은 단일 프롬프트로 이루어집니다.

1모델로 Gemini 3.5 Flash 선택하기

Settings → Agents → Model로 이동해 클라우드 모델 목록에서 Gemini 3.5 Flash를 선택하세요. 자체 API 자격 증명을 사용하고 싶다면 Settings → API Keys → Gemini 아래에 Gemini 키를 입력하여 직접 사용할 수 있습니다.

Gemini 3.5 Flash는 긴 컨텍스트 작업에서 빠르고 비용 효율적인 추론에 최적화되어 있으며, 이는 정확히 CI 로그 분석이 요구하는 방식입니다.

2Gemini Agent API를 원격 서브 에이전트로 활성화하기

Settings → Agents → Remote Agents로 이동해 Gemini Agent API를 켜세요. 그러면 Gemini Agent가 Eigent 워크포스 내부에서 호출 가능한 서브 에이전트로 등록됩니다.

활성화되면 Developer Agent는 수백 줄의 로그에 걸친 근본 원인 분석처럼 계산 집약적인 추론 작업을 하나의 모델 호출에 모두 처리하는 대신, 이를 Gemini Agent에 직접 넘길 수 있습니다. 이렇게 하면 두 단계 구조가 됩니다. Eigent의 로컬 에이전트는 오케스트레이션과 도구 사용을 맡고, Gemini Agent는 심층 추론을 담당합니다.

3ml-failure-audit 스킬 업로드하기

Settings → Agents → Skills로 이동해 ml-failure-audit 스킬 패키지를 업로드하세요. **Skill Hub: ml-failure-audit**에서도 스킬 상세 정보와 설치 단계를 확인할 수 있습니다. 이 스킬은 CI 실패 감사를 위해 Eigent가 어떤 방식으로 접근해야 하는지 정의합니다. 어떤 산출물을 수집할지, 어떤 비교를 실행할지, 어떤 증거를 모을지, 최종 보고서를 어떻게 구성할지까지 포함합니다.

업로드가 완료되면 워크포스의 어떤 에이전트든 ML 감사 작업을 처리할 때 이 스킬을 호출할 수 있습니다.

4작업을 Eigent에 보내기

모든 구성이 끝났다면 Eigent의 채팅에 작업 프롬프트를 입력하세요:

{{ml-failure-audit}} 스킬을 따르고, 복잡한 하위 작업은 원격 서브 에이전트를 사용해 마무리하세요.

Megatron-LM MIMO VLM 사전학습 golden metric CI 실패를 감사해 주세요. 로컬 NVIDIA/Megatron-LM checkout이 <your-commit-sha> 커밋에 있으며, 첨부한 CI 산출물(예: 성공/실패 실행 로그)도 함께 제공합니다. 실패한 워크로드는 sequence packing을 사용하는 8-GPU frozen start convergence check이며, global batch size는 32, total packed sequence length는 3200, packing buffer는 4, training iterations는 100입니다.

이 실패가 실제 모델 convergence/correctness regression인지, 아니면 metric/gating policy 문제인지 판단해 주세요. 저장소의 golden value comparison 코드와 CI 로그를 증거로 사용해 주세요. GPU training은 다시 실행하지 마세요.

repository URL, 대상 commit checkout, 그리고 비교하고 싶은 CI 산출물을 첨부한 상태에서 repo root에 source_refs, extracted_facts, calculations, final_answer, validation이 포함된 answer.json을 생성해 주세요. 간결한 answer.md도 함께 만들어 주세요.

Eigent는 즉시 조사를 계획하기 시작합니다.

프롬프트를 실행하기 전에 ml-failure-audit 스킬을 설치하세요.

입력은 직접 제공하세요: <your-commit-sha>를 감사할 커밋으로 바꾸고, 작업 공간에서 해당 리비전을 체크아웃한 뒤, 비교하고 싶은 CI 산출물(예: 성공 vs 실패 실행 로그, stderr 캡처, 또는 내보낸 CI 작업 출력)을 첨부하세요. Megatron-LM 예시를 조사 중인 어떤 저장소와 실패에도 맞게 변형할 수 있습니다.

5Coordinator Agent가 작업을 계획하고 할당하기

Eigent의 Coordinator Agent는 프롬프트를 읽고 이를 구조화된 감사 계획으로 분해합니다. 핵심 단계(로그 가져오기, 데이터 추출, 증거 추적, 보고서 생성)를 식별한 뒤 전체 조사를 Developer Agent에 할당합니다.

Coordinator는 단순히 무작정 위임하지 않습니다. 스킬 참조, 저장소 컨텍스트, CI 로그 산출물을 함께 전달해 Developer Agent가 필요한 모든 것을 갖춘 상태에서 시작하도록 합니다.

6Developer Agent가 스킬을 불러오고 로그를 가져오기

Developer Agent의 첫 번째 작업은 ml-failure-audit 스킬을 불러와 그 지침을 읽고 감사 방법론을 이해하는 것입니다.

그다음 4개의 명령을 병렬로 실행해 CI 로그 데이터를 가져오며, 두 개의 실패 로그와 관련 메타데이터를 동시에 수집합니다. 병렬 도구 실행 덕분에 데이터 수집 단계는 순차적으로 진행할 때보다 훨씬 짧은 시간에 끝납니다.

7Golden Values를 추출하고 수정 커밋을 추적하기

로그를 확보한 후 Developer Agent는 Python 스크립트를 실행해 golden reference values를 추출합니다. 이는 성공적인 CI 실행이 생성해야 하는 예상 학습 메트릭, loss curve, 벤치마크 수치입니다. 그런 다음 이를 실패 로그에 기록된 값과 비교해 정확히 어디서, 얼마만큼 차이가 발생했는지 파악합니다.

이후 Developer Agent는 Megatron-LM 커밋 기록을 검색해 회귀의 원인이 되었을 가능성이 가장 높은 특정 코드 변경인 fix commit을 찾습니다. 이 커밋은 감사 보고서의 구체적인 증거가 되어, 관찰된 실패와 근본적인 코드 변경 사이의 직접적인 연결고리를 리뷰어에게 제공합니다.

8깊은 추론을 Gemini Agent에 위임하기

원시 증거(log diff, golden value comparison, 추적된 커밋)가 모두 준비되면 Developer Agent는 Gemini Agent를 호출해 무거운 추론 단계를 수행하게 합니다.

Gemini Agent는 코드에서 무엇이 바뀌었는지, 그 변경이 학습 동작에 어떻게 영향을 미쳤는지, 가장 가능성 높은 근본 원인이 무엇인지 전체 맥락을 분석합니다. 몇 분 후, 실패 진단, 기여 요인, 권장 수정 사항을 포함한 완전하고 구조화된 감사 보고서를 반환합니다.

9Developer Agent가 최종 감사 보고서를 작성하기

Developer Agent는 Gemini Agent의 분석을 바탕으로 작업 공간에 두 가지 산출물을 작성합니다:

  • answer.json: 실패 유형, 근본 원인, 영향을 받은 메트릭, 증거 커밋, 권장 해결책을 구조화된 필드로 담은 기계 판독 가능한 감사 기록입니다. 자동화 파이프라인, 티켓 시스템, CI 대시보드에 유용합니다.

  • answer.md: 무엇이 실패했는지, 왜 실패했는지, 증거는 무엇인지, 다음에 무엇을 해야 하는지를 다루는 간결한 사람 친화적 감사 요약입니다. PR 코멘트, Slack 스레드, 인시던트 보고서에 바로 붙여넣을 수 있습니다.

두 파일 모두 작업 공간 폴더에 직접 작성되며 즉시 접근할 수 있습니다.

10이 워크플로가 중요한 이유

ML CI 실패는 밀도 높은 로그 출력 속에 신호가 묻혀 있고, 근본 원인이 종종 증상보다 여러 커밋 뒤에 있기 때문에 디버깅이 매우 어렵기로 유명합니다. 이 워크플로는 세 가지 기능이 함께 작동하도록 하여 이를 해결합니다:

  • 병렬 로그 가져오기로 산출물을 하나씩 가져오는 순차적 병목을 없앱니다.
  • Python 기반 golden value 추출은 패턴 매칭이나 수동 검토에 의존하지 않고 정밀한 수치 비교를 적용합니다.
  • 추론 서브 에이전트로서의 Gemini Agent는 가장 복잡한 추론 단계를 그에 최적화된 모델에 오프로딩하여 오케스트레이션은 가볍게, 분석은 깊게 유지합니다.

그 결과, 엔지니어가 30~60분 동안 집중해서 해야 할 근본 원인 감사 작업이 몇 분 만에 구조화된 산출물 추적과 함께 제공됩니다.

11다음에 시도해 볼 것

첫 번째 감사가 끝나면 다음과 같은 후속 프롬프트로 워크플로를 확장해 보세요:

가장 최근의 CI 실패 3건에 동일한 감사를 실행하고 근본 원인을 비교하세요.

수정 커밋을 찾은 뒤, 감사 보고서가 미리 채워진 상태로 GitHub issue를 여세요.

매일 밤 새로 발생한 CI 실패를 감사하고 answer.md를 Slack에 게시하도록 트리거를 예약하세요.

다른 모델로 바꿔서 더 깊은 분석이 필요하면 Gemini 3.5 Pro를, 더 빠른 처리 시간이 필요하면 Gemini Flash Lite를 사용해 보세요.

12더 나은 결과를 위한 팁

  • CI 산출물을 명시적으로 첨부하세요. ml-failure-audit 스킬은 비교하려는 커밋 checkout과 로그 또는 내보낸 결과물(예: 성공 실행과 실패 실행)을 함께 제공할 때 가장 잘 작동합니다.
  • repository URL을 포함하세요. Developer Agent는 이를 사용해 커밋 기록에서 fix commit을 찾습니다. 저장소로 바로 연결되는 링크가 있으면 검색 단계를 줄일 수 있습니다.
  • 출력 파일을 지정하세요. answer.json과 answer.md 둘 다 요청하면 Developer Agent가 두 형식 모두 생성하도록 지시할 수 있어, CI 파이프라인용 기계 판독 가능한 출력과 팀용 사람 친화적 출력을 모두 필요로 할 때 유용합니다.
  • 추론이 필요한 작업에는 Gemini Agent를 사용하세요. 원격 서브 에이전트 패턴은 로컬 에이전트가 데이터 수집을 담당하고 Gemini Agent가 종합을 담당할 때 가장 효과적입니다. 로컬 도구 사용으로 더 빠르게 처리할 수 있는 단순 조회에 호출하지 마세요.

Other use cases

동영상으로 CAD 모델 만들기: Gemini 3.7 Flash와 3.6 Flash 비교

동영상으로 CAD 모델 만들기: Gemini 3.7 Flash와 3.6 Flash 비교

업로드한 참조 동영상의 Transformers 캐릭터를 분석해 프로덕션용 고정밀 3D CAD/메시 모델을 .glb로 내보냅니다. 스타일, 관절, 표면 세부 요소를 분석하고 논리적인 관절 피벗 기준으로 몸체와 장갑을 분리합니다. 아노다이징 금속, 브러시드 스틸, 다크 티타늄, 고광택 도장과 발광 채널을 포함한 PBR 재질을 적용하고 Diffuse, Normal, Roughness, Metallic, Emissive 텍스처를 GLB에 포함합니다.

영수증 및 인보이스의 VAT 신고 자동화

영수증 및 인보이스의 VAT 신고 자동화

사진, 스캔한 PDF, 디지털 인보이스를 포함하여 "VAT" 폴더의 모든 영수증과 인보이스를 처리해 주세요. 최종 출력에는 두 파일만 포함되어야 합니다: (1) vat_return.xlsx — Excel 파일에는 영수증 또는 인보이스당 한 행이 포함되어야 하며, 추출된 모든 필드를 나열하고, 각 항목의 VAT 환급 가능 여부를 표시하고, 환급 가능한 항목의 VAT 회수 금액을 표시하고, 회수 불가능한 항목의 제외 사유를 포함하고, 수동 검토가 필요한 항목을 명확히 표시하고, 총 회수 가능 VAT 금액을 보여주는 요약 시트를 포함해야 합니다. (2) vat_return.html — 회계팀과 직접 열어 공유할 수 있는 독립형 HTML 파일을 생성해 주세요. HTML 파일에는 모든 VAT 회수 항목, 각 항목의 회수 가능 VAT 금액, 제외된 항목과 제외 사유, 수동 검토가 필요한 항목, 총 회수 가능 VAT 금액이 표시되어야 합니다. 불확실한 정보는 추측하지 마세요.

장기 과제: Eigent에서 GLM-5.1 vs GLM-5.2

장기 과제: Eigent에서 GLM-5.1 vs GLM-5.2

AI 인프라 생태계의 26개 기업을 심층 조사하세요. 이는 전체 AI 가치사슬에서 가장 확실한 핵심 축입니다. 다음 6개 하위 섹터를 모두 다루되, 각 섹터에서는 대형 리더부터 소규모 플레이어까지 대표 기업을 선정하세요: AI 데이터센터(컴퓨트 인프라 / 구축), GPU / AI 칩(학습 및 추론용 실리콘, ASIC, IP), 서버·네트워킹·광 모듈(스위치, NIC, 광 인터커넥트), 전력·액체 냉각·에너지 저장(전원 공급, 열 관리, 에너지 관리), AI 클라우드 / 컴퓨트 플랫폼(하이퍼스케일러, GPU 클라우드, 컴퓨트 대여 플랫폼), 지원 생태계(HBM / 첨단 패키징, 파운드리, 커넥터 및 기타 핵심 부품). 각 기업에 대해 다음을 조사하세요: 회사명, 하위 섹터, 본사 / 국가; 핵심 제품과 AI 체인에서의 구체적 역할; 상장 또는 비상장 여부(상장 시 티커 + 거래소, 비상장 시 최근 기업가치 / 자금조달 라운드); 시가총액 또는 기업가치 규모(순위 산정용); 생태계 내 포지셔닝과 해자(1–2문장); 주요 고객 / 경쟁사. 순서는 각 하위 섹터 내에서 시가총액 / 기업가치 기준으로 큰 순서부터 작은 순서로 정렬하세요. 전체 구조는 하향식으로 구성하세요: 전체 하드웨어 생태계 지형 → 각 개별 기업까지. 출력 요구사항: 먼저 26개 기업 전체, 위 필드, 6개 하위 섹터 분류, 상장/비상장 플래그, 섹터 간 비교 매트릭스를 포함한 구조화된 데이터 파일 ai_infra_data.json을 생성하세요. 그런 다음 해당 JSON을 바탕으로 세련된 HTML 리포트를 생성하세요: 생태계 지형 / 계층형 다이어그램, 섹터 섹션, 기업 카드, 상장 vs. 비상장에 대한 명확한 시각적 표시(태그 또는 색상 구분), 시가총액 순위 차트, 정렬/필터 가능한 비교 테이블을 포함하세요. 디자인은 전문적이고, 정보 밀도가 높으며, 인터랙티브해야 합니다. 먼저 연구 데이터의 정확성을 검증한 뒤(상장 상태, 티커, 기업가치 — 최신 수치와 출처 인용), 그 다음 리포트를 생성하세요. 작업은 단일 에이전트 모드로 보내세요.

Automate everything with AI workforce on desktop
Download Eigent

오늘 Eigent를 사용해보세요

오픈 소스 데스크톱 앱을 다운로드하세요. 여러분의 AI 워크포스가 여러분의 기기에서 실행됩니다.

Eigent 다운로드
Eigent

AI 워크포스 자동화에 대한 최신 소식, 튜토리얼, 출시 정보를 받아보세요.

구독해 주셔서 감사합니다!

제품Eigent환경요금엔터프라이즈
둘러보기솔루션활용 사례스킬플러그인블로그
개발자문서GitHubCAMEL-AI오픈소스 펀드파트너
다운로드오픈 소스용
회사회사 소개브랜드채용이용약관개인정보처리방침보안 및 신뢰쿠키 정책환불 및 체험 정책

모든 권리 보유 © 2026 EIGENT UK LTD