Eigent spotyka MiniMax M2.1
Automatyzacja przeglądarki dla przedsiębiorstw z CAMEL Workforce i MiniMax M2.1

W rzeczywistych środowiskach enterprise wiele wewnętrznych narzędzi, pulpitów nawigacyjnych i systemów legacy działa wyłącznie w przeglądarce. Aby automatyzować te systemy, używamy Eigent — open-source’owej aplikacji workforce z wieloma agentami, działającej lokalnie i możliwej do pełnej konfiguracji ze źródeł, z dużym naciskiem na automatyzację przeglądarki — w praktyce działającej jak otwartoźródłowy współpracownik Eigent, który działa na Twojej własnej infrastrukturze.
W tym wpisie pokazujemy, jak Eigent wykorzystuje CAMEL Workforce i automatyzację przeglądarki do obsługi złożonych, wieloetapowych zadań enterprise. Przyglądamy się też bliżej MiniMax M2.1, analizując jego wydajność w realistycznym workflow enterprise oraz cechy architektoniczne, które pozwalają mu skutecznie działać w długich, agentowych scenariuszach automatyzacji przeglądarki.
Tło: czym jest Eigent i jak wspiera MiniMax M2.1
Eigent to open-source’owy produkt workforce z wieloma agentami, działający na Twoim komputerze. Został zbudowany w oparciu o architekturę workforce z wieloma agentami, wspieraną przez ogólne możliwości, takie jak automatyzacja przeglądarki, automatyzacja terminala oraz MCPs. Taka konstrukcja pozwala agentom w Eigent wykonywać zadania podobnie jak pracownicy, działając w rzeczywistych środowiskach desktopowych bez głębokich integracji API czy ciągłej rekonfiguracji workflow.
W miarę jak modele bazowe stale się rozwijają, integracja ich z open-source’owym systemem wieloagentowym Eigent pozwala deweloperom i użytkownikom enterprise szybko oraz skutecznie stosować możliwości LLM bezpośrednio do rzeczywistych zastosowań. Możesz przejść do strony Model Settings w Eigent, znaleźć sekcję OpenAI Compatible i wpisać swój klucz API oraz URL. Gdy nazwa modelu zostanie ustawiona na MiniMax-M2.1, możesz rozpocząć pracę. Potrzebujesz pomocy? Zobacz nasz przewodnik po konfiguracji klucza API MiniMax: https://platform.minimaxi.com/docs/api-reference/text-openai-api.
Repozytorium GitHub i jak skonfigurować Eigent
Repozytorium GitHub: https://github.com/eigent-ai/eigent
Szybki start: możesz uruchomić Eigent, korzystając z prekompilowanej aplikacji desktopowej, aby od razu zacząć pracę, albo skonfigurować środowisko deweloperskie, aby przejrzeć kod i dostosować agentów.
Opcja A: aplikacja desktopowa bez konfiguracji
- Pobierz klienta z https://www.eigent.ai/.
- Zainstaluj
.dmg(macOS) lub.exe(Windows). - Uruchom aplikację, a lokalny backend uruchomi się automatycznie.
Opcja B: konfiguracja dla deweloperów
- Wymagania wstępne: Node.js (v18-22) i Python.
- Sklonuj repozytorium i zainstaluj zależności:
git clone https://github.com/eigent-ai/eigent.git
cd eigent
npm install
- Uruchom aplikację:
npm run dev
Po uruchomieniu możesz skonfigurować dostawców LLM (MiniMax M2.1 i innych) bezpośrednio w ustawieniach. Bardziej szczegółowe informacje o konfiguracji, zaawansowanych funkcjach i rozwiązywaniu problemów znajdziesz w oficjalnej dokumentacji: https://docs.eigent.ai/get_started/welcome.
Pod maską: pełny stack Eigent i architektura CAMEL Workforce
Przegląd systemu Eigent
Eigent to lokalna aplikacja desktopowa z orkiestracją wielu agentów, napędzana przez CAMEL Workforce jako główny silnik. System implementuje odseparowaną, pełnostackową architekturę, działającą wyłącznie w lokalnej infrastrukturze użytkownika. Taki projekt zapewnia suwerenność danych i eliminuje ryzyka prywatności związane z uruchamianiem agentów w chmurze.
Frontend
Interfejs użytkownika pełni rolę płaszczyzny sterującej dla konfiguracji agentów i monitorowania workflow. Został zbudowany w React i TypeScript w ramach frameworka Electron.
Kluczowe komponenty obejmują:
- Zarządzanie stanem: Zustand obsługuje stan tymczasowy z wydajną reaktywnością.
- Orkiestracja wizualna: React Flow wizualizuje workspace agenta i wykonywanie w czasie rzeczywistym.
- Komunikacja: Frontend komunikuje się z backendem poprzez bezpieczne lokalne żądania HTTP.
Backend
Główna logika znajduje się w lokalnym serwerze Python, opartym na FastAPI i Uvicorn, który hostuje framework CAMEL dla wielu agentów.
- Środowisko uruchomieniowe: Backend działa na Python 3.10+ i jest zarządzany przez uv, zapewniający wydajne rozwiązywanie zależności i izolację środowiska.
- Warstwa trwałości danych: PostgreSQL, za pośrednictwem SQLModel i ORM SQLAlchemy, przechowuje logi audytowe, historię workflow oraz stany agentów.
- Framework systemu wieloagentowego: CAMEL obsługuje logikę orkiestracji (na przykład workforce), integrując się z LLM-ami zarówno zdalnymi (na przykład MiniMax), jak i lokalnymi (na przykład vLLM). CAMEL dostarcza również toolkitów (zestawów narzędzi), takich jak narzędzia do przeglądarki, terminala i generowania dokumentów.
CAMEL Workforce: system wieloagentowy inspirowany strukturami organizacyjnymi
W sercu Eigent leży CAMEL Workforce — system wieloagentowy zaprojektowany do rozwiązywania złożonych, rzeczywistych zadań poprzez zdecentralizowaną współpracę. System korzysta z rygorystycznego wzorca producer-consumer, pośredniczonego przez asynchroniczny kanał wiadomości, aby efektywnie zarządzać grafami zależności.
Role agentów
- Agent koordynator: pełni funkcję głównego dyspozytora, utrzymując globalny stan i przydzielając podzadania na podstawie dostępności i możliwości.
- Agent zadania: odpowiada za semantyczną dekompozycję celów wysokiego poziomu na wykonywalne, atomowe jednostki.
- Agent wykonawczy: realizuje atomowe podzadania za pomocą narzędzi specyficznych dla danej domeny.
Komunikacja asynchroniczna: TaskChannel
Rozdzielenie warstwy koordynacji od warstwy wykonawczej jest realizowane za pomocą TaskChannel. Ta asynchroniczna kolejka wiadomości zarządza dystrybucją zadań bez blokowania głównego wątku wykonania.
Przebieg wykonania:
- Workforce inicjuje zadanie.
- Węzły wykonawcze sprawdzają przydziały.
- Po zakończeniu wyniki są odsyłane z powrotem.
Dynamiczne budowanie DAG
Workflowy enterprise rzadko są liniowe. CAMEL Workforce implementuje mechanizm dynamicznego budowania skierowanego grafu acyklicznego (DAG). Gdy otrzymuje prompt wysokiego poziomu (na przykład „Utwórz plan podróży”), agent Task dekomponuje ten cel na odrębne węzły.
System mapuje zależności, umożliwiając schedulerowi:
- Wykonywanie niezależnych węzłów równolegle (na przykład „Search flight ticket” i „Search hotel” działają jednocześnie).
- Blokowanie węzłów zależnych do momentu, aż ich poprzedniki osiągną stan DONE.
Mechanizmy odporności na błędy
Biorąc pod uwagę niedeterministyczny charakter LLM-ów, Eigent traktuje awarie jako oczekiwane przejścia stanu, a nie wyjątki krytyczne. Architektura implementuje mechanizm odzyskiwania z użyciem:
- Retry: ponownie wykonuje podzadanie na tym samym workerze, aby obsłużyć błędy przejściowe.
- Replan: agent Task modyfikuje oryginalne podzadanie na podstawie logu błędów przed ponownym umieszczeniem go w kolejce.
- Reassign: podzadanie jest przenoszone do innego workera z kompatybilnym zestawem umiejętności.
- Decompose: jeśli zadanie nie powodzi się z powodu złożoności, jest rozbijane na mniejsze podzadania.

Architektura automatyzacji przeglądarki w Eigent
Automatyzacja z wieloma agentami ujawnia prawdziwą wartość enterprise tylko wtedy, gdy jest połączona z silnymi, ogólnymi możliwościami, takimi jak automatyzacja przeglądarki. Eigent stosuje dwuwarstwową architekturę, która oddziela kontrolę przeglądarki od orkiestracji agentów:
- Warstwa TypeScript obsługuje interakcje z przeglądarką. Wykorzystuje natywne API Playwright do wykonywania operacji na DOM, przechwytywania uporządkowanych snapshotów, generowania zrzutów ekranu SoM, wykrywania zasłonięć oraz bezpośredniego obsługiwania zaawansowanej logiki przeglądarki w środowisku JavaScript. Ponieważ Playwright jest natywny dla TypeScript, ta warstwa zyskuje dostęp do funkcji takich jak
_snapshotForAI()i poprawia wydajność oraz niezawodność. - Warstwa Python obsługuje orkiestrację AI. Zarządza wywołaniami LLM, podejmowaniem decyzji przez agentów i planowaniem zadań.
- Obie warstwy komunikują się asynchronicznie przez WebSocket, umożliwiając nieblokujące operacje. Python wysyła żądania operacji przeglądarki, TypeScript je wykonuje, a wyniki są zwracane do pętli agenta.
Taka architektura poprawia wydajność, zwiększa precyzję interakcji z elementami i umożliwia zaawansowane możliwości, takie jak dynamiczne filtrowanie DOM, snapshoty uwzględniające viewport oraz renderowanie SoM w przeglądarce. Przekazując zadania przeglądarki do natywnego kontekstu wykonania, Eigent zapewnia solidne podstawy dla automatyzacji enterprise opartej na agentach.

Testowanie MiniMax M2.1 na rzeczywistych zadaniach enterprise
Przetestowaliśmy Eigent z MiniMax M2.1, aby zautomatyzować procesy sprzedażowe, wykorzystując możliwości automatyzacji przeglądarki w Eigent. Zadania agenta obejmowały rzeczywiste etapy cyklu sprzedaży, w tym pozyskiwanie i tworzenie leadów, kwalifikację i zarządzanie pipeline, ofertowanie, negocjacje, finalizację oraz zarządzanie produktem.
W kolejnych uruchomieniach eksperymentalnych MiniMax M2.1 konsekwentnie wykazywał trzy mocne strony:
- Dobrze radzi sobie ze złożonymi strukturami stron, w tym z iframe’ami i zagnieżdżonymi elementami.
- Sprawdza własne działania, aby zachować dokładność i skracać kroki.
- Korzysta z narzędzi efektywnie i elastycznie, unikając zbędnych kroków.
Zadanie:
„Mamy nowy kontakt w Global Media — Jennifer Martinez (jennifer.m@globalmedia.com) jest ich nową Senior Marketing Manager. Dodaj ją do naszego Salesforce i upewnij się, że jest przypisana do właściwej firmy.”

W tym zadaniu MiniMax M2.1 działał w złożonym interfejsie Salesforce, aby dodać nowy kontakt, Jennifer Martinez (Senior Marketing Manager), do Global Media i upewnić się, że została poprawnie powiązana z właściwym kontem. Wymagało to nawigacji przez wiele warstw UI, zidentyfikowania właściwych punktów wejścia, utworzenia kontaktu, wypełnienia kluczowych pól i zweryfikowania powiązania z kontem.
Wyniki pokazują, że MiniMax M2.1 wykonał każdy krok dokładnie, bez błędnych kliknięć i bez załamań workflow. To dowodzi silnej zdolności modelu do rozumienia złożonych interfejsów użytkownika enterprise, planowania wieloetapowych działań i niezawodnego wykonywania zadań end-to-end.
Jak MiniMax M2.1 poprawia wydajność zadań
MiniMax M2.1 to mocny wybór dla autonomicznych agentów enterprise. Obsługuje długie, wieloetapowe zadania z dużą niezawodnością i zapewnia równowagę między wydajnością, efektywnością i wszechstronnością.
Ulepszone rozumowanie i ciągłość workflow
W porównaniu do poprzednika M2.1 generuje bardziej zwięzłe i wydajne łańcuchy rozumowania, lepszą responsywność oraz mniejsze zużycie tokenów. Został zaprojektowany z myślą o lepszym zarządzaniu kontekstem na wielu etapach, co pomaga utrzymać logiczną ciągłość podczas wywołań funkcji i zmniejsza prawdopodobieństwo błędów w dalszej części workflow.
Możliwości generalizacji agentów i narzędzi
M2.1 dobrze działa w różnych frameworkach do budowania agentów i środowiskach narzędziowych. Generalizuje niezawodnie z różnymi narzędziami i wspiera zintegrowane workflowy, co czyni go praktycznym rozwiązaniem do automatyzacji enterprise.
Odporność w planowaniu długiego horyzontu
Automatyzacja enterprise często wiąże się z niepewnością, taką jak dynamiczne stany UI, opóźnienia ładowania i nieoczekiwane interakcje. Dzięki ulepszonemu rozumowaniu i większej wydajności wykonania M2.1 wykazuje odporność w dłuższych sekwencjach zadań.
Poznaj Eigent i MiniMax M2.1
Eigent jest w pełni open-source, a my zapraszamy deweloperów, badaczy i zespoły enterprise do odkrywania, rozszerzania i współtworzenia:
- GitHub: https://github.com/eigent-ai/eigent
- Hugging Face: https://huggingface.co/MiniMaxAI/MiniMax-M2.1
- Discord: https://discord.camel-ai.org/
Recent Posts

Qwen3.8-Max: model Alibaba do kodowania z otwartymi wagami i 2,4 bln parametrów
Qwen3.8-Max to model Alibaba z otwartymi wagami i 2,4 bln parametrów do kodowania oraz pracy agentowej. Poznaj specyfikację, ceny, potwierdzone fakty i niewiadome.

Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata
Inkling-Small od Thinking Machines Lab to model MoE 276B z otwartymi wagami, który dorównuje Inkling przy jednej czwartej rozmiaru. Specyfikacja, benchmarki, ceny i znaczenie dla branży.

Alternatywa dla Augment Code
Porównaj alternatywy dla Augment Code w dużych bazach kodu pod względem aktualnych cen, wspólnego użycia, jakości kontekstu, dostępu do źródeł, samodzielnego hostingu, bezpieczeństwa i dopasowania do zespołu.