Jedno zadanie, dwa modele, ten sam agent
Najczystszym sposobem porównania dwóch modeli jest niezmienianie niczego innego. Zrobiliśmy więc dokładnie to: to samo długohoryzontowe zadanie, ten sam agent, te same narzędzia. Przekazaliśmy GLM-5.1 i GLM-5.2 identyczny brief w pojedynczym agentowym środowisku Eigenta i obserwowaliśmy, jak każdy z nich planuje, prowadzi research, weryfikuje i dostarcza wynik.
To była prawdziwa praca analityczna, a nie zabawkowy benchmark:
Zbadaj 26 firm z ekosystemu infrastruktury AI — od projektowania układów scalonych i produkcji półprzewodników po platformy chmurowe i centra danych obsługujące frontier AI — a następnie zbuduj interaktywny raport.
Takie długohoryzontowe zadanie to miejsce, w którym modele naprawdę zaczynają się różnić. To nie jedna sprytna odpowiedź; to dziesiątki małych decyzji połączonych w długim przebiegu: jak głęboko planować, ile źródeł uznać za wiarygodne, kiedy przestać badać temat i ile zweryfikować, zanim zadanie zostanie uznane za zakończone.
Prompt
Wysłaliśmy obu uruchomieniom ten sam prompt, w trybie pojedynczego agenta:
Przeprowadź dogłębne badanie 26 firm z ekosystemu infrastruktury AI — najbardziej pewnego głównego nurtu całego łańcucha wartości AI. Obejmij następujące 6 podsektorów (wybierz reprezentatywne firmy w każdym z nich, od liderów o dużej kapitalizacji po mniejszych graczy):
- Centrum danych AI (infrastruktura obliczeniowa / rozbudowa)
- GPU / chipy AI (silicon do treningu i inferencji, ASIC, IP)
- Serwery, sieci i moduły optyczne (switches, NIC, połączenia optyczne)
- Zasilanie, chłodzenie cieczą i magazynowanie energii (zasilanie, termika, zarządzanie energią)
- Chmura AI / platforma obliczeniowa (hyperscalers, chmury GPU, platformy wynajmu mocy obliczeniowej)
- Ekosystem wspierający (HBM / zaawansowane pakowanie, foundry, złącza i inne krytyczne komponenty)
Dla każdej firmy zbadaj: nazwę firmy, podsektor, siedzibę / kraj; kluczowe produkty i jej konkretną rolę w łańcuchu AI; publiczna czy prywatna (ticker + giełda, jeśli notowana; jeśli prywatna, podaj najnowszą wycenę / rundę finansowania); kapitalizację rynkową lub wycenę (do rankingu); pozycjonowanie i przewagę konkurencyjną (1–2 zdania); kluczowych klientów / konkurentów.
Uporządkuj firmy w obrębie każdego podsektora od największej do najmniejszej i zbuduj całość od góry do dołu: od pełnego krajobrazu ekosystemu sprzętowego do każdej pojedynczej firmy.
Wynik: Najpierw wygeneruj uporządkowany ai_infra_data.json ze wszystkimi 26 firmami, 6 klasyfikacjami podsektorów, flagą publiczna/prywatna oraz macierzą porównawczą. Następnie wygeneruj dopracowany, interaktywny raport HTML na podstawie tego JSON-a — diagram krajobrazu ekosystemu, sekcje sektorowe, karty firm, kodowanie kolorami publiczne vs prywatne, wykres rankingu kapitalizacji rynkowej oraz sortowalną/filtrowalną tabelę porównawczą. Najpierw zweryfikuj dokładność danych badawczych (status notowań, tickery, wyceny — najnowsze wartości, cytowane źródła), a dopiero potem wygeneruj raport.
Przygotowanie do wykonania — GLM-5.2 planuje głębiej
Pierwsza rozbieżność pojawiła się jeszcze zanim którykolwiek model dotknął internetu: w planie.
GLM-5.1 rozbił pracę na 4 kroki. GLM-5.2 rozszerzył ten sam brief do 6 kroków — i, co wymowne, zrobił z „zweryfikuj dokładność” osobne, dedykowane zadanie, zamiast traktować to mimochodem. Tak właśnie ostrożny analityk zakresowo definiuje pracę: najpierw research, potem dowód na poprawność researchu, a dopiero potem budowa.
Te same instrukcje. Inna ocena tego, jakiego poziomu rygoru wymaga zadanie.
Research — dwa razy więcej źródeł
Plany przełożyły się na bardzo różne przebiegi researchu.
- GLM-5.1: około 40 źródeł
- GLM-5.2: około 82 źródeł — mniej więcej 2× więcej researchu
I nie chodziło tylko o więcej stron — chodziło o lepiej rozłożone strony. Tam, gdzie GLM-5.1 mocno opierał się na jednej stronie z danymi, GLM-5.2 weryfikował każdą liczbę krzyżowo w serwisach finansowych, dokumentach spółek i bazach danych prywatnego rynku: Reuters, Bloomberg, Crunchbase, TechCrunch i innych.
Jedno źródło to za mało. W przypadku wycen, tickerów i statusu notowania GLM-5.2 traktował pojedynczą liczbę jako hipotezę do potwierdzenia — nie fakt do skopiowania.
GLM-5.2 nie tylko odpowiadał szybciej. Kopał głębiej, korzystając z dwa razy większej liczby stron, by zweryfikować każdą wartość.
Weryfikuj przed zakończeniem
Ponieważ GLM-5.2 wydzielił weryfikację jako osobny krok, faktycznie ją wykonał — ponownie sprawdzając status notowania, tickery i wyceny względem najnowszych danych, zanim umieścił je w raporcie. Efekt to raport, który udowadnia swoją pracę, zamiast tylko ją deklarować.
Wynik — głębsze dane, prawdziwe cytowania
To samo zadanie. Dwa bardzo różne rezultaty.
GLM-5.2 wygenerował:
- bogatszy schemat danych z wydzieloną analizą przewagi konkurencyjnej, szczegółami finansowania i pełną listą źródeł — każda teza możliwa do prześledzenia do miejsca pochodzenia.
- końcowy raport, który był niemal 2× bogatszy niż raport GLM-5.1 zarówno pod względem danych, jak i struktury.
- wynik dostarczony jako w pełni wdrażalna, interaktywna strona — nie tylko statyczna strona HTML: diagram krajobrazu ekosystemu, sekcje sektorowe, kodowanie kolorami publiczne vs prywatne, wykres rankingu kapitalizacji rynkowej oraz sortowalna/filtrowalna tabela porównawcza.
GLM-5.1 dostarczył solidny, poprawny raport. GLM-5.2 dostarczył taki, który można byłoby przekazać komitetowi inwestycyjnemu.
Dlaczego to ma znaczenie
W krótkim zadaniu dwa sprawne modele wyglądają niemal tak samo. W długohoryzontowym zadaniu różnice się kumulują. Każde dodatkowe źródło, które GLM-5.2 zdecydował się przeczytać, każda liczba, którą postanowił sprawdzić dwa razy, oraz decyzja, by weryfikację potraktować jako krok pierwszej klasy, złożyły się na mierzalnie lepszy wynik.
Środowisko było identyczne. Narzędzia były identyczne. Jedyną zmienną był model — i właśnie to sprawia, że jest to uczciwy obraz tego, jak GLM-5.2 rozumuje w długim przebiegu:
Więcej źródeł. Ostrzejsza ocena. Raport, który udowadnia swoją pracę.
Uruchom to samodzielnie
Eigent pozwala podmienić model działający w tym samym pojedynczym agentowym środowisku, więc możesz uruchomić dokładnie takie porównanie na własnym zadaniu:
- Przejdź do Settings → Models i wybierz lub dodaj model, który chcesz przetestować (GLM-5.1, GLM-5.2 lub dowolny model obsługujący function calling).
- Przełącz zadanie na tryb pojedynczego agenta.
- Wklej powyższy prompt deep-research (lub własny brief długohoryzontowy).
- Wyślij go raz dla każdego modelu, a następnie porównaj plany, liczbę źródeł i końcowe raporty obok siebie.
Co przetestować dalej
Uruchom ponownie ten sam brief, ale wymagaj co najmniej 3 niezależnych źródeł dla każdej wyceny i oznacz każdą firmę, dla której źródła się nie zgadzają.
Rozszerz zbiór z 26 do 50 firm i dodaj kolumnę „zależność od łańcucha dostaw” do macierzy porównawczej.
Wygeneruj jednostronicowe podsumowanie wykonawcze końcowego raportu jako PDF oraz prezentację slajdową wykresu rankingu kapitalizacji rynkowej.
Uruchom GLM-5.2 przeciwko innemu modelowi na tym samym zadaniu i wygeneruj raport diff: gdzie się zgadzały, gdzie się różniły i który miał lepsze źródła.
Wskazówki dla lepszych wyników
- Uczyń weryfikację eksplicytną. Prośba, by model „najpierw zweryfikował dokładność, a dopiero potem budował”, zauważalnie zmienia zachowanie — GLM-5.2 zamienił ten zapis w osobny krok planowania.
- Wymagaj cytowań w schemacie. Wymóg pola
sourcesdla każdej firmy wymusza badanie możliwe do prześledzenia, a nie pewne domysły. - Oddziel dane od prezentacji. Generowanie
ai_infra_data.jsonprzed HTML-em sprawia, że raport można ponownie wygenerować, a fakty są audytowalne. - Używaj trybu pojedynczego agenta do rozumowania długohoryzontowego. Dzięki temu pełny kontekst zadania pozostaje w rękach jednego modelu, co jest dokładnie tym, czego chcesz, gdy porównujesz, jak model planuje i koryguje się sam przez długi przebieg.



