GLM-5.3: Model kodowania Z.ai, który niespodziewanie rozwinął umiejętności cybernetyczne
Co zmieniło się w stosunku do GLM-5.2, benchmarki istotne dla agentów i dlaczego wagi open-source są udostępniane etapami

Z.ai wydało GLM-5.3 14 sierpnia 2026 roku, a historia tego wydania jest niezwykła jak na aktualizację punktową: model bazowy pozostał niezmieniony względem GLM-5.2, a mimo to wyniki w kodowaniu i zadaniach agentowych wyraźnie wzrosły — i to model nabył umiejętności z zakresu cyberbezpieczeństwa, których firma, jak twierdzi, nigdy nie planowała. Oto co faktycznie się zmieniło, benchmarki istotne dla twórców agentów AI oraz dlaczego wagi open-source nie są jeszcze dostępne.
Czym jest GLM-5.3?
GLM-5.3 to najnowszy model open-weight z serii GLM firmy Z.ai, pozycjonowany jako frontierowy model kodowania i agentowy. Kluczowy szczegół: model ponownie wykorzystuje tę samą bazę Mixture-of-Experts o 743 miliardach parametrów co GLM-5.2, a wszystkie zgłoszone zyski pochodzą ze zwiększonego post-treningu, a nie z nowej architektury (MarkTechPost).
Mówiąc wprost, Z.ai poświęciło więcej mocy obliczeniowej na trenowanie istniejącego modelu na większej i bardziej zróżnicowanej liczbie środowisk zadaniowych. To cały przepis, a zarazem cenny punkt odniesienia dla każdego, kto śledzi, jak daleko sam post-trening może posunąć model open-weight.
Jak GLM-5.3 ulepsza GLM-5.2
Z.ai opisuje tę metodę jako skalowanie środowisk. GLM-5.2 wprowadził stos treningowy; GLM-5.3 poświęca więcej mocy obliczeniowej na przeprowadzanie modelu przez znacznie większy zestaw symulowanych profesjonalnych środowisk pracy (Unite.AI).
To nie są proste zagadki kodowania. W jednym z przykładów model zostaje umieszczony w środowisku inżyniera infrastruktury ML — z klastrami obliczeniowymi, wewnętrzną dokumentacją, bazami kodu i wynikami eksperymentów — i musi diagnozować wąskie gardła, wdrażać poprawki oraz osiągnąć mierzalne przyspieszenie. Niektóre zadania odpowiadają kilku dniom pracy doświadczonego inżyniera. Aby tworzyć je na dużą skalę, Z.ai używa agentów badawczych, które przekształcają rzeczywiste wzorce pracy w uruchamialne środowiska długoterminowe, oraz agenta-sędziego weryfikującego, czy każde zadanie jest faktycznie rozwiązywalne.
Efekty widać dokładnie tam, gdzie można się tego spodziewać po tej metodzie: im dłuższy horyzont zadania, tym większy zysk.
Benchmarki kodowania GLM-5.3
Wszystkie poniższe dane są raportowane przez producenta. W porównaniu z GLM-5.2:
- Terminal-Bench 3.0: 4,6 → 28,3 — około 6-krotny skok na benchmarku CLI o najdłuższym horyzoncie.
- DeepSWE v1.1: 46,2 → 66,9.
- Agents' Last Exam (CLI): 23,8 → 28,5.
- GDPval-AA v2 (obejmujący 44 zawody): wynik 1 769.
Na wewnętrznym Code Bench Z.ai firma raportuje poprawę o ~50% względem GLM-5.2 oraz godną uwagi efektywność: GLM-5.3 osiąga 31,4% przy ~50 000 tokenach wyjściowych na zadanie, podczas gdy Claude Opus 4.8 uzyskuje 29,5% przy 120 000 tokenach — więcej pracy przy znacznie mniejszej liczbie tokenów. Claude Fable 5 nadal prowadzi w tym benchmarku z wynikiem 39,5% przy maksymalnym wysiłku (MarkTechPost).
Uczciwe zastrzeżenie: na publicznych zestawach testowych GLM-5.3 ustępuje GPT-5.6 Sol i Fable 5 w kilku trudniejszych ocenach kodowania. A ponieważ Code Bench jest prywatnym benchmarkiem, jego wyniki nie mogą być jeszcze niezależnie zreplikowane. Argument Z.ai za utrzymaniem go w prywatności to kontaminacja — publiczne zestawy testowe przenikają do danych treningowych.
Wynik w cyberbezpieczeństwie, którego Z.ai nie planowało
To jest część, która sprawiła, że GLM-5.3 stał się newsem wykraczającym poza typowy cykl premier modeli. Z.ai dodało dane dotyczące wykrywania podatności do post-treningu, oczekując, że model stanie się lepszy w rozumowaniu o pojedynczych błędach. Zamiast tego zdolność ta narastała wraz ze skalowaniem treningu, a model zaczął tworzyć spójne plany obejmujące kompletne łańcuchy eksploitacji (SiliconRepublic).
Liczby potwierdzają to twierdzenie, a wzorzec ponownie się utrzymuje — im głębiej w łańcuch eksploitacji sięga benchmark, tym większy skok:
- CyberGym (znajdowanie i walidacja błędów ze źródła white-box): 77,2% → 84,5%, nieznacznie wyprzedzając Mythos 5 (83,8%) i GPT-5.6 Sol (83,6%).
- ExploitBench (rozumowanie o przyczynie źródłowej plus działający exploit): 24,4% → 54,4% — ponad dwukrotnie więcej niż GLM-5.2, choć nadal za Mythos 5 z wynikiem 78,0%.
- ExploitGym (zadania wykonane w ramach budżetu czasowego): 105 zadań w dwie godziny, 130 w sześć — wobec 29 i 39 dla GLM-5.2.
Z.ai twierdzi również, że jego modele wykryły rzeczywiste, wdrożone błędy: 2 436 podatności w 269 projektach open-source od czasu GLM-5.2, w tym 1 097 ocenionych jako krytyczne lub wysokiego ryzyka — obejmujące jądra systemów, silniki przeglądarek i protokoły sieciowe. Najstarszy błąd, jak twierdzi firma, datował się na 1981 rok. Zasilają one publiczny Security Disclosure Ledger, z 53 CVE ujawnionymi przy premierze i 2 383 nadal objętymi embargiem.
Dlaczego wagi open-source nie są jeszcze dostępne
To jest odejście od schematu GLM-5.2. Wagi GLM-5.2 trafiły na Hugging Face w ciągu kilku dni od premiery. Wagi GLM-5.3 są udostępniane etapami: dostępne teraz wyłącznie przez API Z.ai, GLM Coding Plan i ZCode, a wagi mają zostać udostępnione za około dwa tygodnie po ocenie bezpieczeństwa i wzmocnieniu zabezpieczeń (SiliconANGLE).
Powód bezpośrednio wiąże się z wynikiem w cyberbezpieczeństwie: Z.ai wzmacnia model, który otwarcie opisuje jako rozwijający zdolności ofensywne w zakresie bezpieczeństwa szybciej niż oczekiwano. To pierwsze wydanie GLM wstrzymane wyraźnie ze względu na przegląd bezpieczeństwa.
Jeszcze jedna zmiana na poziomie API warta odnotowania dla twórców: GLM-5.3 obsługuje trzy poziomy wysiłku myślenia (niski, wysoki, maksymalny) i nie pozwala już na wyłączenie myślenia — to przełomowa zmiana, jeśli Twoja aplikacja wcześniej działała z wyłączonym myśleniem.
Co GLM-5.3 oznacza dla twórców agentów AI
Kilka praktycznych wniosków:
- Agenty kodowania o długim horyzoncie to główny obszar zastosowań. Zyski koncentrują się na wieloetapowej pracy z CLI i repozytoriami w skali — refaktoryzacjach, triage CI, długotrwałych pętlach agentowych — a nie na jednorazowych uzupełnieniach.
- Efektywność ma znaczenie równie duże jak wynik główny. Wykonywanie porównywalnej pracy przy ~50 tys. tokenów zamiast 120 tys. to realny czynnik kosztowy dla obciążeń agentowych działających przez cały dzień.
- Możesz używać go już dziś, ale nie wszędzie. Startupy mogą go teraz wdrożyć przez Coding Plan lub API. Zespoły z wymogami dotyczącymi rezydencji danych lub procedurami przeglądu dostawców powinny poczekać na wagi.
- Traktuj benchmarki producenta jako punkt wyjścia. Najbardziej efektowne liczby (wewnętrzny Code Bench, wyniki cybernetyczne w środowisku testowym) nie zostały jeszcze niezależnie zreplikowane. Udostępnienie wag, spodziewane pod koniec sierpnia 2026 roku, to moment, gdy zaczną się zewnętrzne testy.
Wykorzystaj model taki jak GLM-5.3 we własnym środowisku pracy AI
Historia GLM-5.3 dotyczy tak naprawdę długoterminowej, agentowej pracy — modeli wykonujących wieloetapowe zadania od początku do końca zamiast odpowiadania na pojedyncze zapytania. Właśnie do tego służy Eigent: otwartoźródłowa, lokalna aplikacja desktopowa „Cowork", która przekształca takie modele w wieloagentową siłę roboczą do rzeczywistych przepływów pracy — od przeglądania PR-ów na GitHub po uruchamianie samodzielnie hostowanego agenta kodowania AI, który w pełni kontrolujesz. Przynieś własny model, zachowaj pracę na swoim komputerze. Pobierz Eigent i zacznij budować własne przepływy pracy agentów już dziś.
Recent Posts

DeepSeek Harness: Środowisko uruchomieniowe agentów open-source, gdzie wszystko jest wtyczką
DeepSeek Harness v0.1 jest teraz dostępny w wersji deweloperskiej. Środowisko uruchomieniowe agentów open-source na licencji MIT, zbudowane na frameworku Cordis, gdzie modele, narzędzia, piaskownice i interfejs użytkownika są wtyczkami.

Możliwości Grok 4.6 i rzeczywiste przypadki użycia dla agentów AI
Praktyczne spojrzenie na możliwości i przypadki użycia Grok 4.6: długotrwałe agenty, kodowanie i praca wizualna, oraz jak używać go w ramach wieloagentowej siły roboczej AI.

Grok 4.6 vs Grok 4.5, GPT-5.6 Sol i Fable 5: Co się naprawdę zmienia
Grok 4.6 vs Grok 4.5, GPT-5.6 Sol i Fable 5: co xAI oficjalnie potwierdziło, co pozostaje spekulacją i jaka jest rzeczywista poprzeczka benchmarkowa, którą musi przeskoczyć ta aktualizacja oparta wyłącznie na post-trainingu.