Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata
Wydajny model MoE z otwartymi wagami, który dorównuje — a czasem przewyższa — Inkling przy jednej czwartej rozmiaru.

Thinking Machines Lab wydało Inkling-Small — model Mixture-of-Experts (mieszanina ekspertów) z otwartymi wagami, posiadający 276B parametrów łącznie i 12B aktywnych — czyli około jednej czwartej rozmiaru swojego pierwszego modelu, Inkling, a mimo to dorównujący mu lub go przewyższający w rozumowaniu i agentycznym kodowaniu. Sedno tej historii to nie skala, lecz wydajność. Ten przewodnik omawia specyfikację Inkling-Small, wyniki benchmarków prosto z premiery, koszty uruchomienia oraz to, co wydajny model z otwartymi wagami oznacza dla twórców agentów AI.
Czym jest Inkling-Small?
Inkling-Small to drugi model od Thinking Machines Lab — startupu założonego przez byłą CTO OpenAI, Mirę Murati. Pojawił się mniej więcej dwa tygodnie po Inkling, pierwszym wydaniu laboratorium z otwartymi wagami, i zbudowany jest wokół jednej idei: zachować możliwości, ograniczyć obliczenia.
Kluczowe fakty z posta o premierze i karty modelu:
- 276B parametrów łącznie, 12B aktywnych — rzadki transformer MoE. To mniej więcej jedna czwarta Inkling (975B łącznie / 41B aktywnych).
- Okno kontekstowe 1M tokenów.
- Natywna multimodalność — przetwarza tekst, obrazy i dźwięk, korzystając z tej samej architektury bez enkodera co Inkling.
- Zmienny poziom myślenia — możliwość regulacji intensywności rozumowania w zamian za szybkość i koszt.
- Otwarte wagi na licencji Apache 2.0, dostępne na Hugging Face — w tym skwantyzowany checkpoint NVFP4 do wydajnej inferencji.
- Trenowany na systemach NVIDIA GB300 NVL72.
Architektonicznie to 42-warstwowy transformer dekodujący, który kieruje każdy token do 6 spośród 256 ekspertów, plus 2 wspólnych ekspertów aktywnych przy każdym tokenie (karta modelu). Receptura MoE wywodzi się z tej samej linii co Inkling.
Zaskoczenie: mały model bije dużego
Zaskakujące jest to, że Inkling-Small nie tylko przybliża się do Inkling — w kilku benchmarkach go wyprzedza. Thinking Machines wyjaśnia to w poście o premierze: Inkling-Small rozpoczął trening po swoim większym bracie, dzięki czemu zespół mógł ulepszyć mieszankę danych pre-treningowych i recepturę, a następnie post-trenować wczesny checkpoint przy użyciu dystylacji on-policy z Inkling jako nauczycielem. Następnie przez kolejne dwa tygodnie skalowano agentyczne uczenie przez wzmacnianie w kodowaniu (post o premierze).
Efekt, własnymi słowami laboratorium: Inkling-Small przewyższył Inkling w rozumowaniu i agentycznym kodowaniu, podczas gdy Inkling zachowuje przewagę w pokryciu wiedzy i faktyczności. Konkretny przykład — w Humanity's Last Exam (tylko tekst) osiąga 31,6%, wyprzedzając Inkling z wynikiem 29,7%, a laboratorium informuje, że przewaga utrzymuje się przy każdym budżecie myślenia.
Benchmarki Inkling-Small
Wszystkie poniższe liczby pochodzą z premiery, uruchomionej przy effort 0,99. Wzorzec to szeroki, zrównoważony generalist, a nie model nastawiony wyłącznie na tabele liderów. Tam, gdzie zastosowano własną wiązkę testową, zaznaczamy to.
| Benchmark | Inkling-Small | Inkling | Uwaga |
|---|---|---|---|
| SWEBench Verified* | 80,2% | 77,6% | agentyczne kodowanie |
| Terminal Bench 2.1* (najlepsza wiązka) | 64,7% | 63,8% | agentyczne użycie narzędzi |
| GPQA Diamond | 89,5% | 87,2% | rozumowanie |
| HLE (tylko tekst) | 31,6% | 29,7% | rozumowanie |
| AIME 2026 | 95,5% | 97,1% | matematyka |
| ARC-AGI-2 | 40,1% | 36,5% | rozumowanie abstrakcyjne |
| CritPt | 8,3% | 5,4% | trudna fizyka |
| SimpleQA Verified | 20,6% | 43,9% | faktyczność (wygrywa Inkling) |
*SWEBench Verified i Terminal Bench 2.1 korzystają z własnych wiązek kodowania laboratorium dla modeli Inkling; zewnętrzne modele używają liczb zgłoszonych samodzielnie. Porównania między modelami należy traktować z tą zastrzeżeniem — niezależna weryfikacja będzie istotna.
Dwa wnioski. Po pierwsze, w zadaniach kodowania i rozumowania najważniejszych dla agentów, mały model jest co najmniej równy dużemu. Po drugie, kompromisem jest faktyczność: w SimpleQA Verified Inkling-Small spada do 20,6% wobec 43,9% Inkling — mniej parametrów oznacza mniej zapamiętanej wiedzy o świecie, co jest dokładnie tym obszarem, gdzie retrieval (wyszukiwanie) lub narzędzia odgrywają kluczową rolę.
W swojej rzeczywistej klasie wagowej Inkling-Small jest konkurencyjny wobec rówieśników z otwartymi wagami, takich jak DeepSeek V4 Flash, Qwen3.5-397B-A17B i GLM 5.2 — wymieniając zwycięstwa zależnie od benchmarku, zamiast dominować.
Argument za wydajnością: koszt i obliczenia
Prawdziwą ofertą jest krzywa wydajności do ceny. Ponieważ na token aktywnych jest tylko 12B parametrów, Inkling-Small jest tańszy w obsłudze niż Inkling przy podobnym poziomie jakości.
- Cena wyjścia: Inkling-Small jest wyceniony na $1,20 / 1M tokenów wobec $4,05 / 1M tokenów dla Inkling (post o premierze) — mniej więcej jedna trzecia kosztu.
- Minimalne wymagania sprzętowe: checkpoint BF16 wymaga co najmniej 600 GB zagregowanej pamięci VRAM (np. 4× NVIDIA B300 lub 8× H200). Skwantyzowany checkpoint NVFP4 obniża to do 180 GB i może działać na pojedynczym B300 (karta modelu, MarkTechPost).
Ścieżka z pojedynczym GPU to nagłówek dla mniejszych zespołów: model multimodalny 276B, który startup może hostować samodzielnie na jednym wynajętym B300, zamiast potrzebować klastra na poziomie czołowych laboratoriów.
Multimodalność, epistemika i bezpieczeństwo
Multimodalność. Inkling-Small używa tego samego natywnie multimodalnego projektu bez enkodera co Inkling — dźwięk jako spektrogramy dMel, obrazy podzielone na fragmenty 40×40 — a laboratorium informuje, że ulepszyło zdolność modelu do używania Pythona w zadaniach wizualnych, takich jak przycinanie i powiększanie wykresów i dokumentów. W większości multimodalnych testów prawie dorównuje Inkling przy niższym koszcie.
Epistemika. Kalibracja była trenowana z uczeniem przez wzmacnianie względem właściwych reguł punktacji na rzeczywistych pytaniach prognostycznych. W ForecastBench (bez wyszukiwania) osiąga Brier Index 61,3 ± 0,46, nieznacznie wyprzedzając Inkling z wynikiem 60,1 (post o premierze).
Bezpieczeństwo. Dziedziczy recepturę bezpieczeństwa Inkling. StrongREJECT wynosi 98,4%, a w FORTRESS osiąga 71,6% adversarial / 96,9% benign. Laboratorium zaleca nakładanie moderacji downstream, takiej jak Llama Guard, w wdrożeniach skierowanych do konsumentów (MarkTechPost). Podobnie jak w przypadku Inkling, zespoły, które dostrajają otwarte wagi, ponoszą odpowiedzialność za bezpieczeństwo swoich dostosowań.
Jak uruchomić model
Dostępne są trzy ścieżki (karta modelu):
- Pobierz wagi z Hugging Face — checkpoint BF16 lub skwantyzowany NVFP4.
- Dostrajaj na platformie Tinker — platformie fine-tuningu laboratorium, która udostępnia również dostęp przez API i Playground do czatu tekstowego, obrazowego i audio.
- Zewnętrzni dostawcy inferencji przez API dla zespołów, które nie chcą hostować modelu samodzielnie.
Dlaczego wydajny model z otwartymi wagami ma znaczenie dla agentów AI
Dla zespołów budujących agenty Inkling-Small wyostrza tę samą zmianę, którą zapoczątkował Inkling: możesz uruchomić zdolny, multimodalny model na własnej infrastrukturze, dostroić go do swojej domeny i zachować wynik w prywatności — bez płacenia za każde wywołanie API do zamkniętego dostawcy. Różnica teraz to ekonomia. Model o jednej czwartej rozmiaru w jednej trzeciej ceny, ze skwantyzowaną ścieżką na pojedynczym GPU, przesuwa self-hosting z kategorii „budżet czołowego laboratorium" do „jedna wynajęta instancja".
Zmienny poziom myślenia to funkcja natywna dla agentów: spowalniaj model przy trudnych krokach planowania, przyspieszaj przy tanich — wszystko wewnątrz własnej pętli — co jest dokładnie tym, czego potrzebują długie, wieloetapowe przepływy pracy. Jeśli porównujesz otwarte opcje, nasz artykuł o oryginalnym Thinking Machines Inkling omawia większy model i tezę o samodzielnym dostrajaniu bardziej szczegółowo.
Zbuduj własną siłę roboczą AI
Cała idea Inkling-Small — że wydajny, samodzielnie hostowany model, który możesz kształtować według własnych potrzeb, bije rozwiązania uniwersalne — to ten sam zakład, który stoi za Eigent, open-source'ową aplikacją desktopową „Cowork", która uruchamia wieloagentową siłę roboczą AI lokalnie. Podczas gdy Inkling-Small to model bazowy do dostrajania, Eigent to warstwa siły roboczej na wierzchu: zespół agentów automatyzujących rzeczywiste, wieloetapowe przepływy pracy na Twoim komputerze, korzystający z wybranych przez Ciebie modeli. Aby wprawić modele z otwartymi wagami w ruch zamiast tylko czytać tabele benchmarków, pobierz Eigent i zacznij budować własne przepływy pracy agentów.
Recent Posts

Alternatywa dla Augment Code
Porównaj alternatywy dla Augment Code w dużych bazach kodu pod względem aktualnych cen, wspólnego użycia, jakości kontekstu, dostępu do źródeł, samodzielnego hostingu, bezpieczeństwa i dopasowania do zespołu.

Najlepsi agenci AI do programowania open source
Porównaj najlepszych agentów AI do programowania open source według licencji, interfejsu, hostingu, wyboru modelu, zatwierdzeń, bezpieczeństwa, utrzymania i praktycznego dopasowania.

Najlepsi open-source’owi agenci sprzedażowi AI
Porównaj stos agentów sprzedażowych AI z 11x, Artisan, Qualified Piper, Nooks i Rox pod kątem danych kontaktowych, outreachu, przepływów CRM, kosztu, kontroli i dopasowania.