logo
  • Środowiska
  • Dla firm
  • Cennik
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata

Wydajny model MoE z otwartymi wagami, który dorównuje — a czasem przewyższa — Inkling przy jednej czwartej rozmiaru.

EigentEigent
Share to
Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata
  • Czym jest Inkling-Small?
  • Zaskoczenie: mały model bije dużego
  • Benchmarki Inkling-Small
  • Argument za wydajnością: koszt i obliczenia
  • Multimodalność, epistemika i bezpieczeństwo
  • Jak uruchomić model
  • Dlaczego wydajny model z otwartymi wagami ma znaczenie dla agentów AI
  • Zbuduj własną siłę roboczą AI
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab wydało Inkling-Small — model Mixture-of-Experts (mieszanina ekspertów) z otwartymi wagami, posiadający 276B parametrów łącznie i 12B aktywnych — czyli około jednej czwartej rozmiaru swojego pierwszego modelu, Inkling, a mimo to dorównujący mu lub go przewyższający w rozumowaniu i agentycznym kodowaniu. Sedno tej historii to nie skala, lecz wydajność. Ten przewodnik omawia specyfikację Inkling-Small, wyniki benchmarków prosto z premiery, koszty uruchomienia oraz to, co wydajny model z otwartymi wagami oznacza dla twórców agentów AI.

Czym jest Inkling-Small?

Inkling-Small to drugi model od Thinking Machines Lab — startupu założonego przez byłą CTO OpenAI, Mirę Murati. Pojawił się mniej więcej dwa tygodnie po Inkling, pierwszym wydaniu laboratorium z otwartymi wagami, i zbudowany jest wokół jednej idei: zachować możliwości, ograniczyć obliczenia.

Kluczowe fakty z posta o premierze i karty modelu:

  • 276B parametrów łącznie, 12B aktywnych — rzadki transformer MoE. To mniej więcej jedna czwarta Inkling (975B łącznie / 41B aktywnych).
  • Okno kontekstowe 1M tokenów.
  • Natywna multimodalność — przetwarza tekst, obrazy i dźwięk, korzystając z tej samej architektury bez enkodera co Inkling.
  • Zmienny poziom myślenia — możliwość regulacji intensywności rozumowania w zamian za szybkość i koszt.
  • Otwarte wagi na licencji Apache 2.0, dostępne na Hugging Face — w tym skwantyzowany checkpoint NVFP4 do wydajnej inferencji.
  • Trenowany na systemach NVIDIA GB300 NVL72.

Architektonicznie to 42-warstwowy transformer dekodujący, który kieruje każdy token do 6 spośród 256 ekspertów, plus 2 wspólnych ekspertów aktywnych przy każdym tokenie (karta modelu). Receptura MoE wywodzi się z tej samej linii co Inkling.

Zaskoczenie: mały model bije dużego

Zaskakujące jest to, że Inkling-Small nie tylko przybliża się do Inkling — w kilku benchmarkach go wyprzedza. Thinking Machines wyjaśnia to w poście o premierze: Inkling-Small rozpoczął trening po swoim większym bracie, dzięki czemu zespół mógł ulepszyć mieszankę danych pre-treningowych i recepturę, a następnie post-trenować wczesny checkpoint przy użyciu dystylacji on-policy z Inkling jako nauczycielem. Następnie przez kolejne dwa tygodnie skalowano agentyczne uczenie przez wzmacnianie w kodowaniu (post o premierze).

Efekt, własnymi słowami laboratorium: Inkling-Small przewyższył Inkling w rozumowaniu i agentycznym kodowaniu, podczas gdy Inkling zachowuje przewagę w pokryciu wiedzy i faktyczności. Konkretny przykład — w Humanity's Last Exam (tylko tekst) osiąga 31,6%, wyprzedzając Inkling z wynikiem 29,7%, a laboratorium informuje, że przewaga utrzymuje się przy każdym budżecie myślenia.

Benchmarki Inkling-Small

Wszystkie poniższe liczby pochodzą z premiery, uruchomionej przy effort 0,99. Wzorzec to szeroki, zrównoważony generalist, a nie model nastawiony wyłącznie na tabele liderów. Tam, gdzie zastosowano własną wiązkę testową, zaznaczamy to.

BenchmarkInkling-SmallInklingUwaga
SWEBench Verified*80,2%77,6%agentyczne kodowanie
Terminal Bench 2.1* (najlepsza wiązka)64,7%63,8%agentyczne użycie narzędzi
GPQA Diamond89,5%87,2%rozumowanie
HLE (tylko tekst)31,6%29,7%rozumowanie
AIME 202695,5%97,1%matematyka
ARC-AGI-240,1%36,5%rozumowanie abstrakcyjne
CritPt8,3%5,4%trudna fizyka
SimpleQA Verified20,6%43,9%faktyczność (wygrywa Inkling)

*SWEBench Verified i Terminal Bench 2.1 korzystają z własnych wiązek kodowania laboratorium dla modeli Inkling; zewnętrzne modele używają liczb zgłoszonych samodzielnie. Porównania między modelami należy traktować z tą zastrzeżeniem — niezależna weryfikacja będzie istotna.

Dwa wnioski. Po pierwsze, w zadaniach kodowania i rozumowania najważniejszych dla agentów, mały model jest co najmniej równy dużemu. Po drugie, kompromisem jest faktyczność: w SimpleQA Verified Inkling-Small spada do 20,6% wobec 43,9% Inkling — mniej parametrów oznacza mniej zapamiętanej wiedzy o świecie, co jest dokładnie tym obszarem, gdzie retrieval (wyszukiwanie) lub narzędzia odgrywają kluczową rolę.

W swojej rzeczywistej klasie wagowej Inkling-Small jest konkurencyjny wobec rówieśników z otwartymi wagami, takich jak DeepSeek V4 Flash, Qwen3.5-397B-A17B i GLM 5.2 — wymieniając zwycięstwa zależnie od benchmarku, zamiast dominować.

Argument za wydajnością: koszt i obliczenia

Prawdziwą ofertą jest krzywa wydajności do ceny. Ponieważ na token aktywnych jest tylko 12B parametrów, Inkling-Small jest tańszy w obsłudze niż Inkling przy podobnym poziomie jakości.

  • Cena wyjścia: Inkling-Small jest wyceniony na $1,20 / 1M tokenów wobec $4,05 / 1M tokenów dla Inkling (post o premierze) — mniej więcej jedna trzecia kosztu.
  • Minimalne wymagania sprzętowe: checkpoint BF16 wymaga co najmniej 600 GB zagregowanej pamięci VRAM (np. 4× NVIDIA B300 lub 8× H200). Skwantyzowany checkpoint NVFP4 obniża to do 180 GB i może działać na pojedynczym B300 (karta modelu, MarkTechPost).

Ścieżka z pojedynczym GPU to nagłówek dla mniejszych zespołów: model multimodalny 276B, który startup może hostować samodzielnie na jednym wynajętym B300, zamiast potrzebować klastra na poziomie czołowych laboratoriów.

Multimodalność, epistemika i bezpieczeństwo

Multimodalność. Inkling-Small używa tego samego natywnie multimodalnego projektu bez enkodera co Inkling — dźwięk jako spektrogramy dMel, obrazy podzielone na fragmenty 40×40 — a laboratorium informuje, że ulepszyło zdolność modelu do używania Pythona w zadaniach wizualnych, takich jak przycinanie i powiększanie wykresów i dokumentów. W większości multimodalnych testów prawie dorównuje Inkling przy niższym koszcie.

Epistemika. Kalibracja była trenowana z uczeniem przez wzmacnianie względem właściwych reguł punktacji na rzeczywistych pytaniach prognostycznych. W ForecastBench (bez wyszukiwania) osiąga Brier Index 61,3 ± 0,46, nieznacznie wyprzedzając Inkling z wynikiem 60,1 (post o premierze).

Bezpieczeństwo. Dziedziczy recepturę bezpieczeństwa Inkling. StrongREJECT wynosi 98,4%, a w FORTRESS osiąga 71,6% adversarial / 96,9% benign. Laboratorium zaleca nakładanie moderacji downstream, takiej jak Llama Guard, w wdrożeniach skierowanych do konsumentów (MarkTechPost). Podobnie jak w przypadku Inkling, zespoły, które dostrajają otwarte wagi, ponoszą odpowiedzialność za bezpieczeństwo swoich dostosowań.

Jak uruchomić model

Dostępne są trzy ścieżki (karta modelu):

  1. Pobierz wagi z Hugging Face — checkpoint BF16 lub skwantyzowany NVFP4.
  2. Dostrajaj na platformie Tinker — platformie fine-tuningu laboratorium, która udostępnia również dostęp przez API i Playground do czatu tekstowego, obrazowego i audio.
  3. Zewnętrzni dostawcy inferencji przez API dla zespołów, które nie chcą hostować modelu samodzielnie.

Dlaczego wydajny model z otwartymi wagami ma znaczenie dla agentów AI

Dla zespołów budujących agenty Inkling-Small wyostrza tę samą zmianę, którą zapoczątkował Inkling: możesz uruchomić zdolny, multimodalny model na własnej infrastrukturze, dostroić go do swojej domeny i zachować wynik w prywatności — bez płacenia za każde wywołanie API do zamkniętego dostawcy. Różnica teraz to ekonomia. Model o jednej czwartej rozmiaru w jednej trzeciej ceny, ze skwantyzowaną ścieżką na pojedynczym GPU, przesuwa self-hosting z kategorii „budżet czołowego laboratorium" do „jedna wynajęta instancja".

Zmienny poziom myślenia to funkcja natywna dla agentów: spowalniaj model przy trudnych krokach planowania, przyspieszaj przy tanich — wszystko wewnątrz własnej pętli — co jest dokładnie tym, czego potrzebują długie, wieloetapowe przepływy pracy. Jeśli porównujesz otwarte opcje, nasz artykuł o oryginalnym Thinking Machines Inkling omawia większy model i tezę o samodzielnym dostrajaniu bardziej szczegółowo.

Zbuduj własną siłę roboczą AI

Cała idea Inkling-Small — że wydajny, samodzielnie hostowany model, który możesz kształtować według własnych potrzeb, bije rozwiązania uniwersalne — to ten sam zakład, który stoi za Eigent, open-source'ową aplikacją desktopową „Cowork", która uruchamia wieloagentową siłę roboczą AI lokalnie. Podczas gdy Inkling-Small to model bazowy do dostrajania, Eigent to warstwa siły roboczej na wierzchu: zespół agentów automatyzujących rzeczywiste, wieloetapowe przepływy pracy na Twoim komputerze, korzystający z wybranych przez Ciebie modeli. Aby wprawić modele z otwartymi wagami w ruch zamiast tylko czytać tabele benchmarków, pobierz Eigent i zacznij budować własne przepływy pracy agentów.

Recent Posts

Alternatywa dla Augment Code
Aug 3, 2026

Alternatywa dla Augment Code

Porównaj alternatywy dla Augment Code w dużych bazach kodu pod względem aktualnych cen, wspólnego użycia, jakości kontekstu, dostępu do źródeł, samodzielnego hostingu, bezpieczeństwa i dopasowania do zespołu.

Douglas LaiDouglas Lai
Najlepsi agenci AI do programowania open source
Aug 3, 2026

Najlepsi agenci AI do programowania open source

Porównaj najlepszych agentów AI do programowania open source według licencji, interfejsu, hostingu, wyboru modelu, zatwierdzeń, bezpieczeństwa, utrzymania i praktycznego dopasowania.

Douglas LaiDouglas Lai
Najlepsi open-source’owi agenci sprzedażowi AI
BranżaAug 3, 2026

Najlepsi open-source’owi agenci sprzedażowi AI

Porównaj stos agentów sprzedażowych AI z 11x, Artisan, Qualified Piper, Nooks i Rox pod kątem danych kontaktowych, outreachu, przepływów CRM, kosztu, kontroli i dopasowania.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Wypróbuj Eigent już dziś

Pobierz open-source’ową aplikację desktopową. Twoja SI workforce, działająca na Twoim komputerze.

Pobierz Eigent
Eigent

Otrzymuj najnowsze aktualizacje, poradniki i wydania dotyczące automatyzacji SI workforce.

ProduktEigentŚrodowiskaCennikDla firm
OdkrywajRozwiązaniaPrzypadki użyciaUmiejętnościWtyczkiBlogi
DeweloperzyDokumentacjaGitHubCAMEL-AIFundusz Open SourcePartner
PobierzDla open source
FirmaO nasBrandKarieraWarunki korzystaniaPolityka prywatnościBezpieczeństwo i zaufaniePolityka plików cookiePolityka zwrotów i wersji próbnej

Wszelkie prawa zastrzeżone © 2026 EIGENT UK LTD

Wydano nową wersję Eigent 1.0!download