logo
  • Środowiska
  • Dla firm
  • Cennik
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata

Wydajny model MoE z otwartymi wagami, który dorównuje — a czasem przewyższa — Inkling przy jednej czwartej rozmiaru.

EigentEigent
Share to
Thinking Machines Inkling-Small: Model 276B, który bije swojego większego brata
  • Czym jest Inkling-Small?
  • Zaskoczenie: mały model bije dużego
  • Benchmarki Inkling-Small
  • Argument za wydajnością: koszt i obliczenia
  • Multimodalność, epistemika i bezpieczeństwo
  • Jak uruchomić model
  • Dlaczego wydajny model z otwartymi wagami ma znaczenie dla agentów AI
  • Zbuduj własną siłę roboczą AI
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab wydało Inkling-Small — model Mixture-of-Experts (mieszanina ekspertów) z otwartymi wagami, posiadający 276B parametrów łącznie i 12B aktywnych — czyli około jednej czwartej rozmiaru swojego pierwszego modelu, Inkling, a mimo to dorównujący mu lub go przewyższający w rozumowaniu i agentycznym kodowaniu. Sedno tej historii to nie skala, lecz wydajność. Ten przewodnik omawia specyfikację Inkling-Small, wyniki benchmarków prosto z premiery, koszty uruchomienia oraz to, co wydajny model z otwartymi wagami oznacza dla twórców agentów AI.

Czym jest Inkling-Small?

Inkling-Small to drugi model od Thinking Machines Lab — startupu założonego przez byłą CTO OpenAI, Mirę Murati. Pojawił się mniej więcej dwa tygodnie po Inkling, pierwszym wydaniu laboratorium z otwartymi wagami, i zbudowany jest wokół jednej idei: zachować możliwości, ograniczyć obliczenia.

Kluczowe fakty z posta o premierze i karty modelu:

  • 276B parametrów łącznie, 12B aktywnych — rzadki transformer MoE. To mniej więcej jedna czwarta Inkling (975B łącznie / 41B aktywnych).
  • Okno kontekstowe 1M tokenów.
  • Natywna multimodalność — przetwarza tekst, obrazy i dźwięk, korzystając z tej samej architektury bez enkodera co Inkling.
  • Zmienny poziom myślenia — możliwość regulacji intensywności rozumowania w zamian za szybkość i koszt.
  • Otwarte wagi na licencji Apache 2.0, dostępne na Hugging Face — w tym skwantyzowany checkpoint NVFP4 do wydajnej inferencji.
  • Trenowany na systemach NVIDIA GB300 NVL72.

Architektonicznie to 42-warstwowy transformer dekodujący, który kieruje każdy token do 6 spośród 256 ekspertów, plus 2 wspólnych ekspertów aktywnych przy każdym tokenie (karta modelu). Receptura MoE wywodzi się z tej samej linii co Inkling.

Zaskoczenie: mały model bije dużego

Zaskakujące jest to, że Inkling-Small nie tylko przybliża się do Inkling — w kilku benchmarkach go wyprzedza. Thinking Machines wyjaśnia to w poście o premierze: Inkling-Small rozpoczął trening po swoim większym bracie, dzięki czemu zespół mógł ulepszyć mieszankę danych pre-treningowych i recepturę, a następnie post-trenować wczesny checkpoint przy użyciu dystylacji on-policy z Inkling jako nauczycielem. Następnie przez kolejne dwa tygodnie skalowano agentyczne uczenie przez wzmacnianie w kodowaniu (post o premierze).

Efekt, własnymi słowami laboratorium: Inkling-Small przewyższył Inkling w rozumowaniu i agentycznym kodowaniu, podczas gdy Inkling zachowuje przewagę w pokryciu wiedzy i faktyczności. Konkretny przykład — w Humanity's Last Exam (tylko tekst) osiąga 31,6%, wyprzedzając Inkling z wynikiem 29,7%, a laboratorium informuje, że przewaga utrzymuje się przy każdym budżecie myślenia.

Benchmarki Inkling-Small

Wszystkie poniższe liczby pochodzą z premiery, uruchomionej przy effort 0,99. Wzorzec to szeroki, zrównoważony generalist, a nie model nastawiony wyłącznie na tabele liderów. Tam, gdzie zastosowano własną wiązkę testową, zaznaczamy to.

BenchmarkInkling-SmallInklingUwaga
SWEBench Verified*80,2%77,6%agentyczne kodowanie
Terminal Bench 2.1* (najlepsza wiązka)64,7%63,8%agentyczne użycie narzędzi
GPQA Diamond89,5%87,2%rozumowanie
HLE (tylko tekst)31,6%29,7%rozumowanie
AIME 202695,5%97,1%matematyka
ARC-AGI-240,1%36,5%rozumowanie abstrakcyjne
CritPt8,3%5,4%trudna fizyka
SimpleQA Verified20,6%43,9%faktyczność (wygrywa Inkling)

*SWEBench Verified i Terminal Bench 2.1 korzystają z własnych wiązek kodowania laboratorium dla modeli Inkling; zewnętrzne modele używają liczb zgłoszonych samodzielnie. Porównania między modelami należy traktować z tą zastrzeżeniem — niezależna weryfikacja będzie istotna.

Dwa wnioski. Po pierwsze, w zadaniach kodowania i rozumowania najważniejszych dla agentów, mały model jest co najmniej równy dużemu. Po drugie, kompromisem jest faktyczność: w SimpleQA Verified Inkling-Small spada do 20,6% wobec 43,9% Inkling — mniej parametrów oznacza mniej zapamiętanej wiedzy o świecie, co jest dokładnie tym obszarem, gdzie retrieval (wyszukiwanie) lub narzędzia odgrywają kluczową rolę.

W swojej rzeczywistej klasie wagowej Inkling-Small jest konkurencyjny wobec rówieśników z otwartymi wagami, takich jak DeepSeek V4 Flash, Qwen3.5-397B-A17B i GLM 5.2 — wymieniając zwycięstwa zależnie od benchmarku, zamiast dominować.

Argument za wydajnością: koszt i obliczenia

Prawdziwą ofertą jest krzywa wydajności do ceny. Ponieważ na token aktywnych jest tylko 12B parametrów, Inkling-Small jest tańszy w obsłudze niż Inkling przy podobnym poziomie jakości.

  • Cena wyjścia: Inkling-Small jest wyceniony na $1,20 / 1M tokenów wobec $4,05 / 1M tokenów dla Inkling (post o premierze) — mniej więcej jedna trzecia kosztu.
  • Minimalne wymagania sprzętowe: checkpoint BF16 wymaga co najmniej 600 GB zagregowanej pamięci VRAM (np. 4× NVIDIA B300 lub 8× H200). Skwantyzowany checkpoint NVFP4 obniża to do 180 GB i może działać na pojedynczym B300 (karta modelu, MarkTechPost).

Ścieżka z pojedynczym GPU to nagłówek dla mniejszych zespołów: model multimodalny 276B, który startup może hostować samodzielnie na jednym wynajętym B300, zamiast potrzebować klastra na poziomie czołowych laboratoriów.

Multimodalność, epistemika i bezpieczeństwo

Multimodalność. Inkling-Small używa tego samego natywnie multimodalnego projektu bez enkodera co Inkling — dźwięk jako spektrogramy dMel, obrazy podzielone na fragmenty 40×40 — a laboratorium informuje, że ulepszyło zdolność modelu do używania Pythona w zadaniach wizualnych, takich jak przycinanie i powiększanie wykresów i dokumentów. W większości multimodalnych testów prawie dorównuje Inkling przy niższym koszcie.

Epistemika. Kalibracja była trenowana z uczeniem przez wzmacnianie względem właściwych reguł punktacji na rzeczywistych pytaniach prognostycznych. W ForecastBench (bez wyszukiwania) osiąga Brier Index 61,3 ± 0,46, nieznacznie wyprzedzając Inkling z wynikiem 60,1 (post o premierze).

Bezpieczeństwo. Dziedziczy recepturę bezpieczeństwa Inkling. StrongREJECT wynosi 98,4%, a w FORTRESS osiąga 71,6% adversarial / 96,9% benign. Laboratorium zaleca nakładanie moderacji downstream, takiej jak Llama Guard, w wdrożeniach skierowanych do konsumentów (MarkTechPost). Podobnie jak w przypadku Inkling, zespoły, które dostrajają otwarte wagi, ponoszą odpowiedzialność za bezpieczeństwo swoich dostosowań.

Jak uruchomić model

Dostępne są trzy ścieżki (karta modelu):

  1. Pobierz wagi z Hugging Face — checkpoint BF16 lub skwantyzowany NVFP4.
  2. Dostrajaj na platformie Tinker — platformie fine-tuningu laboratorium, która udostępnia również dostęp przez API i Playground do czatu tekstowego, obrazowego i audio.
  3. Zewnętrzni dostawcy inferencji przez API dla zespołów, które nie chcą hostować modelu samodzielnie.

Dlaczego wydajny model z otwartymi wagami ma znaczenie dla agentów AI

Dla zespołów budujących agenty Inkling-Small wyostrza tę samą zmianę, którą zapoczątkował Inkling: możesz uruchomić zdolny, multimodalny model na własnej infrastrukturze, dostroić go do swojej domeny i zachować wynik w prywatności — bez płacenia za każde wywołanie API do zamkniętego dostawcy. Różnica teraz to ekonomia. Model o jednej czwartej rozmiaru w jednej trzeciej ceny, ze skwantyzowaną ścieżką na pojedynczym GPU, przesuwa self-hosting z kategorii „budżet czołowego laboratorium" do „jedna wynajęta instancja".

Zmienny poziom myślenia to funkcja natywna dla agentów: spowalniaj model przy trudnych krokach planowania, przyspieszaj przy tanich — wszystko wewnątrz własnej pętli — co jest dokładnie tym, czego potrzebują długie, wieloetapowe przepływy pracy. Jeśli porównujesz otwarte opcje, nasz artykuł o oryginalnym Thinking Machines Inkling omawia większy model i tezę o samodzielnym dostrajaniu bardziej szczegółowo.

Zbuduj własną siłę roboczą AI

Cała idea Inkling-Small — że wydajny, samodzielnie hostowany model, który możesz kształtować według własnych potrzeb, bije rozwiązania uniwersalne — to ten sam zakład, który stoi za Eigent, open-source'ową aplikacją desktopową „Cowork", która uruchamia wieloagentową siłę roboczą AI lokalnie. Podczas gdy Inkling-Small to model bazowy do dostrajania, Eigent to warstwa siły roboczej na wierzchu: zespół agentów automatyzujących rzeczywiste, wieloetapowe przepływy pracy na Twoim komputerze, korzystający z wybranych przez Ciebie modeli. Aby wprawić modele z otwartymi wagami w ruch zamiast tylko czytać tabele benchmarków, pobierz Eigent i zacznij budować własne przepływy pracy agentów.

Recent Posts

Meta Muse: Osobisty Agent AI, Który Rezerwuje, Kupuje i Negocjuje
Sep 9, 2026

Meta Muse: Osobisty Agent AI, Który Rezerwuje, Kupuje i Negocjuje

Meta Muse to osobisty agent AI, który rezerwuje podróże, kupuje rzeczy i negocjuje rachunki przez czat. Oto co robi, cennik, bezpieczeństwo i porównanie z konkurencją.

EigentEigent
Eigent v1.0.4 — informacje o wydaniu: pulpity Skills i Connectors oraz stabilne przebiegi wieloturowe
ProduktSep 4, 2026

Eigent v1.0.4 — informacje o wydaniu: pulpity Skills i Connectors oraz stabilne przebiegi wieloturowe

Eigent v1.0.4 przebudowuje Skills i Connectors w pulpity zarządzania oraz wzmacnia pracę wieloturową, punkty kontrolne workspace i stany konektorów.

Douglas LaiDouglas Lai
Claude Fable 5.1 i Mythos 5.1: Co nowego, wyjaśnione
Sep 3, 2026

Claude Fable 5.1 i Mythos 5.1: Co nowego, wyjaśnione

Claude Fable 5.1 i Mythos 5.1 wyjaśnione: ten sam model w dwóch poziomach zabezpieczeń, z nowymi wynikami benchmarków, niższymi kosztami o około 25–45 procent i szczegółami dostępu.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Wypróbuj Eigent już dziś

Pobierz open-source’ową aplikację desktopową. Twoja SI workforce, działająca na Twoim komputerze.

Pobierz Eigent
Eigent

Otrzymuj najnowsze aktualizacje, poradniki i wydania dotyczące automatyzacji SI workforce.

Dziękujemy za zapis!

ProduktEigentŚrodowiskaCennikDla firm
OdkrywajRozwiązaniaPrzypadki użyciaUmiejętnościWtyczkiBlogi
DeweloperzyDokumentacjaGitHubCAMEL-AIFundusz Open SourcePartner
PobierzDla open source
FirmaO nasBrandKarieraWarunki korzystaniaPolityka prywatnościBezpieczeństwo i zaufaniePolityka plików cookiePolityka zwrotów i wersji próbnej

Wszelkie prawa zastrzeżone © 2026 EIGENT UK LTD