Thinking Machines Inkling-Small: Um Modelo de 276B Que Supera Seu Irmão Maior
Um MoE de pesos abertos eficiente que iguala — e às vezes supera — o Inkling com um quarto do tamanho.

O Thinking Machines Lab lançou o Inkling-Small, um modelo de pesos abertos do tipo Mixture-of-Experts (Mistura de Especialistas) com 276B de parâmetros totais e 12B ativos — cerca de um quarto do tamanho de seu primeiro modelo, o Inkling, mas igualando ou superando-o em raciocínio e codificação agêntica. O destaque aqui não é a escala; é a eficiência. Este guia cobre as especificações do Inkling-Small, seus números de benchmark direto do lançamento, quanto custa para executar e o que um modelo de pesos abertos eficiente significa para quem está construindo agentes de IA.
O que é o Inkling-Small?
O Inkling-Small é o segundo modelo do Thinking Machines Lab, a startup fundada pela ex-CTO da OpenAI, Mira Murati. Ele chegou aproximadamente duas semanas após o Inkling, o primeiro lançamento de pesos abertos do laboratório, e foi construído em torno de uma ideia: manter a capacidade, reduzir o processamento.
Os fatos principais, do post de lançamento e do cartão do modelo do laboratório:
- 276B de parâmetros totais, 12B ativos — um transformer MoE esparso. Isso é aproximadamente um quarto do Inkling, que tem 975B totais / 41B ativos.
- Janela de contexto de 1M de tokens.
- Nativamente multimodal — raciocina sobre texto, imagens e áudio, usando a mesma arquitetura sem encoder do Inkling.
- Esforço de raciocínio variável — ajuste o raciocínio para cima ou para baixo para trocar precisão por velocidade e custo.
- Pesos abertos sob a licença Apache 2.0, no Hugging Face — incluindo um checkpoint quantizado NVFP4 para inferência eficiente.
- Treinado em sistemas NVIDIA GB300 NVL72.
Arquiteturalmente, é um transformer decoder-only de 42 camadas que roteia cada token para 6 de 256 especialistas, mais 2 especialistas compartilhados ativos em cada token (cartão do modelo). A receita MoE segue a mesma linhagem do Inkling.
A reviravolta: o modelo pequeno supera o grande
A parte surpreendente é que o Inkling-Small não apenas aproxima o Inkling — em vários benchmarks ele se destaca. O Thinking Machines explica o motivo no lançamento: o Inkling-Small começou o treinamento depois de seu irmão maior, então a equipe pôde melhorar a mistura de dados de pré-treinamento e a receita, e depois pós-treinar um checkpoint inicial usando destilação on-policy com o Inkling como professor. A partir daí, escalaram o aprendizado por reforço de codificação agêntica por mais duas semanas (post de lançamento).
O resultado, nas próprias palavras do laboratório: o Inkling-Small superou o Inkling em raciocínio e codificação agêntica, enquanto o Inkling mantém vantagem em cobertura de conhecimento e factualidade. Um exemplo concreto — no Humanity's Last Exam (somente texto) ele pontua 31,6%, à frente dos 29,7% do Inkling, e o laboratório relata que a vantagem se mantém em todos os orçamentos de raciocínio.
Benchmarks do Inkling-Small
Todos os números abaixo são do lançamento, executados com esforço 0,99. O padrão é um generalista amplo e equilibrado, em vez de um modelo que domina apenas tabelas de classificação. Onde um harness (conjunto de avaliação) auto-reportado está envolvido, indicamos.
| Benchmark | Inkling-Small | Inkling | Observação |
|---|---|---|---|
| SWEBench Verified* | 80,2% | 77,6% | codificação agêntica |
| Terminal Bench 2.1* (melhor harness) | 64,7% | 63,8% | uso agêntico de ferramentas |
| GPQA Diamond | 89,5% | 87,2% | raciocínio |
| HLE (somente texto) | 31,6% | 29,7% | raciocínio |
| AIME 2026 | 95,5% | 97,1% | matemática |
| ARC-AGI-2 | 40,1% | 36,5% | raciocínio abstrato |
| CritPt | 8,3% | 5,4% | física avançada |
| SimpleQA Verified | 20,6% | 43,9% | factualidade (Inkling vence) |
*SWEBench Verified e Terminal Bench 2.1 usam os próprios harnesses de codificação do laboratório para os modelos Inkling; modelos externos usam números auto-reportados. Leve as comparações entre modelos com essa ressalva em mente — a verificação independente será importante.
Duas conclusões. Primeiro, nas tarefas de codificação e raciocínio que mais importam para agentes, o modelo pequeno está pelo menos empatado com o grande. Segundo, a troca é a factualidade: no SimpleQA Verified, o Inkling-Small cai para 20,6% versus 43,9% do Inkling — menos parâmetros significa menos conhecimento de mundo memorizado, que é exatamente onde recuperação de informação ou ferramentas ganham seu valor.
Em relação à sua classe de peso real, o Inkling-Small é competitivo com pares de pesos abertos como DeepSeek V4 Flash, Qwen3.5-397B-A17B e GLM 5.2 — alternando vitórias dependendo do benchmark, em vez de dominar.
O argumento de eficiência: custo e processamento
O argumento real é a curva de desempenho por dólar. Como apenas 12B de parâmetros estão ativos por token, o Inkling-Small é mais barato de servir do que o Inkling com uma barra de qualidade semelhante.
- Preço de saída: O Inkling-Small está listado a $1,20 / 1M de tokens versus $4,05 / 1M de tokens do Inkling (post de lançamento) — aproximadamente um terço do custo.
- Requisito mínimo de hardware: o checkpoint BF16 precisa de pelo menos 600 GB de VRAM agregada (por exemplo, 4× NVIDIA B300 ou 8× H200). O checkpoint quantizado NVFP4 reduz isso para 180 GB e pode ser executado em uma única B300 (cartão do modelo, MarkTechPost).
Esse caminho de GPU única é o destaque para equipes menores: um modelo multimodal de 276B que uma startup pode hospedar por conta própria em uma única B300 alugada, em vez de precisar de um cluster de laboratório de fronteira.
Multimodalidade, epistemologia e segurança
Multimodal. O Inkling-Small usa o mesmo design nativamente multimodal e sem encoder do Inkling — áudio como espectrogramas dMel, imagens divididas em patches de 40×40 — e o laboratório afirma que melhorou a capacidade do modelo de usar Python para tarefas visuais como recortar e ampliar gráficos e documentos. Ele quase iguala o Inkling na maioria das avaliações multimodais com menor custo.
Epistemologia. A calibração foi treinada com aprendizado por reforço contra regras de pontuação adequadas em questões de previsão do mundo real. No ForecastBench (sem busca), ele registra um Índice Brier de 61,3 ± 0,46, ligeiramente à frente dos 60,1 do Inkling (post de lançamento).
Segurança. Ele herda a receita de segurança do Inkling. O StrongREJECT está em 98,4%, e no FORTRESS ele pontua 71,6% adversarial / 96,9% benigno. O laboratório recomenda adicionar moderação downstream como o Llama Guard em implantações voltadas ao consumidor (MarkTechPost). Assim como no Inkling, equipes que fazem fine-tune dos pesos abertos são responsáveis pela segurança de suas personalizações.
Como executá-lo
Você tem três caminhos (cartão do modelo):
- Baixe os pesos do Hugging Face — checkpoint BF16 ou o quantizado NVFP4.
- Faça fine-tune no Tinker, a plataforma de ajuste fino do laboratório, que também oferece acesso via API e um Playground para chat de texto, imagem e áudio.
- Provedores de inferência de terceiros via API para equipes que não querem hospedar por conta própria.
Por que um modelo de pesos abertos eficiente importa para agentes de IA
Para equipes que constroem agentes, o Inkling-Small aprofunda a mesma mudança que o Inkling iniciou: você pode executar um modelo capaz e multimodal em sua própria infraestrutura, fazer fine-tune no seu domínio e manter o resultado privado — sem pagar por chamada de API a um provedor fechado. A diferença agora é econômica. Um modelo de um quarto do tamanho a um terço do preço, com um caminho quantizado de GPU única, move a auto-hospedagem de "orçamento de laboratório de fronteira" para "uma instância alugada".
O esforço de raciocínio variável é o recurso nativo para agentes: desacelere o modelo para etapas de planejamento difíceis, acelere-o para as mais simples, tudo dentro do seu próprio loop — que é exatamente o que fluxos de trabalho longos e de múltiplas etapas precisam. Se você está comparando opções abertas, nosso artigo sobre o Thinking Machines Inkling original cobre o modelo maior e a tese de fine-tune-it-yourself com mais profundidade.
Faça isso com sua própria força de trabalho de IA
A premissa central do Inkling-Small — que um modelo eficiente e auto-hospedado que você pode moldar por conta própria supera o modelo único para todos — é a mesma aposta por trás do Eigent, o aplicativo desktop "Cowork" de código aberto que executa uma força de trabalho de IA multi-agente localmente. Enquanto o Inkling-Small é um modelo base que você ajusta, o Eigent é a camada de força de trabalho acima: uma equipe de agentes que automatiza fluxos de trabalho reais e de múltiplas etapas na sua máquina, usando os modelos que você escolher. Para colocar modelos de pesos abertos para trabalhar em vez de apenas ler tabelas de benchmark, baixe o Eigent e comece a construir seus próprios fluxos de trabalho de agentes.
Recent Posts

Alternativa ao Augment Code
Compare alternativas ao Augment Code para grandes bases de código por preço atual, uso compartilhado, qualidade de contexto, acesso ao código, auto-hospedagem, segurança e adequação à equipe.

Melhores agentes de programação com IA open source
Compare os melhores agentes de programação com IA open source por licença, interface, auto-hospedagem, escolha de modelo, aprovações, segurança, manutenção e adequação prática atual.

Melhores Agentes de Vendas de IA Open Source
Compare uma pilha de agentes de vendas de IA com 11x, Artisan, Qualified Piper, Nooks e Rox em dados de contato, abordagem, fluxos de CRM, custo, controle e adequação.