Thinking Machines Inkling-Small : un modèle 276B qui surpasse son grand frère
Un MoE open-weights efficace qui égale — et parfois dépasse — Inkling au quart de sa taille.

Thinking Machines Lab a publié Inkling-Small, un modèle Mixture-of-Experts (mélange d'experts) open-weights doté de 276 milliards de paramètres au total et 12 milliards actifs — soit environ un quart de la taille de son premier modèle, Inkling — tout en l'égalant ou le surpassant sur le raisonnement et le codage agentique. L'enjeu ici n'est pas l'échelle, c'est l'efficacité. Ce guide couvre les spécifications d'Inkling-Small, ses résultats de benchmarks directement issus de la publication, son coût d'exploitation, et ce que représente un modèle open-weights efficace pour ceux qui développent des agents IA.
Qu'est-ce qu'Inkling-Small ?
Inkling-Small est le deuxième modèle de Thinking Machines Lab, la startup fondée par l'ancienne directrice technique d'OpenAI, Mira Murati. Il est arrivé environ deux semaines après Inkling, la première publication open-weights du laboratoire, et repose sur une idée centrale : conserver les capacités, réduire le calcul.
Les faits essentiels, tirés du billet de publication et de la fiche modèle du laboratoire :
- 276 milliards de paramètres au total, 12 milliards actifs — un transformer MoE sparse. C'est environ un quart d'Inkling (975B total / 41B actifs).
- Fenêtre de contexte de 1 million de tokens.
- Nativement multimodal — raisonne sur du texte, des images et de l'audio, en utilisant la même architecture sans encodeur qu'Inkling.
- Effort de raisonnement variable — ajustez le raisonnement à la hausse ou à la baisse pour arbitrer entre précision, vitesse et coût.
- Poids ouverts sous licence Apache 2.0, sur Hugging Face — incluant un checkpoint quantifié NVFP4 pour une inférence efficace.
- Entraîné sur des systèmes NVIDIA GB300 NVL72.
Sur le plan architectural, c'est un transformer décodeur seul à 42 couches qui achemine chaque token vers 6 des 256 experts, plus 2 experts partagés actifs sur chaque token (fiche modèle). La recette MoE suit la même lignée qu'Inkling.
Le paradoxe : le petit modèle bat le grand
La surprise est qu'Inkling-Small ne se contente pas d'approximer Inkling — sur plusieurs benchmarks, il le devance. Thinking Machines explique pourquoi dans la publication : Inkling-Small a commencé son entraînement après son grand frère, ce qui a permis à l'équipe d'améliorer le mélange de données de pré-entraînement et la recette, puis de post-entraîner un checkpoint précoce par distillation on-policy avec Inkling comme modèle enseignant. Ils ont ensuite appliqué un apprentissage par renforcement axé sur le codage agentique pendant deux semaines supplémentaires (billet de publication).
Le résultat, selon les propres termes du laboratoire : Inkling-Small a surpassé Inkling sur le raisonnement et le codage agentique, tandis qu'Inkling conserve un avantage sur la couverture des connaissances et la factualité. Exemple concret — sur Humanity's Last Exam (texte uniquement), il obtient 31,6 %, devant les 29,7 % d'Inkling, et le laboratoire indique que cet avantage se maintient à chaque budget de raisonnement.
Benchmarks d'Inkling-Small
Tous les chiffres ci-dessous proviennent de la publication, obtenus à un effort de 0,99. Le profil est celui d'un généraliste large et équilibré plutôt que d'un modèle optimisé pour les classements. Lorsqu'un harnais auto-rapporté est impliqué, nous le signalons.
| Benchmark | Inkling-Small | Inkling | Note |
|---|---|---|---|
| SWEBench Verified* | 80,2 % | 77,6 % | codage agentique |
| Terminal Bench 2.1* (meilleur harnais) | 64,7 % | 63,8 % | utilisation agentique d'outils |
| GPQA Diamond | 89,5 % | 87,2 % | raisonnement |
| HLE (texte uniquement) | 31,6 % | 29,7 % | raisonnement |
| AIME 2026 | 95,5 % | 97,1 % | mathématiques |
| ARC-AGI-2 | 40,1 % | 36,5 % | raisonnement abstrait |
| CritPt | 8,3 % | 5,4 % | physique avancée |
| SimpleQA Verified | 20,6 % | 43,9 % | factualité (Inkling gagne) |
*SWEBench Verified et Terminal Bench 2.1 utilisent les harnais de codage propres au laboratoire pour les modèles Inkling ; les modèles externes utilisent des chiffres auto-rapportés. Gardez cette réserve à l'esprit pour les comparaisons inter-modèles — une vérification indépendante sera déterminante.
Deux enseignements. Premièrement, sur les tâches de codage et de raisonnement les plus importantes pour les agents, le petit modèle est au moins à égalité avec le grand. Deuxièmement, le compromis porte sur la factualité : sur SimpleQA Verified, Inkling-Small tombe à 20,6 % contre 43,9 % pour Inkling — moins de paramètres signifie moins de connaissances mondiales mémorisées, ce qui est précisément là où la récupération d'informations ou les outils justifient leur utilité.
Face à ses concurrents de même catégorie de poids, Inkling-Small est compétitif avec des pairs open-weights comme DeepSeek V4 Flash, Qwen3.5-397B-A17B et GLM 5.2 — échangeant des victoires selon le benchmark plutôt que dominant.
L'argument de l'efficacité : coût et calcul
L'argument principal est la courbe performance-par-dollar. Comme seulement 12 milliards de paramètres sont actifs par token, Inkling-Small est moins coûteux à servir qu'Inkling pour un niveau de qualité comparable.
- Tarif de sortie : Inkling-Small est affiché à 1,20 $ / 1M de tokens contre 4,05 $ / 1M de tokens pour Inkling (billet de publication) — soit environ un tiers du coût.
- Plancher matériel : le checkpoint BF16 nécessite au minimum 600 Go de VRAM agrégée (par exemple 4× NVIDIA B300 ou 8× H200). Le checkpoint quantifié NVFP4 ramène ce seuil à 180 Go et peut fonctionner sur un seul B300 (fiche modèle, MarkTechPost).
Ce chemin mono-GPU est la grande annonce pour les petites équipes : un modèle multimodal de 276 milliards de paramètres qu'une startup peut auto-héberger sur un seul B300 loué, sans avoir besoin d'un cluster de laboratoire frontier.
Multimodalité, épistémique et sécurité
Multimodalité. Inkling-Small utilise la même conception nativement multimodale sans encodeur qu'Inkling — audio sous forme de spectrogrammes dMel, images découpées en patches de 40×40 — et le laboratoire indique avoir amélioré la capacité du modèle à utiliser Python pour des tâches visuelles comme le recadrage et le zoom sur des graphiques et documents. Il égale presque Inkling sur la plupart des évaluations multimodales à moindre coût.
Épistémique. La calibration a été entraînée par apprentissage par renforcement sur des règles de scoring appropriées appliquées à des questions de prévision du monde réel. Sur ForecastBench (sans recherche), il affiche un Brier Index de 61,3 ± 0,46, légèrement supérieur aux 60,1 d'Inkling (billet de publication).
Sécurité. Il hérite de la recette de sécurité d'Inkling. StrongREJECT atteint 98,4 %, et sur FORTRESS il obtient 71,6 % adversarial / 96,9 % bénin. Le laboratoire recommande d'ajouter une modération en aval telle que Llama Guard pour les déploiements grand public (MarkTechPost). Comme pour Inkling, les équipes qui affinent les poids ouverts sont responsables de la sécurité de leurs personnalisations.
Comment l'exécuter
Trois options s'offrent à vous (fiche modèle) :
- Télécharger les poids depuis Hugging Face — checkpoint BF16 ou quantifié NVFP4.
- Affiner sur Tinker, la plateforme de fine-tuning du laboratoire, qui expose également un accès API et un Playground pour les conversations texte, image et audio.
- Fournisseurs d'inférence tiers via API pour les équipes qui ne souhaitent pas l'héberger elles-mêmes.
Pourquoi un modèle open-weights efficace est important pour les agents IA
Pour les équipes qui développent des agents, Inkling-Small accentue le même changement qu'Inkling avait amorcé : vous pouvez exécuter un modèle multimodal capable sur votre propre infrastructure, l'affiner sur votre domaine et garder le résultat privé — sans payer par appel API à un fournisseur fermé. La différence maintenant, c'est l'économie. Un modèle quatre fois plus petit à un tiers du prix, avec un chemin quantifié mono-GPU, fait passer l'auto-hébergement du « budget de laboratoire frontier » à « une instance louée ».
L'effort de raisonnement variable est la fonctionnalité native pour les agents : ralentissez le modèle pour les étapes de planification complexes, accélérez-le pour les étapes simples, le tout dans votre propre boucle — ce dont ont précisément besoin les workflows longs et multi-étapes. Si vous comparez les options open-weights, notre analyse du Thinking Machines Inkling original couvre le modèle plus grand et la thèse du fine-tuning en profondeur.
Mettez votre propre équipe IA au travail
La promesse centrale d'Inkling-Small — qu'un modèle efficace et auto-hébergé que vous pouvez façonner vous-même surpasse les solutions universelles — est le même pari qui sous-tend Eigent, l'application de bureau open-source « Cowork » qui fait fonctionner localement une équipe d'agents IA multi-agents. Là où Inkling-Small est un modèle de base à affiner, Eigent est la couche d'équipe par-dessus : une équipe d'agents qui automatise de vrais workflows multi-étapes sur votre machine, en utilisant les modèles de votre choix. Pour mettre les modèles open-weights au travail plutôt que de simplement lire des tableaux de benchmarks, téléchargez Eigent et commencez à construire vos propres workflows d'agents.
Recent Posts

Alternative à Augment Code
Comparez les alternatives à Augment Code pour les grandes bases de code selon les tarifs actuels, l’usage mutualisé, la qualité du contexte, l’accès aux sources, l’auto-hébergement, la sécurité et les besoins de l’équipe.

Meilleurs agents de programmation IA open source
Comparez les meilleurs agents de programmation IA open source selon la licence, l’interface, l’auto-hébergement, le choix du modèle, les validations, la sécurité, la maintenance et l’usage réel.

Les meilleurs agents commerciaux IA open source
Comparez une pile d’agents commerciaux IA avec 11x, Artisan, Qualified Piper, Nooks et Rox sur les données de contact, la prospection, les workflows CRM, le coût, le contrôle et l’adéquation.