logo
  • Environnements
  • Entreprise
  • Tarifs
Blogs
Aug 4, 2026

Thinking Machines Inkling-Small : un modèle 276B qui surpasse son grand frère

Un MoE open-weights efficace qui égale — et parfois dépasse — Inkling au quart de sa taille.

EigentEigent
Share to
Thinking Machines Inkling-Small : un modèle 276B qui surpasse son grand frère
  • Qu'est-ce qu'Inkling-Small ?
  • Le paradoxe : le petit modèle bat le grand
  • Benchmarks d'Inkling-Small
  • L'argument de l'efficacité : coût et calcul
  • Multimodalité, épistémique et sécurité
  • Comment l'exécuter
  • Pourquoi un modèle open-weights efficace est important pour les agents IA
  • Mettez votre propre équipe IA au travail
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab a publié Inkling-Small, un modèle Mixture-of-Experts (mélange d'experts) open-weights doté de 276 milliards de paramètres au total et 12 milliards actifs — soit environ un quart de la taille de son premier modèle, Inkling — tout en l'égalant ou le surpassant sur le raisonnement et le codage agentique. L'enjeu ici n'est pas l'échelle, c'est l'efficacité. Ce guide couvre les spécifications d'Inkling-Small, ses résultats de benchmarks directement issus de la publication, son coût d'exploitation, et ce que représente un modèle open-weights efficace pour ceux qui développent des agents IA.

Qu'est-ce qu'Inkling-Small ?

Inkling-Small est le deuxième modèle de Thinking Machines Lab, la startup fondée par l'ancienne directrice technique d'OpenAI, Mira Murati. Il est arrivé environ deux semaines après Inkling, la première publication open-weights du laboratoire, et repose sur une idée centrale : conserver les capacités, réduire le calcul.

Les faits essentiels, tirés du billet de publication et de la fiche modèle du laboratoire :

  • 276 milliards de paramètres au total, 12 milliards actifs — un transformer MoE sparse. C'est environ un quart d'Inkling (975B total / 41B actifs).
  • Fenêtre de contexte de 1 million de tokens.
  • Nativement multimodal — raisonne sur du texte, des images et de l'audio, en utilisant la même architecture sans encodeur qu'Inkling.
  • Effort de raisonnement variable — ajustez le raisonnement à la hausse ou à la baisse pour arbitrer entre précision, vitesse et coût.
  • Poids ouverts sous licence Apache 2.0, sur Hugging Face — incluant un checkpoint quantifié NVFP4 pour une inférence efficace.
  • Entraîné sur des systèmes NVIDIA GB300 NVL72.

Sur le plan architectural, c'est un transformer décodeur seul à 42 couches qui achemine chaque token vers 6 des 256 experts, plus 2 experts partagés actifs sur chaque token (fiche modèle). La recette MoE suit la même lignée qu'Inkling.

Le paradoxe : le petit modèle bat le grand

La surprise est qu'Inkling-Small ne se contente pas d'approximer Inkling — sur plusieurs benchmarks, il le devance. Thinking Machines explique pourquoi dans la publication : Inkling-Small a commencé son entraînement après son grand frère, ce qui a permis à l'équipe d'améliorer le mélange de données de pré-entraînement et la recette, puis de post-entraîner un checkpoint précoce par distillation on-policy avec Inkling comme modèle enseignant. Ils ont ensuite appliqué un apprentissage par renforcement axé sur le codage agentique pendant deux semaines supplémentaires (billet de publication).

Le résultat, selon les propres termes du laboratoire : Inkling-Small a surpassé Inkling sur le raisonnement et le codage agentique, tandis qu'Inkling conserve un avantage sur la couverture des connaissances et la factualité. Exemple concret — sur Humanity's Last Exam (texte uniquement), il obtient 31,6 %, devant les 29,7 % d'Inkling, et le laboratoire indique que cet avantage se maintient à chaque budget de raisonnement.

Benchmarks d'Inkling-Small

Tous les chiffres ci-dessous proviennent de la publication, obtenus à un effort de 0,99. Le profil est celui d'un généraliste large et équilibré plutôt que d'un modèle optimisé pour les classements. Lorsqu'un harnais auto-rapporté est impliqué, nous le signalons.

BenchmarkInkling-SmallInklingNote
SWEBench Verified*80,2 %77,6 %codage agentique
Terminal Bench 2.1* (meilleur harnais)64,7 %63,8 %utilisation agentique d'outils
GPQA Diamond89,5 %87,2 %raisonnement
HLE (texte uniquement)31,6 %29,7 %raisonnement
AIME 202695,5 %97,1 %mathématiques
ARC-AGI-240,1 %36,5 %raisonnement abstrait
CritPt8,3 %5,4 %physique avancée
SimpleQA Verified20,6 %43,9 %factualité (Inkling gagne)

*SWEBench Verified et Terminal Bench 2.1 utilisent les harnais de codage propres au laboratoire pour les modèles Inkling ; les modèles externes utilisent des chiffres auto-rapportés. Gardez cette réserve à l'esprit pour les comparaisons inter-modèles — une vérification indépendante sera déterminante.

Deux enseignements. Premièrement, sur les tâches de codage et de raisonnement les plus importantes pour les agents, le petit modèle est au moins à égalité avec le grand. Deuxièmement, le compromis porte sur la factualité : sur SimpleQA Verified, Inkling-Small tombe à 20,6 % contre 43,9 % pour Inkling — moins de paramètres signifie moins de connaissances mondiales mémorisées, ce qui est précisément là où la récupération d'informations ou les outils justifient leur utilité.

Face à ses concurrents de même catégorie de poids, Inkling-Small est compétitif avec des pairs open-weights comme DeepSeek V4 Flash, Qwen3.5-397B-A17B et GLM 5.2 — échangeant des victoires selon le benchmark plutôt que dominant.

L'argument de l'efficacité : coût et calcul

L'argument principal est la courbe performance-par-dollar. Comme seulement 12 milliards de paramètres sont actifs par token, Inkling-Small est moins coûteux à servir qu'Inkling pour un niveau de qualité comparable.

  • Tarif de sortie : Inkling-Small est affiché à 1,20 $ / 1M de tokens contre 4,05 $ / 1M de tokens pour Inkling (billet de publication) — soit environ un tiers du coût.
  • Plancher matériel : le checkpoint BF16 nécessite au minimum 600 Go de VRAM agrégée (par exemple 4× NVIDIA B300 ou 8× H200). Le checkpoint quantifié NVFP4 ramène ce seuil à 180 Go et peut fonctionner sur un seul B300 (fiche modèle, MarkTechPost).

Ce chemin mono-GPU est la grande annonce pour les petites équipes : un modèle multimodal de 276 milliards de paramètres qu'une startup peut auto-héberger sur un seul B300 loué, sans avoir besoin d'un cluster de laboratoire frontier.

Multimodalité, épistémique et sécurité

Multimodalité. Inkling-Small utilise la même conception nativement multimodale sans encodeur qu'Inkling — audio sous forme de spectrogrammes dMel, images découpées en patches de 40×40 — et le laboratoire indique avoir amélioré la capacité du modèle à utiliser Python pour des tâches visuelles comme le recadrage et le zoom sur des graphiques et documents. Il égale presque Inkling sur la plupart des évaluations multimodales à moindre coût.

Épistémique. La calibration a été entraînée par apprentissage par renforcement sur des règles de scoring appropriées appliquées à des questions de prévision du monde réel. Sur ForecastBench (sans recherche), il affiche un Brier Index de 61,3 ± 0,46, légèrement supérieur aux 60,1 d'Inkling (billet de publication).

Sécurité. Il hérite de la recette de sécurité d'Inkling. StrongREJECT atteint 98,4 %, et sur FORTRESS il obtient 71,6 % adversarial / 96,9 % bénin. Le laboratoire recommande d'ajouter une modération en aval telle que Llama Guard pour les déploiements grand public (MarkTechPost). Comme pour Inkling, les équipes qui affinent les poids ouverts sont responsables de la sécurité de leurs personnalisations.

Comment l'exécuter

Trois options s'offrent à vous (fiche modèle) :

  1. Télécharger les poids depuis Hugging Face — checkpoint BF16 ou quantifié NVFP4.
  2. Affiner sur Tinker, la plateforme de fine-tuning du laboratoire, qui expose également un accès API et un Playground pour les conversations texte, image et audio.
  3. Fournisseurs d'inférence tiers via API pour les équipes qui ne souhaitent pas l'héberger elles-mêmes.

Pourquoi un modèle open-weights efficace est important pour les agents IA

Pour les équipes qui développent des agents, Inkling-Small accentue le même changement qu'Inkling avait amorcé : vous pouvez exécuter un modèle multimodal capable sur votre propre infrastructure, l'affiner sur votre domaine et garder le résultat privé — sans payer par appel API à un fournisseur fermé. La différence maintenant, c'est l'économie. Un modèle quatre fois plus petit à un tiers du prix, avec un chemin quantifié mono-GPU, fait passer l'auto-hébergement du « budget de laboratoire frontier » à « une instance louée ».

L'effort de raisonnement variable est la fonctionnalité native pour les agents : ralentissez le modèle pour les étapes de planification complexes, accélérez-le pour les étapes simples, le tout dans votre propre boucle — ce dont ont précisément besoin les workflows longs et multi-étapes. Si vous comparez les options open-weights, notre analyse du Thinking Machines Inkling original couvre le modèle plus grand et la thèse du fine-tuning en profondeur.

Mettez votre propre équipe IA au travail

La promesse centrale d'Inkling-Small — qu'un modèle efficace et auto-hébergé que vous pouvez façonner vous-même surpasse les solutions universelles — est le même pari qui sous-tend Eigent, l'application de bureau open-source « Cowork » qui fait fonctionner localement une équipe d'agents IA multi-agents. Là où Inkling-Small est un modèle de base à affiner, Eigent est la couche d'équipe par-dessus : une équipe d'agents qui automatise de vrais workflows multi-étapes sur votre machine, en utilisant les modèles de votre choix. Pour mettre les modèles open-weights au travail plutôt que de simplement lire des tableaux de benchmarks, téléchargez Eigent et commencez à construire vos propres workflows d'agents.

Recent Posts

Alternative à Augment Code
Aug 3, 2026

Alternative à Augment Code

Comparez les alternatives à Augment Code pour les grandes bases de code selon les tarifs actuels, l’usage mutualisé, la qualité du contexte, l’accès aux sources, l’auto-hébergement, la sécurité et les besoins de l’équipe.

Douglas LaiDouglas Lai
Meilleurs agents de programmation IA open source
Aug 3, 2026

Meilleurs agents de programmation IA open source

Comparez les meilleurs agents de programmation IA open source selon la licence, l’interface, l’auto-hébergement, le choix du modèle, les validations, la sécurité, la maintenance et l’usage réel.

Douglas LaiDouglas Lai
Les meilleurs agents commerciaux IA open source
IndustrieAug 3, 2026

Les meilleurs agents commerciaux IA open source

Comparez une pile d’agents commerciaux IA avec 11x, Artisan, Qualified Piper, Nooks et Rox sur les données de contact, la prospection, les workflows CRM, le coût, le contrôle et l’adéquation.

Douglas LaiDouglas Lai
Automate everything with AI workforce on desktop
Download Eigent

Essayez Eigent dès aujourd’hui

Téléchargez l’application de bureau open source. Votre workforce IA, exécutée sur votre machine.

Télécharger Eigent
Eigent

Recevez les dernières mises à jour, tutoriels et versions sur l’automatisation de la workforce IA.

ProduitEigentEnvironnementsTarifsEntreprise
ExplorerSolutionsCas d’usageCompétencesPluginsBlogs
DéveloppeursDocumentationGitHubCAMEL-AIOpen Source FundPartenaire
TéléchargementPour open source
EntrepriseÀ propos de nousMarqueCarrièresConditions d’utilisationPolitique de confidentialitéSécurité et confiancePolitique relative aux cookiesPolitique de remboursement et d’essai

Tous droits réservés © 2026 EIGENT UK LTD

Nouvelle version d’Eigent 1.0 publiée !download