Kimi K3 : Le modèle frontier open-weight 2,8T de Moonshot AI pour le codage agentique
Le plus grand modèle open-weight jamais publié — 2,8T de paramètres, un contexte d'1M de tokens, et des benchmarks frontier top-3 orientés codage et agents à long horizon

Kimi K3 est le nouveau modèle de langage phare de Moonshot AI — et, avec 2,8 billions de paramètres, le plus grand modèle open-weight jamais publié. Lancé le 16 juillet 2026, il associe une architecture Mixture-of-Experts (MoE) de classe frontier à une fenêtre de contexte d'un million de tokens et une orientation agent-first sur le codage et le travail de connaissance à long horizon. Ce qui le distingue ne tient pas uniquement à sa taille : Moonshot publie les poids complets, rendant des performances véritablement frontier accessibles pour les agents auto-hébergés. Voici ce qu'est réellement K3, comment il se positionne dans les benchmarks, ce qu'il coûte et où il s'intègre.
Ce guide couvre l'architecture de K3, ses benchmarks, sa tarification, sa comparaison avec la gamme K2, et les workflows concrets que les développeurs font déjà tourner dessus.
Qu'est-ce que Kimi K3 ?
Kimi K3 est un modèle frontier open-weight orienté agents, développé par Moonshot AI basé à Pékin, publié le 16 juillet 2026 en tant que successeur de la série Kimi K2. Moonshot le décrit comme son modèle de codage open-source le plus puissant à ce jour, conçu pour soutenir de longues sessions d'ingénierie, naviguer dans de grands dépôts de code et orchestrer des outils en ligne de commande avec une supervision humaine minimale. (Fortune)
Le chiffre phare est l'échelle. K3 embarque 2,8 billions de paramètres totaux dans une architecture MoE sparse — environ 2,8× la taille de K2.6, et plus grand que les concurrents chinois comme DeepSeek V4 Pro (~1,6T) et la série GLM-5 de Zhipu. Cela en fait, selon Moonshot, le plus grand modèle open-weight jamais construit. (VentureBeat)
Fait crucial, les poids ne resteront pas verrouillés. Moonshot a planifié la publication des poids complets pour le 27 juillet 2026, ce qui signifie que les développeurs pourront inspecter, modifier et auto-héberger le modèle plutôt que de se limiter à appeler une API hébergée. (Axios)
Spécifications et Architecture
K3 conserve la philosophie de conception agent-first inspirée d'OpenAI de la gamme K2 et repousse les limites sur tous les axes.
- MoE sparse à 2,8T de paramètres — des centaines d'experts avec activation sparse, de sorte que seule une fraction du réseau s'exécute par token. L'échelle vise la largeur et la spécialisation, optimisée pour le raisonnement à long horizon et l'utilisation complexe d'outils. (VentureBeat)
- Fenêtre de contexte d'un million de tokens — suffisante pour contenir une base de code entière, un système de design ou un corpus de recherche « en vue » sans découpage élaboré. (Axios)
- Kimi Delta Attention (KDA) — un mécanisme d'attention hybride linéaire publié en premier lieu comme recherche ouverte par Moonshot, visant à rendre les séquences ultra-longues traitables sans l'explosion de coût de l'attention standard. (VentureBeat)
- Attention Residuals (AttnRes) — décrit par Moonshot comme un remplacement direct des connexions résiduelles offrant des gains de mise à l'échelle constants. (VentureBeat)
- Entrée multimodale native — compréhension visuelle sur texte et images, plus un mode de raisonnement permanent que Moonshot appelle « mode de réflexion ». (Axios)
- Compatible OpenAI SDK — l'API reproduit l'interface OpenAI, permettant aux équipes qui développent déjà sur les chaînes d'outils OpenAI ou Anthropic de s'intégrer avec des modifications minimales. (VentureBeat)
KDA et AttnRes ont tous deux été publiés précédemment comme recherche ouverte sur GitHub — un signal que les gains d'efficacité de K3 proviennent de l'architecture, et pas seulement d'une mise à l'échelle brute. (VentureBeat)
Benchmarks : Où se Positionne K3
K3 a fait ses débuts à la 3e place du classement Artificial Analysis, derrière Claude Fable 5 d'Anthropic et GPT-5.6 Sol d'OpenAI — mais devant tout le reste, et il a dominé certains tests pratiques. (Wikipedia)
Quelques résultats se distinguent des analyses de lancement :
- GDPval-AA v2 (tâches du monde réel sur 44 métiers et 9 secteurs) : K3 a obtenu 1 687, troisième au classement général derrière Claude Fable 5 Max (1 815) et GPT-5.6 Sol Max (1 747,8), et devant Claude Opus 4.8 (1 600). (VentureBeat)
- AA-Briefcase (un benchmark privé de travail de connaissance à long horizon) : K3 a pris la deuxième place avec 1 527, battant GPT-5.6 Sol Max et ne se classant qu'après Fable 5 Max. (VentureBeat)
- Automatisation des tâches : K3 s'est classé premier dans quatre des huit benchmarks — dont Automation Bench, SpreadsheetBench 2 et BrowseComp — terminant deuxième derrière Fable 5 dans la plupart des autres. (VentureBeat)
- Codage front-end : lors de tests en aveugle par l'évaluateur Arena, les développeurs ont préféré K3 à tous les modèles américains leaders pour le codage front-end, y compris Fable 5 et GPT-5.6 Sol. (Axios)
Un détail important pour les développeurs d'agents : Moonshot indique avoir obtenu ces résultats d'automatisation dans une configuration mono-agent utilisant le contexte d'1M de tokens — sans compression de contexte ni astuces externes de gestion du contexte. Cela laisse entendre qu'une grande longueur de contexte brute associée à une récupération solide peut rivaliser avec des solutions multi-agents élaborées. (VentureBeat)
La mise en garde : K3 n'est public que depuis quelques jours, et les démonstrations virales et les premiers benchmarks peuvent surestimer la fiabilité d'un modèle dans un vrai travail de production. Considérez les chiffres du classement comme un point de départ prometteur, pas comme un verdict définitif. (Axios)
Tarification et Accès
K3 est disponible dès aujourd'hui via l'interface kimi.com, les applications mobiles et l'API de la plateforme Moonshot sur platform.moonshot.ai. La tarification hébergée est fixée à environ 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie. (MLQ)
C'est la tarification la plus élevée de tout laboratoire d'IA chinois — une rupture nette avec les remises importantes pour lesquelles les modèles précédents de Moonshot étaient connus. Pour comparaison, c'est bien au-dessus du GLM-5.2 de z.ai (4,40 $/M en sortie) et de DeepSeek V4 (0,87 $/M en sortie), mais encore bien moins cher que les modèles frontier américains : Claude Fable coûte environ 50 $ par million de tokens en sortie pour un travail comparable. (Fortune)
Deux remarques pratiques avant d'établir votre budget :
- K3 n'expose actuellement qu'un seul niveau d'effort de raisonnement (« max »), et des testeurs indépendants signalent une consommation importante de tokens de raisonnement — l'un d'eux a relevé environ 13 241 tokens (soit environ 0,25 $) pour générer un simple SVG. Les longues chaînes s'accumulent rapidement. (MLQ)
- Une fois les poids publiés le 27 juillet, l'auto-hébergement devient une option pour les équipes qui ont besoin de résidence des données ou souhaitent contrôler les coûts à grande échelle — le même chemin hébergé vers auto-hébergé que nous avons vu dans toutes les publications open-weight de Moonshot. (Axios)
K3 vs. K2.5 / K2.6 / K2.7 : Ce qui a Changé
Si vous avez utilisé la gamme K2, K3 consiste moins en une nouvelle API qu'en un relèvement des plafonds. La plateforme conserve la même interface de style OpenAI et la même sémantique d'appel d'outils, ce qui simplifie les chemins de mise à niveau.
| Modèle | Focus | Échelle / contexte | Caractéristique clé |
|---|---|---|---|
| K2.5 | Intelligence agentique visuelle | MoE 1T, contexte 256k | Agent Swarm (jusqu'à ~100 sous-agents) |
| K2.6 | Codage à long horizon + essaims | MoE 1T, contexte 256k | Tâches autonomes de 12h+ |
| K2.7 Code | Spécialiste du codage | MoE 1T, contexte 256k | ~30% moins de tokens de raisonnement vs K2.6 |
| K3 | Codage agentique frontier + travail de connaissance | MoE 2,8T, contexte 1M | Plus grand modèle open-weight ; benchmarks top-3 |
Les principaux différenciateurs par rapport à K2.x : près de 3× les paramètres, une fenêtre de contexte 4× plus longue (1M vs 256k), la nouvelle architecture KDA + AttnRes, et un raisonnement multimodal plus puissant. Moonshot indique également que K3 utilise environ 21% moins de tokens en sortie que K2.6 sur des tâches équivalentes — poursuivant la tendance d'efficacité amorcée par Kimi K2.7 Code. (MLQ)
Cas d'Usage Concrets pour les Développeurs et les Équipes
La combinaison de performances frontier, d'un contexte étendu et de poids ouverts fait de K3 un candidat sérieux comme colonne vertébrale pour des travaux d'agents ambitieux :
- Agents de codage autonomes qui prennent en charge des fonctionnalités complètes — soutenant de longues sessions d'ingénierie, naviguant dans des dépôts massifs et orchestrant des outils en ligne de commande avec une supervision minimale. (Fortune)
- Migrations et prototypage à l'échelle d'un dépôt — transformer des PRD, des fichiers de design et des documents hérités en scaffolding fonctionnel tout en conservant le contexte complet du projet dans la fenêtre d'1M de tokens.
- Travail de connaissance à forte densité documentaire en finance, droit et conseil, où un grand contexte associé à la vision native aide avec des rapports denses, et où les poids ouverts permettent de déplacer ultérieurement les workflows sensibles vers une infrastructure auto-hébergée.
Il ne s'agit pas d'une adoption hypothétique. Les modèles précédents de Moonshot étaient déjà intégrés dans des produits occidentaux — Cursor a utilisé Kimi pour aider à construire son agent de codage Composer 2, et le CTO de DoorDash a déclaré que l'entreprise délègue « le travail de bas niveau à Kimi K2.6 ». K3 relève le plafond contre lequel ces équipes construisent. (Fortune)
Pourquoi K3 est Important pour le Paysage de l'IA
Sur le plan stratégique, K3 est la tentative de Moonshot de prouver que les modèles open-weight peuvent concurrencer directement les systèmes fermés dans les segments à plus haute valeur : codage complexe, raisonnement à long horizon et recherche multimodale. Les analystes ont présenté le lancement comme la preuve que l'innovation architecturale associée à la mise à l'échelle du pré-entraînement peut encore générer des gains significatifs pour les laboratoires chinois malgré les contraintes matérielles. (CNBC)
C'est aussi un choc concurrentiel. La publication — programmée juste avant la Conférence mondiale sur l'intelligence artificielle 2026 à Shanghai — est largement interprétée comme la preuve que l'open source ne se retrouve plus en retard de plusieurs mois sur les modèles fermés. Pour les développeurs qui évaluent des modèles frontier, cela signifie que K3 mérite d'être sur la liste restreinte aux côtés de Claude et GPT-5.x, surtout si votre feuille de route inclut des agents auto-hébergés et des workflows multimodaux. (VentureBeat)
Pour une vue d'ensemble des modèles open-weight, K3 se situe aux côtés des autres publications frontier que nous avons suivies : DeepSeek V4 Pro, GLM-5.2 de Zhipu et MiniMax-01.
Mettez un Modèle comme Kimi K3 au Travail dans Votre Propre Équipe IA
La vraie valeur de K3 apparaît lorsqu'un modèle frontier est connecté à de vrais workflows — dépôts, documents, terminaux et plans multi-étapes — et pas seulement à une boîte de chat. C'est exactement l'utilité d'une plateforme multi-agents agnostique aux modèles : router le codage à long horizon vers un modèle comme K3, en garder d'autres pour les tâches routinières, et les orchestrer sur de vrais travaux. Eigent est une application de bureau Cowork open-source qui fait tourner une équipe d'agents IA localement, vous permettant de brancher le meilleur modèle par tâche et de garder les données sensibles sur votre propre machine. Découvrez comment les agents peuvent examiner des PR GitHub de bout en bout, puis téléchargez Eigent pour l'essayer.
Foire Aux Questions
Qu'est-ce que Kimi K3 ?
Kimi K3 est le modèle de langage frontier de Moonshot AI, publié le 16 juillet 2026 — un modèle sparse Mixture-of-Experts à 2,8 billions de paramètres avec une fenêtre de contexte d'un million de tokens et une entrée multimodale native. Moonshot le qualifie de plus grand modèle open-weight jamais publié et de son modèle de codage open-source le plus puissant à ce jour.
Kimi K3 est-il open source ?
Moonshot s'est engagé à publier les poids complets de K3 le 27 juillet 2026, date à laquelle les développeurs pourront l'inspecter, le modifier et l'auto-héberger. En attendant, K3 est accessible via l'interface hébergée kimi.com, les applications mobiles et l'API de la plateforme Moonshot.
Comment Kimi K3 se compare-t-il à Claude et GPT-5 ?
Au lancement, K3 a débuté à la 3e place du classement Artificial Analysis, derrière Claude Fable 5 d'Anthropic et GPT-5.6 Sol d'OpenAI, tout en dominant certains tests pratiques — notamment l'évaluation en aveugle du codage front-end d'Arena, où les développeurs l'ont préféré aux deux. Il s'est classé premier dans quatre des huit benchmarks d'automatisation des tâches.
Combien coûte Kimi K3 ?
La tarification hébergée est d'environ 3 $ par million de tokens en entrée et 15 $ par million de tokens en sortie — la plus élevée de tout laboratoire chinois, mais encore bien en dessous des modèles frontier américains comme Claude Fable. K3 ne propose actuellement qu'un seul niveau de raisonnement « max », et les testeurs signalent une utilisation intensive de tokens de raisonnement, ce qui peut rendre les longues chaînes coûteuses.
Quelles sont les nouveautés de K3 par rapport à la série K2 ?
K3 passe de 1T paramètres de K2 à 2,8T, étend la fenêtre de contexte de 256k à 1M tokens, et ajoute deux nouvelles techniques architecturales — Kimi Delta Attention et Attention Residuals. Il rapporte également environ 21% moins de tokens en sortie que K2.6 sur des tâches équivalentes, avec un raisonnement multimodal plus puissant.
Puis-je utiliser Kimi K3 avec une plateforme multi-agents comme Eigent ?
Oui. Parce que K3 est compatible OpenAI SDK et (à partir du 27 juillet) auto-hébergeable, une plateforme agnostique aux modèles comme Eigent peut router les tâches de codage à long horizon et de travail de connaissance vers K3 tout en utilisant d'autres modèles pour les étapes routinières — en gardant les données locales si nécessaire.
Recent Posts

Notes de version d’Eigent v1.0.3 : tâches durables, Spaces Git et Workspace Bundles
Eigent v1.0.3 ajoute la reprise des tâches, les Spaces Git, des outils en session, la revue de fichiers, les Workspace Bundles, la Memory ciblée et Ant Ling.

GLM-5.3-Flash : le modèle multimodal de Z.ai à un dixième du prix
GLM-5.3-Flash expliqué : le premier modèle GLM-5 nativement multimodal de Z.ai, son architecture hybride 320B-A18B, la licence MIT, le contexte 1M, les benchmarks et la tarification.

Cursor Origin : La Forge Git Conçue pour les Agents IA, Expliquée
Cursor Origin est une forge git pour l'ère agentique. Découvrez ce qui a été livré en bêta anticipée, comment fonctionne la mise en miroir GitHub, ce que les agents peuvent faire, et ce qui manque encore aujourd'hui.