Thinking Machines Inkling-Small: Un Modelo de 276B que Supera a su Hermano Mayor
Un MoE de pesos abiertos y alta eficiencia que iguala — y a veces supera — a Inkling con una cuarta parte del tamaño.

Thinking Machines Lab ha lanzado Inkling-Small, un modelo de Mezcla de Expertos (Mixture-of-Experts) de pesos abiertos con 276B parámetros totales y 12B activos — aproximadamente una cuarta parte del tamaño de su primer modelo, Inkling, pero igualándolo o superándolo en razonamiento y codificación agéntica. La historia aquí no es la escala; es la eficiencia. Esta guía cubre las especificaciones de Inkling-Small, sus cifras de benchmark directamente desde el lanzamiento, cuánto cuesta ejecutarlo y qué significa un modelo de pesos abiertos eficiente si estás desarrollando agentes de IA.
¿Qué es Inkling-Small?
Inkling-Small es el segundo modelo de Thinking Machines Lab, la startup fundada por la ex-CTO de OpenAI, Mira Murati. Llegó aproximadamente dos semanas después de Inkling, el primer lanzamiento de pesos abiertos del laboratorio, y está construido en torno a una idea: mantener la capacidad, reducir el cómputo.
Los datos principales, del post de lanzamiento y la ficha del modelo del laboratorio:
- 276B parámetros totales, 12B activos — un transformador MoE disperso. Eso es aproximadamente una cuarta parte de los 975B totales / 41B activos de Inkling.
- Ventana de contexto de 1M tokens.
- Nativamente multimodal — razona sobre texto, imágenes y audio, usando la misma arquitectura sin codificador que Inkling.
- Esfuerzo de razonamiento variable — ajusta el razonamiento hacia arriba o hacia abajo para intercambiar precisión por velocidad y costo.
- Pesos abiertos bajo Apache 2.0, en Hugging Face — incluyendo un checkpoint cuantizado NVFP4 para inferencia eficiente.
- Entrenado en sistemas NVIDIA GB300 NVL72.
Arquitectónicamente, es un transformador decodificador de 42 capas que enruta cada token a 6 de 256 expertos, más 2 expertos compartidos activos en cada token (ficha del modelo). La receta MoE sigue el mismo linaje que Inkling.
El giro: el modelo pequeño supera al grande
La parte sorprendente es que Inkling-Small no solo aproxima a Inkling — en varios benchmarks lo supera. Thinking Machines explica por qué en el lanzamiento: Inkling-Small comenzó su entrenamiento después de su hermano mayor, por lo que el equipo pudo mejorar la mezcla y la receta de datos de pre-entrenamiento, y luego post-entrenar un checkpoint temprano usando destilación on-policy con Inkling como modelo maestro. A partir de ahí, escalaron el aprendizaje por refuerzo de codificación agéntica durante otras dos semanas (post de lanzamiento).
El resultado, en palabras del propio laboratorio: Inkling-Small superó a Inkling en razonamiento y codificación agéntica, mientras que Inkling mantiene ventaja en cobertura de conocimiento y factualidad. Un ejemplo concreto — en Humanity's Last Exam (solo texto) obtiene 31,6%, por delante del 29,7% de Inkling, y el laboratorio reporta que la ventaja se mantiene en cada presupuesto de razonamiento.
Benchmarks de Inkling-Small
Todos los números a continuación provienen del lanzamiento, ejecutados con esfuerzo 0,99. El patrón es el de un generalista amplio y equilibrado, en lugar de un optimizador de tablas de clasificación. Donde interviene un harness autoreportado, lo indicamos.
| Benchmark | Inkling-Small | Inkling | Nota |
|---|---|---|---|
| SWEBench Verified* | 80,2% | 77,6% | codificación agéntica |
| Terminal Bench 2.1* (mejor harness) | 64,7% | 63,8% | uso agéntico de herramientas |
| GPQA Diamond | 89,5% | 87,2% | razonamiento |
| HLE (solo texto) | 31,6% | 29,7% | razonamiento |
| AIME 2026 | 95,5% | 97,1% | matemáticas |
| ARC-AGI-2 | 40,1% | 36,5% | razonamiento abstracto |
| CritPt | 8,3% | 5,4% | física avanzada |
| SimpleQA Verified | 20,6% | 43,9% | factualidad (Inkling gana) |
*SWEBench Verified y Terminal Bench 2.1 usan los propios harnesses de codificación del laboratorio para los modelos Inkling; los modelos externos usan números autoreportados. Ten en cuenta esa advertencia en las comparaciones entre modelos — la verificación independiente será importante.
Dos conclusiones. Primera, en las tareas de codificación y razonamiento que más importan para los agentes, el modelo pequeño está al menos a la par con el grande. Segunda, la compensación es la factualidad: en SimpleQA Verified, Inkling-Small cae al 20,6% frente al 43,9% de Inkling — menos parámetros significa menos conocimiento del mundo memorizado, que es exactamente donde la recuperación de información o las herramientas demuestran su valor.
Frente a su clase de peso real, Inkling-Small es competitivo con pares de pesos abiertos como DeepSeek V4 Flash, Qwen3.5-397B-A17B y GLM 5.2 — intercambiando victorias según el benchmark en lugar de dominar.
El argumento de eficiencia: costo y cómputo
El verdadero argumento es la curva de rendimiento por dólar. Dado que solo 12B parámetros están activos por token, Inkling-Small es más económico de servir que Inkling con una barra de calidad similar.
- Precio de salida: Inkling-Small figura a $1,20 / 1M tokens frente a los $4,05 / 1M tokens de Inkling (post de lanzamiento) — aproximadamente un tercio del costo.
- Requisito mínimo de hardware: el checkpoint BF16 necesita al menos 600 GB de VRAM agregada (p. ej., 4× NVIDIA B300 u 8× H200). El checkpoint cuantizado NVFP4 reduce eso a 180 GB y puede ejecutarse en una sola B300 (ficha del modelo, MarkTechPost).
Esa ruta de una sola GPU es el titular para equipos más pequeños: un modelo multimodal de 276B que una startup puede autoalojar en una sola B300 alquilada, en lugar de necesitar un clúster de laboratorio de frontera.
Multimodalidad, epistemología y seguridad
Multimodal. Inkling-Small usa el mismo diseño nativamente multimodal y sin codificador que Inkling — audio como espectrogramas dMel, imágenes divididas en parches de 40×40 — y el laboratorio afirma que mejoró la capacidad del modelo para usar Python en tareas visuales como recortar y hacer zoom en gráficos y documentos. Casi iguala a Inkling en la mayoría de las evaluaciones multimodales a menor costo.
Epistemología. La calibración se entrenó con aprendizaje por refuerzo contra reglas de puntuación adecuadas en preguntas de pronóstico del mundo real. En ForecastBench (sin búsqueda) obtiene un Índice Brier de 61,3 ± 0,46, ligeramente por delante del 60,1 de Inkling (post de lanzamiento).
Seguridad. Hereda la receta de seguridad de Inkling. StrongREJECT se sitúa en 98,4%, y en FORTRESS obtiene 71,6% adversarial / 96,9% benigno. El laboratorio recomienda añadir moderación adicional como Llama Guard en implementaciones orientadas al consumidor (MarkTechPost). Al igual que con Inkling, los equipos que ajustan los pesos abiertos son responsables de la seguridad de sus personalizaciones.
Cómo ejecutarlo
Tienes tres opciones (ficha del modelo):
- Descargar los pesos desde Hugging Face — BF16 o el checkpoint cuantizado NVFP4.
- Ajustar fino en Tinker, la plataforma de fine-tuning del laboratorio, que también expone acceso a API y un Playground para chat de texto, imagen y audio.
- Proveedores de inferencia de terceros vía API para equipos que no quieren alojarlo ellos mismos.
Por qué un modelo de pesos abiertos eficiente importa para los agentes de IA
Para los equipos que desarrollan agentes, Inkling-Small agudiza el mismo cambio que Inkling inició: puedes ejecutar un modelo capaz y multimodal en tu propia infraestructura, ajustarlo a tu dominio y mantener el resultado privado — sin pagar por llamada a la API de un proveedor cerrado. La diferencia ahora es económica. Un modelo de un cuarto del tamaño a un tercio del precio, con una ruta cuantizada de una sola GPU, mueve el autoalojamiento de "presupuesto de laboratorio de frontera" a "una instancia alquilada".
El esfuerzo de razonamiento variable es la característica nativa para agentes: ralentiza el modelo para los pasos de planificación difíciles, aceléralo para los más simples, todo dentro de tu propio bucle — que es exactamente lo que necesitan los flujos de trabajo largos y de múltiples pasos. Si estás comparando opciones abiertas, nuestro análisis del Thinking Machines Inkling original cubre el modelo más grande y la tesis de ajustarlo tú mismo con mayor profundidad.
Haz esto con tu propia fuerza laboral de IA
La premisa completa de Inkling-Small — que un modelo eficiente y autoalojado que puedes moldear tú mismo supera al de talla única — es la misma apuesta detrás de Eigent, la aplicación de escritorio "Cowork" de código abierto que ejecuta una fuerza laboral de IA multi-agente localmente. Donde Inkling-Small es un modelo base que ajustas, Eigent es la capa de fuerza laboral encima: un equipo de agentes que automatiza flujos de trabajo reales y de múltiples pasos en tu máquina, usando los modelos que eliges. Para poner los modelos de pesos abiertos a trabajar en lugar de solo leer tablas de benchmarks, descarga Eigent y comienza a construir tus propios flujos de trabajo de agentes.
Recent Posts

Alternativa a Augment Code
Compara alternativas a Augment Code para grandes bases de código por precio actual, uso compartido, calidad de contexto, acceso al código, autoalojamiento, seguridad y adecuación al equipo.

Mejores agentes de programación con IA open source
Compara los mejores agentes de programación con IA open source por licencia, interfaz, autoalojamiento, elección de modelo, aprobaciones, seguridad, mantenimiento y adecuación práctica actual.

Los mejores agentes de ventas con IA de código abierto
Compara una pila de agentes de ventas con IA con 11x, Artisan, Qualified Piper, Nooks y Rox en datos de contacto, prospección, flujos de trabajo de CRM, coste, control y adecuación.