logo
  • Entornos
  • Empresa
  • Precios
Blogs
Sector|Jul 17, 2026

Thinking Machines Inkling: El Primer Modelo de Pesos Abiertos de Mira Murati

Un MoE multimodal de 975B parámetros diseñado para ser ajustado, no para liderar clasificaciones.

Douglas LaiDouglas Lai
Share to
Thinking Machines Inkling: El Primer Modelo de Pesos Abiertos de Mira Murati
  • ¿Qué es Inkling?
  • La apuesta: ajústalo tú mismo
  • Esfuerzo de razonamiento controlable
  • Benchmarks de Inkling
  • Cómo fue construido (y la cuestión de la destilación)
  • Por qué los pesos abiertos importan para los agentes de IA
  • Haz esto con tu propia fuerza de trabajo de IA de código abierto
Automate Everything with
AI Workforce on Desktop
Download Eigent

Thinking Machines Lab, la startup fundada por la ex directora de tecnología de OpenAI, Mira Murati, ha lanzado su primer modelo propio: Inkling, un sistema de Mezcla de Expertos (MoE) multimodal de pesos abiertos. La sorpresa no está en el tamaño, sino en la estrategia. Inkling no está diseñado para ganar benchmarks; está diseñado para ser descargado, ajustado y adaptado por las organizaciones que lo utilizan. Esta guía cubre las especificaciones de Inkling, sus benchmarks, el concepto de "esfuerzo de razonamiento controlable" y lo que significa una base de pesos abiertos para quienes desarrollan agentes de IA.

¿Qué es Inkling?

Inkling es el primer modelo público de Thinking Machines Lab, lanzado el 15 de julio de 2026 — el primer punto de prueba real del laboratorio tras aproximadamente 18 meses de trabajo de infraestructura mayormente privado (TechCrunch).

Los datos principales, extraídos del propio post de lanzamiento del laboratorio:

  • 975B parámetros totales, 41B activos — un transformador de Mezcla de Expertos (MoE) que activa solo una fracción de sus pesos por token, lo que permite ejecutar un modelo muy grande de forma más rápida y económica.
  • Ventana de contexto de 1M de tokens.
  • Preentrenado con 45 billones de tokens de texto, imágenes, audio y vídeo, con razonamiento nativo en los cuatro tipos. Por ahora, las salidas son texto: código, datos estructurados y artefactos con formato.
  • Pesos abiertos — los pesos completos están disponibles en Hugging Face, tanto como checkpoint original como en formato NVFP4 para inferencia eficiente en NVIDIA Blackwell.
  • Una versión preliminar de Inkling-Small, un MoE de 276B (12B activos) optimizado para menor coste y latencia.

La frase más llamativa proviene del propio laboratorio: Inkling "no es el modelo más potente disponible hoy en día, ni abierto ni cerrado." Esa es la estrategia completa, no una advertencia.

La apuesta: ajústalo tú mismo

La mayoría de los laboratorios de frontera — OpenAI, Anthropic, Google — lanzan primero un chatbot de propósito general y luego añaden funciones agénticas por encima. Inkling invierte ese orden. Thinking Machines lo comercializa menos como un producto terminado y más como una base para la personalización: un modelo de base amplio y equilibrado que las organizaciones adaptan a sus propios flujos de trabajo mediante Tinker, la plataforma de ajuste fino del laboratorio.

El argumento, expuesto en una publicación de la empresa anterior al lanzamiento, es que un modelo entrenado de forma centralizada y luego congelado rinde menos que uno que cada organización puede moldear en torno a su propia experiencia. Esta visión cuenta con apoyo externo: Satya Nadella, de Microsoft, advirtió recientemente que las empresas que dependen de modelos cerrados efectivamente "pagan dos veces" — una en cuotas de suscripción, y otra al alimentar conocimiento propietario en las versiones futuras del modelo de otra empresa (TechCrunch).

El ejemplo más claro que ofrece Thinking Machines es un proyecto con el fondo de cobertura Bridgewater Associates: los investigadores ajustaron un modelo abierto con la experiencia financiera de Bridgewater, y supuestamente obtuvo un 84,7% en pruebas de razonamiento financiero, con un coste de ejecución aproximadamente catorce veces menor que el de los principales modelos propietarios. Cabe señalar que esas cifras provienen de la evaluación propia de las dos empresas, no de una evaluación independiente.

La contrapartida es la asunción del riesgo. Dado que los clientes ajustan Inkling por su cuenta, son ellos — y no Thinking Machines — quienes son responsables de mantener sus personalizaciones seguras. Y el ajuste fino a este nivel requiere talento real en aprendizaje automático.

Esfuerzo de razonamiento controlable

La característica más relevante para los agentes es el esfuerzo de razonamiento controlable. Inkling permite ajustar el razonamiento hacia arriba o hacia abajo — intercambiando precisión por velocidad y coste — y la configuración puede modificarse desde dentro de un entorno de codificación o de agentes. En transformers de Hugging Face, se expone como un argumento reasoning_effort con niveles predefinidos.

Por qué importa: el coste y la latencia suelen ser las restricciones determinantes en los agentes en producción, no las puntuaciones máximas en benchmarks. El lanzamiento de Inkling muestra su configuración de esfuerzo desde 0,2 hasta 0,99 y demuestra que el modelo alcanza una puntuación determinada con menos tokens que sus rivales en su configuración predeterminada. El ejemplo más destacado: en Terminal Bench 2.1, Inkling iguala a NVIDIA Nemotron 3 Ultra usando aproximadamente un tercio de los tokens.

Curiosamente, esta eficiencia surgió en parte de forma emergente durante el aprendizaje por refuerzo. A lo largo de más de 30 millones de rollouts de RL, la cadena de pensamiento de Inkling se volvió más concisa por sí sola — eliminando artículos y conectores mientras seguía siendo comprensible y llegando a la misma respuesta. La eficiencia por sí sola impulsó la compresión; no fue un objetivo de entrenamiento directo.

Benchmarks de Inkling

Inkling se posiciona como un modelo de pesos abiertos competitivo, no como un líder absoluto. Algunos resultados representativos del lanzamiento (ejecutados con esfuerzo 0,99):

  • SWEBench Verified: 77,6% — por delante de Nemotron 3 Ultra (70,7%), aproximadamente al nivel de Kimi K2.6 (80,2%) y GLM 5.2 (80,0%), por detrás de modelos cerrados como Claude Fable 5 (95,0%).
  • Terminal Bench 2.1 (mejor harness): 63,8% — en la zona media entre los pesos abiertos; queda por detrás de GLM 5.2 (82,7%) en este caso.
  • GPQA Diamond: 87,2%; AIME 2026: 97,1% — razonamiento sólido.
  • FORTRESS (Seguridad adversarial): 78,0% — las salvaguardas integradas más altas de cualquier modelo de pesos abiertos comparado por el laboratorio, sin rechazar en exceso consultas benignas similares.
  • Multimodal: 73,5% en MMMU Pro (visión), 91,4% en VoiceBench (audio) — entre los resultados omni de pesos abiertos más sólidos.

El patrón es deliberado: amplio y equilibrado en texto, tareas agénticas, multimodalidad y seguridad, en lugar de destacar en una única clasificación. La verificación independiente será importante aquí — varias puntuaciones dependen de los propios entornos de evaluación del laboratorio o de datos autoinformados.

Cómo fue construido (y la cuestión de la destilación)

Algunas notas de arquitectura para los más técnicos. El diseño MoE sigue en gran medida a DeepSeek-V3 (256 expertos enrutados, 2 compartidos, 6 activos por token). La atención intercala capas de ventana deslizante y globales en una proporción de 5:1, y — notablemente — Thinking Machines utiliza embeddings posicionales relativos en lugar de RoPE, reportando una mejor extrapolación de longitud. El entrenamiento utilizó un optimizador híbrido Muon/Adam en sistemas NVIDIA GB300 NVL72.

Una advertencia honesta que la empresa reconoce voluntariamente: para arrancar el post-entrenamiento, ejecutó un ajuste fino supervisado inicial sobre datos sintéticos generados por otros modelos abiertos, incluyendo Kimi K2.5 de Moonshot AI — una práctica conocida como destilación. El laboratorio afirma que esto representó una pequeña fracción del cómputo y que su próximo modelo utilizará un post-entrenamiento completamente autónomo.

La afirmación sobre velocidad forma parte del argumento: OpenAI tardó aproximadamente cinco años en llevar su tecnología al mercado, y Anthropic alrededor de tres; Thinking Machines afirma haberlo logrado en aproximadamente nueve meses.

Por qué los pesos abiertos importan para los agentes de IA

Para los equipos que desarrollan agentes, el cambio interesante no es el número de parámetros — es el modelo de despliegue. Una base de pesos abiertos cambia la economía: en lugar de pagar por llamada a la API de un proveedor cerrado, puedes ejecutar el modelo en tu propia infraestructura, ajustarlo a tu dominio y mantener el modelo resultante de forma privada. Esa es la misma lógica de "poseer tu propia fuerza de trabajo" que impulsa el interés en los stacks de agentes locales y abiertos en general.

El esfuerzo controlable de Inkling y su entrenamiento orientado a harnesses agénticos encajan bien en ese mundo. Un modelo que puedes ralentizar para los pasos difíciles y acelerar para los más sencillos — dentro de tu propio bucle de agentes — es exactamente lo que necesitan los flujos de trabajo largos y de múltiples pasos. Si estás evaluando opciones abiertas, nuestros análisis de DeepSeek V4 Pro, GLM-5.2 y Kimi K2.7 Code cubren los otros modelos de pesos abiertos de clase frontera con los que se compara Inkling.

Haz esto con tu propia fuerza de trabajo de IA de código abierto

La premisa central de Inkling — que una IA adaptable y autoalojada supera a la de talla única — es la misma apuesta detrás de Eigent, la aplicación de escritorio de código abierto "Cowork" que ejecuta una fuerza de trabajo de agentes de IA de forma local. Mientras que Inkling es un modelo base que ajustas, Eigent es la capa de fuerza de trabajo por encima: un equipo de agentes que automatiza flujos de trabajo reales y de múltiples pasos en tu propia máquina, utilizando los modelos que tú eliges. Si quieres poner los modelos de pesos abiertos a trabajar en lugar de solo leer benchmarks, descarga Eigent y empieza a construir tus propios flujos de trabajo de agentes hoy mismo.

Recent Posts

Notas de la versión de Eigent v1.0.3: tareas duraderas, espacios con Git y Workspace Bundles
ProductoAug 28, 2026

Notas de la versión de Eigent v1.0.3: tareas duraderas, espacios con Git y Workspace Bundles

Eigent v1.0.3 incorpora recuperación de tareas, espacios con Git, herramientas en sesión, revisión de archivos, Workspace Bundles, memoria por ámbitos y Ant Ling.

Douglas LaiDouglas Lai
Doubao Work y las guerras de la IA en la oficina: comparativa de todos los agentes de trabajo
SectorAug 27, 2026

Doubao Work y las guerras de la IA en la oficina: comparativa de todos los agentes de trabajo

Doubao Work se une a ChatGPT Work, Claude Cowork, WorkBuddy y Qwen Office. Qué hace cada agente de trabajo con IA, en qué se diferencian y cómo elegir el más adecuado.

EigentEigent
GLM-5.3-Flash: El Modelo Multimodal de Z.ai a una Décima del Precio
SectorAug 26, 2026

GLM-5.3-Flash: El Modelo Multimodal de Z.ai a una Décima del Precio

GLM-5.3-Flash explicado: el primer modelo GLM-5 nativamente multimodal de Z.ai, su arquitectura híbrida 320B-A18B, licencia MIT, contexto de 1M, benchmarks y precios.

EigentEigent
Automate everything with AI workforce on desktop
Download Eigent

Prueba Eigent hoy

Descarga la aplicación de escritorio de código abierto y empieza a automatizar con una fuerza laboral de IA en tu equipo.

Descargar Eigent
Eigent

Recibe las últimas actualizaciones y tutoriales sobre automatización de la fuerza laboral con IA.

¡Gracias por suscribirte!

ProductoEigentEntornosPreciosEmpresarial
ExplorarSolucionesCasos de usoHabilidadesPluginsBlog
DesarrolladoresDocumentaciónGitHubCAMEL-AIFondo Open SourceSocio
DescargarPara código abierto
EmpresaSobre nosotrosMarcaEmpleosTérminos de usoPolítica de privacidadSeguridad y confianzaPolítica de cookiesPolítica de reembolso y prueba

Todos los derechos reservados © 2026 EIGENT UK LTD