¿Qué es Jev? El Modelo System One de TypeSafe AI, Explicado
Un nuevo tipo de modelo de IA que devuelve decisiones tipadas en lugar de texto — y su lugar en un flujo de trabajo de agentes.

La mayoría de los lanzamientos de IA de este año compitieron por ser más inteligentes en el chat. TypeSafe AI tomó el camino opuesto. El 15 de septiembre de 2026 presentó Jev, su primer "modelo System One" — una IA que nunca escribe una oración y en su lugar devuelve decisiones tipadas y probabilísticas sobre las que tu código puede actuar directamente. Si desarrollas agentes o automatizaciones, Jev vale la pena entenderlo: apunta a las decisiones aburridas y de alto volumen que los LLMs toman de forma lenta y costosa. Aquí está qué es, cómo funciona, cuánto cuesta y dónde las afirmaciones merecen escepticismo.
¿Qué es Jev en una sola oración?
Jev es un modelo de frontera de TypeSafe AI que toma el estado del programa junto con un conjunto de preguntas tipadas y las responde todas en un único paso paralelo — devolviendo valores estructurados con probabilidades calibradas en lugar de texto generado.
La empresa enmarca esto como una nueva categoría de modelo, no simplemente un LLM más pequeño. TypeSafe lo llama "System One", tomando prestada la distinción de Daniel Kahneman entre el pensamiento rápido e intuitivo del Sistema 1 y el razonamiento lento y deliberado del Sistema 2. La apuesta: la mayoría de las decisiones dentro del software son juicios rápidos ("¿en qué categoría va esto?", "¿es urgente?"), y hemos estado alquilando un modelo de razonamiento completo para tomarlas.
Jev fue construido por Diogo Almeida, quien ayudó a crear el trabajo de RLHF e InstructGPT detrás de ChatGPT en OpenAI, y se lanzó con una ronda de $40M liderada por DCVC. El nombre hace referencia al economista William Stanley Jevons — la idea es que a medida que el costo de una decisión baja, la demanda de decisiones explota.
Cómo Jev se diferencia de un LLM
La diferencia central está en la salida. Un LLM genera una cadena de texto un token a la vez; luego debes analizar y validar esa cadena, y esperar que no haya alucinado ni devuelto la forma incorrecta. Jev define las respuestas posibles de antemano y las devuelve como valores tipados, por lo que no hay nada que analizar y — por construcción — no hay errores de tipo.
| Jev (System One) | LLMs de frontera | |
|---|---|---|
| Salida | Decisiones tipadas + probabilidades | Texto generado (cadenas) |
| Muestreo | Paralelo, un solo paso | Secuencial, token por token |
| Latencia | 70–500 ms (según el proveedor) | Segundos |
| Errores de salida estructurada | 0% por construcción | Distinto de cero |
| Confianza | Calibrada con cada respuesta | A menudo sobreconfiada |
Dos aspectos destacan. Primero, el muestreo paralelo: Jev evalúa todas las preguntas de una solicitud a la vez, por lo que agregar una décima pregunta apenas cambia el tiempo de respuesta. Segundo, la confianza calibrada: Jev se entrena con un método que TypeSafe llama Reinforcement Learning for Calibrated Decisions (RLCD), que optimiza sus probabilidades frente a resultados en lugar de preferencias humanas. En conjunto, una mayor confianza está destinada a significar mayor precisión — que es exactamente lo que necesitas para decidir cuándo actuar automáticamente y cuándo escalar.
También comprende entradas en lenguaje natural como un LLM, pero actualmente acepta solo texto — cadenas, JSON o matrices de texto. Sin imágenes, audio o video por ahora.
Los tres primitivos
Toda la API se compone de tres tipos de preguntas. Ese es el diseño, no una limitación:
- Choice (elección) — elige una opción de un conjunto (hasta 255). Devuelve la opción, una probabilidad por opción y una puntuación de confianza. Agrega una opción explícita
otherpara que el modelo pueda decir "ninguna de estas encaja." - Score (puntuación) — una posición en una escala de 2 a 10 niveles que describes con palabras. Devuelve una puntuación que puede caer entre niveles (p. ej.,
1.4). - Noul — una pregunta de sí/no devuelta como una única probabilidad de 0 a 1.
Una llamada sobre un ticket de soporte podría preguntar, en una sola solicitud: qué equipo debe manejarlo (Choice), qué tan frustrado está el cliente (Score) y si pidió explícitamente un reembolso (Noul). Tu código luego combina esas respuestas tipadas con sentencias if ordinarias. La propia documentación de TypeSafe enmarca a Jev como una "sentencia if inteligente" — clasificar, enrutar, puntuar, extraer o ramificar donde las reglas escritas a mano son demasiado frágiles.
En qué es bueno Jev — y en qué no
Jev está construido para decisiones repetidas de alto volumen sobre conjuntos de respuestas conocidos: clasificación de tickets, enrutamiento de intenciones, moderación de contenido, extracción, puntuación y verificaciones de guardarraíles en las salidas de otros modelos. Dado que las preguntas se ejecutan en paralelo y la salida es gratuita, puedes "expandirte" y preguntar todo de antemano, luego dejar que el código decida qué importaba.
Es la herramienta equivocada para cualquier cosa que requiera escritura: chat, generación de código o una explicación de su razonamiento. Dos limitaciones más que vale la pena señalar:
- Sin conocimiento del mundo. Jev solo conoce el estado que le proporcionas; no puede buscar nada. Ese paso establece el techo de cualquier flujo de trabajo construido a su alrededor.
- La calibración es una propiedad grupal. TypeSafe es claro en que la calibración se mantiene a través de muchas predicciones — no garantiza que ninguna respuesta individual sea correcta. Jev todavía puede equivocarse.
Precios y velocidad: lee la letra pequeña
Los números principales de TypeSafe son llamativos: entrada a $0.042 por millón de tokens con salida gratuita, latencia de 70–500 ms, y afirmaciones en la página de inicio de "193.6x más rápido, 444.6x más barato" frente a los LLMs en su benchmark de flujos de trabajo.
Trátalos como afirmaciones del proveedor, no como resultados independientes. El propio TypeSafe añade advertencias útiles: las evaluaciones se ejecutaron desde sus propias laptops en la Costa Oeste; no puede probar que los precios no estén subsidiados; y sus flujos de trabajo, aunque no están en el conjunto de entrenamiento, fueron construidos por su propio equipo. El benchmark también usa el promedio de GPT-6 Astra y Fable 5.1 como referencia "correcta", lo que introduce un sesgo hacia esos modelos. Las guías prácticas que cubren el lanzamiento, como este tutorial en dev.to, repiten la misma advertencia: las cifras de velocidad y costo son autoejecutadas y no reproducidas. La única afirmación difícil de refutar es el 0% de errores de tipo — la coincidencia de esquemas está garantizada, por lo que un solo contraejemplo la falsificaría.
Dónde encaja Jev en un bucle de agente
Para los equipos que construyen sistemas multiagente, el patrón interesante es el enrutamiento con umbral de confianza. En lugar de un umbral de precisión único para todo el sistema, estableces un umbral por acción, escalado según el costo de equivocarse: actúa de forma autónoma en decisiones baratas y de solo lectura por encima de alta confianza; pide confirmación en las costosas; y enruta a un humano — o a un modelo de razonamiento completo — cuando la confianza es baja.
Eso convierte a Jev en una capa de decisión dentro de un bucle de agente, no en un reemplazo de tu LLM. Una forma común es una cascada: Jev clasifica y enruta de forma económica, el código determinista maneja lo que puede, y un modelo de frontera toma la minoría difícil. El valor son menos llamadas costosas a LLMs y un límite claro y auditable entre "la máquina decidió" y "una persona debería revisar."
La conclusión
Jev es una idea genuinamente diferente: un primitivo de IA con la forma de una llamada a función en lugar de un chatbot. Si se mantiene fuera de los benchmarks del propio proveedor, los modelos System One podrían hacerse cargo de los millones de pequeños juicios que actualmente se encuentran de forma incómoda dentro de los prompts de los LLMs. Por ahora, está en acceso anticipado, es solo de texto, y cada número de rendimiento es autoinformado — prometedor, pero no probado. El movimiento correcto es probarlo en una decisión estrecha y de alto volumen y medirlo frente a tu configuración actual.
Construye flujos de trabajo basados en decisiones con tu propia fuerza de trabajo de IA
Jev es una capa del stack de automatización — la decisión rápida. El resto es orquestación: recopilar el estado, llamar a la herramienta correcta y actuar sobre el resultado en aplicaciones reales. Eso es lo que hace Eigent como una aplicación de escritorio "Cowork" multiagente de código abierto, coordinando agentes a través de flujos de trabajo de extremo a extremo como revisar PRs de GitHub o clasificar el trabajo entrante. ¿Quieres construir automatización con umbral de confianza localmente? Descarga Eigent y conecta tus decisiones a una fuerza de trabajo que actúe sobre ellas.
Recent Posts

Periodic Neon: La IA Entrenada en Laboratorio que Supera a los Modelos Frontier en Ciencia
Periodic Neon es una IA de 1T parámetros entrenada con datos físicos de laboratorio que supera a GPT-6 Astra en análisis de difracción. Esto es lo que hace y por qué es importante.

Meta Muse: El Agente de IA Personal que Reserva, Compra y Negocia
Meta Muse es un agente de IA personal que reserva viajes, compra cosas y negocia facturas desde un chat. Aquí encontrarás qué hace, precios, seguridad y cómo se compara con otras opciones.

Notas de la versión Eigent v1.0.4: paneles de Skills y Connectors y ejecuciones multiturno estables
Eigent v1.0.4 reconstruye Skills y Connectors como paneles de gestión y refuerza el trabajo multiturno, los checkpoints del workspace y los estados de conector.