Nota de lectura. Este artículo se apoya en el lanzamiento de Jev el 15 de septiembre de 2026 y en la cobertura disponible en la fecha de escritura (TechCrunch, The Register, Tom's Hardware, Simon Willison). Las cifras de velocidad y de coste proceden de la propia TypeSafe AI. No se ha publicado ningún artículo técnico y todavía no existe ninguna medición independiente completa. Las citamos como afirmaciones, no como hechos establecidos.
En una frase
El 15 de septiembre de 2026, TypeSafe AI, una joven empresa de San Francisco fundada por un antiguo investigador de OpenAI, lanzó Jev, un modelo de inteligencia artificial que lee texto como un LLM (large language model, gran modelo de lenguaje) pero que nunca lo escribe: solo devuelve números, es decir, elecciones, notas y probabilidades, cada una acompañada de una puntuación de confianza. La apuesta es sencilla: la mayoría de las llamadas a la IA dentro de un programa no sirven para producir prosa, sino para decidir. Si la apuesta se confirma, una gran parte del mercado de los «modelos pequeños» podría desplazarse hacia una nueva categoría, la de los modelos de decisión. Creemos que la señal más importante no es la velocidad anunciada. Es que, por primera vez desde ChatGPT, un actor serio apuesta a que una IA más útil no necesita hablar mejor.
1. Un lanzamiento a contracorriente
Situemos el momento. Desde hace tres años, cada gran lanzamiento va en la misma dirección: más razonamiento, más contexto, más autonomía. Hace apenas tres semanas, OpenAI presentaba GPT-6 Astra como la entrada en «la era de la AGI». La carrera se mide en capacidades conversacionales y agénticas.
TypeSafe AI toma la dirección contraria. Los hechos, tal como se han publicado:
- La empresa. Fundada en 2024 en San Francisco por Diogo Almeida, Erik Gafni y Sasha Sheng. Almeida pasó unos cuatro años en OpenAI, donde trabajó en el RLHF (reinforcement learning from human feedback, aprendizaje por refuerzo a partir de retroalimentación humana), la técnica que hizo utilizable ChatGPT.
- La financiación. Una ronda de 40 millones de dólares liderada por el fondo DCVC, con una valoración estimada en torno a 200 millones de dólares.
- El producto. Jev, disponible en acceso anticipado limitado. Un modelo propietario basado en la arquitectura Transformer y entrenado, según la empresa, exclusivamente con datos sintéticos.
- El precio. 0,042 $ por millón de tokens de entrada, y nada por la salida, según la tarifa difundida por Simon Willison y The Register.
El diagnóstico de Almeida, recogido por TechCrunch, cabe en una idea: los LLM actuales se adaptan mal a la automatización porque los ordenadores no hablan el mismo idioma que ellos. Un programa no quiere un párrafo matizado; quiere un booleano, una categoría, un número.
2. Qué hace un modelo de decisión
El cambio de enfoque merece una descripción precisa, porque es más sencillo de lo que parece.
Con un LLM clásico, se formula una pregunta en lenguaje natural y se recibe texto. Si se quiere una decisión que un programa pueda usar, se pide al modelo que responda «sí» o «no», y luego se espera que respete la consigna, que no añada comentarios, que no invente una tercera opción. Toda una ingeniería se ha construido para corregir estas desviaciones.
Jev elimina el problema de raíz. El desarrollador describe un estado (texto o datos semiestructurados) y luego plantea preguntas de solo tres formas:
- Choice — elegir entre opciones fijadas de antemano. Jev devuelve una distribución de probabilidades sobre esas opciones.
- Score — puntuar en una escala definida (urgencia de 1 a 5, pertinencia, calidad).
- Noul — una pregunta cerrada, a la que Jev responde con una probabilidad entre 0 y 1.
De ello se derivan dos consecuencias. Primero, la salida está restringida por construcción: el modelo no puede responder fuera del esquema. En ese sentido afirma TypeSafe AI que elimina las alucinaciones. La afirmación es exacta en la forma, más discutible en el fondo: una mala elección entre tres opciones sigue siendo un error, simplemente un error bien formateado. Segundo, la confianza se convierte en un dato de primer orden. Un programa puede decidir actuar solo por encima de 0,9 y recurrir a una persona por debajo.
RLCD — por Reinforcement Learning for Calibrated Decisions, aprendizaje por refuerzo para decisiones calibradas. Es el método de entrenamiento que reivindica la empresa. Donde el RLHF optimiza lo que los humanos prefieren, el RLCD buscaría alinear las probabilidades anunciadas con los resultados reales. Un modelo calibrado es un modelo que, cuando dice «80 %», acierta aproximadamente cuatro de cada cinco veces.
TypeSafe AI sitúa Jev en una categoría que denomina System One models, en referencia al pensamiento rápido e intuitivo descrito por el psicólogo Daniel Kahneman. La imagen es elocuente: los LLM de frontera desempeñan el papel del razonamiento lento y deliberado; Jev, el del reflejo.
3. Las cifras, y lo que conviene retener
La empresa reivindica respuestas en 70 a 500 milisegundos, y un modelo de 40 a 200 veces más rápido y de 40 a 400 veces más barato que los modelos de frontera, con picos de 193 y 444 veces medidos en sus propios flujos de trabajo. Ella misma reconoce un «posible sesgo» y que esos picos representan la parte alta del rango.
Los testimonios de campo son más modestos, y más interesantes por ello:
- Vercel, según TechCrunch, habría sustituido Luna, el modelo pequeño de OpenAI, por Jev en algunas tareas, con resultados de 5 a 18 veces más rápidos y mayor precisión.
- Bryo AI menciona un coste de 10 a 20 veces inferior al de Gemini y, sobre todo, puntuaciones de confianza realmente aprovechables.
Retengamos el orden de magnitud más que el récord: un factor 10 en el coste y la latencia de una tarea de clasificación. Es más que suficiente para cambiar una arquitectura de software. A 0,042 $ el millón de tokens, un millón de decisiones sobre textos de unos 500 tokens cada uno costaría del orden de una veintena de dólares.
Los límites ya están documentados. Simon Willison señala que el modelo tiene dificultades con los números, las fechas y los contenidos diseñados para engañarlo. El comentarista Mo Bitar plantea la pregunta que sigue abierta: «Sé que es rápido. Sé que es barato, pero ¿es bueno?». Y sobre todo, Jev no puede justificar sus decisiones. Un LLM puede al menos producir una explicación, aunque sea imperfecta. Aquí, el razonamiento desaparece detrás de un número decimal.
4. Lo que implica para el mercado
El mercado de la IA se divide en dos capas
Hasta ahora, un mismo tipo de herramienta servía para todo: redactar un correo, resumir un contrato y decidir si un mensaje es spam. Jev formaliza una separación que ya existía en la práctica:
- La capa que habla — redacción, razonamiento, conversación, agentes. Sigue siendo el terreno de los modelos de frontera, caros y lentos por naturaleza.
- La capa que decide — clasificar, enrutar, filtrar, puntuar, priorizar. Miles de millones de microdecisiones invisibles que hacen funcionar el software.
La segunda capa representa probablemente la mayor parte de las llamadas en volumen. Hasta ahora se facturaba como la primera, con modelos sobredimensionados. Es esa ineficiencia la que Jev viene a explotar.
Los modelos pequeños de los grandes laboratorios, directamente expuestos
Las gamas de entrada (las versiones Nano, Flash y Luna de los grandes laboratorios) se usan masivamente para clasificación. Son ellas las que Jev compite primero, no los modelos de frontera. El caso de Vercel debe leerse así: no se sustituye Astra, se sustituye Luna.
Vemos tres respuestas posibles por parte de los grandes laboratorios: bajar aún más los precios de sus modelos pequeños, ofrecer puntos de acceso de «decisión» nativos (las probabilidades internas de un LLM ya existen y podrían servirse mejor) o comprar. La ausencia de un artículo técnico y el recurso a datos sintéticos sugieren que la ventaja de TypeSafe AI reside más en su ejecución que en un secreto difícil de reproducir. Los imitadores ya están aquí: una comparativa comunitaria, JevBench, recogería más de 80 sistemas «de clase Jev». Si esta dinámica se confirma, la categoría podría convertirse en una commodity en pocos meses.
La paradoja de Jevons, esta vez en el nombre
El modelo debe su nombre a William Stanley Jevons, el economista del siglo XIX que observó que hacer más eficiente el uso del carbón aumentaba su consumo total. Describimos este mecanismo a propósito del desplome del coste del token. Jev lo asume abiertamente.
Cuando una decisión cuesta una fracción de céntimo y una décima de segundo, no se sustituyen simplemente las llamadas existentes: se añaden en todas partes donde nunca se habría osado. Cada fila de una hoja de cálculo, cada evento de un registro técnico, cada acción de un agente puede recibir su puntuación. El gasto unitario se desploma; el volumen, en cambio, podría dispararse.
«Sistemas más inteligentes, no modelos más inteligentes»
La frase es de Adam Jacob, recogida por The Register, y resume el desplazamiento del valor. Andrej Karpathy ve en ello una respuesta a una demanda latente, poco atendida porque toda la industria perseguía más inteligencia. Si esta lectura es correcta, la ventaja competitiva se desplaza del modelo a la orquestación: saber qué pregunta enviar a qué modelo, a partir de qué umbral de confianza escalar, cuándo hacer intervenir a una persona.
Un uso ilustra bien este desplazamiento: la supervisión de agentes. Un agente autónomo costoso puede estar vigilado por un modelo de decisión que comprueba, en cada paso, si la acción prevista sigue dentro del marco establecido. El reflejo vigila el razonamiento.
La evaluación y el cumplimiento normativo se convierten en el verdadero producto
La opacidad de Jev tiene una consecuencia directa: solo se puede confiar en él si se mide. La paradoja es que su coste irrisorio es precisamente lo que hace posible una evaluación exhaustiva, sobre decenas de miles de casos. Esperamos ver surgir un mercado de herramientas de evaluación y calibración especializadas en estos modelos.
En el plano regulatorio, la tentación será grande de usar un modelo de decisión para filtrar candidaturas, puntuar expedientes de crédito o priorizar solicitudes de ayuda. Sin embargo, el reglamento europeo de inteligencia artificial (AI Act) ya clasifica varios de estos usos, como la contratación, entre los sistemas de alto riesgo, con obligaciones de transparencia y supervisión humana. Una puntuación sin explicación encaja mal. Simon Willison señala además posibles sesgos desde sus primeras pruebas. En Europa, la velocidad de adopción de los modelos de decisión podría depender menos de su rendimiento que de la capacidad de auditar sus elecciones.
5. Señales a vigilar
- Mediciones independientes. Mientras los factores ×193 y ×444 los mida TypeSafe AI en sus propios flujos, seguirán siendo argumentos comerciales. Un banco de pruebas externo, sobre tareas públicas, dirá dónde está la realidad.
- La calibración real. Toda la promesa descansa en probabilidades fiables. Si un «0,9» de Jev resulta acertado nueve de cada diez veces, en ámbitos variados, la categoría es sólida. Si no, no es más que un clasificador rápido.
- La respuesta de los grandes laboratorios. Una API de decisión nativa en OpenAI, Anthropic o Google, o una nueva bajada de precio de sus modelos pequeños, confirmaría que la amenaza se toma en serio.
- La llegada de modelos abiertos equivalentes. Si aparece un modelo de decisión de pesos abiertos, la categoría escapará al control de un solo actor y se convertirá en una pieza estándar.
- Los primeros usos sensibles. Contratación, crédito, moderación: ahí aparecerán las primeras controversias, y las primeras exigencias de explicabilidad.
6. Una palabra situada
Desde La Reunión, Jev nos interpela por una razón sencilla: da la razón a una intuición que defendemos desde el inicio del laboratorio. La buena respuesta no es siempre el modelo más potente. Buena parte de lo que se pide a la IA en una herramienta concreta, ya sea clasificar mensajes, detectar una urgencia o enrutar una solicitud, es cuestión de reflejo y no de reflexión. Pagar un modelo de frontera para estas tareas es fletar un avión para cruzar la calle.
Para un actor insular y frugal, se desprenden tres lecciones.
Primero, el coste de la decisión ya no es un freno. Una pequeña organización puede ahora añadir criterio automático a sus herramientas por unos pocos dólares al mes. El argumento «la IA es demasiado cara para nosotros» pierde buena parte de su fuerza.
Segundo, la latencia de red pesa más que la del modelo. Cuando el modelo responde en 150 milisegundos, el trayecto de ida y vuelta entre nuestra isla y un servidor californiano puede pesar tanto como el propio cálculo. Cuanto más rápido es el modelo, más visible se vuelve la distancia. Es un argumento más para disponer, localmente, de una capacidad modesta, en la línea de lo que escribimos sobre el hardware de escritorio capaz de ejecutar modelos.
Por último, una decisión alquilada sigue siendo una decisión revocable. Jev es propietario, está alojado en Estados Unidos y no tiene publicación técnica. Lo vimos con Fable 5: un acceso puede desaparecer en pocos días, y la demanda en el lanzamiento fue tan fuerte que la API habría dejado de estar disponible brevemente. El buen uso nos parece este: aprovechar la herramienta, pero diseñar nuestros sistemas para que la capa de decisión siga siendo sustituible, con nuestros propios conjuntos de pruebas para comprobar que otro modelo lo hace igual de bien.
Hay algo tranquilizador en este lanzamiento. Tras tres años de una carrera en la que cada anuncio prometía una inteligencia más general, alguien recuerda que un software útil está hecho a menudo de pequeñas decisiones acertadas, rápidas y baratas. No es la dirección más espectacular, pero quizá sea la que llegue a más gente. 決
Fuentes y lecturas complementarias
- TechCrunch — «A new kind of AI model from a ChatGPT inventor is thrilling developers» — Declaraciones de Diogo Almeida, testimonios de Vercel y Bryo AI.
- Simon Willison — «Jev introduces a new shape of LLM—System One, aka Decision Models» — Funcionamiento de la API, tarifa, límites y riesgos de sesgo.
- The Register — «Shut up and calculate: Jev's new AI primitives for coders» — Primitivas Choice, Score y Noul, usos de los desarrolladores, reacciones críticas.
- Tom's Hardware — «TypeSafe AI's Jev offers an alternative to LLMs that claims to be 193x faster and 445x cheaper» — Cifras de velocidad y coste reivindicadas.
- Wikipedia — «Jev (AI model)») — Cronología, financiación, método RLCD y origen del nombre.
- Ryuzaki Labs — «El desplome del coste del token», «GPT-6 Astra» y «Fable 5, desenchufado en 72 horas» — Nuestros análisis anteriores sobre la paradoja de Jevons, la carrera hacia la frontera y la revocabilidad de las capacidades alquiladas.
Este documento se actualiza si aparecen elementos nuevos. Última revisión: 文 24 de septiembre de 2026.