Strebula
Radar Strebula
Inteligencia artificial 6 min de lectura

Jev y los «System One models»: IA que decide en milisegundos en vez de escribir

TypeSafe AI lanzó Jev, un modelo que no genera texto: responde preguntas cerradas con probabilidades calibradas. Qué es, qué promete, qué falta demostrar y dónde tendría sentido en el Perú.

Equipo Strebula

Primer plano de una placa de circuitos azul oscuro
Foto: Vishnu Mohanan en Unsplash

Los modelos de lenguaje llevan años escribiendo mejor que muchas personas. Aun así, cuando una empresa intenta que la IA decida algo dentro de un sistema (aprobar un reembolso, clasificar un reclamo, marcar una transacción sospechosa), aparecen los mismos problemas: la respuesta llega en texto libre que hay que interpretar, tarda segundos y no dice cuándo el modelo no está seguro.

El 15 de septiembre de 2026, la startup estadounidense TypeSafe AI presentó una propuesta distinta: Jev, el primer modelo de una familia que llaman System One models. Su idea central cabe en una línea: entra información desordenada, salen decisiones tipadas con su probabilidad.

Qué es Jev

Jev no conversa ni redacta. Recibe un estado (texto, idealmente con estructura: un formulario, un registro, un ticket) y una lista de preguntas cerradas, y responde cada una con una probabilidad calibrada. Las preguntas pueden ser de tres tipos, según la documentación oficial:

  • Sí o no, con la probabilidad de que la respuesta sea «sí».
  • Elegir entre opciones definidas de antemano, con una distribución sobre todas ellas.
  • Puntuar según una rúbrica.

Como las respuestas posibles están fijadas antes de preguntar, el resultado siempre respeta el formato que el programa espera. No hay que interpretar un párrafo ni validar un JSON que llegó mal formado.

El nombre no es una sigla. Viene del economista William Stanley Jevons, que observó en el siglo XIX que las máquinas de vapor más eficientes no redujeron el consumo de carbón, sino que lo multiplicaron. TypeSafe apuesta a lo mismo con la inteligencia: si decidir cuesta mucho menos, aparecen muchos más casos donde vale la pena automatizar. Y System One es un guiño al «Sistema 1» de Daniel Kahneman en Pensar rápido, pensar despacio: el pensamiento rápido e intuitivo, frente al lento y deliberado.

Cómo funciona, según sus creadores

El anuncio de TypeSafe, firmado por su fundador Diogo Almeida (ex investigador de OpenAI), describe tres piezas:

  • Una arquitectura nueva con un muestreador en paralelo: produce todas las respuestas en una sola consulta, en lugar de generar palabra por palabra como un modelo de lenguaje.
  • Un entrenamiento propio, RLCD (Reinforcement Learning for Calibrated Decisions), que premia que las probabilidades sean honestas: si Jev dice 80 %, debería acertar cerca del 80 % de las veces.
  • Datos generados por la propia empresa. TypeSafe afirma que no entrena con datos de sus clientes.

El modelo es cerrado (no se publican los pesos ni su tamaño) y está en acceso anticipado. También se puede usar a través de Cloudflare, que lo lista con una ventana de 32 000 tokens y sin retención de datos.

Lo que dicen los números, y su letra chica

TypeSafe reporta respuestas de 70 a 500 milisegundos de punta a punta y un precio de USD 0,042 por millón de tokens de entrada, con la salida gratis. En sus propias pruebas de flujos de trabajo habla de ganancias de hasta 193 veces más rápido y 444 veces más barato que modelos de frontera.

Lo interesante es que la propia empresa publica las advertencias:

  • Las pruebas de velocidad se hicieron desde la costa oeste de Estados Unidos, donde está el servicio.
  • Los flujos evaluados los escribió su equipo, y la «respuesta de referencia» es el promedio de otros dos modelos, no una verdad comprobada.
  • No pueden probar que el precio no esté subsidiado.
  • No hay artículo científico ni benchmarks públicos independientes todavía.

Las primeras reacciones externas, recogidas por TechCrunch, son positivas pero anecdóticas: un ingeniero de Vercel reportó resultados entre 5 y 18 veces más rápidos, y otra empresa, costos entre 10 y 20 veces menores. La demanda fue tal que la API dejó de responder por un momento.

Qué no es

La frase «no puede alucinar» circula mucho y hay que leerla bien. Lo que está garantizado es que la respuesta siempre tiene el formato correcto. Eso no significa que sea la respuesta correcta: Jev puede elegir con total prolijidad la opción equivocada, como señaló The Decoder. Lo que sí aporta es la probabilidad, que permite decidir cuándo confiar y cuándo pasar el caso a una persona.

Tampoco reemplaza a los modelos de lenguaje. Si necesitas redactar un correo o resumir un contrato, sigue siendo trabajo de un LLM. Jev apunta a los miles de pequeñas decisiones que hay alrededor.

Cómo lo aplicaríamos en el Perú

Estas son propuestas nuestras, no casos publicados. Todas siguen el mismo patrón: muchas decisiones repetitivas, un conjunto cerrado de respuestas y un humano que revisa solo los casos dudosos.

Finanzas y fintech. Priorizar las alertas de transacciones antes de que lleguen a cumplimiento, o clasificar los reclamos del Libro de Reclamaciones por producto, urgencia y riesgo regulatorio. Los casos con baja confianza van a un analista; el resto se ordena solo.

Minería. Las mineras guardan años de reportes de incidentes, órdenes de mantenimiento y bitácoras de turno escritas a mano. Con un costo por documento tan bajo, se vuelve viable recorrer todo ese archivo y extraer campos útiles: tipo de equipo, severidad según una rúbrica y causa probable de una lista cerrada. Eso alimenta después modelos de mantenimiento predictivo o tableros de seguridad.

Comercio y agroexportación. Clasificar catálogos y facturas por categoría o partida, verificar que un certificado cumpla cada requisito con su probabilidad, o enrutar tickets de atención en menos de un segundo.

Legal. Decidir si una norma nueva afecta a un contrato o a un proceso, como primer filtro antes de la revisión de un abogado.

Antes de usarlo en serio

  • Español. No encontramos información pública sobre su desempeño en español. Habría que armar evaluaciones propias con casos reales, algo que la misma TypeSafe recomienda.
  • Datos personales. El servicio corre en Estados Unidos. Enviar datos de clientes exige revisarlo contra la Ley 29733 de Protección de Datos Personales.
  • Madurez. Es acceso anticipado, cerrado y sin auditorías independientes. Para un piloto está bien; para un proceso crítico, todavía no.

Nuestra lectura

Más allá de si Jev cumple todo lo que promete, la idea de fondo nos parece la correcta: la automatización real necesita decisiones rápidas, baratas, con formato fijo y con un nivel de confianza explícito. Es exactamente lo que falta cuando se intenta llevar un chatbot a producción. Vamos a probarlo con casos en español y contaremos aquí lo que encontremos.

Fuentes

Dónde lo aplicaríamos en el Perú

  • Finanzas
  • Minería
  • Comercio
  • Legal

¿Te imaginas esto en tu negocio?

Conversemos 30 minutos y vemos si tiene sentido para ti.

Más en el Radar Strebula