JEV Lab · banco de pruebas

¿Qué IA entrega más, por menos?

Aquí le damos el mismo trabajo, en el mismo instante, a varios modelos de IA — y medimos en vivo lo que entrega cada uno: velocidad, costo y precisión en la misma tarea. Elige un caso para empezar.

Disponible

Noticias

Los mismos titulares de un feed RSS salen al mismo tiempo hacia varios modelos de IA. Cada clasificación aparece apenas llega: quien cruza la meta primero, aparece primero. Comparamos tiempo por solicitud, costo y concordancia entre modelos.

Feed RSS en vivo · puedes pegar cualquier feedAbrir caso
Disponible

Churn

Clientes de una base real de telecomunicaciones (la clásica Telco, de IBM/Kaggle) se sortean y se envían a los modelos — sin la columna Churn. Cada uno estima la probabilidad de cancelación, y el marcador es simple: acertó o falló, contra la respuesta real. Una regresión logística entrenada en la misma base entra como referencia del método clásico.

Base real con respuestas · LLMs vs. método clásicoAbrir caso
Nuevo

Ahorcado: descubriendo palabras, letra a letra

Aquí la tarea cambia de naturaleza: en vez de clasificar o estimar, el modelo tiene que decidir en secuencia. Cada uno recibe la misma palabra oculta y sigue intentando, letra por letra, hasta descubrirla. Comparamos cuánto tiempo, cuántas rondas y cuánto dinero exigió cada solución.

Decisión en secuencia · costo y tiempo hasta resolverAbrir caso

El marcador acumulado

Cada carrera que corre aquí suma a esta cuenta. Es el promedio de todo lo que ya pasó por el laboratorio — cuánto tarda y cuánto cuesta cada modelo por ítem, y, en churn, cuánto acierta contra la respuesta real.

Las filas marcadas como referencia no compiten por el podio: la regresión logística es el método estadístico clásico, y los modelos de frontera — Claude Opus 5, Kimi K3 y GPT-5.6 Sol — no corren en vivo (sería caro y lento). Medimos cada uno en 50 solicitudes por caso, con los mismos prompts, el 20 de septiembre de 2026. Sirven de vara.

Sumando el historial…

¿Quién es JEV?

La mayoría de los modelos de IA se hizo para conversar: tú preguntas, él escribe. JEV, de TypeSafe AI, nació para otra cosa — decidir. En vez de devolver un texto para que lo interpretemos, devuelve la decisión lista, con un nivel de confianza: "esta noticia es Economía, 92% de certeza". Es lo que TypeSafe llama un modelo System One: rápido, directo, sin charla.

Y eso es justamente lo que este laboratorio — jev.welljose.net — pone a prueba. ¿Un modelo hecho para decidir es de verdad más veloz, más preciso y más barato que los modelos de conversación adaptados a la misma tarea? Aquí no lo damos por hecho: lo medimos.

Todos los modelos corren vía OpenRouter, con la misma vara y el mismo material — y JEV entra como typesafe/jev-1.13. ¿Quieres la versión oficial, de la fuente? El anuncio de TypeSafe está en typesafe.ai/blog.

Todos los casos usan la misma vara: los modelos reciben exactamente el mismo material, en el mismo instante, y los resultados aparecen en orden de llegada — sin edición, sin respuestas impuestas. Cuando los modelos no coinciden, la diferencia queda resaltada para que tú juzgues.