OpenRouter · banco de pruebas · con respuestas

¿Quién va a cancelar?

Sorteamos clientes de una base real de telecomunicaciones. Cada modelo recibe el perfil — sin saber qué pasó — y estima la probabilidad de cancelación. Después comparamos con la realidad. La carrera es entre modelos de IA; una regresión logística entrenada en esta base entra como referencia del método clásico.

Un detalle: las tareas en sí corren en portugués (feed de noticias brasileño, palabras en portugués, los mismos prompts para todos los modelos). Así cada carrera sigue siendo comparable — y el marcador no se divide.

1

Empieza por aquí: sorteemos los clientes

Esta prueba parte de una base real de telecomunicaciones. Sorteamos clientes al azar — tú ves quién entró en la muestra antes de que cualquier modelo opine.

clientes sorteados al azar

Cada cliente se convierte en una solicitud separada por modelo, en secuencia — la medición más justa. Los modelos ven el perfil (antigüedad, contrato, servicios, cargos), nunca el identificador ni la columna Churn. ¿Un modelo tarda más de 20 segundos? Lo sacamos de la carrera y el informe sigue con lo que ya entregó.

2

Ahora solo falta largar la carrera

Sortea una muestra de clientes para empezar.
Sobre la base de datos

Telco Customer Churn, de IBM — uno de los datasets clásicos de machine learning, con 7043 clientes de una empresa ficticia de telecomunicaciones de California. Disponible públicamente en Kaggle. Aquí usamos la columna Churn solo como respuesta correcta: nunca se envía a los modelos — haz clic en el logo de cualquier modelo para ver la solicitud exacta. La regresión logística de referencia se entrena en esta misma base en cada sesión; los LLMs nunca ven ningún dato de la población. Haz clic en la Σ para ver lo que aprendió.