IA en la práctica · Avanzado

Evaluación: cómo saber que el sistema mejoró

En una línea: Sin un conjunto de evaluación fijo, cada cambio es una creencia, y una mejora en un área ocultará una regresión en otra.

De qué está hecho un buen conjunto

Casos reales del campo, clasificados en categorías, incluyendo casos límite y los que no tienen una buena respuesta. Para cada caso: entrada, y una respuesta deseada o un criterio de aceptación.

Cada incidente encontrado en producción añade una fila. Así el conjunto crece en los sitios correctos.

Tres métodos de puntuación

Reglas automáticas: estructura correcta, número correcto, fuente citada. Barato y preciso donde es posible.

Evaluación basada en el modelo contra criterios escritos: rápido y barato, y necesita calibración frente al juicio humano.

Revisión humana de una muestra: caro, y el ancla de la verdad.

Cómo leer los resultados

Compara con la versión anterior, no con una puntuación absoluta. Y comprueba por desglose de categoría: un promedio estable suele ocultar una caída en una categoría que es justo el caso importante.

En profundidad

Ejecuta el conjunto en la tubería de construcción y bloquea una fusión cuando una métrica clave cae. Y añade una muestra de tráfico en vivo para la revisión humana semanal: un conjunto fijo envejece, y el campo siempre produce casos que no pensaste.