Avaliação: como saber que o sistema melhorou
Do que é feito um bom conjunto
Casos reais do campo, classificados em categorias, incluindo casos limites e os que não têm uma boa resposta. Para cada caso: entrada e uma resposta desejada ou critério de aceite.
Todo incidente encontrado em produção adiciona uma linha. Assim o conjunto cresce nos lugares certos.
Três métodos de pontuação
Regras automáticas — estrutura correta, número certo, fonte citada. Barato e preciso onde é possível.
Avaliação baseada em modelo contra critérios escritos — rápido e barato, e precisa de calibração frente ao julgamento humano.
Revisão humana de uma amostra — caro, e a âncora da verdade.
Como ler os resultados
Compare com a versão anterior, não com uma pontuação absoluta. E verifique por recorte de categoria — uma média estável costuma esconder uma queda em uma categoria que é exatamente o caso importante.
Indo mais fundo
Execute o conjunto na pipeline de build e bloqueie um merge quando uma métrica-chave cai. E adicione uma amostra de tráfego ao vivo para revisão humana semanal — um conjunto fixo envelhece, e o campo sempre produz casos que você não pensou.