落地的人工智能 · 进阶
评估:怎么知道系统变好了
一句话: 没有固定的评估集,每一次改动都是一种信念——而且一个方面的改进会掩盖另一个方面的退步。
一个好的评估集由什么组成
来自真实场景的案例,按类别归类,包含边界情况和那些本来就没有好答案的情况。每个案例要有:输入,以及一个期望答案或验收标准。
生产环境里发现的每一次问题都往里加一行。这样评估集就会在正确的地方生长。
三种打分方法
自动规则——结构正确、数字正确、有引用来源。在可行之处既便宜又精确。
基于模型、依照书面标准打分——快而便宜,需要对照人的判断做校准。
对样本做人工评审——昂贵,但它是真相的锚点。
怎么读结果
和上一个版本比,而不是和一个绝对分数比。并且按类别拆开看——平稳的平均分经常掩盖某一个类别的下滑,而那个类别往往正是重要的场景。
深入一层
把评估集放进构建流水线里跑,当关键指标下降时阻止合并。并加入一份线上流量样本做每周的人工评审——固定评估集会过时,而真实场景总会产生你没想到的情况。