落地的人工智能 · 综合

分类与抽取:回报最高的任务

一句话: 在做聊天之前,先确认问题是不是其实就是「给工单分类」或「从文档里抽字段」——这两个简单任务能立刻带来价值。

为什么偏偏是这两个

分类和抽取有可以核对的正确答案、简短便宜的输出,以及与现有系统的简单集成。它们也正是模型能替代重复人工的场景——分派工单、读发票、给线索打标。

相比之下,开放式的聊天界面难以度量、成本高,而且会引发系统未必能满足的期待。

怎么做才对

定义封闭的类别,每一类都有书面定义,其中要包含一个「不清楚」类别。没有它,模型会把每个case硬塞进最接近的类别,并在数字上骗你。

在抽取上:定义严格的schema、在代码里校验,并且宁可返回空值也不要猜。一个幻觉出来的字段,比一个缺失的字段更危险。

人在环路里

把低置信度的情况路由给人,并用他的判断来扩充评估集。这样系统会因为被使用而变好,不需要任何训练项目。

深入一层

每个类别单独度量——92%的整体准确率可能掩盖了一个只有60%的关键类别。并构建一个混淆矩阵:它显示的不只是有多少错误,还有哪些类别在互相混淆,而那通常是定义上的缺陷,不是模型的问题。