落地的人工智能 · 综合

数据:从哪来,没有的时候怎么办

一句话: 大多数项目里数据是存在的,只是分散、没标注、没清洗——而这正是吃掉大部分时间的那个阶段。

动手前的三个问题

信息在物理上存在哪里、谁有访问权;它处于什么状态——格式、完整性、重复;以及是否被允许用于这个用途。第三个问题拦下的项目,比前两个加起来还多。

没有标注的时候

从小开始:两百个标注良好的样本,胜过一万个草率标注的。写标注指南、对一份样本做双人标注,并度量标注者之间的一致性——不一致说明定义含糊,而不是标注员不行。

也可以先用模型生成初始标注再人工修正。这样快,但需要抽查样本,以免把偏差固化下来。

值得做的清洗

合并重复实体、归一化希伯来语文本、修正日期和数字,以及删掉没有意义的记录。质量上的大部分跃升来自这里,而不是来自一个更好的模型。

深入一层

把数据按版本保存:哪份样本用于了哪次评估。没有这个,比较两次在不同周做的运行就没有意义,你也无法知道到底是你变好了,还是只是数据变了。