落地的人工智能 · 进阶

怎么选模型——以及为什么它不是第一个决定

一句话: 先用最强的模型验证这个任务能不能做,然后再往下降到更便宜的,直到质量崩掉为止。

正确的方向

如果连强模型都做不成,你就以很低的代价发现了:问题不在模型选择,而在任务定义、数据或提示词。如果它做成了,你就有了一条质量基线,接下来可以往下降,找到质量跌破你标准的那个点。

四个维度

在你的任务上的质量——不是在测别的任务的公开榜单上。

每次调用的成本——主要由输入的文本量决定,而不是输出。

速度——在实时界面里是关键,在后台处理中几乎无关紧要。

数据在哪里运行——这是合规和风险问题,不是质量问题。

什么时候训练

几乎总是不需要,而且开头一定不需要。改进提示词、给好的示例、接上正确的信息源,能解决大多数差距。微调值得考虑的时机,是你已经有成千上万个高质量样本,而目标是降低成本或响应时间。

深入一层

把模型调用包在一层你自己控制的封装里,这样换供应商就是改一个配置。并且每次调用都记录日志——模型、提示词版本、文本量和耗时——否则「质量是什么时候掉下去的」这类问题就无法回答。