落地的人工智能 · 进阶

小模型、本地模型与边缘模型

一句话: 当量大、延迟关键,或者数据不能外传时——跑在你这边的小模型胜过云上的大模型。

什么时候划算

格式固定、范围狭窄的重复任务;隐私或合规要求;使按量付费变得昂贵的规模;或者需要不依赖网络的即时响应。

要付出什么代价

运维:硬件、可用性、更新、监控,以及一个会维护它的团队。还有:在开放式任务上的质量差距仍然存在,即便已经缩小。

一条中间路线

按难度路由:小模型处理大多数请求,难的交给强模型。这通常是最优点——成本低,而在重要的地方质量得到保留。

也可以做蒸馏:用强模型生成高质量样本,再用它们为特定任务微调一个小模型。

深入一层

用并发请求下的吞吐量来度量,而不只是单次响应时间。本地模型在负载下的表现完全不同,而基于单用户测试做出的容量规划,总会在上线时带来意外。