実践としての AI · 上級
小さい、ローカル、エッジモデル
一行でいうと: ボリュームが大きく、レイテンシが重要で、データが出られないとき——あなたの側の小さなモデルはクラウドの大きなモデルに勝る。
価値があるとき
固定された形式の狭い繰り返しタスク;プライバシーまたは規制上の要件;従量課金を高くするボリューム;またはネットワーク依存なしの即時応答の必要。
代わりに何を支払うか
運用:ハードウェア、可用性、更新、監視、維持方法を知るチーム。そして:オープンなタスクでの品質ギャップはまだ存在し、縮小したとしても。
中間の道
難易度によるルーティング:小さなモデルがほとんどのリクエストを処理し、難しいものは強力なモデルに行く。それが通常最適だ——コストが低く、重要な場所で品質が保たれる。
蒸留することもできる:強力なモデルを使って品質のある例を生成し、それで特定のタスクのために小さなモデルをファインチューンする。
さらに深く
単一の応答時間だけでなく、同時リクエストのスループットを測定する。ローカルモデルは負荷下で全く異なる動作をし、単一ユーザーテストによる容量計画は常にローンチ時のサプライズにつながる。