実践としての AI · 上級
モデルの選び方——そしてなぜ最初の決定ではないか
一行でいうと: タスクが解けるかどうかをテストするために最も強力なモデルから始め、品質が壊れるまで安いものに降りる。
正しい方向
強力なモデルでさえ失敗するなら、問題はモデルの選択ではなくタスクの定義、データ、プロンプトだと安く発見した。成功したなら、品質のベースラインがあり、今は品質がバー以下に落ちる場所を見つけるために降りられる。
四つの軸
あなたのタスクでの品質——他のタスクをテストする公開テーブルではない。
操作あたりのコスト——主に入ってくるテキストによって決まり、出ていくテキストではない。
速度——ライブインターフェースでは重要、バックグラウンド処理ではほぼ無関係。
データが実行される場所——品質ではなく規制とリスクの問題。
トレーニングするとき
ほぼ常にしない、最初はしない。プロンプトの改善、良い例、正しい情報源への接続がほとんどのギャップを解決する。ファインチューニングは何千もの品質のある例があり、目標がコストまたは応答時間を下げることのときに価値がある。
さらに深く
ベンダー変更が設定変更になるよう制御するレイヤーでモデル呼び出しを包む。そして呼び出しごとのログを保持する——モデル、プロンプトバージョン、テキスト量、時間——さもなければ「いつ品質が落ちたか」などの質問は答えられなくなる。