実践としての AI · 上級
評価:システムが改善したことをどう知るか
一行でいうと: 固定の評価セットなしに、すべての変更は信念だ——そして一つのエリアでの改善は別のところでのリグレッションを隠す。
良いセットを構成するもの
フィールドからの実際のケース、カテゴリに分類され、エッジケースと良い答えがないものを含む。各ケースに:入力と望ましい回答または受け入れ基準。
本番で見つかったすべてのインシデントが行を追加する。そうしてセットは正しい場所で成長する。
三つのスコアリング方法
自動ルール——正しい構造、正しい数、ソース引用。可能な場所で安く正確。
書かれた基準に対するモデルベースの評価——速く安く、人間の判断に対してキャリブレーションが必要。
サンプルの人間によるレビュー——高価で、真実のアンカー。
結果の読み方
絶対スコアではなく前のバージョンと比較する。そしてカテゴリの内訳でチェックする——安定した平均はしばしばまさに重要なケースである一つのカテゴリでの落ちを隠す。
さらに深く
ビルドパイプラインでセットを実行し、キー指標が落ちたときにマージをブロックする。そして週次の人間のレビューのためにライブトラフィックのサンプルを追加する——固定セットは古くなり、フィールドは常に考えていなかったケースを生む。