実践としての AI · 中級
実験:変更が何かを改善したことをどう知るか
一行でいうと: 同じトラフィックで同時に二つのバージョンを比較する——すべての「前後比較」は世界も測定し、あなただけではない。
なぜ前後比較でないか
季節性、実行中のキャンペーン、ユーザーミックスの変化——すべてが影響する。同時のランダム分割はそれらを中和し、だから信頼できる答えを与える唯一のツールだ。
正しく実行する方法
主要指標、サンプルサイズ、期間を事前に決め、改善が現れた瞬間に止めない——早停は自分を欺く最も一般的な方法だ。
他の何かを犠牲にして達成された改善を検出するために、少なくとも一つのバランス指標を保持する。
十分なトラフィックがないとき
内部システムには常に統計的なサンプルがあるわけではない。その場合、固定の評価セットで比較し、定性的なチェックを追加する:二十の実際のケース、二人の評価者、根拠のある決定。
さらに深く
各実験を一箇所に記録する:仮説、指標、結果、決定。組織は何が試みられたかを忘れ、同じアイデアを年に一度実行する。実験ログは最も安い組織の記憶だ。