実践としての AI · 中級
データ:どこから来てないときはどうするか
一行でいうと: ほとんどのプロジェクトでデータは存在するが、散乱していてラベルなし、クリーンでない——そしてそれが時間のほとんどを食う段階だ。
始める前の三つの質問
情報が物理的にどこに存在し、誰がアクセスできるか;どんな状態か——形式、完全性、重複;そしてこの目的のために使用することが許可されているか。三つ目が最初の二つより多くのプロジェクトを止める。
ラベリングがないとき
小さく始める:二百の良くラベル付けされた例は一万の不注意にラベル付けされたものより価値がある。ラベリングガイドラインを書き、サンプルを二回ラベル付けし、ラベラー間の合意を測定する——不一致は曖昧な定義を示し、悪い作業者ではない。
モデルで最初のラベリングを生成して手動で修正することもできる。速く、バイアスを永続させないためにサンプルを確認することが必要だ。
報われるクリーニング
重複エンティティのマージ、ヘブライ語テキストの正規化、日付と数値の修正、意味のないレコードの削除。品質のほとんどの跳躍はここから来て、より良いモデルからではない。
さらに深く
データをバージョンで保持する:どのサンプルがどの評価に使われたか。なければ、異なる週に行われた二つの実行の比較は意味がなく、改善したか単にデータが変わったかがわからない。