実践としての AI · 上級
あなたの知識をモデルに接続する:大げさな言葉なしの検索
一行でいうと: モデルはあなたの文書を知らない——各質問に関連するパッセージを見つけてプロンプトに添付する必要がある。
四つのステップ
チャンク化。構造で切る——セクション、見出し、行——そして各チャンクに文書名と見出しパスを保持する。恣意的な切り取りは悪い回答の最も一般的な原因だ。
インデックス化。意味ベースの検索と文字通りの検索を組み合わせることは、特にヘブライ語と識別子でどちらかを単独で使うより優れる。
取得。多くではなく少ない関連チャンク。多くのチャンクはコストが高く、遅くし、ノイズを追加する。
回答。モデルに素材からのみ回答し、ソースを引用し、回答がない場合に明示的にそう言うよう指示する。
落とし穴
取得で忘れられた権限;日付ベースの優先順位なしの矛盾する文書;実際にはデータクエリであるテキスト検索ではない質問;正規化されていないヘブライ語のスペル。
機能していることをどう知るか
二つのステップを別々に測定する:正しいチャンクが結果に現れたか、そしてそれが現れたら——回答は正確か?最終結果のみを測定しても何を修正すべきかわからない。
さらに深く
各々が既知の正しいチャンクを持つ質問のセットを構築し、それが上位五件に現れた頻度を測定する。それがほとんどの改善を駆動する指標だ。検索前の質問の言い換えを追加し、フォローアップの質問のために前のターンのコンテキストを保持する。