AIの回答が良くなったかを、どう比べる?小さな評価セットの作り方
指示文を直してAIの回答が読みやすくなっても、必要な情報が抜けていれば改善とは言い切れません。用途に合う確認項目と例題を用意し、変更前後を同じ条件で比較する方法を、文章整理の仮例で紹介します。
「良い回答」を、確認できる条件に分ける
評価セットとは、試す入力と、その結果を判定する基準をまとめたものです。難しい採点システムがなくても、何を確認したいかを先に決めるところから始められます。
Anthropicの成功基準と評価のガイドは、目的に沿った具体的・測定可能な基準を設け、実際の用途や例外的な入力を評価に含める考え方を説明しています。以下の例題や判定方法は、この考え方を踏まえた本記事独自の提案です。
たとえば会議メモから作業一覧を作るなら、「自然な日本語」だけでなく、作業の抜け、担当者の取り違え、期限の捏造を別々に確認できます。文章の好みと、情報の正しさを同じ点数だけで扱わないことが、結果を読み解く助けになります。
普通の入力と、判断に迷う入力を用意する
次は架空の会議メモを使う評価例です。実際の顧客情報や、検証で得た結果ではありません。
表が見切れる場合は横にスクロールできます
試す入力 | 回答で確認すること |
|---|---|
作業・担当者・期限が明記されている | 三つを対応付けて取り出せるか。 |
担当者だけが未定 | 人名を補わず、未定と分かる形で残すか。 |
会議中に期限が変更された | 古い期限を最終決定として扱わないか。 |
検討しただけで採用されなかった案がある | 実施する作業に混ぜないか。 |
例題ごとに期待する内容を人が先に書いておくと、出てきた回答に合わせて基準を変えてしまうのを防げます。人同士でも結論が分かれるメモは、正解を無理に一つにするより、「確認が必要」と返すべき入力として扱う方法があります。
実データを使う場合は、利用許可と入力先のデータ取り扱いを確認してください。使えない情報を含むなら、条件を保った架空の例を作る選択肢もあります。
変更する条件を絞り、失敗の中身を見る
指示文を比べるなら、モデル、入力資料、利用できるツールなど、ほかの条件をできるだけそろえます。モデルも資料も同時に変わると、何が結果の違いにつながったのか分かりにくくなるためです。
結果は「合格した例題数」だけでなく、どの項目で失敗したかを残すと次の修正に使えます。言い回しの差と、未定の担当者を勝手に決める誤りでは、運用上の影響が異なります。
一度の成功を安定した性能と受け取らないことも必要です。同じ例題を再度試したときに結果が変わるなら、その幅も記録します。合否を決める回数や許容範囲は、失敗した場合の影響に合わせて決めるもので、どの業務にも共通する本記事の推奨値はありません。
練習した例題だけに合っていないか
同じ例題を見ながら指示文を何度も直すと、その例ではうまくいく一方、別の言い回しには弱い可能性が残ります。調整用とは別に、最後の確認用の入力を取っておくと、その違いを見つける材料になります。
また、評価を通過しても、試していない業務や利用者まで品質を保証することはできません。運用中に見つかった失敗は、機密情報を保護したうえで次の例題に加えると、実際の用途に近い評価へ育てられます。
まとめ
- 良し悪しを、抜け・誤り・表現など確認できる条件に分けます。
- 通常の入力に加え、情報不足や変更・取り消しを含む例題も用意します。
- 同じ条件で比較し、合格数だけでなく失敗の内容と未検証の範囲を残します。
まずは普段任せたい作業を一つ選び、「この誤りは困る」という例から書き出してみましょう。用途の選定はAI導入の小さな検証、個々の回答の照合は出典・日付・条件の確認で扱っています。
