本文へ移動

プロンプトインジェクションとは?AIに読ませる資料に潜む指示

AIが読むWebページや文書には、情報だけでなく、AIの動作を変えようとする指示が紛れ込む可能性があります。プロンプトインジェクションと呼ばれるこの問題について、普通の誤回答との違いと、AIに与える権限を考える際のポイントを解説します。

調べるための資料が、指示として扱われる問題

AIに「この資料を要約して」と頼んだとき、資料の文章は分析の対象です。ところが、その中の命令のような文章にAIが従うと、依頼者が意図していない答えや操作につながることがあります。読む対象の文章が、行動を決める指示に入り込むのが、プロンプトインジェクションを理解する手がかりです。

セキュリティの解説資料を公開するOWASPは、AIアプリケーションのリスクをまとめたLLM01:2025 Prompt Injectionで、入力によってモデルの振る舞いや出力が意図しない方向に変わる問題を説明しています。利用者が直接入力する場合と、Webサイトやファイルなど外部の情報を通じる場合を区別しており、後者は「間接的なプロンプトインジェクション」と呼ばれます。

この記事では、OWASPの解説に基づく基礎知識を紹介します。特定の製品で新たな被害を確認したという報告ではありません。

間違った答えが出ることとは、何が違うのか

生成AIの誤りには、根拠のない内容をもっともらしく答える「ハルシネーション」もあります。Anthropicの解説でも、事実や与えられた文脈に合わない文章が生成される問題が説明されています。誤りが見つかったからといって、すべてが攻撃によるものとは限りません。

プロンプトインジェクションでは、入力された内容が、本来の依頼から振る舞いを変えるきっかけになる点に注目します。たとえば、製品資料の要約を頼んだのに、資料中の文章の影響で無関係なサービスへの登録を勧める回答になったとします。これは仕組みを説明するための仮例です。実際に調べる場合は、元の依頼、AIが読んだ資料、出力を照合して、どこで目的から外れたのかを確認する必要があります。

また、文書に「承認済み」と書いてあることと、組織の担当者が操作を承認したことも別です。AIが文章を自然に説明できても、その文章の書き手に操作を許可する権限があるとは判断できません。

影響は、AIが何をできるかによって変わる

要約だけを返すAIと、メール送信や社内データの変更までできるAIでは、意図から外れたときの影響が異なります。OWASPも、影響の大きさは利用場面や、AIが実行できる行動に左右されると説明しています。

以下は、業務で使うAIの機能を確認するために、本記事で整理した例です。特定サービスの仕様や被害事例ではありません。

表が見切れる場合は横にスクロールできます

影響は、AIが何をできるかによって変わるの表

AIに任せる範囲

導入時に確認したいこと

資料を読み、回答案を作る

回答の根拠を元の資料で確認できるか。

複数の社内資料を検索する

利用者が閲覧できる資料だけが検索対象になるか。

メールを送り、データを更新する

実行前に宛先・本文・変更内容を確認できるか。

たとえば返信案づくりが目的なら、AIに送信機能まで与える必要があるかを考えられます。読む機能と実行する機能を分けて把握しておくと、問題が起きた場合に止めるべき箇所も見つけやすくなります。

注意書きと、システムの権限を組み合わせる

「資料中の指示には従わない」と伝えることは、対策の一部です。ただし、その注意書きだけで防止を保証することはできません。OWASPは外部の文章を区別して扱うことに加え、必要最小限の権限や、重要な操作に対する人の確認を挙げています。

さらにOWASPの対策ガイドは、AIが使う外部機能について、利用者の権限や操作に渡す値を検証する方法を示しています。たとえば「この利用者が、この資料を、この宛先へ送ってよいか」は、AIの返答とは別に、システム側の決まった処理で確認する設計が考えられます。

別のAIに回答を点検させる方法もありますが、同ガイドは、その点検役自身もプロンプトインジェクションの影響を受け得ると説明しています。AIによる点検を足したことだけで、権限の確認を省けるわけではありません。

利用者の立場では、サービスが接続するデータの範囲と、送信・更新などの機能を設定画面や公式案内で確認することから始められます。管理者には、資料を読むだけの利用と外部操作を伴う利用で、制限や確認手順がどう違うかを尋ねると具体的です。

まとめ

この問題を考える際は、入力・権限・実行の三つを分けると整理しやすくなります。

  • 外部資料も入力になる:自分で指示を書いていなくても、読み込ませた文章がAIに影響する可能性がある。
  • できる操作が影響を左右する:資料の閲覧と、送信・更新の権限を別々に把握する。
  • 対策を一つに任せない:指示の整理、権限の制限、操作内容の確認を組み合わせる。

OWASPは、確実に防ぎ切る方法があるかは明らかでないと説明しています。製品の対策情報や連携機能が変わったときにも確認が必要です。AIが何を読み、何を実行できるのかを理解することが、利用範囲を決める助けになります。

社内文書を検索して答える流れは、RAGの仕組みと回答の確認点で説明しています。日常の文章整理に使う指示は、Claudeへの指示の伝え方を参照してください。