プロンプトインジェクション

term_id: prompt_injection

Category: ethics_safety

Definition

プロンプトインジェクションは、大規模言語モデルが入力テキスト内に隠されたまたは矛盾した指示を埋め込むことでユーザーの指示を解釈する方法を利用します。これにより、モデルが元の安全制約や指示を無視して、攻撃者の意図した動作を引き起こす可能性があります。

Summary

悪意のある入力を操作し、AIモデルの安全フィルターを回避したり、意図しないコマンドを実行させたりする敵対的攻撃手法。

Key Concepts

  • 敵対的攻撃
  • システムプロンプト
  • セキュリティリスク
  • 入力サニタイズ

Use Cases

  • LLMセキュリティテスト
  • チャットボットの安全性確保
  • データプライバシー保護