提示注入

term_id: prompt_injection

Category: ethics_safety

Definition

提示注入利用大语言模型解释用户指令的方式,通过在输入文本中嵌入隐藏或冲突的指令来 exploit 这一特性。这可能导致模型忽略其原始的系统设定或安全限制。

Summary

一种对抗性攻击,恶意输入操纵 AI 模型以绕过安全过滤器或执行非预期命令。

Key Concepts

  • 对抗性攻击
  • 系统提示词
  • 安全风险
  • 输入清洗

Use Cases

  • 大语言模型安全测试
  • 聊天机器人安全性
  • 数据隐私保护