越狱

term_id: jailbreak

Category: ethics_safety

Definition

越狱涉及设计特定的输入或提示,诱骗 AI 模型忽略其内置的安全指南并生成禁止的内容,例如仇恨言论、危险指令或非法建议。

Summary

一种旨在绕过 AI 模型安全过滤器和伦理约束的提示工程技术。

Key Concepts

  • 提示注入
  • 安全过滤器
  • 红队测试
  • 对齐

Use Cases

  • 安全研究测试
  • 恶意生成有害内容
  • 评估模型鲁棒性