Jailbreak
term_id: jailbreak
Category: ethics_safety
Definition
Jailbreaking melibatkan pembuatan input atau prompt spesifik yang menipu model AI untuk mengabaikan pedoman keamanan bawaannya dan menghasilkan konten terlarang, seperti ujaran kebencian atau instruksi berbahaya.
Summary
Teknik rekayasa prompt yang dirancang untuk melewati filter keamanan dan batasan etika model AI.
Key Concepts
- Injeksi Prompt
- Filter Keamanan
- Uji Tim Merah
- Penyelarasan
Use Cases
- Pengujian riset keamanan
- Menghasilkan konten berbahaya secara jahat
- Menilai ketahanan model