Jailbreak

term_id: jailbreak

Category: ethics_safety

Definition

Jailbreaking melibatkan pembuatan input atau prompt spesifik yang menipu model AI untuk mengabaikan pedoman keamanan bawaannya dan menghasilkan konten terlarang, seperti ujaran kebencian atau instruksi berbahaya.

Summary

Teknik rekayasa prompt yang dirancang untuk melewati filter keamanan dan batasan etika model AI.

Key Concepts

  • Injeksi Prompt
  • Filter Keamanan
  • Uji Tim Merah
  • Penyelarasan

Use Cases

  • Pengujian riset keamanan
  • Menghasilkan konten berbahaya secara jahat
  • Menilai ketahanan model