Guardrails

term_id: guardrails

Category: application_paradigms

Definition

Guardrails merujuk pada seperangkat kontrol perangkat lunak dan lapisan penegakan kebijakan yang terintegrasi ke dalam aplikasi AI, khususnya model bahasa besar (LLM), untuk memastikan perilaku yang aman dan patuh terhadap aturan. Mereka berfungsi sebagai filter yang memantau dan memodifikasi input serta output untuk menjaga kepatuhan.

Summary

Mekanisme keamanan yang dirancang untuk membatasi keluaran model AI guna mencegah generasi konten yang berbahaya, bias, atau tidak sah.

Key Concepts

  • Filtering Input/Keluaran
  • Penegakan Kebijakan
  • Deteksi Toksisitas
  • Pertahanan terhadap Injeksi Prompt

Use Cases

  • Chatbot perusahaan yang memerlukan kepatuhan merek yang ketat
  • Asisten kesehatan yang memastikan akurasi medis dan privasi
  • Bot layanan pelanggan yang mencegah penggunaan bahasa ofensif