Ochranné prvky

term_id: guardrails

Category: application_paradigms

Definition

Ochranné prvky označují sadu softwarových kontrolních mechanismů a vrstev vynucování politik integrovaných do aplikací AI, zejména velkých jazykových modelů, aby se zajistilo bezpečné a souladné chování. Fungují jako filtry pro vstupní a výstupní data.

Summary

Bezpečnostní mechanismy navržené k omezení výstupů modelů AI s cílem zabránit generování škodlivého, zkresleného nebo neoprávněného obsahu.

Key Concepts

  • Filtrování vstupu/výstupu
  • Vynucování politik
  • Detekce toxicita
  • Obrana proti injekci promptů

Use Cases

  • Podnikové chatboty vyžadující přísnou dodržování značky
  • Zdravotní asistenti zajišťující lékařskou přesnost a soukromí
  • Boty zákaznické podpory bránící používání urážlivého jazyka