Sikkerhedsrestriktioner

term_id: guardrails

Category: application_paradigms

Definition

Sikkerhedsrestriktioner refererer til et sæt softwarekontroller og politikopfyldningslag, der er integreret i AI-applikationer, især store sprogmodeller, for at sikre sikker og overholdelsesdygtig adfærd. De fungerer som filtre, der overvåger og regulerer både input og output.

Summary

Sikkerhedsmekanismer designet til at begrænse AI-modellers output for at forhindre generering af skadeligt, bias-præget eller uautoriseret indhold.

Key Concepts

  • Input/Output-filtering
  • Politikopfyldning
  • Detektion af toksicitet
  • Forsvar mod prompt-injektion

Use Cases

  • Virksomhedskchatbots, der kræver streng overholdelse af brandstandarder
  • Sundhedsassistenters sikring af medicinsk nøjagtighed og privatlivets fred
  • Kundeservicebots, der forhindrer stødende sprogbrug