가드레일 (Guardrails)
term_id: guardrails
Category: application_paradigms
Definition
가드레일(Guardrails)은 AI 애플리케이션, 특히 대형 언어 모델에 통합된 소프트웨어 제어 및 정책 집행 레이어의 집합을 의미합니다. 이는 모델이 안전하고 규정 준수하는 행동을 유지하도록 보장하며, 입력 및 출력 필터링, 유해 콘텐츠 감지 등을 통해 시스템의 신뢰성을 높이는 역할을 합니다.
Summary
유해하거나 편향된, 승인되지 않은 콘텐츠 생성을 방지하기 위해 AI 모델의 출력을 제한하도록 설계된 안전 메커니즘입니다.
Key Concepts
- 입출력 필터링 (Input/Output Filtering)
- 정책 집행 (Policy Enforcement)
- 독성 감지 (Toxicity Detection)
- 프롬프트 인젝션 방어 (Prompt Injection Defense)
Use Cases
- 엄격한 브랜드 준수가 필요한 기업용 챗봇
- 의료 정확성과 프라이버시를 보장하는 의료 보조 도구
- 공격적 언어를 방지하는 고객 서비스 봇