Rào chắn an toàn (Guardrails)

term_id: guardrails

Category: application_paradigms

Definition

Rào chắn an toàn đề cập đến một tập hợp các lớp kiểm soát phần mềm và thực thi chính sách được tích hợp vào các ứng dụng AI, đặc biệt là các mô hình ngôn ngữ lớn (LLM), nhằm đảm bảo hành vi an toàn và tuân thủ. Chúng hoạt động như các bộ lọc để giám sát và điều chỉnh đầu vào cũng như đầu ra của mô hình.

Summary

Các cơ chế an toàn được thiết kế để hạn chế đầu ra của mô hình AI, ngăn ngừa việc tạo ra nội dung độc hại, thiên vị hoặc trái phép.

Key Concepts

  • Lọc Đầu vào/Đầu ra
  • Thực thi Chính sách
  • Phát hiện Độc hại
  • Phòng vệ chống lại Tấn công Prompt

Use Cases

  • Chatbot doanh nghiệp yêu cầu tuân thủ thương hiệu nghiêm ngặt
  • Trợ lý y tế đảm bảo độ chính xác về y khoa và quyền riêng tư
  • Bot dịch vụ khách hàng ngăn chặn ngôn từ xúc phạm