AI Hiến pháp
term_id: constitutional_ai
Category: application_paradigms
Definition
AI Hiến pháp là một khung làm việc để căn chỉnh các mô hình ngôn ngữ lớn với giá trị con người mà không phụ thuộc hoàn toàn vào phản hồi của con người cho từng bước. Nó liên quan đến việc tạo ra một ‘hiến pháp’ gồm các nguyên tắc cấp cao để hướng dẫn mô hình tự điều chỉnh và đánh giá đầu ra của mình.
Summary
Một phương pháp huấn luyện mô hình AI tuân theo các hướng dẫn an toàn thông qua tự phê bình dựa trên một bộ nguyên tắc đã được xác định trước.
Key Concepts
- Tự sửa lỗi (Self-Correction)
- Căn chỉnh (Alignment)
- Huấn luyện dựa trên nguyên tắc (Principles-Based Training)
- Phương án thay thế RLHF (RLHF Alternative)
Use Cases
- Giảm thiểu đầu ra gây hại trong LLM
- Cải thiện mức độ hữu ích và trung thực của mô hình
- Mở rộng quy mô huấn luyện an toàn một cách hiệu quả