Sự căn chỉnh AI
term_id: ai_alignment
Category: ethics_safety
Definition
Sự căn chỉnh AI giải quyết thách thức trong việc làm cho các hệ thống trí tuệ nhân tạo hoạt động robust theo đúng ý định của người dùng, thay vì chỉ tuân thủ cứng nhắc những gì được chỉ định về mặt ngôn ngữ. Lĩnh vực này bao gồm các phương pháp kỹ thuật để đảm bảo rằng hành vi của AI luôn mang lại lợi ích và an toàn.
Summary
Ngành nghiên cứu tập trung vào việc đảm bảo các hệ thống AI hoạt động phù hợp với giá trị và ý định của con người.
Key Concepts
- học giá trị
- hành vi có lợi
- vấn đề kiểm soát
- khả năng giải thích
Use Cases
- Nghiên cứu an toàn trong các mô hình ngôn ngữ lớn
- Phát triển hàm phần thưởng cho RLHF
- Triển khai các nguyên tắc đạo đức