Alignment (Sự phù hợp/Định hướng)
term_id: alignment
Category: ethics_safety
Definition
Alignment tập trung vào việc đảm bảo rằng các hệ thống AI làm những gì con người thực sự muốn, chứ không chỉ đơn thuần là làm những gì họ yêu cầu theo nghĩa đen. Nó bao gồm các kỹ thuật như Học tăng cường từ phản hồi của con người (RLHF) để điều chỉnh hành vi.
Summary
Quá trình đảm bảo rằng các mục tiêu và hành vi của hệ thống AI phù hợp với giá trị và ý định của con người.
Key Concepts
- RLHF (Học tăng cường từ phản hồi con người)
- Nạp giá trị (Value loading)
- Phù hợp ý định (Intent matching)
- Mô hình hóa phần thưởng (Reward modeling)
Use Cases
- Điều chỉnh chatbot để lịch sự hơn
- Đảm bảo tính chính xác về sự thật trong tóm tắt
- Ngăn chặn các cuộc khai thác vượt tường lửa (jailbreak)