Học tăng cường từ phản hồi của con người
term_id: rlhf
Category: training_techniques
Definition
Học tăng cường từ phản hồi của con người (RLHF) là một phương pháp được sử dụng để tinh chỉnh các mô hình ngôn ngữ lớn sao cho đầu ra của chúng phù hợp hơn với giá trị và kỳ vọng của con người. Nó thường bao gồm ba bước
Summary
RLHF là một kỹ thuật căn chỉnh các mô hình AI với sở thích của con người bằng cách sử dụng phản hồi của con người để huấn luyện một mô hình phần thưởng cho học tăng cường.
Key Concepts
- Dữ liệu sở thích
- Mô hình phần thưởng
- Căn chỉnh (Alignment)
- PPO (Tối ưu hóa chính sách cận biên)
Use Cases
- Tinh chỉnh chatbot
- Kiểm duyệt nội dung
- Cải thiện khả năng tuân thủ hướng dẫn