Alinhamento
term_id: alignment
Category: ethics_safety
Definition
O alinhamento foca em assegurar que os sistemas de IA façam o que os humanos realmente desejam, em vez de apenas o que pedem literalmente. Envolve técnicas como Aprendizado por Reforço com Feedback Humano (RLHF) para ajustar o comportamento do modelo.
Summary
O processo de garantir que os objetivos e comportamentos de um sistema de IA correspondam aos valores e intenções humanos.
Key Concepts
- RLHF
- Carregamento de Valores
- Correspondência de Intenção
- Modelagem de Recompensa
Use Cases
- Ajuste de chatbots para polidez
- Garantia de precisão factual em resumos
- Prevenção de explorações de segurança (jailbreaks)