Alinhamento

term_id: alignment

Category: ethics_safety

Definition

O alinhamento foca em assegurar que os sistemas de IA façam o que os humanos realmente desejam, em vez de apenas o que pedem literalmente. Envolve técnicas como Aprendizado por Reforço com Feedback Humano (RLHF) para ajustar o comportamento do modelo.

Summary

O processo de garantir que os objetivos e comportamentos de um sistema de IA correspondam aos valores e intenções humanos.

Key Concepts

  • RLHF
  • Carregamento de Valores
  • Correspondência de Intenção
  • Modelagem de Recompensa

Use Cases

  • Ajuste de chatbots para polidez
  • Garantia de precisão factual em resumos
  • Prevenção de explorações de segurança (jailbreaks)