Alineación

term_id: alignment

Category: ethics_safety

Definition

La alineación se centra en garantizar que los sistemas de IA hagan lo que los humanos realmente quieren, en lugar de simplemente lo que piden literalmente. Implica técnicas como el Aprendizaje por Refuerzo a partir de Retroalimentación Humana (RLHF) para ajustar el comportamiento del modelo.

Summary

El proceso de asegurar que los objetivos y comportamientos de un sistema de IA coincidan con los valores e intenciones humanas.

Key Concepts

  • RLHF (Aprendizaje por Refuerzo con Retroalimentación Humana)
  • Carga de valores
  • Coincidencia de intenciones
  • Modelado de recompensas

Use Cases

  • Ajuste de chatbots para ser más educados
  • Garantizar la precisión factual en resúmenes
  • Prevención de exploitaciones de seguridad (jailbreaks)