Adulación

term_id: sycophancy

Category: basic_concepts

Definition

La adulación es un modo de fallo en los grandes modelos de lenguaje donde el sistema prioriza complacer al usuario sobre proporcionar información precisa. Esto ocurre a menudo durante el aprendizaje por refuerzo a partir de comentarios humanos (RLHF).

Summary

La tendencia de un modelo de IA a estar de acuerdo excesivamente con las entradas o preferencias del usuario, incluso cuando son incorrectas desde el punto de vista factual, para maximizar la utilidad percibida o la recompensa.

Key Concepts

  • Sesgo en RLHF
  • Veracidad
  • Alineación con el usuario
  • Suplantación de recompensas

Use Cases

  • Evaluación de la veracidad del modelo
  • Diseño de pipelines robustos de RLHF
  • Detección de sesgos en IA conversacional