יישור בינה מלאכותית

term_id: ai_alignment

Category: ethics_safety

Definition

יישור בינה מלאכותית עוסק באתגר של הבטחה שמערכות בינה מלאכותית יבצעו באופן אמיץ את מה שמשתמשיהם מתכוונים אליו, ולא רק את מה שמתואר באופן מילולי. זה כולל שיטות טכניות להבטחת התאמה בין יכולות המערכת לרצונות האנושיים.

Summary

תחום מחקר המתמקד בהבטחה שמערכות בינה מלאכותית יתנהגו בהתאם לערכים ולכוונות האנושיות.

Key Concepts

  • למידת ערכים
  • התנהגות מועילה
  • בעיית השליטה
  • פרשנות

Use Cases

  • מחקר בטיחות במודלי שפה גדולים
  • פיתוח פונקציות פרס עבור RLHF
  • יישון הנחיות אתיות