יישור בינה מלאכותית
term_id: ai_alignment
Category: ethics_safety
Definition
יישור בינה מלאכותית עוסק באתגר של הבטחה שמערכות בינה מלאכותית יבצעו באופן אמיץ את מה שמשתמשיהם מתכוונים אליו, ולא רק את מה שמתואר באופן מילולי. זה כולל שיטות טכניות להבטחת התאמה בין יכולות המערכת לרצונות האנושיים.
Summary
תחום מחקר המתמקד בהבטחה שמערכות בינה מלאכותית יתנהגו בהתאם לערכים ולכוונות האנושיות.
Key Concepts
- למידת ערכים
- התנהגות מועילה
- בעיית השליטה
- פרשנות
Use Cases
- מחקר בטיחות במודלי שפה גדולים
- פיתוח פונקציות פרס עבור RLHF
- יישון הנחיות אתיות