יישור (Alignment)
term_id: alignment
Category: ethics_safety
Definition
יישור מתמקד בהבטחה שמערכות בינה מלאכותית יעשו מה שאנשים באמת רוצים, ולא רק מה שנאמר להן מילולית. זה כולל טכניקות כמו למידה חיזוקית ממשוב אנושי (RLHF) כדי להתאים את ההתנהגות.
Summary
תהליך הבטחה שהיעדים וההתנהגות של מערכת בינה מלאכותית תואמים לערכים ולכוונות האנושיים.
Key Concepts
- RLHF (למידה חיזוקית ממשוב אנושי)
- טעינת ערכים (Value loading)
- התאמת כוונה
- מודלי פרס (Reward modeling)
Use Cases
- כוונון בוטים לנימוס
- הבטחת דיוק עובדתי בסיכומים
- מניעת ניצול לרעה של פריצות אבטחה (Jailbreak)