יישור (Alignment)

term_id: alignment

Category: ethics_safety

Definition

יישור מתמקד בהבטחה שמערכות בינה מלאכותית יעשו מה שאנשים באמת רוצים, ולא רק מה שנאמר להן מילולית. זה כולל טכניקות כמו למידה חיזוקית ממשוב אנושי (RLHF) כדי להתאים את ההתנהגות.

Summary

תהליך הבטחה שהיעדים וההתנהגות של מערכת בינה מלאכותית תואמים לערכים ולכוונות האנושיים.

Key Concepts

  • RLHF (למידה חיזוקית ממשוב אנושי)
  • טעינת ערכים (Value loading)
  • התאמת כוונה
  • מודלי פרס (Reward modeling)

Use Cases

  • כוונון בוטים לנימוס
  • הבטחת דיוק עובדתי בסיכומים
  • מניעת ניצול לרעה של פריצות אבטחה (Jailbreak)