حسب السياسة الحالية

term_id: on_policy

Category: basic_concepts

Definition

تتطلب خوارزميات ‘حسب السياسة الحالية’ أن يتعلم الوكيل مباشرة من الإجراءات التي اتخذتها سياسته الحالية. هذا يعني أن البيانات المجمعة أثناء الاستكشاف تُستخدم فوراً لتحديث السياسة، مما يضمن اتساق العينة.

Summary

نهج في التعلم التعزيزي حيث تكون السياسة التي يتم تقييمها وتحسينها هي نفسها المستخدمة لتوليد البيانات.

Key Concepts

  • التعلم التعزيزي
  • تدرج السياسة
  • اتساق البيانات
  • كفاءة العينة

Use Cases

  • تحكم الروبوتات مع قيود السلامة
  • وكلاء اللعب الذين يتطلبون تحديثات دقيقة
  • الأنظمة التكيفية في الوقت الفعلي