حسب السياسة الحالية
term_id: on_policy
Category: basic_concepts
Definition
تتطلب خوارزميات ‘حسب السياسة الحالية’ أن يتعلم الوكيل مباشرة من الإجراءات التي اتخذتها سياسته الحالية. هذا يعني أن البيانات المجمعة أثناء الاستكشاف تُستخدم فوراً لتحديث السياسة، مما يضمن اتساق العينة.
Summary
نهج في التعلم التعزيزي حيث تكون السياسة التي يتم تقييمها وتحسينها هي نفسها المستخدمة لتوليد البيانات.
Key Concepts
- التعلم التعزيزي
- تدرج السياسة
- اتساق البيانات
- كفاءة العينة
Use Cases
- تحكم الروبوتات مع قيود السلامة
- وكلاء اللعب الذين يتطلبون تحديثات دقيقة
- الأنظمة التكيفية في الوقت الفعلي