لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش برنامهنویسی پاداش: بهینهسازی کارایی و ایمنی در یادگیری تقویتشده (RL)
- آخرین آپدیت
دانلود Reward Programming: Optimizing RL Efficiency and Safety
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
چگونه پاداشهایی طراحی کنیم که عاملهای یادگیری تقویتشده را به سمت رفتاری هدایت کنند که ما واقعاً مد نظر داریم؟ این دوره، طراحی پاداش را به عنوان یک مسئله برنامهنویسی و تعیین مشخصات (Specification) در یادگیری تقویتشده مورد بررسی قرار میدهد.
یادگیری تقویتشده کلاسیک معمولاً فرض میکند که هدف به صورت یک تابع پاداش اسکالر ارائه شده است. با این حال، در عمل بسیاری از وظایف واقعی شامل اهداف، محدودیتها، ترتیب زمانی، الزامات ایمنی، تکرار، مشاهدهپذیری جزئی، سلسلهمراتب، سایر عاملها و انتظارات رفتاری بلندمدتی هستند که بیان آنها تنها از طریق پاداشهای تکمرحلهای دشوار است. پاداشهایی که به درستی طراحی نشده باشند میتوانند منجر به «هک پاداش» (Reward Hacking)، بازی با مشخصات و ایجاد سیاستهایی شوند که هدف مکتوب را بهینه میکنند اما قصد واقعی طراح را نادیده میگیرند.
این دوره، برنامهنویسی پاداش را به عنوان یک رویکرد ساختاریافته برای تعیین، شکلدهی، استنتاج، نظارت و حسابرسی آنچه یک عامل باید بیاموزد، معرفی میکند. فراگیران منطق زمانی (Temporal Logic)، اتوماتا، MDPهای محصول و ماشینهای پاداش را به عنوان ابزارهایی برای نمایش اهدافی که به تاریخچه، پیشرفت، ایمنی و رفتار بلندمدت وابسته هستند، مطالعه میکنند. آنها همچنین شکلدهی پاداش، یادگیری تقویتشده معکوس، بازخورد مبتنی بر ترجیحات و رویکردهای یادگیری اتوماتا را برای استنتاج یا بهبود مکانیسمهای پاداش بررسی میکنند.
سپس دوره به بررسی انتزاعهای مدلسازی غنیتر برای برنامهنویسی پاداش، از جمله فرآیندهای تصمیمگیری مارکوف با مشاهدهپذیری جزئی، حافظه و باورها، وظایف سلسلهمراتبی و بازگشتی، محیطهای چند-عاملی و سیستمهای زمان-پیوسته میپردازد. ماژول نهایی به مطالعه ایمنی، شیلدینگ (Shielding)، RL محدودشده، حسابرسی، تست استرس و گردش کار مهندسی پاداش برای اتصال قصد طراح به مشخصات، مکانیسمهای پاداش، یادگیری، لایههای ایمنی و بازبینی میپردازد.
در پایان این دوره، فراگیران قادر خواهند بود مکانیسمهای پاداش ساختاریافته را طراحی و استنتاج کنند، ارزیابی کنند که آیا این مکانیسمها با رفتار مورد نظر همسو هستند یا خیر، و در مورد پیامدهای آنها برای ایمنی، شفافیت و قابلیت اطمینان استدلال کنند.
این دوره میتواند به عنوان بخشی از مدارک کارشناسی ارشد علوم کامپیوتر (MS-CS) و کارشناسی ارشد هوش مصنوعی (MS-AI) دانشگاه کلرادو بولدر در پلتفرم کورسرا گذرانده شود.
سرفصل ها و درس ها
چرا مهندسی پاداش دشوار است
Why Reward Engineering Is Hard
مقدمه دوره
Course Introduction
مقدمه ماژول
Module Introduction
مهندسی پاداش به عنوان طراحی مشخصات
Reward Engineering as Specification Design
زمانی که پاداش بالا، رفتار مورد نظر نیست
When High Reward is not the Intended Behavior
ساختار زمانی در اهداف یادگیری
Temporal Structure in Learning Objectives
زمانی که پاداشها به حافظه نیاز دارند
When Rewards Need Memory
از قصد تا مشخصات و نظارتها
From Intent to Specifications and Montiors
منطق زمانی برای یادگیری تقویتشده
Temporal Logic for Reinforcement Learning
مقدمه ماژول ۲
Module 2 Introduction
برچسبگذاری رفتار با گزارههای اتمیک
Labeling Behavior with Atomic Propositions
نوشتن مشخصات زمانی
Writing Temporal Specifications
تفسیر فرمولها روی ردپاها (Traces)
Interpreting Formulas Over Traces
دسترسپذیری، ایمنی، پاسخ، تکرار و تداوم
Reachability, Safety, Response, Recurrence, and Persitence
اهداف بلندمدت برای رفتارهای نامحدود
Long-Run Objectives for Infinite Behavior
MDPهای محصول، دترمینیسم حدی و دسترسپذیری حدی
Product MDPs, Limit Determinism, and Limit Reachability
ماشینهای پاداش به عنوان مشخصات ساختاریافته پاداش
Reward Machines as Structured Reward Specifications
مقدمه ماژول
Module Introduction
زمانی که پاداشها به حافظه نیاز دارند
When Rewards Need Memory
حالتها، انتقالها و پاداشها
States, Transitions, and Rewards
مارکوف کردن پاداشهای غیر مارکوفی
Making Non-Markovian Rewards Markovian
توالی، ایمنی، پاسخ و تکرار
Sequencing, Safety, Response, and Recurrence
تجزیه، تفسیرپذیری و تجربه متقابل (Counterfactual)
Decomposition, Interpretability, and Counterfactual Experience
شکلدهی پاداش و یادگیری پاداشها
Reward Shaping and Learning Rewards
مقدمه ماژول
Module Introduction
اطلاعاتیتر کردن سیگنالهای یادگیری
Making Learning Signals More Informative
متراکم کردن پاداشها با حفظ بهینگی
Densifying Rewards While Preserving Optimality
استنتاج پاداشها از رفتار متخصص
Inferring Rewards From Expert Behavior
یادگیری اهداف از طریق مقایسهها
Learning Objectives From Comparisons
نمایش نظرات