آموزش برنامه‌نویسی پاداش: بهینه‌سازی کارایی و ایمنی در یادگیری تقویت‌شده (RL) - آخرین آپدیت

دانلود Reward Programming: Optimizing RL Efficiency and Safety

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: چگونه پاداش‌هایی طراحی کنیم که عامل‌های یادگیری تقویت‌شده را به سمت رفتاری هدایت کنند که ما واقعاً مد نظر داریم؟ این دوره، طراحی پاداش را به عنوان یک مسئله برنامه‌نویسی و تعیین مشخصات (Specification) در یادگیری تقویت‌شده مورد بررسی قرار می‌دهد. یادگیری تقویت‌شده کلاسیک معمولاً فرض می‌کند که هدف به صورت یک تابع پاداش اسکالر ارائه شده است. با این حال، در عمل بسیاری از وظایف واقعی شامل اهداف، محدودیت‌ها، ترتیب زمانی، الزامات ایمنی، تکرار، مشاهده‌پذیری جزئی، سلسله‌مراتب، سایر عامل‌ها و انتظارات رفتاری بلندمدتی هستند که بیان آن‌ها تنها از طریق پاداش‌های تک‌مرحله‌ای دشوار است. پاداش‌هایی که به درستی طراحی نشده باشند می‌توانند منجر به «هک پاداش» (Reward Hacking)، بازی با مشخصات و ایجاد سیاست‌هایی شوند که هدف مکتوب را بهینه می‌کنند اما قصد واقعی طراح را نادیده می‌گیرند. این دوره، برنامه‌نویسی پاداش را به عنوان یک رویکرد ساختاریافته برای تعیین، شکل‌دهی، استنتاج، نظارت و حسابرسی آنچه یک عامل باید بیاموزد، معرفی می‌کند. فراگیران منطق زمانی (Temporal Logic)، اتوماتا، MDPهای محصول و ماشین‌های پاداش را به عنوان ابزارهایی برای نمایش اهدافی که به تاریخچه، پیشرفت، ایمنی و رفتار بلندمدت وابسته هستند، مطالعه می‌کنند. آن‌ها همچنین شکل‌دهی پاداش، یادگیری تقویت‌شده معکوس، بازخورد مبتنی بر ترجیحات و رویکردهای یادگیری اتوماتا را برای استنتاج یا بهبود مکانیسم‌های پاداش بررسی می‌کنند. سپس دوره به بررسی انتزاع‌های مدل‌سازی غنی‌تر برای برنامه‌نویسی پاداش، از جمله فرآیندهای تصمیم‌گیری مارکوف با مشاهده‌پذیری جزئی، حافظه و باورها، وظایف سلسله‌مراتبی و بازگشتی، محیط‌های چند-عاملی و سیستم‌های زمان-پیوسته می‌پردازد. ماژول نهایی به مطالعه ایمنی، شیلدینگ (Shielding)، RL محدودشده، حسابرسی، تست استرس و گردش کار مهندسی پاداش برای اتصال قصد طراح به مشخصات، مکانیسم‌های پاداش، یادگیری، لایه‌های ایمنی و بازبینی می‌پردازد. در پایان این دوره، فراگیران قادر خواهند بود مکانیسم‌های پاداش ساختاریافته را طراحی و استنتاج کنند، ارزیابی کنند که آیا این مکانیسم‌ها با رفتار مورد نظر همسو هستند یا خیر، و در مورد پیامدهای آن‌ها برای ایمنی، شفافیت و قابلیت اطمینان استدلال کنند. این دوره می‌تواند به عنوان بخشی از مدارک کارشناسی ارشد علوم کامپیوتر (MS-CS) و کارشناسی ارشد هوش مصنوعی (MS-AI) دانشگاه کلرادو بولدر در پلتفرم کورسرا گذرانده شود.

سرفصل ها و درس ها

چرا مهندسی پاداش دشوار است Why Reward Engineering Is Hard

  • مقدمه دوره Course Introduction

  • مقدمه ماژول Module Introduction

  • مهندسی پاداش به عنوان طراحی مشخصات Reward Engineering as Specification Design

  • زمانی که پاداش بالا، رفتار مورد نظر نیست When High Reward is not the Intended Behavior

  • ساختار زمانی در اهداف یادگیری Temporal Structure in Learning Objectives

  • زمانی که پاداش‌ها به حافظه نیاز دارند When Rewards Need Memory

  • از قصد تا مشخصات و نظارت‌ها From Intent to Specifications and Montiors

منطق زمانی برای یادگیری تقویت‌شده Temporal Logic for Reinforcement Learning

  • مقدمه ماژول ۲ Module 2 Introduction

  • برچسب‌گذاری رفتار با گزاره‌های اتمیک Labeling Behavior with Atomic Propositions

  • نوشتن مشخصات زمانی Writing Temporal Specifications

  • تفسیر فرمول‌ها روی ردپاها (Traces) Interpreting Formulas Over Traces

  • دسترس‌پذیری، ایمنی، پاسخ، تکرار و تداوم Reachability, Safety, Response, Recurrence, and Persitence

  • اهداف بلندمدت برای رفتارهای نامحدود Long-Run Objectives for Infinite Behavior

  • MDPهای محصول، دترمینیسم حدی و دسترس‌پذیری حدی Product MDPs, Limit Determinism, and Limit Reachability

ماشین‌های پاداش به عنوان مشخصات ساختاریافته پاداش Reward Machines as Structured Reward Specifications

  • مقدمه ماژول Module Introduction

  • زمانی که پاداش‌ها به حافظه نیاز دارند When Rewards Need Memory

  • حالت‌ها، انتقال‌ها و پاداش‌ها States, Transitions, and Rewards

  • مارکوف کردن پاداش‌های غیر مارکوفی Making Non-Markovian Rewards Markovian

  • توالی، ایمنی، پاسخ و تکرار Sequencing, Safety, Response, and Recurrence

  • تجزیه، تفسیرپذیری و تجربه متقابل (Counterfactual) Decomposition, Interpretability, and Counterfactual Experience

شکل‌دهی پاداش و یادگیری پاداش‌ها Reward Shaping and Learning Rewards

  • مقدمه ماژول Module Introduction

  • اطلاعاتی‌تر کردن سیگنال‌های یادگیری Making Learning Signals More Informative

  • متراکم کردن پاداش‌ها با حفظ بهینگی Densifying Rewards While Preserving Optimality

  • استنتاج پاداش‌ها از رفتار متخصص Inferring Rewards From Expert Behavior

  • یادگیری اهداف از طریق مقایسه‌ها Learning Objectives From Comparisons

  • استنتاج منطق ساختاریافته پاداش Inferring Structured Reward Logic

  • وفاداری، استحکام و بازی با مشخصات Faithfulness, Robustness, and Specification Gaming

مدل‌های غنی‌تر برای برنامه‌نویسی پاداش Richer Models for Reward Programming

  • مقدمه ماژول Module Introduction

  • زمانی که عامل کل حالت را نمی‌بیند When the Agent Does Not See the Full State

  • حالت‌های اطلاعاتی برای برنامه‌نویسی پاداش Information States For Reward Programming

  • ساختار پاداش برای وظایف ترکیبی Reward Structure for Composed Tasks

  • اهداف تحت تعاملات استراتژیک Objectives Under Strategic Interaction

  • برنامه‌نویسی پاداش فراتر از زمان گسسته Reward Programming Beyond Discrete Time

  • خلاصه و مطالعه بیشتر Summary and Further Readings

نمایش نظرات

آموزش برنامه‌نویسی پاداش: بهینه‌سازی کارایی و ایمنی در یادگیری تقویت‌شده (RL)
جزییات دوره
13h 7m
34
(آخرین آپدیت)
97
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar