آموزش یادگیری تقویت عمیق: از تئوری تا عمل - آخرین آپدیت

دانلود Deep Reinforcement Learning: From Theory to Practice

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: یادگیری تقویتی چگونه می‌تواند از مسائل جدولی کوچک به محیط‌های با ابعاد بالا مانند بازی‌ها، رباتیک و تصمیم‌گیری‌های خودگردان گسترش یابد؟ این دوره به معرفی یادگیری تقویت عمیق (Deep Reinforcement Learning) می‌پردازد، جایی که الگوریتم‌های یادگیری تقویتی با تخمین تابع مبتنی بر شبکه‌های عصبی ترکیب می‌شوند. آموزش‌گیرندگان با بررسی دلیل شکست متدهای جدولی در فضاهای حالت بزرگ یا پیوسته و نحوه نمایش توابع مقدار، توابع مقدار عمل و سیاست‌ها توسط مدل‌های پارامتری شروع می‌کنند. سپس دوره به توسعه روش‌های یادگیری تقویت عمیق مبتنی بر مقدار، از جمله تکرار مقدار برازش شده (Fitted Value Iteration)، شبکه‌های Q عمیق (DQN)، بافرهای بازپخش (Replay Buffers)، شبکه‌های هدف، Double DQN، شبکه‌های Dueling و بازپخش تجربه اولویت‌بندی شده می‌پردازد. همچنین بهینه‌سازی مستقیم سیاست از طریق متدهای گرادیان سیاست مانند REINFORCE و متدهای Actor-Critic که بهینه‌سازی سیاست را با تخمین مقدار ترکیب می‌کنند، مورد مطالعه قرار می‌گیرد. این دوره الگوریتم‌های مدرن منتخب RL عمیق مانند PPO، DDPG و SAC را با تأکید بر پیاده‌سازی، پایداری، تشخیص خطا و ارزیابی تجربی معرفی می‌کند. در پایان این دوره، فراگیران قادر خواهند بود عامل‌های یادگیری تقویت عمیق را پیاده‌سازی کنند، منابع رایج ناپایداری را تشخیص دهند، رفتار یادگرفته شده را با استفاده از پروتکل‌های آزمایشی مناسب ارزیابی کرده و نتایج را به روشی بازتولیدپذیر گزارش کنند. این دوره می‌تواند به عنوان بخشی از مدارک کارشناسی ارشد علوم کامپیوتر (MS-CS) و کارشناسی ارشد هوش مصنوعی (MS-AI) دانشگاه کلرادو بولدر در پلتفرم کورسرا گذرانده شود.

سرفصل ها و درس ها

تخمین تابع برای یادگیری تقویتی Function Approximation for RL

  • معرفی دوره Course Introduction

  • زمانی که یادگیری تقویتی جدولی شکست می‌خورد When Tabular RL Breaks

  • از جداول به Vθ و Qθ From Tables to Vθ and Qθ

  • توابع زیان، گرادیان‌ها و به‌روزرسانی‌های نیمه‌گرادیان Losses, Gradients, and Semi-Gradient Updates

  • بوت‌استرپینگ، تغییر اهداف و داده‌های همبسته Bootstrapping, Changing Targets, and Correlated Data

  • تخمین تابع، بوت‌استرپینگ و یادگیری Off-Policy Function Approximation, Bootstrapping, and Off-Policy Learning

  • پلی از تکرار مقدار به یادگیری Q عمیق A Bridge from Value Iteration to Deep Q-Learning

  • خلاصه ماژول Module Summary

یادگیری Q عمیق و یادگیری تقویت عمیق مبتنی بر مقدار Deep Q-Learning and Value-Based Deep RL

  • جایگزینی جدول با شبکه عصبی Replacing the Table by a Neural Network

  • مقادیر عمل به عنوان خروجی‌های شبکه عصبی Action Values as Neural Network Outputs

  • اهداف بلمن و به‌روزرسانی‌های گرادیان Bellman Targets and Gradient Updates

  • یادگیری از انتقال‌های ذخیره‌شده Learning From Stored Transitions

  • پایدار کردن اهداف بوت‌استرپ شده Stabilizing Bootstrapped Targets

  • ترکیب قطعات در کنار هم Putting the Pieces Together

  • Double DQN، شبکه‌های Dueling و بهبودهای کاربردی Double DQN, Dueling Networks, and Practical Refinements

گرادیان‌های سیاست و REINFORCE Policy Gradients and REINFORCE

  • معرفی ماژول Module Introduction

  • یادگیری مستقیم سیاست‌ها Learning Policies Directly

  • از مقادیر عمل به πθ(a | s) From Action Values to πθ(a | s)

  • بازده مورد انتظار به عنوان یک مسئله بهینه‌سازی Expected Return as an Optimization Problem

  • نحوه مشتق‌گیری از عمل‌های نمونه‌برداری شده How To Differentiate Through Sampled Actions

  • یادگیری گرادیان سیاست مونت کارلو Monte Carlo Policy-Gradient Learning

  • کاربردی کردن گرادیان‌های سیاست Making Policy Gradients Practical

  • چرا به منتقدان (Critics) یادگرفته شده نیاز داریم Why We Need Learned Critics

  • خلاصه ماژول Module Summary

متدهای Actor-Critic Actor-Critic Methods

  • معرفی ماژول Module Introduction

  • از REINFORCE به منتقدان یادگرفته شده From REINFORCE to Learned Critics

  • ترکیب سیاست‌ها و توابع مقدار Policies and Value Functions Together

  • یادگیری از نتایج بهتر از حد انتظار Learning from Better-than-Expected Outcomes

  • استفاده از خطاهای TD برای به‌روزرسانی سیاست Using TD Errors to Update the Policy

  • آموزش دو شبکه عصبی Training the Two Networks

  • ایجاد تعادل بین بایاس و واریانس Balancing Bias and Variance

  • چرا به‌روزرسانی‌های پایدار سیاست اهمیت دارند Why Stable Policy Updates Matter

یادگیری تقویت عمیق مدرن: PPO, DDPG و SAC Modern Deep RL: PPO, DDPG, and SAC

  • معرفی ماژول Module Introduction

  • پایداری، عمل‌های پیوسته و اکتشاف Stability, Continuous Actions, and Exploration

  • الگوریتم Actor-Critic با به‌روزرسانی‌های کنترل‌شده Actor–Critic with Controlled Updates

  • نسبت‌های احتمالی و برش (Clipping) Probability Ratios and Clipping

  • کنترل پیوسته: چرا متدهای عمل گسسته کافی نیستند Continuous Control: Why Discrete-Action Methods Are Not Enough

  • الگوریتم Actor-Critic قطعی برای عمل‌های پیوسته Deterministic Actor-Critic for Continuous Actions

  • یادگیری سیاست‌هایی که اکتشاف می‌کنند Learning Policies that Explore

  • الگوریتم Soft Actor-Critic و طراحی مدرن RL عمیق Soft Actor–Critic and Modern Deep RL Design

پیاده‌سازی عملی یادگیری تقویت عمیق Practical Deep RL Implementation

  • معرفی ماژول Module Introduction

  • چگونه الگوریتم‌ها به کد تبدیل می‌شوند How Algorithms Become Code

  • سازماندهی تجربیات Organizing Experience

  • آموزش Actorها و Criticها Training Actors and Critics

  • تشخیص اینکه آیا یادگیری در حال پیشرفت است یا خیر Knowing Whether Learning Is Working

  • اندازه‌گیری قابل اعتماد رفتار یادگرفته شده Measuring Learned Behavior Reliably

  • خلاصه دوره Course Summary

نمایش نظرات

آموزش یادگیری تقویت عمیق: از تئوری تا عمل
جزییات دوره
13h 57m
47
(آخرین آپدیت)
220
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar