لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش یادگیری تقویت عمیق: از تئوری تا عمل
- آخرین آپدیت
دانلود Deep Reinforcement Learning: From Theory to Practice
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
یادگیری تقویتی چگونه میتواند از مسائل جدولی کوچک به محیطهای با ابعاد بالا مانند بازیها، رباتیک و تصمیمگیریهای خودگردان گسترش یابد؟ این دوره به معرفی یادگیری تقویت عمیق (Deep Reinforcement Learning) میپردازد، جایی که الگوریتمهای یادگیری تقویتی با تخمین تابع مبتنی بر شبکههای عصبی ترکیب میشوند.
آموزشگیرندگان با بررسی دلیل شکست متدهای جدولی در فضاهای حالت بزرگ یا پیوسته و نحوه نمایش توابع مقدار، توابع مقدار عمل و سیاستها توسط مدلهای پارامتری شروع میکنند. سپس دوره به توسعه روشهای یادگیری تقویت عمیق مبتنی بر مقدار، از جمله تکرار مقدار برازش شده (Fitted Value Iteration)، شبکههای Q عمیق (DQN)، بافرهای بازپخش (Replay Buffers)، شبکههای هدف، Double DQN، شبکههای Dueling و بازپخش تجربه اولویتبندی شده میپردازد. همچنین بهینهسازی مستقیم سیاست از طریق متدهای گرادیان سیاست مانند REINFORCE و متدهای Actor-Critic که بهینهسازی سیاست را با تخمین مقدار ترکیب میکنند، مورد مطالعه قرار میگیرد. این دوره الگوریتمهای مدرن منتخب RL عمیق مانند PPO، DDPG و SAC را با تأکید بر پیادهسازی، پایداری، تشخیص خطا و ارزیابی تجربی معرفی میکند.
در پایان این دوره، فراگیران قادر خواهند بود عاملهای یادگیری تقویت عمیق را پیادهسازی کنند، منابع رایج ناپایداری را تشخیص دهند، رفتار یادگرفته شده را با استفاده از پروتکلهای آزمایشی مناسب ارزیابی کرده و نتایج را به روشی بازتولیدپذیر گزارش کنند.
این دوره میتواند به عنوان بخشی از مدارک کارشناسی ارشد علوم کامپیوتر (MS-CS) و کارشناسی ارشد هوش مصنوعی (MS-AI) دانشگاه کلرادو بولدر در پلتفرم کورسرا گذرانده شود.
سرفصل ها و درس ها
تخمین تابع برای یادگیری تقویتی
Function Approximation for RL
معرفی دوره
Course Introduction
زمانی که یادگیری تقویتی جدولی شکست میخورد
When Tabular RL Breaks
از جداول به Vθ و Qθ
From Tables to Vθ and Qθ
توابع زیان، گرادیانها و بهروزرسانیهای نیمهگرادیان
Losses, Gradients, and Semi-Gradient Updates
بوتاسترپینگ، تغییر اهداف و دادههای همبسته
Bootstrapping, Changing Targets, and Correlated Data
تخمین تابع، بوتاسترپینگ و یادگیری Off-Policy
Function Approximation, Bootstrapping, and Off-Policy Learning
پلی از تکرار مقدار به یادگیری Q عمیق
A Bridge from Value Iteration to Deep Q-Learning
خلاصه ماژول
Module Summary
یادگیری Q عمیق و یادگیری تقویت عمیق مبتنی بر مقدار
Deep Q-Learning and Value-Based Deep RL
جایگزینی جدول با شبکه عصبی
Replacing the Table by a Neural Network
مقادیر عمل به عنوان خروجیهای شبکه عصبی
Action Values as Neural Network Outputs
اهداف بلمن و بهروزرسانیهای گرادیان
Bellman Targets and Gradient Updates
یادگیری از انتقالهای ذخیرهشده
Learning From Stored Transitions
پایدار کردن اهداف بوتاسترپ شده
Stabilizing Bootstrapped Targets
ترکیب قطعات در کنار هم
Putting the Pieces Together
Double DQN، شبکههای Dueling و بهبودهای کاربردی
Double DQN, Dueling Networks, and Practical Refinements
گرادیانهای سیاست و REINFORCE
Policy Gradients and REINFORCE
نمایش نظرات