آموزش مبانی یادگیری تقویت‌شده (Reinforcement Learning) - آخرین آپدیت

دانلود Fundamentals of Reinforcement Learning

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: یادگیری تقویت‌شده (RL) زیرمجموعه‌ای از یادگیری ماشین است که به عنوان یک چارچوب کلی برای تصمیم‌گیری خودکار و هوش مصنوعی شناخته می‌شود. این دوره شما را با تکنیک‌های یادگیری آماری آشنا می‌کند که در آن یک عامل (Agent) به طور صریح اقداماتی را انجام داده و با محیط اطراف خود تعامل می‌کند. امروزه با افزایش علاقه شرکت‌ها به عوامل تعاملی و تصمیم‌گیری هوشمند، درک اهمیت و چالش‌های یادگیری برای عواملی که تصمیم می‌گیرند، حیاتی است. این دوره مبانی یادگیری تقویت‌شده را به شما آموزش می‌دهد. پس از اتمام این دوره، شما قادر خواهید بود: - مسائل را به صورت فرآیندهای تصمیم‌گیری مارکوف (MDP) فرموله کنید - روش‌های پایه اکتشاف و توازن بین اکتشاف و بهره‌برداری (Exploration/Exploitation Tradeoff) را درک کنید - توابع مقدار (Value Functions) را به عنوان ابزاری کلی برای تصمیم‌گیری بهینه بشناسید - نحوه پیاده‌سازی برنامه‌نویسی پویا (Dynamic Programming) را به عنوان یک رویکرد حل بهینه برای مسائل کنترل صنعتی یاد بگیرید این دوره مفاهیم کلیدی یادگیری تقویت‌شده و الگوریتم‌های کلاسیک و مدرن RL را آموزش می‌دهد. پس از تکمیل این دوره، شما می‌توانید استفاده از RL را برای مسائل واقعی که در آن‌ها MDP تعریف شده یا قابل تعریف است، آغاز کنید. این اولین دوره از تخصص یادگیری تقویت‌شده است.

سرفصل ها و درس ها

به دوره خوش آمدید! Welcome to the Course!

  • معرفی تخصص Specialization Introduction

  • معرفی دوره Course Introduction

  • آشنایی با مدرسان Meet your instructors!

  • نقشه راه تخصص شما Your Specialization Roadmap

مقدمه‌ای بر تصمیم‌گیری متوالی An Introduction to Sequential Decision-Making

  • تصمیم‌گیری متوالی با بازخورد ارزیابی Sequential Decision Making with Evaluative Feedback

  • یادگیری مقادیر اقدام Learning Action Values

  • تخمین تدریجی مقادیر اقدام Estimating Action Values Incrementally

  • توازن بین اکتشاف و بهره‌برداری چیست؟ What is the trade-off?

  • مقادیر اولیه خوش‌بینانه Optimistic Initial Values

  • انتخاب اقدام بر اساس حد بالای اطمینان (UCB) Upper-Confidence Bound (UCB) Action Selection

  • جاناتان لنگفورد: Bandits متنی برای یادگیری تقویت‌شده در دنیای واقعی Jonathan Langford: Contextual Bandits for Real World Reinforcement Learning

  • خلاصه هفته اول Week 1 Summary

فرآیندهای تصمیم‌گیری مارکوف Markov Decision Processes

  • فرآیندهای تصمیم‌گیری مارکوف Markov Decision Processes

  • مثال‌هایی از MDPها Examples of MDPs

  • هدف یادگیری تقویت‌شده The Goal of Reinforcement Learning

  • مایکل لیتمن: فرضیه پاداش Michael Littman: The Reward Hypothesis

  • وظایف مستمر Continuing Tasks

  • مثال‌هایی از وظایف اپیزودیک و مستمر Examples of Episodic and Continuing Tasks

  • خلاصه هفته دوم Week 2 Summary

توابع مقدار و معادلات بلمن Value Functions & Bellman Equations

  • تعیین سیاست‌ها Specifying Policies

  • توابع مقدار Value Functions

  • ریچ ساتون و اندی بارتو: تاریخچه کوتاهی از RL Rich Sutton and Andy Barto: A brief History of RL

  • استخراج معادله بلمن Bellman Equation Derivation

  • چرا معادلات بلمن؟ Why Bellman Equations?

  • سیاست‌های بهینه Optimal Policies

  • توابع مقدار بهینه Optimal Value Functions

  • استفاده از توابع مقدار بهینه برای دستیابی به سیاست‌های بهینه Using Optimal Value Functions to Get Optimal Policies

  • خلاصه هفته سوم Week 3 Summary

برنامه‌نویسی پویا Dynamic Programming

  • ارزیابی سیاست در مقابل کنترل Policy Evaluation vs. Control

  • ارزیابی تکراری سیاست Iterative Policy Evaluation

  • بهبود سیاست Policy Improvement

  • تکرار سیاست (Policy Iteration) Policy Iteration

  • انعطاف‌پذیری چارچوب تکرار سیاست Flexibility of the Policy Iteration Framework

  • کارایی برنامه‌نویسی پویا Efficiency of Dynamic Programming

  • وارن پاول: برنامه‌نویسی پویای تقریبی برای مدیریت ناوگان (کوتاه) Warren Powell: Approximate Dynamic Programming for Fleet Management (Short)

  • وارن پاول: برنامه‌نویسی پویای تقریبی برای مدیریت ناوگان (بلند) Warren Powell: Approximate Dynamic Programming for Fleet Management (Long)

  • خلاصه هفته چهارم Week 4 Summary

  • تبریکات! Congratulations!

نمایش نظرات

آموزش مبانی یادگیری تقویت‌شده (Reinforcement Learning)
جزییات دوره
15h 9m
38
(آخرین آپدیت)
110,230
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar