آموزش تسلط بر الگوریتم‌های کلاسیک یادگیری تقویت‌شده - آخرین آپدیت

دانلود Mastering Classic Reinforcement Learning Algorithms

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: یک عامل چگونه می‌تواند از طریق تعامل مکرر با یک محیط نامطمئن، تصمیم‌گیری‌های درست را بیاموزد؟ این دوره مبانی ریاضی و الگوریتمی یادگیری تقویت‌شده (Reinforcement Learning) کلاسیک را با تأکید بر فرآیندهای تصمیم‌گیری مارکوف محدود و روش‌های جدولی معرفی می‌کند. دوره با ساده‌ترین تنظیماتی شروع می‌شود که مفاهیم مرکزی در آن‌ها واضح‌تر هستند: فرآیندهای تصمیم‌گیری قطعی، پاداش‌های تنزیل‌شده و معادلات بهینه بلمن. سپس تصادفی بودن از طریق زنجیره‌های مارکوف و فرآیندهای تصمیم‌گیری مارکوف معرفی می‌شود، جایی که یادگیرندگان سیاست‌ها، توابع ارزش، پاداش تنزیل‌شده مورد انتظار و برنامه‌نویسی پویا را مطالعه می‌کنند. با استقرار این پایه، دوره به سراغ روش‌های برنامه‌ریزی برای مدل‌های شناخته شده، از جمله تکرار ارزش (Value Iteration)، تکرار سیاست (Policy Iteration) و فرمول‌بندی‌های برنامه‌ریزی خطی می‌رود. نیمه دوم دوره به مطالعه یادگیری تقویت‌شده در شرایطی می‌پردازد که مدل ناشناخته است و عامل باید از تجربیات نمونه‌برداری شده یاد بگیرد. موضوعات شامل راهزنان چند بازویی (Multi-armed Bandits)، اکتشاف و بهره‌برداری، روش‌های مونت کارلو، یادگیری تفاضل زمانی (TD)، SARSA، Q-learning و اصول همگرایی است. دوره با یک ارزیابی نهایی به پایان می‌رسد که در آن یادگیرندگان یک MDP محدود را هم از دیدگاه برنامه‌ریزی مبتنی بر مدل و هم از دیدگاه یادگیری بدون مدل حل می‌کنند. در پایان این دوره، یادگیرندگان قادر خواهند بود مسائل تصمیم‌گیری محدود را به عنوان فرآیندهای تصمیم‌گیری مارکوف فرمول‌بندی کنند، آن‌ها را با استفاده از الگوریتم‌های برنامه‌ریزی کلاسیک حل کنند و الگوریتم‌های یادگیری تقویت‌شده جدولی را از داده‌های نمونه‌برداری شده پیاده‌سازی کنند. این دوره زیربنای لازم برای مطالعه‌های بعدی در زمینه یادگیری تقویت‌شده عمیق، برنامه‌نویسی پاداش و سیستم‌های هوش مصنوعی قابل اعتماد را فراهم می‌کند. این دوره می‌تواند به عنوان بخشی از مدارک کارشناسی ارشد علوم کامپیوتر (MS-CS) و کارشناسی ارشد هوش مصنوعی (MS-AI) دانشگاه CU Boulder در پلتفرم Coursera گذرانده شود. این مدارک تحصیلات تکمیلی معتبر، دوره‌های هدفمند، جلسات کوتاه ۸ هفته‌ای و شهریه پرداخت به میزان مصرف را ارائه می‌دهند. پذیرش بر اساس عملکرد در سه دوره مقدماتی است، نه سوابق تحصیلی. مدارک CU در کورسرا برای فارغ‌التحصیلان جدید یا متخصصان شاغل ایده‌آل است.

سرفصل ها و درس ها

فرآیندهای تصمیم‌گیری قطعی Deterministic Decision Processes

  • مقدمه‌ای بر دوره Course Introduction

  • تصمیم‌گیری در طول زمان Decision-Making over Time

  • حالات، اقدامات، انتقال‌ها و پاداش‌ها States, Actions, Transitions, and Rewards

  • از تصمیمات بازشده تا مدل‌های مبتنی بر حالت From Unfolded Decisions to State-Based Models

  • تعریف رسمی یک فرآیند تصمیم‌گیری قطعی Formal Definition of a Deterministic Decision Process

  • تنزیل جریان‌های پاداش نامحدود Discounting Infinite Reward Streams

  • اجراها، تاریخچه‌ها، سیاست‌ها و ارزش‌ها Runs, Histories, Policies, and Values

  • معادلات بهینگی تنزیل‌شده Discounted Optimality Equations

  • بررسی ارزش‌ها و استخراج سیاست‌ها Checking Values and Extracting Policies

  • چرا معادلات بلمن رفتار بهینه را توصیف می‌کنند Why Bellman Equations Characterize Optimal Behavior

  • وجود، یکتایی و تکرار ارزش Existence, Uniqueness, and Value Iteration

زنجیره‌های مارکوف و فرآیندهای تصمیم‌گیری مارکوف Markov Chains and Markov Decision Processes

  • مقدمه ماژول Module Introduction

  • از انتقال‌های قطعی به انتقال‌های تصادفی From Deterministic to Stochastic Transitions

  • زنجیره‌های مارکوف Markov Chains

  • فرآیندهای تصمیم‌گیری مارکوف Markov Decision Processes

  • سیاست‌ها و ارزش‌ها Policies and Values

  • بررسی ارزش‌ها و استخراج سیاست‌ها Checking Values and Extracting Policies

  • معادلات بهینگی بلمن Bellman Optimality Equations

  • چرا معادلات بهینگی بلمن درست هستند Why Bellman Optimality Equations Are Correct

برنامه‌نویسی پویا در MDPها Dynamic Programming in MDPs

  • مقدمه ماژول Module Introduction

  • راه‌اندازی برنامه‌ریزی Planning Setup

  • ارزیابی سیاست Policy Evaluation

  • از ارزش‌ها به سیاست‌های بهتر From Values to Better Policies

  • عملگر بهینگی بلمن The Bellman Optimality Operator

  • تکرار ارزش به عنوان محاسبه نقطه ثابت Value Iteration as Fixed-Point Computation

  • تناوب بین ارزیابی و بهبود Alternating Evaluation and Improvement

  • دیدگاه برنامه‌ریزی خطی به بهینگی The Linear Programming View of Optimality

  • خلاصه ماژول Module Summary

یادگیری از تجربیات نمونه‌برداری شده Learning from Sampled Experience

  • مقدمه ماژول Module Introduction

  • از برنامه‌ریزی به یادگیری تقویت‌شده From Planning to Reinforcement Learning

  • پاداش‌ها، عدم قطعیت و اکتشاف Rewards, Uncertainty, and Exploration

  • رابط عامل-محیط The Agent–Environment Interface

  • راهزن تک بازویی One-Armed Bandits

  • راهزنان چند بازویی Multi-Armed Bandits

  • ارزیابی سیاست مونت کارلو Monte Carlo Policy Evaluation

  • کنترل مونت کارلو Monte Carlo Control

  • خلاصه ماژول Module Summary

کنترل، اکتشاف و الگوریتم‌های RL جدولی Control, Exploration, and Tabular RL Algorithms

  • یادگیری پیش از پایان اپیزود Learning before the Episode Ends

  • پیش‌بینی بوت‌استرپ یک مرحله‌ای One-Step Bootstrapped Prediction

  • کنترل تفاضل زمانی On-Policy On-Policy Temporal-Difference Control

  • کنترل تفاضل زمانی Off-Policy Off-Policy Temporal-Difference Control

  • چه سیاستی در حال یادگیری است؟ What Policy Is Being Learned?

  • اهداف هموارتر و بیش‌تخمینی Smoother Targets and Overestimation

  • کاهش سوگیری بیشینه‌سازی Reducing Maximization Bias

  • بین مونت کارلو و TD یک مرحله‌ای Between Monte Carlo and One-Step TD

نمایش نظرات

آموزش تسلط بر الگوریتم‌های کلاسیک یادگیری تقویت‌شده
جزییات دوره
14h 8m
45
(آخرین آپدیت)
418
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar