آموزش یادگیری تقویت‌کننده برای ترازسازی و استدلال LLM توسط Pearson - آخرین آپدیت

دانلود Reinforcement Learning for LLM Alignment and Reasoning by Pearson

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:

پیش‌آموزش به مدل‌های زبانی بزرگ (LLM) قابلیت می‌دهد، اما قدرت قضاوت را نه. در این دوره، بیاموزید که چگونه تکنیک‌های یادگیری تقویت‌کننده مانند بهینه‌سازی مستقیم ترجیحات (DPO) و بهینه‌سازی سیاست نسبی گروهی (GRPO)، رفتار، ایمنی و استدلال مدل را شکل می‌دهند و چگونه سیستم‌های ارزیابی و حاکمیتی بسازید که ترازسازی (Alignment) را در مسیر درست نگه دارند. این دوره برای توسعه‌دهندگان، دانشمندان داده و مهندسان یادگیری ماشین که در حال تنظیم دقیق (Fine-tuning) یا استقرار LLMها هستند و قصد دارند ایمنی، اثربخشی و توانایی‌های استدلالی آن‌ها را بهبود ببخشند، ایده‌آل است.

توجه: این دوره توسط Pearson ایجاد شده است و ما مفتخریم که این آموزش را در کتابخانه خود میزبانی کنیم.


سرفصل ها و درس ها

مقدمه Introduction

  • معرفی دوره Course introduction

1. مبانی ترازسازی 1. Foundations of Alignment

  • اهداف ترازسازی و حالت‌های شکست Alignment goals and failure modes

  • مباحث کلیدی Key topics

  • تبیین مسئله ترازسازی برای LLMها Framing the alignment problem for LLMs

  • مرور کلی پس‌آموزش: SFT، بهینه‌سازی ترجیحات و RLHF Post-training overview: SFT, preference optimization, and RLHF

2. اصول یادگیری تقویت‌کننده برای LLMها 2. Reinforcement Learning Basics for LLMs

  • مباحث کلیدی Key topics

  • پیاده‌سازی PPO با استفاده از Flan T5 PPO in action using Flan-T5

  • الگوریتم‌های رایج مورد استفاده در پس‌آموزش Common algorithms used in post-training

  • سیاست‌ها، پاداش‌ها و اکتشاف Policies, rewards, and exploration

3. ساخت مدل پاداش 3. Building a Reward Model

  • آموزش یک مدل پاداش Training a reward model

  • مبانی مدل‌سازی پاداش Foundations of reward modeling

  • مباحث Topics

4. پس‌آموزش مدرن 4. Modern Post-Training

  • بهینه‌سازی مستقیم ترجیحات (DPO) Direct preference optimization (DPO)

  • الگوریتم RLOO (حذف یکی از REINFORCE) REINFORCE leave-one-out (RLOO)

  • چرا RLHF تکامل یافت Why RLHF evolved

  • مباحث Topics

5. پس‌آموزش پیشرفته برای استدلال 5. Advanced Post-Training for Reasoning

  • مطالعه موردی: القای استدلال در LLMها با GRPO Case study: Inducing reasoning in LLMs with GRPO

  • چرا استدلال به متد پس‌آموزش متفاوتی نیاز دارد Why reasoning needs a different post-training method

  • مباحث کلیدی Key topics

  • بهینه‌سازی سیاست نسبی گروهی (GRPO) Group relative policy optimization (GRPO)

6. مسیرهای آینده، ایمنی و حاکمیت 6. Future Directions, Safety, and Governance

  • مطالعه موردی: هوش مصنوعی قانون‌مند به همراه ارزیابی ایمنی Case study: Constitutional AI plus safety evaluation

  • بنچ‌مارک‌های کاربردی ایمنی و استحکام Practical safety and robustness benchmarks

  • مباحث کلیدی Key topics

  • ارزیابی‌های مشترک ایمنی و تیم قرمز (Red Teaming) Joint safety evaluations and red teaming

  • چارچوب‌های حاکمیتی و مدیریت ریسک Governance and risk frameworks

  • ساخت یک سیستم ساده برای ارزیابی ایمنی Building a simple safety evaluation harness

نتیجه‌گیری Conclusion

  • خلاصه دوره و گام‌های بعدی Course summary and next steps

نمایش نظرات

آموزش یادگیری تقویت‌کننده برای ترازسازی و استدلال LLM توسط Pearson
جزییات دوره
3h 46m
27
(آخرین آپدیت)
478
- از 5
ندارد
دارد
دارد
Pearson
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Pearson Pearson

Pearson یک ارائه دهنده آموزش و یادگیری است.

هدف پیرسون این است که به افراد کمک کند تا زندگی خود را از طریق یادگیری درک کنند، با این باور که هر فرصت یادگیری فرصتی برای پیشرفت شخصی است. کارکنان پیرسون متعهد به ایجاد تجربیات یادگیری پر جنب و جوش و غنی هستند که برای تأثیرگذاری در زندگی واقعی طراحی شده اند. آنها در نزدیک به 200 کشور با محتوای دیجیتال، ارزیابی ها، صلاحیت ها و داده ها به مشتریان خدمات ارائه می دهند.