لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش یادگیری تقویتکننده برای ترازسازی و استدلال LLM توسط Pearson
- آخرین آپدیت
دانلود Reinforcement Learning for LLM Alignment and Reasoning by Pearson
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
پیشآموزش به مدلهای زبانی بزرگ (LLM) قابلیت میدهد، اما قدرت قضاوت را نه. در این دوره، بیاموزید که چگونه تکنیکهای یادگیری تقویتکننده مانند بهینهسازی مستقیم ترجیحات (DPO) و بهینهسازی سیاست نسبی گروهی (GRPO)، رفتار، ایمنی و استدلال مدل را شکل میدهند و چگونه سیستمهای ارزیابی و حاکمیتی بسازید که ترازسازی (Alignment) را در مسیر درست نگه دارند. این دوره برای توسعهدهندگان، دانشمندان داده و مهندسان یادگیری ماشین که در حال تنظیم دقیق (Fine-tuning) یا استقرار LLMها هستند و قصد دارند ایمنی، اثربخشی و تواناییهای استدلالی آنها را بهبود ببخشند، ایدهآل است.
توجه: این دوره توسط Pearson ایجاد شده است و ما مفتخریم که این آموزش را در کتابخانه خود میزبانی کنیم.
سرفصل ها و درس ها
مقدمه
Introduction
معرفی دوره
Course introduction
1. مبانی ترازسازی
1. Foundations of Alignment
اهداف ترازسازی و حالتهای شکست
Alignment goals and failure modes
مباحث کلیدی
Key topics
تبیین مسئله ترازسازی برای LLMها
Framing the alignment problem for LLMs
مرور کلی پسآموزش: SFT، بهینهسازی ترجیحات و RLHF
Post-training overview: SFT, preference optimization, and RLHF
2. اصول یادگیری تقویتکننده برای LLMها
2. Reinforcement Learning Basics for LLMs
مباحث کلیدی
Key topics
پیادهسازی PPO با استفاده از Flan T5
PPO in action using Flan-T5
الگوریتمهای رایج مورد استفاده در پسآموزش
Common algorithms used in post-training
سیاستها، پاداشها و اکتشاف
Policies, rewards, and exploration
3. ساخت مدل پاداش
3. Building a Reward Model
آموزش یک مدل پاداش
Training a reward model
مبانی مدلسازی پاداش
Foundations of reward modeling
مباحث
Topics
4. پسآموزش مدرن
4. Modern Post-Training
بهینهسازی مستقیم ترجیحات (DPO)
Direct preference optimization (DPO)
الگوریتم RLOO (حذف یکی از REINFORCE)
REINFORCE leave-one-out (RLOO)
چرا RLHF تکامل یافت
Why RLHF evolved
مباحث
Topics
5. پسآموزش پیشرفته برای استدلال
5. Advanced Post-Training for Reasoning
مطالعه موردی: القای استدلال در LLMها با GRPO
Case study: Inducing reasoning in LLMs with GRPO
چرا استدلال به متد پسآموزش متفاوتی نیاز دارد
Why reasoning needs a different post-training method
مباحث کلیدی
Key topics
بهینهسازی سیاست نسبی گروهی (GRPO)
Group relative policy optimization (GRPO)
6. مسیرهای آینده، ایمنی و حاکمیت
6. Future Directions, Safety, and Governance
مطالعه موردی: هوش مصنوعی قانونمند به همراه ارزیابی ایمنی
Case study: Constitutional AI plus safety evaluation
بنچمارکهای کاربردی ایمنی و استحکام
Practical safety and robustness benchmarks
مباحث کلیدی
Key topics
ارزیابیهای مشترک ایمنی و تیم قرمز (Red Teaming)
Joint safety evaluations and red teaming
چارچوبهای حاکمیتی و مدیریت ریسک
Governance and risk frameworks
ساخت یک سیستم ساده برای ارزیابی ایمنی
Building a simple safety evaluation harness
نتیجهگیری
Conclusion
خلاصه دوره و گامهای بعدی
Course summary and next steps
هدف پیرسون این است که به افراد کمک کند تا زندگی خود را از طریق یادگیری درک کنند، با این باور که هر فرصت یادگیری فرصتی برای پیشرفت شخصی است. کارکنان پیرسون متعهد به ایجاد تجربیات یادگیری پر جنب و جوش و غنی هستند که برای تأثیرگذاری در زندگی واقعی طراحی شده اند. آنها در نزدیک به 200 کشور با محتوای دیجیتال، ارزیابی ها، صلاحیت ها و داده ها به مشتریان خدمات ارائه می دهند.
نمایش نظرات