آموزش ارزیابی و مشاهده‌پذیری ایجنت‌های هوش مصنوعی LLM با Galileo AI - آخرین آپدیت

دانلود LLM AI Agent Evaluations and Observability with Galileo AI

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: ساخت ایجنت‌های هوش مصنوعی قدرتمند | مانیتورینگ ایجنت‌های AI در محیط عملیاتی | ساخت ارزیابی‌های سفارشی | تسلط بر Galileo AI | مخصوص مهندسان طراحی برنامه مشاهده‌پذیری LLM: چه مواردی ثبت شوند، نحوه ساختاردهی Traces و چگونگی تشخیص خطاها ساخت مجموعه‌داده‌های ارزیابی با ورودی‌های واقع‌گرایانه، رفتارهای مورد انتظار، متاداده‌ها و بخش‌بندی برای موارد خاص (Edge Cases) و رگرسیون‌ها اجرای آزمایش‌های تکرارپذیر در Galileo AI برای مقایسه مدل‌ها، پرامپت‌ها و نسخه‌های مختلف ایجنت بر روی مجموعه‌های تست یکسان پیاده‌سازی معیارهای ارزیابی سفارشی برای کیفیت تولید محتوا، مستند بودن (Groundedness)، ایمنی و صحت عملکرد ابزارها (فراتر از دقت ساده) به‌کارگیری امتیازدهی LLM-as-judge با استفاده از روبیریک‌ها، محدودیت‌ها و بررسی‌های تصادفی برای کاهش سوگیری و تغییرات ارزیاب عیب‌یابی خطاهای ایجنت با استفاده از Traceها برای شناسایی دقیق نقاط شکست در بازیابی (Retrieval)، برنامه‌ریزی، استفاده از ابزار یا ترکیب پاسخ‌ها راه‌اندازی مانیتورینگ عملیاتی در Galileo با سیگنال‌ها، داشبوردها و هشدارها برای شناسایی رگرسیون‌ها و خطاهای خاموش استفاده از نتایج ارزیابی برای اولویت‌بندی اصلاحات، تأیید بهبودها و جلوگیری از افت کیفیت یا ایمنی در طول زمان انتخاب روش‌های مشاهده‌پذیری و ارزیابی برای اپلیکیشن‌های تک-درخواست LLM در مقابل ایجنت‌های چندمرحله‌ای و بررسی مزایا و معایب هرکدام ابزارگذاری اپلیکیشن‌ها و ایجنت‌های LLM در Galileo برای ثبت Traceها، Spanها، پرامپت‌ها، فراخوانی ابزارها و متاداده‌ها جهت عیب‌یابی طرای برنامه مشاهده‌پذیری LLM: چه مواردی ثبت شوند، نحوه ساختاردهی Traces و چگونگی تشخیص خطاها پیش نیازها: دانش پایه پایتون دانش پایه در ساخت ایجنت‌های هوش مصنوعی توانایی کار با Jupyter Notebooks بدون نیاز به تجربه قبلی در زمینه مشاهده‌پذیری (Observability)

نکته مهم: لطفا برای اطلاعات بیشتر روی ویدیو کلیک کنید. این دوره کاملاً عملی و کاربردی است و برای توسعه‌دهندگان، مهندسان AI، بنیان‌گذاران و تیم‌هایی طراحی شده است که سیستم‌های واقعی LLM و ایجنت‌های هوش مصنوعی می‌سازند. همچنین برای هر کسی که علاقه‌مند به مشاهده‌پذیری LLM و ارزیابی‌های AI است و می‌خواهد این مهارت‌ها را در اپلیکیشن‌های ایجنتی آینده به کار بگیرد، ایده‌آل است. شما باید دانش اولیه‌ای در مورد ایجنت‌های AI و نحوه ساخت آن‌ها داشته باشید.


توجه داشته باشید که این یک راهنمای جامع برای مشاهده‌پذیری و ارزیابی‌های AI است. ما هم به تئوری و هم به عمل می‌پردازیم و از Galileo AI به عنوان پلتفرم مانیتورینگ ایجنت‌های AI / LLM استفاده می‌کنیم. فراگیران همچنین به تمامی منابع و کدهای گیت‌هاب / نوت‌بوک‌های استفاده شده در دوره دسترسی خواهند داشت.


چرا مشاهده‌پذیری و ارزیابی LLM اهمیت دارد؟

مدل‌های LLM قدرتمند هستند اما غیرقابل پیش‌بینی‌اند. آن‌ها دچار توهم می‌شوند، به‌صورت خاموش شکست می‌خورند و در پرامپت‌ها و نسخه‌های مختلف رفتارهای متفاوتی دارند. تفاوت زیادی بین ساخت یک سیستم ایجنتی / LLM و تبدیل آن به یک محصول عملیاتی (Productionalizing) وجود دارد. چه اتفاقی می‌افتد اگر LLM محتوای توهین‌آمیز تولید کند؟ اگر ابزارهای تعبیه شده در ایجنت‌ها بدون خطا دادن از کار بیفتند چه؟ چگونه افت کیفیت مدل را اندازه‌گیری می‌کنید؟

روش‌های سنتی مانیتورینگ و ساخت، پاسخگو نیستند. شما نیاز دارید آزمایش‌ها را اجرا کنید، ارزیابی‌های سفارشی بسازید و هشدارهایی تنظیم کنید که معیارهای ذهنی را بسنجند. داشبوردهایی که برای ردیابی دقت دسته‌بندی (Classification Accuracy) ساخته شده‌اند، برای تولید متن باز طراحی نشده‌اند. خط لوله‌های لاگی (Log Pipelines) که برای APIهای قابل پیش‌بینی ایجاد شده‌اند، نمی‌توانند مراحل استدلال، استفاده از ابزار یا دلیل شکست یک ایجنت را ثبت کنند.

در نتیجه، بسیاری از تیم‌ها به بررسی‌های دستی تصادفی، حس شخصی و تغییرات بی‌پایان پرامپت متوسل می‌شوند. این رویکرد ممکن است در ابتدا جواب دهد، اما مقیاس‌پذیر نیست.

آنچه ما به جای آن نیاز داریم، یک روش سیستماتیک برای اندازه‌گیری، مانیتورینگ، ارزیابی و بهبود مستمر سیستم‌های LLM و ایجنتی است. اینجاست که مشاهده‌پذیری و ارزیابی ساختاریافته وارد عمل می‌شوند.


این دوره چیست؟

این دوره هنگام ساخت و استقرار ایجنت‌های AI یا سایر سیستم‌های مبتنی بر LLM، اعتماد به نفس شما را افزایش می‌دهد. این دوره ابزارها و ترفندهای لازم برای ساخت ایجنت‌های AI قدرتمند با ارزیابی‌ها و آزمایش‌های شخصی‌سازی شده و ساختاریافته را به شما می‌آموزد و نشان می‌دهد چگونه ایجنت‌های خود را در محیط عملیاتی با مشاهده‌پذیری و لاگ‌گیری مانیتور کنید. ما ابتدا با مبانی و تئوری‌هایی شروع می‌کنیم که چرا ساخت و ردیابی ایجنت‌های AI / سیستم‌های LLM دشوار است و سپس به بخش عملی می‌رویم تا ارزیابی‌های خودمان را بسازیم و اپلیکیشن‌هایمان را با Galileo AI ابزارگذاری کنیم.


Galileo AI چیست؟

Galileo پلتفرمی است که اختصاصاً برای ارزیابی و مانیتورینگ سیستم‌های LLM و ایجنتی طراحی شده است و ویژگی‌های زیر را شامل می‌شود:

  • مشاهده‌پذیری (Observability): ثبت تعاملات LLM، ردیابی Spanها و متاداده‌ها، بصری‌سازی جریان‌های ایجنت، مانیتورینگ سیگنال‌های ایمنی و انطباق

  • ارزیابی‌ها (Evaluations): طراحی آزمایش‌ها، ایجاد مجموعه‌داده‌های ارزیابی، تعریف و ثبت معیارها، استفاده از LLM-as-judges، نسخه‌بندی و مقایسه نتایج

به طور خلاصه، این پلتفرم روشی ساختاریافته برای درک رفتار سیستم‌های AI به شما می‌دهد و به شما در ساخت آن‌ها کمک می‌کند. در این دوره، ما یک مسترکلاس در Galileo AI و نحوه استفاده از آن برای مانیتورینگ و ارزیابی اپلیکیشن AI شما برگزار می‌کنیم.


مرور کلی دوره:

  • مقدمه - با توضیح اهمیت ارزیابی‌ها و مشاهده‌پذیری LLM شروع می‌کنیم و ریسک‌های استقرار AI مولد بدون مانیتورینگ ساختاریافته، تعیین انتظارات و بررسی نقشه راه دوره را پوشش می‌دهیم.

  • تئوری: مشاهده‌پذیری LLM/ایجنت - این بخش مفاهیم مانیتورینگ سنتی را معرفی کرده، توضیح می‌دهد چرا این مفاهیم برای سیستم‌های مولد ناکافی هستند و اجزای کلیدی مشاهده‌پذیری LLM را شرح می‌دهد.

  • تئوری: ارزیابی‌های LLM/ایجنت - شما تئوری ارزیابی را بررسی می‌کنید، می‌فهمید چرا ارزیابی‌ها برای AI عملیاتی حیاتی هستند، رویکردهای اصلی ارزیابی را می‌آموزید و چالش‌های رایجی که تیم‌ها با LLMها دارند را می‌بینید.

  • تئوری: مشاهده‌پذیری و ارزیابی در LLMها در مقابل ML سنتی - ما AI مولد را با یادگیری ماشین کلاسیک مقایسه می‌کنیم و ریسک‌ها، هزینه‌ها و حلقه‌های تکرار منحصر‌به‌فرد را برجسته می‌کنیم.

  • تئوری: ابزارها و رویکردهای مشاهده‌پذیری و ارزیابی LLM - این بخش چشم‌اندازی از ابزارهای موجود برای سیستم‌های LLM ارائه می‌دهد و توضیح می‌دهد چرا پلتفرم‌های تخصصی ضروری هستند.

  • تمرین: بررسی عمیق پلتفرم Galileo و راه‌اندازی - این بخش شما را با معماری، یکپارچه‌سازی‌ها، قیمت‌گذاری، ساخت حساب کاربری، کلون کردن مخزن و تنظیمات توسعه محلی آشنا می‌کند تا برای ابزارگذاری آماده شوید.

  • تمرین: ثبت تعاملات LLM با Galileo - شما لاگ‌گیری عملی با Galileo را یاد می‌گیرید، از جمله اصطلاحات، روش‌های دستی و مبتنی بر SDK، شبیه‌سازی اپلیکیشن‌های LLM، بررسی گراف‌های ایجنت، شناسایی خطاها و تنظیم هشدارها و سیگنال‌ها.

  • تمرین: ارزیابی عملکرد LLM با Galileo - از مشاهده به سمت ارزیابی می‌رویم و یاد می‌گیریم چگونه آزمایش‌ها را طراحی کنیم، مجموعه‌داده‌ها و متاداده‌ها را مدیریت کنیم، کد ارزیابی را پیاده‌سازی کنیم، معیارها را تعریف کنیم و ارزیابی‌های خاص ایجنت و LLM-as-judge را انجام دهیم.

  • جمع‌بندی: دریافت گواهینامه


سرفصل ها و درس ها

مقدمه Introduction

  • چرا ارزیابی‌ها و مشاهده‌پذیری LLM مهم هستند؟ Why LLM evaluations and observability?

  • نکات دوره Course tips

  • این دوره درباره چیست؟ What is this course?

  • نقشه راه دوره Course roadmap

  • منابع Resources

  • درباره مدرس About the instructor

  • کلیدهای موفقیت Keys to success

  • راه‌های ارتباطی Ways to reach out

  • ثبت امتیاز Leave a rating

  • تماشا با کیفیت 1080p Watch in 1080p

مشاهده‌پذیری LLM و ایجنت LLM / Agent Observability

  • از مانیتورینگ سنتی تا مشاهده‌پذیری Traditional monitoring to observability

  • چرا سیستم‌های AI به مشاهده‌پذیری نیاز دارند؟ Why AI systems need observability

  • اجزای کلیدی مشاهده‌پذیری LLM Key components of LLM observability

ارزیابی‌های LLM و ایجنت LLM / Agent Evaluations

  • چرا ارزیابی‌ها حیاتی هستند؟ Why evaluations are critical

  • انواع و رویکردهای ارزیابی LLM Types and approaches for LLM evaluations

  • چالش‌های ارزیابی LLM Challenges to LLM evaluations

مشاهده‌پذیری و ارزیابی LLM در مقابل ML سنتی Observability and Evaluations for LLMs vs Traditional ML

  • چالش‌های منحصر‌به‌فرد مشاهده‌پذیری LLM در مقابل ML سنتی Unique challenges to LLM observability vs. traditional ML

  • عوامل ریسک و هزینه خاص در مشاهده‌پذیری و ارزیابی LLM Unique risk and cost factors to LLM observability and evaluations

  • حلقه‌های تکرار و چرخه حیات در توسعه LLM Iteration and lifecycle loops in LLM development

ابزارها و رویکردهای مشاهده‌پذیری و ارزیابی LLM Tools and Approaches for LLM Observability and Evaluations

  • چرا به یک پلتفرم تخصصی نیاز است؟ Why a dedicated platform is needed

  • چشم‌انداز پلتفرم‌های مشاهده‌پذیری و ارزیابی Landscape of obsevability and evaluation platforms

بررسی عمیق و راه‌اندازی پلتفرم Galileo Galileo Platform Deep-Dive Overview and Setup

  • Galileo چیست؟ What is Galileo

  • یکپارچه‌سازی‌ها Integrations

  • مشکلات و راهکارهای Galileo Problems and solutions with Galileo

  • قیمت‌گذاری Pricing

  • ساخت حساب کاربری Galileo Create a Galileo account

  • کلون کردن مخزن (Repo) Clone the repo

  • تنظیمات مخزن و محیط محلی Repo and local setup

ثبت تعاملات LLM با Galileo Logging LLM Interactions with Galileo

  • مقدمه‌ای بر مشاهده‌پذیری Observability intro

  • اصطلاحات لاگ‌گیری Logging terminology

  • چرا لاگ بگیریم؟ و روش‌های مختلف لاگ‌گیری Why log and different methods of logging

  • مبانی لاگ‌گیری دستی Manual logging basics

  • انواع Span و متاداده‌ها Span types and metadata

  • دکوراتور لاگ (Log Decorator) Log decorator

  • SDKهای OpenAI در Galileo Galileo OpenAI SDK

  • شبیه‌سازی یک اپلیکیشن LLM Simulation an LLM app

  • مشاهده نتایج فراخوانی LLM در داشبورد Galileo Viewing results of LLM call in Galileo dashboard

  • جمع‌آوری لاگ‌ها از فراخوانی‌های واقعی ایجنت Real agent calls gathering logs

  • گراف ایجنت (Agent Graph) Agent graph

  • یافتن سرنخ‌های ابزارهای معیوب و فراخوانی‌های LLM در گراف ایجنت Agent graph finding clues on bad tools and LLM calls

  • لاگ‌گیری، هشدارها، سیگنال‌ها و نمونه‌برداری معیارها Logging, alerts, signals, and metric sampling

ارزیابی عملکرد LLM با Galileo Evaluating LLM Performance with Galileo

  • از مشاهده تا ارزیابی From observation to evaluation

  • شباهت‌سازی با ارزیابی AI Analogy to AI evaluation

  • آزمایش‌ها و معیارها Experiments and metrics

  • ساخت مجموعه‌داده (Dataset) Dataset creation

  • متاداده‌ها Metadata

  • نسخه‌بندی Versioning

  • محیط آزمایشگاهی (Playground) آزمایش‌ها Experiments playground

  • کدهای مربوط به آزمایش‌ها Experiments code

  • معیارهای پاسخ جعبه‌ای (Box Response) Metrics box response

  • معیارهای ایمنی و انطباق Metrics safety and compliance

  • بیان و اطمینان (Expression and Confidence) Expression and confidence

  • معیارهای ایجنتی (Agentic Metrics) Agentic metrics

  • معیارهای ایجنت ۲ Agent metrics 2

  • معیارهای محلی Local metrics

  • معیارهای ثبت شده Registered metrics

  • LLM به عنوان داور (LLM as judge) LLM as judge

  • مهندسی پرامپت Prompt egineering

  • استفاده از LLM به عنوان داور برای کدها و سایر انواع خروجی LLM as judge using code and other output types

جمع‌بندی Conclusion

  • جمع‌بندی و گواهینامه Conclusion and Certification

نمایش نظرات

آموزش ارزیابی و مشاهده‌پذیری ایجنت‌های هوش مصنوعی LLM با Galileo AI
جزییات دوره
7.5 hours
60
(آخرین آپدیت)
671
4.6 از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Henry Habib Henry Habib

مشاور مدیریت | دانشمند داده | متخصص بدون کد

The Intelligent Worker The Intelligent Worker

برای بهره وری بیشتر از هوش مصنوعی، اتوماسیون و بدون کد استفاده کنید