لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش ارزیابی و مشاهدهپذیری ایجنتهای هوش مصنوعی LLM با Galileo AI
- آخرین آپدیت
دانلود LLM AI Agent Evaluations and Observability with Galileo AI
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
ساخت ایجنتهای هوش مصنوعی قدرتمند | مانیتورینگ ایجنتهای AI در محیط عملیاتی | ساخت ارزیابیهای سفارشی | تسلط بر Galileo AI | مخصوص مهندسان
طراحی برنامه مشاهدهپذیری LLM: چه مواردی ثبت شوند، نحوه ساختاردهی Traces و چگونگی تشخیص خطاها
ساخت مجموعهدادههای ارزیابی با ورودیهای واقعگرایانه، رفتارهای مورد انتظار، متادادهها و بخشبندی برای موارد خاص (Edge Cases) و رگرسیونها
اجرای آزمایشهای تکرارپذیر در Galileo AI برای مقایسه مدلها، پرامپتها و نسخههای مختلف ایجنت بر روی مجموعههای تست یکسان
پیادهسازی معیارهای ارزیابی سفارشی برای کیفیت تولید محتوا، مستند بودن (Groundedness)، ایمنی و صحت عملکرد ابزارها (فراتر از دقت ساده)
بهکارگیری امتیازدهی LLM-as-judge با استفاده از روبیریکها، محدودیتها و بررسیهای تصادفی برای کاهش سوگیری و تغییرات ارزیاب
عیبیابی خطاهای ایجنت با استفاده از Traceها برای شناسایی دقیق نقاط شکست در بازیابی (Retrieval)، برنامهریزی، استفاده از ابزار یا ترکیب پاسخها
راهاندازی مانیتورینگ عملیاتی در Galileo با سیگنالها، داشبوردها و هشدارها برای شناسایی رگرسیونها و خطاهای خاموش
استفاده از نتایج ارزیابی برای اولویتبندی اصلاحات، تأیید بهبودها و جلوگیری از افت کیفیت یا ایمنی در طول زمان
انتخاب روشهای مشاهدهپذیری و ارزیابی برای اپلیکیشنهای تک-درخواست LLM در مقابل ایجنتهای چندمرحلهای و بررسی مزایا و معایب هرکدام
ابزارگذاری اپلیکیشنها و ایجنتهای LLM در Galileo برای ثبت Traceها، Spanها، پرامپتها، فراخوانی ابزارها و متادادهها جهت عیبیابی
طرای برنامه مشاهدهپذیری LLM: چه مواردی ثبت شوند، نحوه ساختاردهی Traces و چگونگی تشخیص خطاها
پیش نیازها: دانش پایه پایتون
دانش پایه در ساخت ایجنتهای هوش مصنوعی
توانایی کار با Jupyter Notebooks
بدون نیاز به تجربه قبلی در زمینه مشاهدهپذیری (Observability)
نکته مهم: لطفا برای اطلاعات بیشتر روی ویدیو کلیک کنید. این دوره کاملاً عملی و کاربردی است و برای توسعهدهندگان، مهندسان AI، بنیانگذاران و تیمهایی طراحی شده است که سیستمهای واقعی LLM و ایجنتهای هوش مصنوعی میسازند. همچنین برای هر کسی که علاقهمند به مشاهدهپذیری LLM و ارزیابیهای AI است و میخواهد این مهارتها را در اپلیکیشنهای ایجنتی آینده به کار بگیرد، ایدهآل است. شما باید دانش اولیهای در مورد ایجنتهای AI و نحوه ساخت آنها داشته باشید.
توجه داشته باشید که این یک راهنمای جامع برای مشاهدهپذیری و ارزیابیهای AI است. ما هم به تئوری و هم به عمل میپردازیم و از Galileo AI به عنوان پلتفرم مانیتورینگ ایجنتهای AI / LLM استفاده میکنیم. فراگیران همچنین به تمامی منابع و کدهای گیتهاب / نوتبوکهای استفاده شده در دوره دسترسی خواهند داشت.
چرا مشاهدهپذیری و ارزیابی LLM اهمیت دارد؟
مدلهای LLM قدرتمند هستند اما غیرقابل پیشبینیاند. آنها دچار توهم میشوند، بهصورت خاموش شکست میخورند و در پرامپتها و نسخههای مختلف رفتارهای متفاوتی دارند. تفاوت زیادی بین ساخت یک سیستم ایجنتی / LLM و تبدیل آن به یک محصول عملیاتی (Productionalizing) وجود دارد. چه اتفاقی میافتد اگر LLM محتوای توهینآمیز تولید کند؟ اگر ابزارهای تعبیه شده در ایجنتها بدون خطا دادن از کار بیفتند چه؟ چگونه افت کیفیت مدل را اندازهگیری میکنید؟
روشهای سنتی مانیتورینگ و ساخت، پاسخگو نیستند. شما نیاز دارید آزمایشها را اجرا کنید، ارزیابیهای سفارشی بسازید و هشدارهایی تنظیم کنید که معیارهای ذهنی را بسنجند. داشبوردهایی که برای ردیابی دقت دستهبندی (Classification Accuracy) ساخته شدهاند، برای تولید متن باز طراحی نشدهاند. خط لولههای لاگی (Log Pipelines) که برای APIهای قابل پیشبینی ایجاد شدهاند، نمیتوانند مراحل استدلال، استفاده از ابزار یا دلیل شکست یک ایجنت را ثبت کنند.
در نتیجه، بسیاری از تیمها به بررسیهای دستی تصادفی، حس شخصی و تغییرات بیپایان پرامپت متوسل میشوند. این رویکرد ممکن است در ابتدا جواب دهد، اما مقیاسپذیر نیست.
آنچه ما به جای آن نیاز داریم، یک روش سیستماتیک برای اندازهگیری، مانیتورینگ، ارزیابی و بهبود مستمر سیستمهای LLM و ایجنتی است. اینجاست که مشاهدهپذیری و ارزیابی ساختاریافته وارد عمل میشوند.
این دوره چیست؟
این دوره هنگام ساخت و استقرار ایجنتهای AI یا سایر سیستمهای مبتنی بر LLM، اعتماد به نفس شما را افزایش میدهد. این دوره ابزارها و ترفندهای لازم برای ساخت ایجنتهای AI قدرتمند با ارزیابیها و آزمایشهای شخصیسازی شده و ساختاریافته را به شما میآموزد و نشان میدهد چگونه ایجنتهای خود را در محیط عملیاتی با مشاهدهپذیری و لاگگیری مانیتور کنید. ما ابتدا با مبانی و تئوریهایی شروع میکنیم که چرا ساخت و ردیابی ایجنتهای AI / سیستمهای LLM دشوار است و سپس به بخش عملی میرویم تا ارزیابیهای خودمان را بسازیم و اپلیکیشنهایمان را با Galileo AI ابزارگذاری کنیم.
Galileo AI چیست؟
Galileo پلتفرمی است که اختصاصاً برای ارزیابی و مانیتورینگ سیستمهای LLM و ایجنتی طراحی شده است و ویژگیهای زیر را شامل میشود:
مشاهدهپذیری (Observability): ثبت تعاملات LLM، ردیابی Spanها و متادادهها، بصریسازی جریانهای ایجنت، مانیتورینگ سیگنالهای ایمنی و انطباق
ارزیابیها (Evaluations): طراحی آزمایشها، ایجاد مجموعهدادههای ارزیابی، تعریف و ثبت معیارها، استفاده از LLM-as-judges، نسخهبندی و مقایسه نتایج
به طور خلاصه، این پلتفرم روشی ساختاریافته برای درک رفتار سیستمهای AI به شما میدهد و به شما در ساخت آنها کمک میکند. در این دوره، ما یک مسترکلاس در Galileo AI و نحوه استفاده از آن برای مانیتورینگ و ارزیابی اپلیکیشن AI شما برگزار میکنیم.
مرور کلی دوره:
مقدمه - با توضیح اهمیت ارزیابیها و مشاهدهپذیری LLM شروع میکنیم و ریسکهای استقرار AI مولد بدون مانیتورینگ ساختاریافته، تعیین انتظارات و بررسی نقشه راه دوره را پوشش میدهیم.
تئوری: مشاهدهپذیری LLM/ایجنت - این بخش مفاهیم مانیتورینگ سنتی را معرفی کرده، توضیح میدهد چرا این مفاهیم برای سیستمهای مولد ناکافی هستند و اجزای کلیدی مشاهدهپذیری LLM را شرح میدهد.
تئوری: ارزیابیهای LLM/ایجنت - شما تئوری ارزیابی را بررسی میکنید، میفهمید چرا ارزیابیها برای AI عملیاتی حیاتی هستند، رویکردهای اصلی ارزیابی را میآموزید و چالشهای رایجی که تیمها با LLMها دارند را میبینید.
تئوری: مشاهدهپذیری و ارزیابی در LLMها در مقابل ML سنتی - ما AI مولد را با یادگیری ماشین کلاسیک مقایسه میکنیم و ریسکها، هزینهها و حلقههای تکرار منحصربهفرد را برجسته میکنیم.
تئوری: ابزارها و رویکردهای مشاهدهپذیری و ارزیابی LLM - این بخش چشماندازی از ابزارهای موجود برای سیستمهای LLM ارائه میدهد و توضیح میدهد چرا پلتفرمهای تخصصی ضروری هستند.
تمرین: بررسی عمیق پلتفرم Galileo و راهاندازی - این بخش شما را با معماری، یکپارچهسازیها، قیمتگذاری، ساخت حساب کاربری، کلون کردن مخزن و تنظیمات توسعه محلی آشنا میکند تا برای ابزارگذاری آماده شوید.
تمرین: ثبت تعاملات LLM با Galileo - شما لاگگیری عملی با Galileo را یاد میگیرید، از جمله اصطلاحات، روشهای دستی و مبتنی بر SDK، شبیهسازی اپلیکیشنهای LLM، بررسی گرافهای ایجنت، شناسایی خطاها و تنظیم هشدارها و سیگنالها.
تمرین: ارزیابی عملکرد LLM با Galileo - از مشاهده به سمت ارزیابی میرویم و یاد میگیریم چگونه آزمایشها را طراحی کنیم، مجموعهدادهها و متادادهها را مدیریت کنیم، کد ارزیابی را پیادهسازی کنیم، معیارها را تعریف کنیم و ارزیابیهای خاص ایجنت و LLM-as-judge را انجام دهیم.
جمعبندی: دریافت گواهینامه
سرفصل ها و درس ها
مقدمه
Introduction
چرا ارزیابیها و مشاهدهپذیری LLM مهم هستند؟
Why LLM evaluations and observability?
نکات دوره
Course tips
این دوره درباره چیست؟
What is this course?
نقشه راه دوره
Course roadmap
منابع
Resources
درباره مدرس
About the instructor
کلیدهای موفقیت
Keys to success
راههای ارتباطی
Ways to reach out
ثبت امتیاز
Leave a rating
تماشا با کیفیت 1080p
Watch in 1080p
مشاهدهپذیری LLM و ایجنت
LLM / Agent Observability
از مانیتورینگ سنتی تا مشاهدهپذیری
Traditional monitoring to observability
چرا سیستمهای AI به مشاهدهپذیری نیاز دارند؟
Why AI systems need observability
اجزای کلیدی مشاهدهپذیری LLM
Key components of LLM observability
ارزیابیهای LLM و ایجنت
LLM / Agent Evaluations
چرا ارزیابیها حیاتی هستند؟
Why evaluations are critical
انواع و رویکردهای ارزیابی LLM
Types and approaches for LLM evaluations
چالشهای ارزیابی LLM
Challenges to LLM evaluations
مشاهدهپذیری و ارزیابی LLM در مقابل ML سنتی
Observability and Evaluations for LLMs vs Traditional ML
چالشهای منحصربهفرد مشاهدهپذیری LLM در مقابل ML سنتی
Unique challenges to LLM observability vs. traditional ML
عوامل ریسک و هزینه خاص در مشاهدهپذیری و ارزیابی LLM
Unique risk and cost factors to LLM observability and evaluations
حلقههای تکرار و چرخه حیات در توسعه LLM
Iteration and lifecycle loops in LLM development
ابزارها و رویکردهای مشاهدهپذیری و ارزیابی LLM
Tools and Approaches for LLM Observability and Evaluations
چرا به یک پلتفرم تخصصی نیاز است؟
Why a dedicated platform is needed
چشمانداز پلتفرمهای مشاهدهپذیری و ارزیابی
Landscape of obsevability and evaluation platforms
بررسی عمیق و راهاندازی پلتفرم Galileo
Galileo Platform Deep-Dive Overview and Setup
Galileo چیست؟
What is Galileo
یکپارچهسازیها
Integrations
مشکلات و راهکارهای Galileo
Problems and solutions with Galileo
قیمتگذاری
Pricing
ساخت حساب کاربری Galileo
Create a Galileo account
کلون کردن مخزن (Repo)
Clone the repo
تنظیمات مخزن و محیط محلی
Repo and local setup
ثبت تعاملات LLM با Galileo
Logging LLM Interactions with Galileo
مقدمهای بر مشاهدهپذیری
Observability intro
اصطلاحات لاگگیری
Logging terminology
چرا لاگ بگیریم؟ و روشهای مختلف لاگگیری
Why log and different methods of logging
مبانی لاگگیری دستی
Manual logging basics
انواع Span و متادادهها
Span types and metadata
دکوراتور لاگ (Log Decorator)
Log decorator
SDKهای OpenAI در Galileo
Galileo OpenAI SDK
شبیهسازی یک اپلیکیشن LLM
Simulation an LLM app
مشاهده نتایج فراخوانی LLM در داشبورد Galileo
Viewing results of LLM call in Galileo dashboard
جمعآوری لاگها از فراخوانیهای واقعی ایجنت
Real agent calls gathering logs
گراف ایجنت (Agent Graph)
Agent graph
یافتن سرنخهای ابزارهای معیوب و فراخوانیهای LLM در گراف ایجنت
Agent graph finding clues on bad tools and LLM calls
لاگگیری، هشدارها، سیگنالها و نمونهبرداری معیارها
Logging, alerts, signals, and metric sampling
ارزیابی عملکرد LLM با Galileo
Evaluating LLM Performance with Galileo
از مشاهده تا ارزیابی
From observation to evaluation
نمایش نظرات