آموزش پایداری، SLOها و مدیریت حوادث برای سیستم‌های هوش مصنوعی مولد (GenAI) - آخرین آپدیت

دانلود Reliability, SLOs, and Incident Management for GenAI Systems

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: سیستم‌های هوش مصنوعی مولد ممکن است در ظاهر سالم به نظر برسند اما در سکوت دچار خطا شوند: افزایش ناگهانی تأخیر (Latency)، بازگرداندن محتوای کم‌ارزش در بازیابی، افت کیفیت و افزایش هزینه‌ها تا زمانی که کاربران شکایت کنند. در این دوره آموزشی با عنوان «پایداری، SLOها و مدیریت حوادث برای سیستم‌های GenAI»، شما توانایی مدیریت سیستم‌های تولیدی GenAI را با پایداری قابل اندازه‌گیری و یک فرآیند تکرارپذیر برای مدیریت حوادث کسب خواهید کرد. ابتدا، مفاهیم بنیادی پایداری، تحلیل حالت‌های شکست، بررسی سلامت (Health Checks) و مانیتورینگ سنتتیک برای اجزای GenAI را بررسی می‌کنید. سپس، نحوه تعریف SLIها، تعیین SLOها و تبدیل آن‌ها به ورودی‌های SLA با استفاده از بودجه‌های خطا (Error Budgets) را خواهید آموخت. در نهایت، یاد می‌گیرید که چگونه الگوهای تاب‌آوری را پیاده‌سازی کنید، تست‌های هرج‌ومرج (Chaos Tests) را اجرا کرده و شیوه‌های پاسخ به حوادث و بهبود مستمر را به کار بگیرید. در پایان این دوره، شما مهارت‌ها و دانش مهندسی پایداری GenAI را خواهید داشت که برای حفظ ثبات سیستم‌ها تحت بار واقعی و در مواجهه با شکست‌ها ضروری است.

سرفصل ها و درس ها

مبانی پایداری عملیاتی برای سیستم‌های GenAI Production Reliability Fundamentals for GenAI Systems

  • مبانی پایداری برای معماری‌های GenAI Reliability Fundamentals for GenAI Architectures

  • تحلیل حالت‌های شکست برای سیستم‌های RAG Failure Mode Analysis for a RAG System

  • بررسی سلامت و مانیتورینگ سنتتیک برای شناسایی خطاهای نرم Health Checks and Synthetic Monitoring That Catch Soft Failures

  • دمو: پیاده‌سازی بررسی سلامت و پروب‌های سنتتیک با OpenTelemetry Demo: Implement Health Checks and Synthetic Probes with OpenTelemetry

شاخص‌های SLI، SLO و SLA برای سرویس‌های GenAI SLIs, SLOs, and SLAs for GenAI Services

  • شاخص‌های SLI حیاتی در GenAI: تأخیر، کیفیت و هزینه GenAI SLIs That Matter: Latency, Quality, and Cost

  • دمو: ابزارگذاری SLIهای GenAI با متریک‌های Prometheus در FastAPI Demo: Instrument GenAI SLIs with Prometheus Metrics in FastAPI

  • اهداف SLO، بودجه‌های خطا و ورودی‌های SLA SLO Targets, Error Budgets, and SLA Inputs

  • دمو: داشبوردهای SLO، هشدارهای نرخ سوخت و تریگرهای توقف ویژگی‌ها Demo: SLO Dashboards, Burn-rate Alerts, and Feature Freeze Triggers

مدیریت خطا و الگوهای تاب‌آوری برای GenAI Failure Handling and Resilience Patterns for GenAI

  • الگوهای تاب‌آوری برای APIهای LLM و بازیابی اطلاعات Resilience Patterns for LLM APIs and Retrieval

  • دمو: پیاده‌سازی Retries و Circuit Breakers با HTTPX Demo: Retries and Circuit Breakers with HTTPX

  • کاهش تدریجی کیفیت (Graceful Degradation) با Redis Cache و کلیدهای Idempotency Graceful Degradation with Redis Cache and Idempotency Keys

  • دمو: تست هرج‌ومرج با Toxiproxy، Redis و مکانیزم‌های جایگزین Demo: Chaos Testing with Toxiproxy, Redis, and Fallbacks

پاسخ به حوادث و تعالی عملیاتی در GenAI Incident Response and Operational Excellence for GenAI

  • چرخه حوادث و نقش‌های On-call برای سیستم‌های GenAI Incident Lifecycle and On-call Roles for GenAI Systems

  • دمو: هشداردهی و ارجاع (Escalation) با Prometheus Alertmanager Demo: Alerting and Escalation with Prometheus Alertmanager

  • بررسی حوادث با استفاده از لاگ‌ها، متریک‌ها و Traceها در Tempo Incident Investigation with Logs, Metrics, and Traces in Tempo

  • دمو: کالبدشکافی بدون مقصریابی (Blameless Postmortems)، متریک‌های MTTR و بک‌لاگ‌های پایداری Demo: Blameless Postmortems, MTTR Metrics, and Reliability Backlogs

نمایش نظرات

آموزش پایداری، SLOها و مدیریت حوادث برای سیستم‌های هوش مصنوعی مولد (GenAI)
جزییات دوره
1h 21m
16
(آخرین آپدیت)
2
از 5
دارد
دارد
دارد
Rupesh Tiwari
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Rupesh Tiwari Rupesh Tiwari

روپش یک مشاور مستقل با بیش از 12 سال تجربه در زمینه تولید نرم افزار است. Rupesh به عنوان یک معمار نرم افزار ، برنامه های وب را برای صنایع مختلف دامنه با استفاده از JavaScript ، Node ، Angular ، C # و .Net ایجاد می کند. روپش بیش از 100 توسعه دهنده نرم افزار را در کنفرانس ها و شرکت های سراسر جهان در زمینه توسعه بخش ، آزمایش ، کد تمیز ، طراحی دامنه محور ، خدمات خرد و معماری سرویس گرا آموزش داد. او در نیوجرسی زندگی می کند ، جایی که در codeproject.com وبلاگ می نویسد و به عنوانroopkt در توییتر فعال است.