آموزش دوره جامع مهندسی قابلیت اطمینان سایت (SRE) - آخرین آپدیت

دانلود Foundations of Site Reliability Engineering Training

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: این دوره پیشرفته مهندسی قابلیت اطمینان سایت (SRE)، تخصص لازم برای طراحی، مدیریت و مقیاس‌بندی سیستم‌های ابری با قابلیت اطمینان بالا را با استفاده از متدهای مدرن SRE و DevOps ایجاد می‌کند. در این دوره شما با مفاهیمی همچون SLI، SLO، SLA، بودجه خطا (Error Budgets)، مشاهده‌پذیری (Observability)، مدیریت حوادث، سیستم‌های هشدار، تحلیل علت ریشه‌ای (RCA)، خط لوله CI/CD، مهندسی هرج‌ومرج (Chaos Engineering)، زیرساخت به عنوان کد (IaC) و تست عملکرد از طریق آزمایشگاه‌های عملی و دموهای واقعی با ابزارهایی نظیر Prometheus، Grafana، Jenkins، Docker، Kubernetes و Ansible آشنا خواهید شد. این دوره به شما می‌آموزد چگونه کارهای تکراری (Toil) را کاهش داده، عملیات را اتوماتیک کنید، تاب‌آوری سیستم را بهبود بخشید و سیستم‌های آماده تولید را در مقیاس بالا نگهداری کنید. در پایان این دوره، شما قادر خواهید بود: - پیاده‌سازی معیارهای قابلیت اطمینان: تعریف SLI، SLO، SLA و مدیریت بودجه‌های خطا - ساخت سیستم‌های مشاهده‌پذیری: پیکربندی Prometheus، Grafana و سیستم‌های هشدار پیشرفته - اتوماسیون پاسخ به حوادث: به‌کارگیری RCA، بررسی‌های پس از حادثه (بدون سرزنش) و کاهش کارهای تکراری - طراحی استقرار تاب‌آور: استفاده از استراتژی‌های Blue-Green، Canary و خط لوله‌های CI/CD - اجرای مهندسی هرج‌ومرج: تست تاب‌آوری سیستم در محیط‌های Kubernetes - بهینه‌سازی عملکرد در مقیاس بالا: اجرای تست‌های فشار و بهبود قابلیت اطمینان این دوره برای مهندسان DevOps، متخصصان ابری، متقاضیان SRE، مدیران سیستم و فعالان حوزه IT ایده‌آل است.

سرفصل ها و درس ها

مبانی SRE SRE Foundations

  • مقدمه دوره: مهندسی قابلیت اطمینان سایت (SRE) Course Introduction: Site Reliability Engineering (SRE)

  • اهداف یادگیری Learning Objectives

  • آشنایی با مهندسی قابلیت اطمینان سایت (SRE) Introduction to Site Reliability Engineering (SRE)

  • مفاهیم اصلی در SRE Core Concepts in SRE

  • دمو: ایجاد یک نمونه EC2 Demo: Creating an EC2 Instance

  • دمو: ایجاد SLI، SLO و SLA برای یک سرویس نمونه Demo: Creating SLIs, SLOs, and SLAs for a Sample Service

  • درک بودجه خطا: مفاهیم و مزایا Understanding Error Budgets: Concepts and Benefits

  • به‌کارگیری بودجه خطا: مثال‌ها و متدهای پیشرفته Applying Error Budgets: Examples and Advanced Practices

بودجه خطا و مشاهده‌پذیری Error Budgets & Observability

  • دمو: محاسبه و شبیه‌سازی بودجه خطا Demo: Calculating and Simulating Error Budget

  • مانیتورینگ و مشاهده‌پذیری Monitoring and Observability​

  • بررسی خستگی ناشی از هشدارها (Alert Fatigue) Overview of Alert Fatigue

  • همبستگی داده‌های مشاهده‌پذیری Correlating Observability Data

  • هوش مصنوعی و یادگیری ماشین در مشاهده‌پذیری AI/ML in Observability

  • دمو: راه‌اندازی Prometheus و Grafana برای مانیتورینگ - بخش اول Demo: Setting up Prometheus and Grafana for Monitoring - Part 1

  • دمو: راه‌اندازی Prometheus و Grafana برای مانیتورینگ - بخش دوم Demo: Setting up Prometheus and Grafana for Monitoring - Part 2

مدیریت حوادث و کاهش کارهای تکراری Incident Management & Toil Reduction

  • مدیریت حوادث Incident Management

  • بررسی پس از حادثه بدون سرزنش (Blameless Postmortem) Blameless Postmortem

  • مرور کلی و انواع ارتباطات در زمان حادثه Overview and Types of Incident Communication

  • معیارها و اتوماسیون در پاسخ به حوادث Metrics and Automation in Incident Response

  • دمو: پیاده‌سازی مدیریت حوادث با Prometheus - بخش اول Demo: Implementing Incident Management with Prometheus - Part 1

  • دمو: پیاده‌سازی مدیریت حوادث با Prometheus - بخش دوم Demo: Implementing Incident Management with Prometheus - Part 2

  • کاهش کارهای تکراری (Toil Reduction) Toil Reduction

  • دمو: کاهش کارهای تکراری با بازیابی خودکار سرویس با اسکریپت شل - بخش اول Demo: Implementing Toil Reduction with Automated Service Recovery Using Shell Script - Part 1

  • دمو: کاهش کارهای تکراری با بازیابی خودکار سرویس با اسکریپت شل - بخش دوم Demo: Implementing Toil Reduction with Automated Service Recovery Using Shell Script - Part 2

  • فرهنگ SRE SRE Culture

  • نکات کلیدی Key Takeaways

مهندسی قابلیت اطمینان و استقرار Reliability Engineering & Deployments

  • اهداف یادگیری Learning Objectives

  • مقدمه‌ای بر مهندسی قابلیت اطمینان Introduction to Reliability Engineering

  • استراتژی‌های استقرار در مهندسی قابلیت اطمینان Deployment Strategies in Reliability Engineering

  • دمو: پیاده‌سازی SRE با استقرار Blue-Green و Canary Demo: Implementing Site Reliability Engineering (SRE) with Blue-Green and Canary Deployment

  • مقدمه‌ای بر اتوماسیون SRE Introduction to SRE Automation

  • زیرساخت به عنوان کد (IaC): مفاهیم، مزایا، ابزارها و بهترین متدها Infrastructure as Code (IaC): Concepts, Benefits, Tools, and Best Practices

  • مدیریت پیکربندی در SRE: مفاهیم، متدها و مزایا Configuration Management in SRE: Concepts, Practices, and Benefits

  • اتوماسیون SRE: حوزه‌ها و انواع کلیدی SRE Automation: Key Areas and Types

  • اتوماسیون SRE: خط لوله‌ها، مانیتورینگ، مقیاس‌بندی و پاسخ به حوادث SRE Automation: Pipelines, Monitoring, Scaling, and Incident Response

  • دمو: اتوماتیک کردن SRE با Ansible و HTTPS Nginx Demo: Automating SRE with Ansible and HTTPS Nginx

هشداردهی، اتوماسیون و RCA Alerting, Automation & RCA

  • اصول هشداردهی صحیح Principles of Good Alerting

  • مدیریت خستگی هشدارها: هشدارهای عملیاتی و چارچوب اولویت‌بندی Managing Alert Fatigue: Actionable Alerts and Prioritization Framework

  • ابزارهای رایج هشداردهی Common Alerting Tools

  • طراحی هشدارهای موثر: هشداردهی چندسطحی و مبتنی بر SLO Designing Effective Alerts: Multi-Level and SLO-Based Alerting

  • دمو: مانیتورینگ نمونه EC2 و استراتژی هشدار با Prometheus، Node Exporter و Alertmanager - بخش اول Demo: Monitoring EC2 Instance and Alerting Strategy with Prometheus, Node Exporter, and Alertmanager - Part 1

  • دمو: مانیتورینگ نمونه EC2 و استراتژی هشدار با Prometheus، Node Exporter و Alertmanager - بخش دوم Demo: Monitoring EC2 Instance and Alerting Strategy with Prometheus, Node Exporter, and Alertmanager - Part 2

  • پاسخ به حوادث: فرآیند، مسیرهای تصاعدی و نقش فرمانده حادثه Incident Response: Process, Escalation Paths, and the Incident Commander Role

  • تحلیل علت ریشه‌ای (RCA) و اهمیت آن در SRE Root Cause Analysis (RCA) and Its Importance in SRE

  • تحلیل علت ریشه‌ای در SRE: تکنیک‌ها و پیاده‌سازی Root Cause Analysis in SRE: Techniques and Implementation

  • بررسی‌های موثر پس از حادثه: متدهای بدون سرزنش و بهبود مستمر Effective Postmortems: Blameless Practices and Continuous Improvement

  • دمو: راه‌اندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش اول Demo: Setting Up System Monitoring, Incident Alerts, and Response with Prometheus and Alertmanager - Part 1

  • دمو: راه‌اندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش دوم Demo: Setting Up System Monitoring, Incident Alerts, and Response with Prometheus and Alertmanager - Part 2

  • دمو: راه‌اندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش سوم Demo: Setting Up System Monitoring Incident Alerts and Response with Prometheus and Alertmanager - Part 3

  • قابلیت اطمینان در SRE SRE Reliability

  • مدیریت قابلیت اطمینان با بودجه خطا Managing Reliability with Error Budgets

  • اندازه‌گیری و بهبود قابلیت اطمینان Measuring and Improving Reliability

  • نکات کلیدی Key Takeaways

CI/CD و مهندسی هرج‌ومرج CI/CD & Chaos Engineering

  • اهداف یادگیری Learning Objectives

  • مبانی CI/CD برای SRE CI/CD Fundamentals for SRE

  • عملیاتی کردن CI/CD برای تیم‌های SRE Operationalizing CI/CD for SRE Teams

  • ابزارها و اتوماسیون CI/CD برای تیم‌های SRE CI/CD Tooling and Automation for SRE Teams

  • دمو: راه‌اندازی خط لوله CI/CD با Jenkins و Docker - بخش اول Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 1

  • دمو: راه‌اندازی خط لوله CI/CD با Jenkins و Docker - بخش دوم Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 2

  • دمو: راه‌اندازی خط لوله CI/CD با Jenkins و Docker - بخش سوم Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 3

  • مبانی مهندسی هرج‌ومرج (Chaos Engineering) Choas Engineering Fundamentals

  • متدهای مهندسی هرج‌ومرج Chaos Engineering Practices

  • مهندسی هرج‌ومرج در Kubernetes و موارد کاربرد Chaos Engineering in Kubernetes and Use Cases

  • دمو: پیاده‌سازی مهندسی هرج‌ومرج با Pumba - بخش اول Demo: Implementing Chaos Engineering with Pumba​ - Part 1

  • دمو: پیاده‌سازی مهندسی هرج‌ومرج با Pumba - بخش دوم Demo: Implementing Chaos Engineering with Pumba​ - Part 2

تست عملکرد و SRE پیشرفته Performance Testing & Advanced SRE

  • مقدمه‌ای بر تست عملکرد Introduction to Performance Testing

  • پروفایل‌های فشار واقع‌گرایانه Realistic Load Profiles

  • تست عملکرد در CI/CD Performance Testing in CI/CD

  • دمو: تست فشار چندکاربره با هرج‌ومرج - بخش اول Demo: Multi-User Load Testing with Chaos - Part 1

  • دمو: تست فشار چندکاربره با هرج‌ومرج - بخش دوم Demo: Multi-User Load Testing with Chaos - Part 2

  • مبانی SRE: اصول اصلی و متدهای پشتیبان SRE Fundamentals: Core Principles and Supporting Practices

  • پیاده‌سازی SRE: جریان کاری، ساختار تیم، ابزارها و معیارها Implementing SRE: Workflow, Team Structure, Tools, and Metrics

  • پیاده‌سازی بودجه خطا و ایجاد فرهنگ یادگیری Implementing Error Budgets and Building a Learning Culture

  • مورد کاربرد: رویکرد یکپارچه SRE Use Case: Integrated SRE approach

  • پیاده‌سازی SRE: چالش‌ها، استراتژی‌ها و روندهای آینده SRE Implementation: Challenges, Strategies, and Future Trends

  • دمو: پیاده‌سازی تشخیص ری‌استارت کانتینر و هشداردهی با Docker - بخش اول Demo: Implementing Container Restart Detection and Alerting with Docker - Part 1

  • دمو: پیاده‌سازی تشخیص ری‌استارت کانتینر و هشداردهی با Docker - بخش دوم Demo: Implementing Container Restart Detection and Alerting with Docker - Part 2

  • نکات کلیدی Key Takeaways

نمایش نظرات

آموزش دوره جامع مهندسی قابلیت اطمینان سایت (SRE)
جزییات دوره
22h 22m
78
(آخرین آپدیت)
212
- از 5
دارد
دارد
دارد
Chris Croft
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Chris Croft Chris Croft

مربی مدیریت، سخنران، نویسنده