لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش دوره جامع مهندسی قابلیت اطمینان سایت (SRE)
- آخرین آپدیت
دانلود Foundations of Site Reliability Engineering Training
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
این دوره پیشرفته مهندسی قابلیت اطمینان سایت (SRE)، تخصص لازم برای طراحی، مدیریت و مقیاسبندی سیستمهای ابری با قابلیت اطمینان بالا را با استفاده از متدهای مدرن SRE و DevOps ایجاد میکند. در این دوره شما با مفاهیمی همچون SLI، SLO، SLA، بودجه خطا (Error Budgets)، مشاهدهپذیری (Observability)، مدیریت حوادث، سیستمهای هشدار، تحلیل علت ریشهای (RCA)، خط لوله CI/CD، مهندسی هرجومرج (Chaos Engineering)، زیرساخت به عنوان کد (IaC) و تست عملکرد از طریق آزمایشگاههای عملی و دموهای واقعی با ابزارهایی نظیر Prometheus، Grafana، Jenkins، Docker، Kubernetes و Ansible آشنا خواهید شد. این دوره به شما میآموزد چگونه کارهای تکراری (Toil) را کاهش داده، عملیات را اتوماتیک کنید، تابآوری سیستم را بهبود بخشید و سیستمهای آماده تولید را در مقیاس بالا نگهداری کنید.
در پایان این دوره، شما قادر خواهید بود:
- پیادهسازی معیارهای قابلیت اطمینان: تعریف SLI، SLO، SLA و مدیریت بودجههای خطا
- ساخت سیستمهای مشاهدهپذیری: پیکربندی Prometheus، Grafana و سیستمهای هشدار پیشرفته
- اتوماسیون پاسخ به حوادث: بهکارگیری RCA، بررسیهای پس از حادثه (بدون سرزنش) و کاهش کارهای تکراری
- طراحی استقرار تابآور: استفاده از استراتژیهای Blue-Green، Canary و خط لولههای CI/CD
- اجرای مهندسی هرجومرج: تست تابآوری سیستم در محیطهای Kubernetes
- بهینهسازی عملکرد در مقیاس بالا: اجرای تستهای فشار و بهبود قابلیت اطمینان
این دوره برای مهندسان DevOps، متخصصان ابری، متقاضیان SRE، مدیران سیستم و فعالان حوزه IT ایدهآل است.
آشنایی با مهندسی قابلیت اطمینان سایت (SRE)
Introduction to Site Reliability Engineering (SRE)
مفاهیم اصلی در SRE
Core Concepts in SRE
دمو: ایجاد یک نمونه EC2
Demo: Creating an EC2 Instance
دمو: ایجاد SLI، SLO و SLA برای یک سرویس نمونه
Demo: Creating SLIs, SLOs, and SLAs for a Sample Service
درک بودجه خطا: مفاهیم و مزایا
Understanding Error Budgets: Concepts and Benefits
بهکارگیری بودجه خطا: مثالها و متدهای پیشرفته
Applying Error Budgets: Examples and Advanced Practices
بودجه خطا و مشاهدهپذیری
Error Budgets & Observability
دمو: محاسبه و شبیهسازی بودجه خطا
Demo: Calculating and Simulating Error Budget
مانیتورینگ و مشاهدهپذیری
Monitoring and Observability
بررسی خستگی ناشی از هشدارها (Alert Fatigue)
Overview of Alert Fatigue
همبستگی دادههای مشاهدهپذیری
Correlating Observability Data
هوش مصنوعی و یادگیری ماشین در مشاهدهپذیری
AI/ML in Observability
دمو: راهاندازی Prometheus و Grafana برای مانیتورینگ - بخش اول
Demo: Setting up Prometheus and Grafana for Monitoring - Part 1
دمو: راهاندازی Prometheus و Grafana برای مانیتورینگ - بخش دوم
Demo: Setting up Prometheus and Grafana for Monitoring - Part 2
مدیریت حوادث و کاهش کارهای تکراری
Incident Management & Toil Reduction
مدیریت حوادث
Incident Management
بررسی پس از حادثه بدون سرزنش (Blameless Postmortem)
Blameless Postmortem
مرور کلی و انواع ارتباطات در زمان حادثه
Overview and Types of Incident Communication
معیارها و اتوماسیون در پاسخ به حوادث
Metrics and Automation in Incident Response
دمو: پیادهسازی مدیریت حوادث با Prometheus - بخش اول
Demo: Implementing Incident Management with Prometheus - Part 1
دمو: پیادهسازی مدیریت حوادث با Prometheus - بخش دوم
Demo: Implementing Incident Management with Prometheus - Part 2
کاهش کارهای تکراری (Toil Reduction)
Toil Reduction
دمو: کاهش کارهای تکراری با بازیابی خودکار سرویس با اسکریپت شل - بخش اول
Demo: Implementing Toil Reduction with Automated Service Recovery Using Shell Script - Part 1
دمو: کاهش کارهای تکراری با بازیابی خودکار سرویس با اسکریپت شل - بخش دوم
Demo: Implementing Toil Reduction with Automated Service Recovery Using Shell Script - Part 2
فرهنگ SRE
SRE Culture
نکات کلیدی
Key Takeaways
مهندسی قابلیت اطمینان و استقرار
Reliability Engineering & Deployments
اهداف یادگیری
Learning Objectives
مقدمهای بر مهندسی قابلیت اطمینان
Introduction to Reliability Engineering
استراتژیهای استقرار در مهندسی قابلیت اطمینان
Deployment Strategies in Reliability Engineering
دمو: پیادهسازی SRE با استقرار Blue-Green و Canary
Demo: Implementing Site Reliability Engineering (SRE) with Blue-Green and Canary Deployment
مقدمهای بر اتوماسیون SRE
Introduction to SRE Automation
زیرساخت به عنوان کد (IaC): مفاهیم، مزایا، ابزارها و بهترین متدها
Infrastructure as Code (IaC): Concepts, Benefits, Tools, and Best Practices
مدیریت پیکربندی در SRE: مفاهیم، متدها و مزایا
Configuration Management in SRE: Concepts, Practices, and Benefits
اتوماسیون SRE: حوزهها و انواع کلیدی
SRE Automation: Key Areas and Types
اتوماسیون SRE: خط لولهها، مانیتورینگ، مقیاسبندی و پاسخ به حوادث
SRE Automation: Pipelines, Monitoring, Scaling, and Incident Response
دمو: اتوماتیک کردن SRE با Ansible و HTTPS Nginx
Demo: Automating SRE with Ansible and HTTPS Nginx
هشداردهی، اتوماسیون و RCA
Alerting, Automation & RCA
اصول هشداردهی صحیح
Principles of Good Alerting
مدیریت خستگی هشدارها: هشدارهای عملیاتی و چارچوب اولویتبندی
Managing Alert Fatigue: Actionable Alerts and Prioritization Framework
ابزارهای رایج هشداردهی
Common Alerting Tools
طراحی هشدارهای موثر: هشداردهی چندسطحی و مبتنی بر SLO
Designing Effective Alerts: Multi-Level and SLO-Based Alerting
دمو: مانیتورینگ نمونه EC2 و استراتژی هشدار با Prometheus، Node Exporter و Alertmanager - بخش اول
Demo: Monitoring EC2 Instance and Alerting Strategy with Prometheus, Node Exporter, and Alertmanager - Part 1
دمو: مانیتورینگ نمونه EC2 و استراتژی هشدار با Prometheus، Node Exporter و Alertmanager - بخش دوم
Demo: Monitoring EC2 Instance and Alerting Strategy with Prometheus, Node Exporter, and Alertmanager - Part 2
پاسخ به حوادث: فرآیند، مسیرهای تصاعدی و نقش فرمانده حادثه
Incident Response: Process, Escalation Paths, and the Incident Commander Role
تحلیل علت ریشهای (RCA) و اهمیت آن در SRE
Root Cause Analysis (RCA) and Its Importance in SRE
تحلیل علت ریشهای در SRE: تکنیکها و پیادهسازی
Root Cause Analysis in SRE: Techniques and Implementation
بررسیهای موثر پس از حادثه: متدهای بدون سرزنش و بهبود مستمر
Effective Postmortems: Blameless Practices and Continuous Improvement
دمو: راهاندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش اول
Demo: Setting Up System Monitoring, Incident Alerts, and Response with Prometheus and Alertmanager - Part 1
دمو: راهاندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش دوم
Demo: Setting Up System Monitoring, Incident Alerts, and Response with Prometheus and Alertmanager - Part 2
دمو: راهاندازی مانیتورینگ سیستم، هشدارهای حادثه و پاسخ با Prometheus و Alertmanager - بخش سوم
Demo: Setting Up System Monitoring Incident Alerts and Response with Prometheus and Alertmanager - Part 3
قابلیت اطمینان در SRE
SRE Reliability
مدیریت قابلیت اطمینان با بودجه خطا
Managing Reliability with Error Budgets
اندازهگیری و بهبود قابلیت اطمینان
Measuring and Improving Reliability
نکات کلیدی
Key Takeaways
CI/CD و مهندسی هرجومرج
CI/CD & Chaos Engineering
اهداف یادگیری
Learning Objectives
مبانی CI/CD برای SRE
CI/CD Fundamentals for SRE
عملیاتی کردن CI/CD برای تیمهای SRE
Operationalizing CI/CD for SRE Teams
ابزارها و اتوماسیون CI/CD برای تیمهای SRE
CI/CD Tooling and Automation for SRE Teams
دمو: راهاندازی خط لوله CI/CD با Jenkins و Docker - بخش اول
Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 1
دمو: راهاندازی خط لوله CI/CD با Jenkins و Docker - بخش دوم
Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 2
دمو: راهاندازی خط لوله CI/CD با Jenkins و Docker - بخش سوم
Demo: Setting up CI/CD Pipeline with Jenkins and Docker - Part 3
دمو: تست فشار چندکاربره با هرجومرج - بخش اول
Demo: Multi-User Load Testing with Chaos - Part 1
دمو: تست فشار چندکاربره با هرجومرج - بخش دوم
Demo: Multi-User Load Testing with Chaos - Part 2
مبانی SRE: اصول اصلی و متدهای پشتیبان
SRE Fundamentals: Core Principles and Supporting Practices
پیادهسازی SRE: جریان کاری، ساختار تیم، ابزارها و معیارها
Implementing SRE: Workflow, Team Structure, Tools, and Metrics
پیادهسازی بودجه خطا و ایجاد فرهنگ یادگیری
Implementing Error Budgets and Building a Learning Culture
مورد کاربرد: رویکرد یکپارچه SRE
Use Case: Integrated SRE approach
پیادهسازی SRE: چالشها، استراتژیها و روندهای آینده
SRE Implementation: Challenges, Strategies, and Future Trends
دمو: پیادهسازی تشخیص ریاستارت کانتینر و هشداردهی با Docker - بخش اول
Demo: Implementing Container Restart Detection and Alerting with Docker - Part 1
دمو: پیادهسازی تشخیص ریاستارت کانتینر و هشداردهی با Docker - بخش دوم
Demo: Implementing Container Restart Detection and Alerting with Docker - Part 2
نمایش نظرات