آموزش پایپ‌لاین‌های داده لیک‌هوس (Lakehouse) با Spark و dbt - آخرین آپدیت

دانلود Lakehouse Data Pipelines with Spark and dbt

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: در این دوره، تخصص عملی در مهندسی داده‌های دسته‌ای (Batch Data Engineering) مدرن را با استفاده از Apache Spark، PySpark، dbt Core، Apache Airflow، Apache Iceberg، MinIO، PostgreSQL و SQL کسب کنید. شما خواهید آموخت که مهندسان داده چگونه مجموعه‌داده‌های بزرگ را پردازش می‌کنند، مدل‌های تبدیل داده بازیافت‌پذیر می‌سازند، جریان‌های کاری وابسته را مدیریت (Orchestrate) می‌کنند و داده‌های تحلیلی را با استفاده از فناوری‌های متن‌باز لیک‌هوس مدیریت می‌نمایند. شما با بررسی مفاهیم بنیادی پردازش توزیع‌شده و معماری Apache Spark شروع خواهید کرد و مواردی نظیر درایورها، اگزکیوتورها، جاب‌ها، استیج‌ها، تسک‌ها، ارزیابی تنبل (Lazy Evaluation)، پارتیشن‌ها، شافل‌ها و برنامه‌های اجرا را بررسی می‌کنید. از طریق دموهای هدایت‌شده، PySpark را به صورت محلی نصب کرده، مجموعه‌داده‌های CSV، JSON و Parquet را می‌خوانید، اسکیم‌ها را تعریف می‌کنید، دیتا‌فریم‌ها را تغییر می‌دهید و داده‌ها را با استفاده از Spark SQL تحلیل می‌کنید. سپس وارد بخش مهندسی تبدیل با dbt Core می‌شوید که در آن رویکردهای ETL و ELT، مدل‌سازی لایه‌ای، دانه‌بندی مدل (Model Grain) و تبدیل‌های SQL بازیافت‌پذیر را بررسی خواهید کرد. با استفاده از dbt Core و PostgreSQL، مدل‌های Staging و Intermediate را ساخته، جداول Fact و Dimension را ایجاد کرده، تست‌ها را اعمال می‌کنید، مستندات تولید می‌کنید، Lineage را بررسی کرده و با استراتژی‌های Materialization، قراردادهای تبدیل و مدیریت تغییرات کار می‌کنید. در نهایت، نحوه هماهنگ‌سازی جریان‌های کاری دسته‌ای را با استفاده از Apache Airflow و مدیریت داده‌های لیک‌هوس با MinIO و Apache Iceberg خواهید آموخت. شما با DAGها، تسک‌ها، زمان‌بندی‌ها، وابستگی‌ها، تلاش‌های مجدد (Retries)، مانیتورینگ، Backfills و Catchup کار خواهید کرد. همچنین فضای ذخیره‌سازی Object Storage، فرمت Parquet، جداول Iceberg، اسنپ‌شات‌ها، تکامل اسکیم (Schema Evolution)، فشرده‌سازی (Compaction) و مدیریت فایل‌های کوچک را بررسی می‌کنید. دوره با یک پروژه جامع پایپ‌لاین لیک‌هوس دسته‌ای به پایان می‌رسد که پردازش توزیع‌شده، تبدیل، ارکستراسیون و ذخیره‌سازی لیک‌هوس را با هم ترکیب می‌کند. در پایان این دوره، شما قادر خواهید بود: - مفاهیم بنیادی پردازش توزیع‌شده و معماری Apache Spark را توضیح دهید. - مجموعه‌داده‌های CSV، JSON و Parquet را با استفاده از PySpark DataFrames پردازش کنید. - داده‌ها را با استفاده از PySpark و Spark SQL تبدیل، پاک‌سازی، تجمیع و تحلیل کنید. - مفاهیم پارتیشن‌ها، شافل‌ها، برنامه‌های اجرا، کشینگ و محاسبه مجدد را تفسیر کنید. - نقش ETL، ELT و مهندسی تحلیلی را در جریان‌های کاری مدرن داده‌ها توضیح دهید. - مدل‌های تبدیل لایه‌ای را با استفاده از dbt Core بسازید. - مدل‌های Staging، Intermediate، Fact، Dimension و Mart ایجاد کنید. - تست‌ها، مستندات، Lineage، Materialization و قراردادهای تبدیل dbt را پیاده‌سازی کنید. - جریان‌های کاری دسته‌ای را با استفاده از Apache Airflow مدیریت کنید. - زمان‌بندی‌ها، وابستگی‌ها، Retries، Backfills، Catchup و مانیتورینگ را مدیریت نمایید. - جداول Apache Iceberg را روی MinIO ایجاد کرده و با آن‌ها کار کنید. - مفاهیم اسنپ‌شات، تکامل اسکیم، Compaction و مدیریت فایل‌های کوچک را درک کنید. - یک پایپ‌لاین لیک‌هوس دسته‌ای جامع و ارکستره شده را با استفاده از فناوری‌های متن‌باز بسازید. این دوره برای مهندسان داده، علاقه‌مندان به مهندسی داده، مهندسان تحلیلی، توسعه‌دهندگان نرم‌افزار، تحلیلگران داده و متخصصان پایگاه داده طراحی شده است و شما را برای ساخت پایپ‌لاین‌های داده‌ای مقیاس‌پذیر، قابل نگهداری و قابل اعتماد آماده می‌کند.

سرفصل ها و درس ها

پردازش توزیع‌شده با PySpark Distributed Processing with PySpark

  • معرفی تخصص Specialization Introduction

  • معرفی دوره Course Introduction

  • مبانی پردازش توزیع‌شده داده‌ها Distributed Data Processing Fundamentals

  • معماری Apache Spark و جریان اجرا Apache Spark Architecture and Execution Flow

  • راه‌اندازی PySpark به صورت محلی Setting Up PySpark Locally

  • خواندن فایل‌های CSV، JSON و Parquet با PySpark Reading CSV, JSON, and Parquet with PySpark

  • تبدیل داده‌ها با PySpark DataFrames Transforming Data with PySpark DataFrames

  • تحلیل داده‌ها با Spark SQL Analysing Data with Spark SQL

  • پارتیشن‌ها، شافل‌ها و برنامه‌های اجرا Partitions, Shuffles, and Execution Plans

مهندسی تبدیل با dbt Transformation Engineering with dbt

  • مفاهیم ETL، ELT و مهندسی تحلیلی ETL, ELT, and Analytics Engineering

  • مدل‌سازی لایه‌ای با dbt Core Layered Modelling with dbt Core

  • راه‌اندازی dbt Core با PostgreSQL Setting Up dbt Core with PostgreSQL

  • ساخت مدل‌های Staging و Intermediate Building Staging and Intermediate Models

  • ایجاد مدل‌های Fact و Dimension Creating Fact and Dimension Models

  • تست و مستندسازی مدل‌های dbt Testing and Documenting dbt Models

ارکستراسیون و مبانی لیک‌هوس Orchestration and Lakehouse Foundations

  • Apache Airflow و ارکستراسیون جریان کاری Apache Airflow and Workflow Orchestration

  • مبانی لیک‌هوس متن‌باز با Iceberg Open Lakehouse Foundations with Iceberg

  • اجرای Apache Airflow با Docker Compose Running Apache Airflow with Docker Compose

  • ساخت یک DAG در Airflow برای جریان کاری دسته‌ای Building an Airflow DAG for a Batch Workflow

  • ایجاد جدول Apache Iceberg روی MinIO Creating an Apache Iceberg Table on MinIO

  • ساخت یک پایپ‌لاین لیک‌هوس دسته‌ای ارکستره شده Building an Orchestrated Batch Lakehouse Pipeline

  • جمع‌بندی دوره Course Summary

نمایش نظرات

آموزش پایپ‌لاین‌های داده لیک‌هوس (Lakehouse) با Spark و dbt
جزییات دوره
5h 19m
22
(آخرین آپدیت)
13
- از 5
دارد
دارد
دارد
Chris Croft
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Chris Croft Chris Croft

مربی مدیریت، سخنران، نویسنده