مشکل زیرساخت شبکه و افت سرعت کاملاً برطرف شده است. در حال حاضر فعالسازی و آمادهسازی دورهها در حال انجام است. از صبر و شکیبایی شما سپاسگزاریم.
لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش پایپلاینهای داده لیکهوس (Lakehouse) با Spark و dbt
- آخرین آپدیت
دانلود Lakehouse Data Pipelines with Spark and dbt
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
در این دوره، تخصص عملی در مهندسی دادههای دستهای (Batch Data Engineering) مدرن را با استفاده از Apache Spark، PySpark، dbt Core، Apache Airflow، Apache Iceberg، MinIO، PostgreSQL و SQL کسب کنید. شما خواهید آموخت که مهندسان داده چگونه مجموعهدادههای بزرگ را پردازش میکنند، مدلهای تبدیل داده بازیافتپذیر میسازند، جریانهای کاری وابسته را مدیریت (Orchestrate) میکنند و دادههای تحلیلی را با استفاده از فناوریهای متنباز لیکهوس مدیریت مینمایند.
شما با بررسی مفاهیم بنیادی پردازش توزیعشده و معماری Apache Spark شروع خواهید کرد و مواردی نظیر درایورها، اگزکیوتورها، جابها، استیجها، تسکها، ارزیابی تنبل (Lazy Evaluation)، پارتیشنها، شافلها و برنامههای اجرا را بررسی میکنید. از طریق دموهای هدایتشده، PySpark را به صورت محلی نصب کرده، مجموعهدادههای CSV، JSON و Parquet را میخوانید، اسکیمها را تعریف میکنید، دیتافریمها را تغییر میدهید و دادهها را با استفاده از Spark SQL تحلیل میکنید.
سپس وارد بخش مهندسی تبدیل با dbt Core میشوید که در آن رویکردهای ETL و ELT، مدلسازی لایهای، دانهبندی مدل (Model Grain) و تبدیلهای SQL بازیافتپذیر را بررسی خواهید کرد. با استفاده از dbt Core و PostgreSQL، مدلهای Staging و Intermediate را ساخته، جداول Fact و Dimension را ایجاد کرده، تستها را اعمال میکنید، مستندات تولید میکنید، Lineage را بررسی کرده و با استراتژیهای Materialization، قراردادهای تبدیل و مدیریت تغییرات کار میکنید.
در نهایت، نحوه هماهنگسازی جریانهای کاری دستهای را با استفاده از Apache Airflow و مدیریت دادههای لیکهوس با MinIO و Apache Iceberg خواهید آموخت. شما با DAGها، تسکها، زمانبندیها، وابستگیها، تلاشهای مجدد (Retries)، مانیتورینگ، Backfills و Catchup کار خواهید کرد. همچنین فضای ذخیرهسازی Object Storage، فرمت Parquet، جداول Iceberg، اسنپشاتها، تکامل اسکیم (Schema Evolution)، فشردهسازی (Compaction) و مدیریت فایلهای کوچک را بررسی میکنید. دوره با یک پروژه جامع پایپلاین لیکهوس دستهای به پایان میرسد که پردازش توزیعشده، تبدیل، ارکستراسیون و ذخیرهسازی لیکهوس را با هم ترکیب میکند.
در پایان این دوره، شما قادر خواهید بود:
- مفاهیم بنیادی پردازش توزیعشده و معماری Apache Spark را توضیح دهید.
- مجموعهدادههای CSV، JSON و Parquet را با استفاده از PySpark DataFrames پردازش کنید.
- دادهها را با استفاده از PySpark و Spark SQL تبدیل، پاکسازی، تجمیع و تحلیل کنید.
- مفاهیم پارتیشنها، شافلها، برنامههای اجرا، کشینگ و محاسبه مجدد را تفسیر کنید.
- نقش ETL، ELT و مهندسی تحلیلی را در جریانهای کاری مدرن دادهها توضیح دهید.
- مدلهای تبدیل لایهای را با استفاده از dbt Core بسازید.
- مدلهای Staging، Intermediate، Fact، Dimension و Mart ایجاد کنید.
- تستها، مستندات، Lineage، Materialization و قراردادهای تبدیل dbt را پیادهسازی کنید.
- جریانهای کاری دستهای را با استفاده از Apache Airflow مدیریت کنید.
- زمانبندیها، وابستگیها، Retries، Backfills، Catchup و مانیتورینگ را مدیریت نمایید.
- جداول Apache Iceberg را روی MinIO ایجاد کرده و با آنها کار کنید.
- مفاهیم اسنپشات، تکامل اسکیم، Compaction و مدیریت فایلهای کوچک را درک کنید.
- یک پایپلاین لیکهوس دستهای جامع و ارکستره شده را با استفاده از فناوریهای متنباز بسازید.
این دوره برای مهندسان داده، علاقهمندان به مهندسی داده، مهندسان تحلیلی، توسعهدهندگان نرمافزار، تحلیلگران داده و متخصصان پایگاه داده طراحی شده است و شما را برای ساخت پایپلاینهای دادهای مقیاسپذیر، قابل نگهداری و قابل اعتماد آماده میکند.
سرفصل ها و درس ها
پردازش توزیعشده با PySpark
Distributed Processing with PySpark
معرفی تخصص
Specialization Introduction
معرفی دوره
Course Introduction
مبانی پردازش توزیعشده دادهها
Distributed Data Processing Fundamentals
معماری Apache Spark و جریان اجرا
Apache Spark Architecture and Execution Flow
راهاندازی PySpark به صورت محلی
Setting Up PySpark Locally
خواندن فایلهای CSV، JSON و Parquet با PySpark
Reading CSV, JSON, and Parquet with PySpark
تبدیل دادهها با PySpark DataFrames
Transforming Data with PySpark DataFrames
تحلیل دادهها با Spark SQL
Analysing Data with Spark SQL
پارتیشنها، شافلها و برنامههای اجرا
Partitions, Shuffles, and Execution Plans
مهندسی تبدیل با dbt
Transformation Engineering with dbt
مفاهیم ETL، ELT و مهندسی تحلیلی
ETL, ELT, and Analytics Engineering
مدلسازی لایهای با dbt Core
Layered Modelling with dbt Core
راهاندازی dbt Core با PostgreSQL
Setting Up dbt Core with PostgreSQL
ساخت مدلهای Staging و Intermediate
Building Staging and Intermediate Models
ایجاد مدلهای Fact و Dimension
Creating Fact and Dimension Models
تست و مستندسازی مدلهای dbt
Testing and Documenting dbt Models
ارکستراسیون و مبانی لیکهوس
Orchestration and Lakehouse Foundations
Apache Airflow و ارکستراسیون جریان کاری
Apache Airflow and Workflow Orchestration
مبانی لیکهوس متنباز با Iceberg
Open Lakehouse Foundations with Iceberg
اجرای Apache Airflow با Docker Compose
Running Apache Airflow with Docker Compose
ساخت یک DAG در Airflow برای جریان کاری دستهای
Building an Airflow DAG for a Batch Workflow
ایجاد جدول Apache Iceberg روی MinIO
Creating an Apache Iceberg Table on MinIO
ساخت یک پایپلاین لیکهوس دستهای ارکستره شده
Building an Orchestrated Batch Lakehouse Pipeline
نمایش نظرات