آموزش مهندسی داده Databricks با AWS - آخرین آپدیت

دانلود Databricks Data Engineering with AWS

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: یک Lakehouse عملیاتی بسازید و یک پروژه نهایی (Capstone) واقعی را با استفاده از Unity Catalog، Delta Lake، Lakeflow، DABs و CI/CD مستقر کنید. راه‌اندازی و مدیریت یک فضای کاری Databricks عملیاتی روی AWS با استفاده از Unity Catalog. تسلط بر ساختارهای داخلی Delta Lake — تراکنش‌های ACID، سفر در زمان (Time Travel)، محدودیت‌ها و بهینه‌سازی عملکرد. طراحی خط‌لوله‌های معماری مدالیون (Medallion Architecture)، ابتدا به صورت دستی و سپس به صورت deklarative با Lakeflow Declarative Pipelines. جذب داده‌ها در مقیاس بالا با Lakeflow Connect — کانکتورهای SaaS، قابلیت CDC پایگاه داده و Auto Loader. مدیریت خط‌لوله‌های عملیاتی با Lakeflow Jobs — گراف‌های جهت‌دار (DAGs)، تلاش مجدد (Retries)، جریان کنترل، REST API و CLI. ساخت یک Lakehouse کامل برای یک کسب‌وکار واقعی تجارت الکترونیک، از مرحله جذب تا پنج خروجی در لایه طلایی (Gold). نوشتن تست‌های واحد (Unit Test) و تست‌های یکپارچگی (Integration Test) برای کدهای خط‌لوله Databricks با استفاده از pytest. بسته‌بندی و استقرار خط‌لوله‌ها با استفاده از Databricks Asset Bundles (DABs). ساخت یک خط‌لوله CI/CD با GitHub Actions جهت تست، اعتبارسنجی و استقرار در محیط UAT. پیشنیازها: دانش کاربردی از Apache Spark — شامل DataFrames، تبدیلات و Spark SQL پایه. تسلط بر نوشتن Python و SQL — هر دو زبان در طول دوره و پروژه نهایی استفاده می‌شوند. یک حساب AWS (یک حساب رایگان برای شروع کافی است؛ فصل‌های بعدی و پروژه نهایی هزینه‌های اندکی برای AWS/Databricks خواهند داشت). عدم نیاز به تجربه قبلی در Databricks — این دوره مفاهیم را از پایه آموزش می‌دهد. آشنایی اولیه با Git و خط فرمان (Command Line) در ماژول‌های CI/CD و DABs کمک‌کننده است، اما الزامی نیست.

پلتفرم Databricks به انتخاب پیش‌فرض Lakehouse برای مهندسی داده در AWS تبدیل شده است — بیش از ۶۰٪ از شرکت‌های Fortune 500 از آن استفاده می‌کنند. اما شناخت ویژگی‌های پراکنده با توانایی طراحی، ساخت، تست و استقرار یک خط‌لوله عملیاتی واقعی متفاوت است. این دوره شما را با هر دو آشنا می‌کند: شما مهارت‌های اصلی Databricks و AWS را فصل به فصل یاد می‌گیرید و سپس همه آن‌ها را در یک پروژه نهایی واقع‌گرایانه به کار می‌برید — یک Lakehouse جامع برای یک کسب‌وکار واقعی که دقیقاً به روش تیم‌های عملیاتی مستقر می‌شود.

یادگیری Databricks روی AWS و ساخت یک Lakehouse عملیاتی واقعی از پایه

  • راه‌اندازی و مدیریت فضای کاری Databricks روی AWS با Unity Catalog از روز اول

  • تسلط بر Delta Lake — تراکنش‌های ACID، سفر در زمان، محدودیت‌ها و عملکرد

  • طراحی خط‌لوله‌های معماری مدالیون با Lakeflow Connect و Lakeflow Declarative Pipelines

  • مدیریت خط‌لوله‌های عملیاتی با Lakeflow Jobs — DAGهای چندوظیفه‌ای، تلاش مجدد و پارامتریک کردن

  • ساخت یک Lakehouse کامل برای یک کسب‌وکار واقعی تجارت الکترونیک — ۵ سیستم منبع و ۵ خروجی حیاتی در لایه طلایی

  • تست، بسته‌بندی و استقرار خط‌لوله‌ها با pytest، Databricks Asset Bundles و CI/CD در GitHub Actions

یک مسیر کامل از مبانی Databricks تا یک Lakehouse در سطح عملیاتی مستقر شده — ساخته شده با یادگیری گام به گام مهارت‌های واقعی.

فاز ۱ — مبانی.شما با مهارت‌های کلیدی که هر مهندس داده Databricks در AWS به آن‌ها نیاز دارد شروع خواهید کرد:

  • راه‌اندازی Workspace و حاکمیت داده با Unity Catalog

  • ساختارهای داخلی Delta Lake — تراکنش‌های ACID، سفر در زمان و محدودیت‌ها

  • معماری مدالیون، ابتدا به صورت دستی و سپس به صورت deklarative با Lakeflow Declarative Pipelines

  • جذب داده‌ها با Lakeflow Connect — SaaS، CDC پایگاه داده و Auto Loader

  • ارکستراسیون با Lakeflow Jobs — DAGها، تلاش مجدد، جریان کنترل، REST API و CLI

فاز ۲ — پروژه نهایی (Capstone).هر مهارت ذکر شده در بالا در یک پروژه مستمر به کار گرفته می‌شود: StepRight، یک خرده‌فروشی متوسط کفش آنلاین با ۵ سیستم منبع که ۵ خروجی لایه طلایی را تغذیه می‌کنند — درآمد روزانه، دید ۳۶۰ درجه مشتری، عملکرد محصول، تحلیل قیف فروش و سلامت تحویل کالا.

شما داده‌های CDC و فایل-محور را در مقیاس عملیاتی جذب خواهید کرد و سپس فراتر از اکثر دوره‌ها پیش خواهید رفت:

  • نوشتن تست‌های واحد و یکپارچگی برای منطق تبدیل داده‌ها

  • بسته‌بندی پروژه به عنوان یک Databricks Asset Bundle

  • پیاده‌سازی CI/CD در GitHub Actions — تست، اعتبارسنجی و استقرار در UAT

این دقیقاً همان گردش کاری است که تیم‌های واقعی پلتفرم داده اجرا می‌کنند — نه یک مثال ساده و آموزشی.

در پایان این دوره، شما یک Lakehouse تحت حاکمیت، تست شده و با ساختار عملیاتی را به صورت کامل و توسط خودتان ساخته و مستقر خواهید کرد.

دستاوردهای شما:

  • یک پروژه Lakehouse کامل و فعال که خودتان ساخته‌اید و می‌توانید ارائه دهید (نه فقط تماشا کرده باشید)

  • نوت‌بوک‌های کاربردی برای هر فصل، آماده برای وارد کردن در فضای کاری Databricks شما

  • ساختار کامل مخزن GitHub از پروژه نهایی، که دقیقاً نحوه سازماندهی یک پروژه عملیاتی را نشان می‌دهد

این دوره صرفاً گشتی در ویژگی‌ها نیست؛ بلکه معماری، ابزارها و انضباط استقراری است که تیم‌های واقعی پلتفرم داده اجرا می‌کنند.

سلب مسئولیت: این دوره با کمک ابزارهای هوش مصنوعی برای تحقیق محتوا، ویرایش و تولید اسلایدها توسعه یافته است. تمام محتوای فنی توسط مدرس بررسی، تست و تایید شده است.


سرفصل ها و درس ها

قبل از شروع Before you start

  • درباره دوره About the Course

  • پیش‌نیازهای دوره Course Prerequisites

  • نحوه دسترسی به مطالب و منابع دوره How to access Course Material and Resources

مقدمه Introduction

  • مقدمه‌ای بر مهندسی داده Introduction to Data Engineering

  • از Apache Spark تا پلتفرم مهندسی داده Apache Spark to Data Engineering Platform

  • مقدمه‌ای بر پلتفرم Databricks Introduction to Databricks Platform

  • معماری پلتفرم Databricks Databricks Platform Architecture

  • دسترسی به پلتفرم Databricks — رایگان در مقابل پولی Databricks Platform Access - Paid vs Free

  • ساخت حساب رایگان Databricks Creating Databricks Free Account

ثبت‌نام در پلتفرم Databricks در AWS Sign up for Databricks Platform in AWS

  • مروری بر دسترسی به پلتفرم Premium Databricks Overview of Databricks Premium Platform Access

  • ساخت حساب AWS Creating AWS Account

  • ساخت حساب کاربر IAM در AWS Creating AWS IAM User Account

  • مدیریت هزینه‌های AWS Managing your AWS Cost

  • ایجاد قرارداد سرویس Databricks در AWS Creating AWS Databricks Service Contract

  • ساخت فضای کاری Serverless Databricks در AWS Creating AWS Databricks Serverless Workspace

  • ساخت فضای کاری Classic Databricks در AWS Creating AWS Databricks Classic Workspace

  • حذف و پاک‌سازی فضای کاری Databricks Delete and Cleanup Databricks Workspace

کار با فضای کاری Databricks Working in Databricks Workspace

  • مقدمه‌ای بر فضای کاری Databricks Introduction to Databricks Workspace

  • مقدمه‌ای بر نوت‌بوک‌های Databricks Introduction to Databricks Notebooks

  • دستورات Magic در نوت‌بوک Notebook Magic Commands

  • ابزارها و ویجت‌های Databricks Databricks Utilities and Widgets

  • نحوه عیب‌یابی نوت‌بوک‌ها How to Debug Notebooks

  • فایل‌های Workspace در مقابل پوشه‌های Git Workspace Files vs Git Folders

  • کلاستر محاسباتی Databricks Databricks Compute Cluster

  • سنجش دانش Check Your Knowledge

بررسی عمیق Delta Lake Delta Lake — Deep Dive

  • Delta Lake چیست و چرا اهمیت دارد What is Delta Lake and why it matters

  • ساخت و مدیریت جداول Delta Creating and Managing Delta tables

  • خواندن و نوشتن Delta — دسته‌ای و جریانی (Streaming) Reading and writing Delta — batch and streaming

  • سفر در زمان — کوئری گرفتن از نسخه‌های تاریخی Time Travel — querying historical versions

  • دستورات OPTIMIZE، VACUUM و نگهداری داده‌ها OPTIMIZE, VACUUM and Data Retention

  • استراتژی‌های RESTORE و بازگشت (Rollback) RESTORE and Rollback Strategies

  • دستور MERGE INTO — موتور Upsert در Delta MERGE INTO — the Delta Upsert Engine

  • دستورات DELETE، UPDATE و نوشتن‌های Idempotent DELETE, UPDATE and Idempotent writes

  • اجبار به طرحواره (Schema Enforcement) و تکامل طرحواره (Schema Evolution) Schema Enforcement and Schema Evolution

  • گسترش نوع داده (Type Widening) و نوع داده Variant Type Widening and the Variant Data Type

  • محدودیت‌های جدول — NOT NULL، CHECK و ستون‌های Identity Table constraints — NOT NULL, CHECK, and Identity Columns

  • سنجش دانش Check Your Knowledge

Unity Catalog — حاکمیت داده از روز اول Unity Catalog — Governance from day one

  • چرا Unity Catalog — معماری Why Unity Catalog — Architecture

  • پیاده‌سازی معماری Unity Catalog Implementing Unity Catalog Architecture

  • کاتالوگ‌ها، مکان‌های خارجی و اعتبارنامه‌های ذخیره‌سازی Catalogs, External Locations and Storage Credentials

  • هویت در Unity Catalog — کاربران، گروه‌ها و Service Principals Identity in Unity Catalog — Users, Groups, and Service Principals

  • پیاده‌سازی کاربران، گروه‌ها و کنترل دسترسی Implementing Users, Groups, and Access Control

  • مدل مجوزهای Unity Catalog — GRANT Unity Catalog Permissions Model - GRANT

  • پیاده‌سازی مجوزهای Unity Catalog برای کاتالوگ و طرحواره Implementing Unity Catalog Permission for Catalog and Schema

  • مجوزهای Unity Catalog برای جداول و Volumeها Unity Catalog Permissions for Tables and Volumns

  • سنجش دانش Check Your Knowledge

معماری مدالیون — طراحی و پیاده‌سازی Medallion Architecture — Design and Implementation

  • معماری مدالیون چیست What is Medallion Architecture

  • طراحی لایه برنزی (Bronze) Designing the Bronze Layer

  • طراحی لایه نقره‌ای (Silver) Designing the Silver Layer

  • طراحی لایه طلایی (Gold) Designing the Gold Layer

  • بررسی معماری و تصمیمات طراحی Architecture Review and Design Decisions

  • سنجش دانش Check Your Knowledge

Lakeflow Connect — ستون جذب داده‌ها Lakeflow Connect — Ingestion Pillar

  • Lakeflow Connect چیست — ستون جذب داده‌ها What is Lakeflow Connect — The Ingestion Pillar

  • جذب داده‌ها به لایه برنزی از یک اپلیکیشن SaaS Ingesting Data to Bronze Layer from a SaaS Application

  • جذب افزایشی از پایگاه داده با استفاده از کانکتور مبتنی بر کوئری Incremental Ingestion from Database Using Query Based Connector

  • جذب افزایشی CDC از پایگاه داده با استفاده از کانکتور مدیریت شده Incremental CDC from Database Using Managed Connector

  • جذب فایل-محور با Auto Loader File-Based Ingestion with Auto Loader

  • جذب افزایشی، تکامل طرحواره و رکوردهای معیوب در محیط عملیاتی Incremental Ingestion, Schema Evolution and Bad Records in Production

  • انتخاب ابزار جذب مناسب Choosing the Right Ingestion Tool

  • سنجش دانش Check Your Knowledge

Lakeflow Spark Declarative Pipelines — ستون تبدیل داده‌ها Lakeflow Spark Declarative Pipelines — Transformation Pillar

  • Lakeflow SDP چیست — چرا جایگزین خط‌لوله‌های دستی می‌شود What is Lakeflow SDP — Why it Replaces Manual Pipelines

  • مفاهیم اصلی — خط‌لوله‌ها، جریان‌ها، مقاصد و API پایتون Core concepts — Pipelines, Flows, Destinations, and the Python API

  • API مربوط به SDP — انواع جریان‌ها، انواع مقاصد و سینتکس SDP API — Flow types, Destination Types, and Syntax

  • ساخت لایه برنزی — Auto Loader به عنوان جدول جریانی Building the Bronze layer — Auto Loader as a Streaming Table

  • ساخت لایه نقره‌ای — AUTO CDC و SCD نوع ۲ Building the Silver layer — AUTO CDC and SCD Type 2

  • ساخت لایه طلایی — نماهای متجمیع (Materialized Views) و به‌روزرسانی افزایشی Building the Gold layer — Materialized Views and Incremental Refresh

  • تصمیمات طراحی SDP و الگوهای عملیاتی SDP Design Decisions and Production Patterns

  • سنجش دانش Check Your Knowledge

Lakeflow Jobs — ستون ارکستراسیون Lakeflow Jobs — The Orchestration Pillar

  • Lakeflow Jobs چیست و جایگاه آن کجاست What is Lakeflow Jobs — and where it fits

  • اولین Job شما — تسک خط‌لوله، زمان‌بندی و تنظیمات سطح Job Your first job — pipeline task, schedule, and job-level config

  • پارامتریک کردن Jobها — ارسال پارامتر به تسک نوت‌بوک Parameterizing jobs — Passing Parameters to Notebook Task

  • ارسال پارامتر به تسک اسکریپت پایتون، مقدار تسک و Repair Runs Passing Parameters to Python Script Task, Task Value, Repair Runs

  • DAGهای چندوظیفه‌ای — جریان کنترل، تلاش مجدد و Backfill Multi-task DAGs — Control Flow, Retries, and Backfill

  • اتوماسیون Jobها — REST API و Databricks CLI Automating Jobs — REST API and Databricks CLI

  • تصمیمات طراحی Job و الگوهای عملیاتی Jobs Design Decisions and Production Patterns

  • سنجش دانش Check Your Knowledge

پروژه StepRight — زیربنای پروژه StepRight - Project Foundation

  • ما چه می‌سازیم — بررسی معماری StepRight What are we building-StepRight Architecture Walkthrough

  • ساختار پروژه — برنامه‌ریزی ساختار اولیه پروژه Project Structure - Planning the Initial Project Structure

  • راه‌اندازی محیط — مخزن، کاتالوگ، طرحواره و Volume Environment Setup - Repo, Catalog, Schema, and Volume

  • استراتژی داده‌های تست — برنامه‌ریزی آماده‌سازی داده‌های تست Test Data Strategy - Planning your Test Data Preparation

  • تغذیه پروژه — نوت‌بوک تولیدکننده و بارگذار داده‌ها Seed the Project - Data Generator and Loader Notebook

  • دانلود سورس کد پروژه Download Project Source Code

پروژه StepRight — لایه جذب (Ingestion) StepRight - Ingestion Layer

  • برنامه‌ریزی و طراحی خط‌لوله برنزی برای منابع CDC Planning and Designing Bronze Pipeline for CDC Sources

  • توسعه خط‌لوله برنزی برای منابع CDC Developing Bronze Pipeline for CDC Sources

  • برنامه‌ریزی و طراحی خط‌لوله برنزی برای منابع فایل Planning and Designing Bronze Pipeline for File Sources

  • توسعه خط‌لوله SDP برنزی برای منابع فایل Developing Bronze SDP Pipeline for File Sources

  • طراحی نظارت بر کیفیت داده‌های منبع در لایه برنزی Design Source Data Quality Monitoring in Bronze Layer

  • توسعه الگوی قرنطینه (Quarantine) در لایه برنزی Developing Quarantine Pattern in Bronze Layer

پروژه StepRight — لایه‌های تبدیل (Transformation) StepRight - Transformation Layers

  • طراحی قوانین و رویکرد کیفیت داده‌های لایه نقره‌ای Design the Silver Layer Data Quality Rules and Approach

  • برنامه‌ریزی و طراحی خط‌لوله نقره‌ای برای منابع CDC Planning and Designing Silver Pipeline for CDC Sources

  • توسعه خط‌لوله نقره‌ای برای منابع AUTO CDC Developing Silver Pipeline for AUTO CDC Sources

  • برنامه‌ریزی و طراحی خط‌لوله نقره‌ای برای منابع فایل Planning and Designing Silver Pipeline for File Sources

  • توسعه خط‌لوله SDP نقره‌ای برای منابع فایل Developing Silver SDP Pipeline for File Sources

پروژه StepRight — گزارش‌دهی و تحلیل لایه طلایی StepRight - Gold Layer Reporting and Analysis

  • محاسبه درآمد بر اساس روز، دسته‌بندی و منطقه Revenue Computation by Day, Category, Region

  • دید ۳۶۰ درجه مشتری برای بازاریابی Customer 360 for Marketing

  • عملکرد محصول و سرعت فروش برای مدیریت موجودی Product Performance and Sales Velocity for Merchandising

  • تحلیل قیف کلیک‌استریم برای تیم‌های رشد Clickstream Funnel Analysis for Growth Teams

  • تحلیل تحویل محصول و سلامت عملیات برای بخش عملیات Product Delivery and Fulfilment Health for Operations

پروژه StepRight — ارکستراسیون و زمان‌بندی وظایف StepRight - Orchestration and Job Scheduling

  • طراحی ارکستراسیون و جریان Job Design the Orchestration and Job Flow

  • پیاده‌سازی بررسی سلامت و کیفیت داده‌های خط‌لوله Job Job Pipeline Data Quality and Health Check Implementation

  • گزارش کیفیت و سلامت داده‌ها در لاگ‌های Job Job Data Quality and Health Reporting in the Job Logs

  • ساخت Job ارکستراسیون Creating the Orchestration Job

پروژه StepRight — تست‌های واحد (Unit Testing) StepRight - Unit Testing

  • طراحی استراتژی تست برای پروژه Design Test Strategy for the Project

  • بازنویسی (Refactoring) کد و آماده‌سازی برای تست واحد Refactoring Your Code and Getting Ready for Unit Testing

  • طراحی و توسعه موارد تست واحد (Unit Test Cases) Designing and Developing Unit Test Cases

  • کدنویسی و اجرای تمامی تست‌های واحد Code and Run all Unit Test Case

پروژه StepRight — نظارت بر کیفیت داده‌ها StepRight - Data Quality Monitoring

  • طراحی الزامات نظارت بر کیفیت داده‌ها Design Your Data Quality Monitoring Requirements

  • راه‌اندازی لاگ‌های رویداد خط‌لوله برای نظارت بر انتظارات (Expectations) Setup Pipeline Event Logs for Expectations Monitoring

  • آماده‌سازی کوئری‌های کیفیت داده برای انتظارات، قرنطینه و داده‌های یتیم Prepare DQ Queries for Expectations, Quarantine and Orphans

  • ساخت داشبورد نظارت بر کیفیت داده‌ها Creating Data Quality Monitoring Dashboard

  • راه‌اندازی نظارت و هشدار بلادرنگ کیفیت داده‌ها Setup a Real Time Data Quality Monitoring and Alert

پروژه StepRight — تست یکپارچگی، بسته‌بندی و استقرار StepRight - Integration Testing, Packaging and Deployment

  • بسته‌بندی پروژه با استفاده از Declarative Automation Bundle Package your project using Declarative Automation Bundle

  • تعریف منابع Automation Bundle و تنظیم Job Define your Automation Bundle Resources and Setup Job

  • تست بسته استقرار در محیط توسعه (Dev) Test Your Deployment Bundle in Dev Environment

  • برنامه‌ریزی و طراحی رویکرد تست یکپارچگی Planning and Designing Integration Testing Approach

  • توسعه تست یکپارچگی برای محیط UAT Developing your Integration Test for the UAT

  • توسعه و اجرای خط‌لوله CI/CD برای استقرار و تست یکپارچگی Develop and Trigger Your CI/CD Pipeline for Deployment and Integration Testing

  • مرحله نهایی — استقرار در محیط عملیاتی و تست دود (Smoke Testing) پروژه Final Stage - Production Deployment and Smoke Testing Your Project

نمایش نظرات

آموزش مهندسی داده Databricks با AWS
جزییات دوره
28.5 hours
111
(آخرین آپدیت)
387
4.9 از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Prashant Kumar Pandey Prashant Kumar Pandey

معمار ، نویسنده ، مشاور ، مربی @ Learning JournalPrashant Kumar Pandey علاقه زیادی به کمک به مردم برای یادگیری و رشد در زندگی حرفه ای خود دارد و از بین بردن شکاف بین مهارت های موجود و مورد نیاز آنها است. وی در تلاش برای تحقق این مأموریت ، نویسندگی کتاب ، انتشار مقالات فنی و ایجاد فیلم های آموزشی برای کمک به متخصصان و دانشجویان فناوری اطلاعات در صنعت است. وی با بیش از 18 سال تجربه در IT به عنوان توسعه دهنده ، معمار ، مشاور ، مربی و مربی ، با سازمان های بین المللی خدمات نرم افزار در پروژه های مختلف داده محوری و Bigdata کار کرده است. Prashant اعتقاد راسخ به یادگیری مستمر مادام العمر و رشد مهارت دارد. وی برای محبوبیت بخشیدن به یادگیری مادام العمر مادام العمر ، شروع به انتشار فیلم های آموزشی رایگان در کانال YouTube خود کرد و ایده ایجاد ژورنال یادگیری خود را تحت عنوان Learning Journal مفهوم سازی کرد. وی بنیانگذار ، نویسنده اصلی و سردبیر اصلی پورتال Learning Journal است که دوره های مختلف مهارت آموزی ، آموزش و مقالات فنی را از ابتدای سال 2018 ارائه می دهد.