لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش پلیبوک Databricks: مدیریت، حاکمیت و دفاع از Lakehouse
- آخرین آپدیت
دانلود Databricks Playbook: Operate, Govern & Defend the Lakehouse
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
Delta Lake، Lakeflow، Unity Catalog، استریمینگ و FinOps — ساخت، مدیریت و دفاع از یک lakehouse عملیاتی در Databricks.
ساخت یک lakehouse کامل در محیط عملیاتی — شامل ingest، لایههای مدالیون، استریمینگ و تحلیلهای تحت حاکمیت — بر اساس یک سناریوی خردهفروشی سازمانی (SNOWMART).
تسلط بر ساختار داخلی Delta Lake: لاگ تراکنشها، سفر در زمان (Time Travel)، بردارهای حذف (Deletion Vectors)، تعامل UniForm/Iceberg و خوشهبندی مایع (Liquid Clustering).
طراحی و مدیریت ingest با Lakeflow Connect، Auto Loader و Structured Streaming با تضمین Exactly-once.
پیادهسازی هر چهار استراتژی SCD (نوع ۱، نوع ۲ با MERGE، مقیاسپذیر و انتخاب استراتژی در سطح معماری) روی جداول واقعی Delta.
حاکمیت دادهها با Unity Catalog: فضای نامها (Namespaces)، دسترسیها، Lineage، مدل ABAC، فیلترهای ردیفی و ماسکهای ستونی.
ارائه تحلیلها با Databricks SQL، داشبوردهای AI/BI و پرسوجوهای زبان طبیعی با Genie.
مدیریت پلتفرم با قابلیت مشاهده از طریق System Table، مانیتورینگ lakehouse و تحلیل هزینههای FinOps.
استقرار با نظم عملیاتی: Jobs و Workflows، Asset Bundles، Terraform و هرم تست مهندسی داده.
گسترش پلتفرم به حوزه هوش مصنوعی: جستجوی برداری (Vector Search)، سرویسدهی مدلها، خط لوله RAG و MLflow در محیط عملیاتی.
دفاع از تصمیمات معماری با استفاده از ماتریسهای تصمیمگیری قابل استفاده مجدد، شناسایی آنتی-پترنها و استدلالهای سطح مصاحبه شغلی.
ناوبری در معماری استقرار Azure Databricks: محیطهای کاری (Workspaces)، Entra ID، شبکه و Landing Zones.
عیبیابی و رفع مشکلات واقعی عملکرد: Skew، مشکلات Shuffle، پروفایلهای کوئری، Photon و اجرای تطبیقی کوئری (AQE).
پیش نیازها:
تسلط بر SQL — Joinها، Aggregationها و توابع Window پایه.
آشنایی مقدماتی با Python، ترجیحاً تجربه کار با Spark یا PySpark؛ تخصص عمیق الزامی نیست.
دسترسی به یک محیط رایگان Databricks Community/trial یا محیط شرکتی (راهنمای راهاندازی موجود است).
عدم نیاز به تجربه قبلی در Unity Catalog، Delta Lake یا استریمینگ — این دوره مفاهیم را از پایه میسازد.
تمایل به کدنویسی و تجربه خطا — هر ماژول به صورت عملی در یک محیط واقعی اجرا میشود.
اکثر دورههای Databricks تنها معرفی ویژگیها هستند — دموئی از Delta Lake در اینجا یا اسکرینشاتی از Unity Catalog در آنجا، اما هرگز سیستمی که واقعاً استقرار یافته باشد. این دوره متفاوت است: هر ماژول یک lakehouse عملیاتی به نام SNOWMART (یک پلتفرم خردهفروشی سازمانی) را میسازد و هر قطعه کد به صورت زنده در یک محیط واقعی Databricks اجرا شده است. در پایان، شما فقط با ویژگیها آشنا نمیشوید، بلکه یک پلتفرم را از ابتدا تا انتها مدیریت، حاکم و دفاع کردهاید.
شما معماری مدالیون را از پایه خواهید ساخت: لایه Bronze برای ingest با Lakeflow Connect و Auto Loader، لایه Silver برای پاکسازی و طراحی قرنطینه، و لایه Gold برای تحلیلهای تجاری که تحلیلگران واقعاً به آن اعتماد کنند — و هر چهار استراتژی SCD را روی جداول واقعی Delta پیاده خواهید کرد، نه روی اسلایدهای آموزشی. شما بر ساختار داخلی Delta Lake مسلط خواهید شد، مواردی که اکثر مهندسان تنها از طریق تجربه سخت در محیط عملیاتی میآموزند: لاگ تراکنشها، سفر در زمان، بردارهای حذف، تعامل Iceberg در UniForm و خوشهبندی مایع که حدس زدن کلیدهای پارتیشن را برای همیشه به پایان میبرد.
پلتفرم تنها به ذخیرهسازی ختم نمیشود. شما Structured Streaming را با Watermarkها، Aggregationهای Stateful و تضمین Exactly-once اجرا خواهید کرد؛ همه چیز را در Unity Catalog با فضای نامها، Lineage، ABAC، فیلترهای ردیفی و ماسکهای ستونی مدیریت میکنید؛ و تحلیلها را از طریق Databricks SQL، داشبوردهای AI/BI و Genie با پرسوجوهای زبان طبیعی ارائه میدهید. شما پلتفرم را همانطور که یک تیم واقعی مدیریت میکند، به کار میگیرید — قابلیت مشاهده با System Table، مانیتورینگ lakehouse و تحلیلهای FinOps که هزینههای خارج از کنترل را قبل از بخش مالی شناسایی میکند — و سپس همه اینها را با نظم عملیاتی استقرار میدهید: Jobs و Workflows، Asset Bundles، Terraform و هرم تست مهندسی داده.
دوره با گسترش پلتفرم به حوزه هوش مصنوعی (AI) به پایان میرسد: جستجوی برداری، سرویسدهی مدلها، یک خط لوله RAG ساخته شده بر روی دادههای SNOWMART و MLflow در محیط عملیاتی — سپس شما را با ماتریسهای تصمیمگیری، شناسایی آنتی-پترنها و استدلالهای سطح مصاحبه تجهیز میکند تا از هر تصمیم معماری خود دفاع کنید، به علاوه بررسی تخصصی معماری استقرار Azure Databricks و تلههای آزمونهای گواهینامه.
این یک دوره پیشرفته برای مهندسان داده است که مبانی Spark را میدانند و به دنبال تسلطی بر پلتفرم هستند که تفاوت بین «من یک دوره گذراندم» و «من میتوانم از این طراحی در یک جلسه بازبینی دفاع کنم» را ایجاد میکند. در پایان پروژه نهایی، شما یک lakehouse سازمانی کامل را ساخته، مدیریت و از آن دفاع کردهاید — نه اینکه صرفاً تماشایش کنید.
سرفصل ها و درس ها
خوشآمدگویی به Lakehouse: نقشه پلتفرم ۲۰۲۶
Welcome to the Lakehouse: The 2026 Platform Map
پلتفرم در یک تصویر: Lakehouse، محیطهای کاری و محل قرارگیری اجزا
The Platform in One Picture: Lakehouse, Workspaces, and Where Everything Lives
کالبدشکافی Compute: کلاسترهها، انبارهای SQL و Serverless
Compute Decoded: Clusters, SQL Warehouses, and Serverless
آشنایی با SNOWMART: پلتفرم خردهفروشی که خواهید ساخت
Meet SNOWMART: The Retail Platform You Will Build
واقعیت استقرار در Azure: محیطهای کاری، Entra ID و Landing Zones
Azure Deployment Reality: Workspaces, Entra ID, and Landing Zones
پایه و اساس Delta Lake: ACID، سفر در زمان، بردارهای حذف، UniForm
Delta Lake Foundation: ACID, Time Travel, Deletion Vectors, UniForm
چرا فایلها شکست میخورند: از هرج و مرج Data Lake تا جداول ACID
Why Files Fail: From Data-Lake Chaos to ACID Tables
لاگ دلتا: چگونه هر نوشتن به یک تراکنش تبدیل میشود
The Delta Log: How Every Write Becomes a Transaction
سفر در زمان و نسخهبندی در محیط عملیاتی
Time Travel and Versioning in Production
اجبار و تکامل Schema بدون ایجاد خرابی
Schema Enforcement and Evolution Without Breakage
بردارهای حذف و UniForm: دلتایی که با Iceberg صحبت میکند
Deletion Vectors and UniForm: Delta That Speaks Iceberg
خط لوله مدالیون: برنز، نقره، طلا
The Medallion Pipeline: Bronze, Silver, Gold
برنز: ورود دادههای خام با دقت کامل
Bronze: Raw Ingestion with Full Fidelity
نقره: پاکسازی، همسانسازی و طراحی قرنطینه
Silver: Cleansing, Conforming, and Quarantine Design
طلا: تجمیعات تجاری مورد اعتماد تحلیلگران
Gold: Business Aggregates Analysts Trust
آنتی-پترنهای مدالیون و زمان شکستن قوانین
Medallion Anti-Patterns and When to Break the Rules
کلینیک خطا: بازسازی ایمن یک لایه فاسد شده
Failure Clinic: Rebuilding a Corrupted Layer Safely
پیادهسازیهای SCD در Delta Lake
SCD Implementations on Delta Lake
SCD نوع ۱: بازنویسی با اطمینان
SCD Type 1: Overwrite with Confidence
SCD نوع ۲ با MERGE: تاریخچهای که از حسابرسیها جان سالم به در میبرد
SCD Type 2 with MERGE: History That Survives Audits
SCD در مقیاس بالا: عملکرد و ابعاد با ورود دیرهنگام
SCD at Scale: Performance and Late-Arriving Dimensions
دیدگاه معمار: انتخاب استراتژی SCD برای هر جدول
Architect's Lens: Choosing an SCD Strategy per Table
تسلط بر PySpark DataFrame برای مهندسان Databricks
PySpark DataFrame Mastery for Databricks Engineers
کار درست با DataFrames: انتخاب، فیلتر و عبارات ستونی
DataFrames Done Right: Select, Filter, and Column Expressions
Joinها و تجمیعها بدون درگیر شدن با Shuffle
Joins and Aggregations Without the Shuffle Biting You
توابع Window برای تحلیلهای واقعی
Window Functions for Real Analytics
UDFها، Pandas UDFها و زمان برتری توابع Native
UDFs, Pandas UDFs, and When Native Functions Win
مدیریت JSON و دادههای تو در تو (Nested)
Handling JSON and Nested Data
تست PySpark: تستهای واحد برای شناسایی باگهای واقعی
Testing PySpark: Unit Tests That Catch Real Bugs
ورود دادهها با Lakeflow Connect و Auto Loader
Ingestion with Lakeflow Connect and Auto Loader
ماتریس تصمیمگیری Ingestion: COPY INTO، Auto Loader و Lakeflow Connect
The Ingestion Decision Matrix: COPY INTO, Auto Loader, Lakeflow Connect
بررسی عمیق Auto Loader: استنتاج و تکامل Schema
Auto Loader Deep Dive: Schema Inference and Evolution
عملیات Auto Loader: چکپوینتها، Backfillها و دادههای نجاتیافته
Auto Loader Operations: Checkpoints, Backfills, and Rescued Data
Lakeflow Connect: کانکتورهای مدیریت شده برای دیتابیسها و SaaS
Lakeflow Connect: Managed Connectors for Databases and SaaS
فرمتهای فایل و طراحی Landing Zone
File Formats and Landing-Zone Design
نمایش نظرات