لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش Apache Iceberg: از مشخصات فنی تا پیادهسازی Lakehouse چند موتور
- آخرین آپدیت
دانلود Apache Iceberg: Multi-Engine Lakehouse, Spec to Production
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
در این دوره، بر مشخصات (Spec) آیسبرگ، تمامی کاتالوگها، همه موتورهای پردازشی و نظم لازم برای اجرای یک Lakehouse واقعی با چندین موتور مسلط شوید.
مشخصات Iceberg شامل manifestها، snapshotها، فایل metadata.json و پروتکل commit را به عنوان یک مدل ذهنی کاربردی یاد بگیرید.
با استفاده از ماتریس Decision Spine، کاتالوگ مناسب (Polaris, Unity OSS, Nessie, Glue, HMS) را انتخاب کرده و دلیل انتخاب خود را تحلیل کنید.
یک Lakehouse مدل مدالین (Medallion) کامل را روی Iceberg با استفاده از Kafka CDC، عملیات Spark MERGE و خوانندههای چند موتوره پیادهسازی کنید.
نگهداری محیط عملیاتی (Production) شامل عملیات compaction، حذف snapshotهای قدیمی (expire-snapshots)، پاکسازی فایلهای یتیم (orphan-cleanup) و بازنویسی manifestها را با تحلیل هزینههای واقعی اجرا کنید.
الگوهای WAP، شاخهبندی (Branching)، تگگذاری (Tagging) و بازگشت زمانی (Time-travel rollback) را به گونهای پیاده کنید که مورد تایید حسابرسان و مهندسان SRE باشد.
انبار دادههای Hive، Delta یا Parquet خام را با استفاده از استراتژیهای مناسب به Iceberg منتقل کنید.
چهار مورد از رایجترین خطاهای Iceberg را با استفاده از یک دستورالعمل (Playbook) ۱۰ مرحلهای عیبیابی کنید.
از معیار ارزیابی ۸ بعدی معماران داده (Spec, Catalog, Writes, Reads, Maintenance, Security, Cost, Troubleshooting) عبور کنید.
پیش نیازها: تسلط بر SQL و مفاهیم اصلی مهندسی داده (تجربه ساخت یا نگهداری خط لولههای داده/ETL).
آشنایی با حداقل یکی از موتورهای پرسوجو یا پردازش (مانند Spark, Trino, Snowflake یا موارد مشابه) کمککننده است اما الزامی نیست.
آشنایی ابتدایی با ذخیرهسازهای ابری (S3/ADLS/GCS)؛ برای دنبال کردن دوره نیازی به حساب کاربری یا نصب خاصی نیست.
Apache Iceberg برنده جنگ فرمتهای جدول شد. حالا نوبت شماست که آن را در محیط عملیاتی اجرا کنید.
بسیاری از آموزشها فقط یک دستور CREATE TABLE را نشان میدهند و آن را Lakehouse مینامند. این دوره شما را تا انتها همراهی میکند: از جزئیات داخلی مشخصات فنی و هر کاتالوگ اصلی گرفته تا تمامی موتورهای خواندن و نوشتن و نظم عملیاتی که یک پروژه آزمایشی آخر هفته را از پلتفرمی که ۲۰۰ مهندس به آن وابسته هستند، متمایز میکند.
در طول ۲۳ ماژول و ۱۱۶ درس (حدود ۱۲.۵ ساعت)، شما مسیر «سارا» را دنبال میکنید — مدیر پلتفرم دادهای که ذخیرهسازی مشترک Iceberg را در سه قاره مدیریت میکند — و تصمیماتی را میگیرید که به زودی در دنیای واقعی با آنها روبرو خواهید شد. شما مشخصات فنی را به عنوان یک مدل ذهنی یاد میگیرید و سپس با یک ماتریس تصمیمگیری واقعی (Decision Spine)، کاتالوگهای Polaris، Unity OSS، Nessie، Glue و Hive Metastore را مقایسه کرده و بهترین گزینه را انتخاب میکنید.
سپس یک Lakehouse مدل مدالین کامل میسازید: لایه برنز با Kafka CDC، لایه سیلور با Spark MERGE و الگوی Write-Audit-Publish، و لایه گلد با خوانندههای چند موتوره (Trino, Snowflake, DuckDB). شما عملیات نگهداری را که هیچکس آموزش نمیدهد — مانند compaction و پاکسازی فایلها — با اعداد واقعی هزینهها اجرا میکنید و در الگوهای شاخهبندی و بازگشت زمانی که مورد تایید SREهاست، استاد میشوید.
چه چیزی این دوره را متفاوت میکند؟
از مشخصات فنی تا عملیات واقعی، نه فقط Hello-World. شما در پایان قادر خواهید بود Iceberg را تحت فشار واقعی مدیریت کنید، نه فقط ساخت یک جدول ساده.
اول تصمیمگیری، بعد اجرا. یک ماتریس تصمیمگیری ۶ نسخهای (فرمت، کاتالوگ، هزینه ذخیرهسازی، هزینه موتور، مهاجرت و معیار ۸ بعدی) به شما چارچوبی مستدل میدهد، نه تبلیغات فروشندگان.
واقعاً چند موتوره. Spark, Flink, Kafka Connect, Trino, Snowflake, DuckDB — یک ذخیرهساز، چندین موتور؛ دقیقاً همان روشی که Lakehouseهای واقعی ساخته میشوند.
داستانهای واقعی + دستورالعمل عیبیابی ۱۰ مرحلهای برای چهار خطای بحرانی که هر تیم Iceberg در نهایت با آنها مواجه میشود.
شما یاد خواهید گرفت که:
مشخصات Iceberg (manifests, snapshots, metadata.json, commit protocol) را به عنوان یک مدل ذهنی درک کنید.
کاتالوگ مناسب را با ماتریس Decision Spine انتخاب و تحلیل کنید.
یک Lakehouse مدالین با Kafka CDC، Spark MERGE و خواندن چند موتوره را راهاندازی کنید.
نگهداری محیط عملیاتی را با تحلیل دقیق هزینهها مدیریت کنید.
الگوهای WAP، Branching، Tagging و Time-travel را پیاده کنید.
محیطهای Hive، Delta یا Parquet را با استراتژی درست به Iceberg منتقل کنید.
رایجترین خطاهای Iceberg را با یک Playbook ۱۰ مرحلهای تشخیص دهید.
مدرس دوره
این دوره توسط Snowbrix Academy تهیه و توسط Amit تدریس شده است — متخصص دارای گواهینامههای SnowPro Core و دو گواهینامه Databricks که شغلش ساخت پلتفرمهای داده عملیاتی است. هر الگوی ارائه شده در این دوره، قابل دفاع در محیطهای کاری واقعی است.
اگر مهندس دادهای هستید که میخواهید مالکیت Lakehouse را به دست بگیرید — یعنی از دنبال کردن آموزشهای ساده دست بردارید و شروع به معماری و مدیریت آن کنید — این دوره برای شماست.
سرفصل ها و درس ها
بیداری در دنیای Lakehouse
The Lakehouse Wakeup Call
بحران دوشنبه صبح در Lakehouse
The Monday Morning Lakehouse Crisis
چرا Hive Metastore به محدودیتهای خود رسید
Why Hive Metastore Hit Its Limits
خاصیت ACID روی ذخیرهسازهای Object — مسئله دشوار
ACID on Object Storage — The Hard Problem
معنای واقعی Open Lakehouse چیست
What Open Lakehouse Actually Means
ماتریس تصمیمگیری v1 — چه زمانی Iceberg مناسب است
Decision Spine v1 — When Iceberg Fits
چرا Iceberg پیروز شد؟ تحلیل صادقانه جنگ فرمتها
Why Iceberg Won, Format Wars Honest
داستان پیدایش Iceberg (نتفلیکس، ۲۰۱۷)
Iceberg's Origin Story (Netflix, 2017)
جنگ فرمتها: Iceberg در مقابل Delta و Hudi
Format Wars: Iceberg vs Delta vs Hudi
نقاط چرخش سالهای ۲۰۲۴ تا ۲۰۲۶
The 2024-2026 Inflection Points
حکمرانی Apache در مقابل انشعابات تجاری (Vendor Forking)
Apache Governance vs Vendor Forking
مرور ماژول و پل ارتباطی به جزئیات فنی
Module Recap and Bridge to Spec Internals
مشخصات Iceberg بخش اول — ساختار فایلها
Iceberg Spec Pt 1 — File Layout
کالبدشکافی یک جدول Iceberg
Anatomy of an Iceberg Table
فایلهای داده — انتخاب بین Parquet, ORC, Avro
Data Files — Parquet, ORC, Avro Choices
بررسی عمیق فایلهای Manifest
Manifest Files Deep Dive
لیستهای Manifest و اسنپشاتها
Manifest Lists and Snapshots
آزمایشگاه — بررسی یک جدول واقعی Iceberg روی دیسک
Lab — Inspect a Real Iceberg Table on Disk
مشخصات Iceberg بخش دوم — اشارهگر کاتالوگ
Iceberg Spec Pt 2 — The Catalog Pointer
فایل metadata.json — منبع حقیقت
metadata.json — The Source of Truth
کامیتهای اتمیک از طریق کاتالوگ
Atomic Commits via Catalog
مشخصات v1 در مقابل v2 — چه تغییراتی رخ داد
v1 vs v2 Spec — What Changed
آزمایشگاه — ردیابی یک کامیت از Spark تا S3
Lab — Trace a Commit from Spark to S3
تکامل طرحواره (Schema) و پارتیشنبندی
Schema and Partition Evolution
تکامل طرحواره — افزودن، حذف و تغییر نام ایمن
Schema Evolution — Add, Drop, Rename Safely
پارتیشنبندی مخفی در مقابل پارتیشنبندی Hive
Hidden Partitioning vs Hive Partitioning
تکامل پارتیشن — تغییر بدون بازنویسی مجدد
Partition Evolution — Change Without Rewrite
ترتیب مرتبسازی و تاثیرات آن
Sort Orders and Their Impact
آزمایشگاه — تکامل طرحواره و ساختار پارتیشن
Lab — Evolve a Schema and Partition Layout
بررسی عمیق REST Catalog
REST Catalog Deep Dive
چرا REST Catalog آینده است
Why REST Catalog Is the Future
بررسی نقاط انتهایی (Endpoints) در REST API
REST API Endpoints Walkthrough
عملیات هویت، فضای نام (Namespace) و جدول
Identity, Namespace, Table Ops
احراز هویت — OAuth و AWS Sigv4
Authentication — OAuth and AWS Sigv4
آزمایشگاه — راهاندازی سرور REST Catalog
Lab — Spin Up a REST Catalog Server
مقایسه پنج کاتالوگ برتر
Catalog Big Five Comparison
نمایش نظرات