لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش آپاچی آیسبرگ: از صفر تا پیادهسازی دیتالیک-هاوس در محیط عملیاتی
- آخرین آپدیت
دانلود Apache Iceberg: From Zero to Production Data Lakehouse
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
این دوره برای مهندسان داده، مهندسان تحلیل، مهندسان پلتفرم داده و معماران دادهای طراحی شده است که با دریاچههای داده (Data Lakes) کار میکنند و قصد دارند زیرساختهای دادهای خود را مدرنسازی کنند. همچنین برای مهندسان نرمافزار که در حال انتقال به نقشهای دادهای هستند و مدیران فنی که در حال ارزیابی Apache Iceberg برای سازمان خود هستند، بسیار ارزشمند است.
در پایان این دوره، شما قادر خواهید بود:
- یک Lakehouse با استفاده از Apache Iceberg را با بهرهگیری از کاتالوگها، ذخیرهسازهای Object Storage و موتورهای کوئری مانند Spark و Trino بسازید و پیکربندی کنید.
- ساختارهای بهینه جدول را با استفاده از Hidden Partitioning، ترتیبهای مرتبسازی (Sort Orders) و متریکهای ستونی برای به حداکثر رساندن عملکرد کوئریها طراحی کنید.
- دادههای موجود را از جداول Hive، فایلهای Parquet، CSV و پایگاههای داده با استفاده از روشهای Snapshot، Migrate و Reserialization به Iceberg منتقل کنید.
- گردشکارهای عملیاتی را با استفاده از متد Write-Audit-Publish برای اعتبارسنجی، Branching برای تست و Rollback برای بازیابی دادهها پیادهسازی کنید.
- طرحوارههای جدول (Schema) و مشخصات پارتیشن را بدون توقف سیستم (Downtime) یا بازنویسی دادهها تکامل ببخشید.
- عملیات نگهداری از جمله فشردهسازی فایلهای داده (Compaction)، فشردهسازی متادیتا و انقضای اسنپشاتها را اجرا کنید.
- استراتژیهای نوشتن (Merge-on-Read در مقابل Copy-on-Write) و حالتهای توزیع را متناسب با نیازهای مختلف کاری پیکربندی کنید.
- عملیات همزمان را مدیریت کرده و از تداخلات در سناریوهای چند-نویسنده (Multi-writer) جلوگیری کنید.
برای موفقیت در این دوره، باید موارد زیر را داشته باشید:
- دانش کاربردی از SQL و مفاهیم پایگاه دادههای رابطهای (جداول، طرحوارهها، کوئریها).
- درک پایه از مفاهیم مهندسی داده شامل ETL/ELT، انبار داده (Data Warehouse) و دریاچه داده (Data Lake).
- آشنایی با رابط خط فرمان (CLI) و Docker برای اجرای محیط دوره.
- توانایی خواندن و درک نمونه کدهای پایتون/PySpark (کدها ارائه شدهاند و نیازی به نوشتن از ابتدا نیست).
- تجربه کار با Apache Spark یا محاسبات توزیع شده مفید است اما الزامی نیست؛ مفاهیم اصلی در طول دوره توضیح داده میشوند.
سرفصل ها و درس ها
مبانی آپاچی آیسبرگ
Apache Iceberg Fundamentals
معرفی دوره
Course Introduction
مفهوم Open Table Format در آپاچی آیسبرگ چیست؟
What does it mean that Apache Iceberg is an Open Table Format?
مفهوم Open Lakehouse
The Open Lakehouse
مدلسازی دادهها در جداول آپاچی آیسبرگ
Modeling Data into an Apache Iceberg Table
پارتیشنبندی پنهان (Hidden Partitioning) در جداول آیسبرگ
Hidden Partitioning in Apache Iceberg Tables
جمعبندی فصل اول
Summary of Module 1
بهرهبرداری از قابلیتهای جداول آپاچی آیسبرگ
Taking Advantage of Apache Iceberg Tables
انتقال دادههای موجود به آیسبرگ
Moving existing data to Iceberg
قابلیتهای مشابه Git با استفاده از Write Audit Publish، Branching و Tagging
Git-like features with Write-Audit-Publish and Branching and Tagging
تکامل طرحواره (Schema Evolution) برای جداول آیسبرگ
Schema Evolution for Iceberg Tables
تکامل پارتیشن (Partition Evolution) برای جداول آیسبرگ
Partition Evolution for Iceberg Tables
جمعبندی فصل دوم
Summary of Module 2
مدیریت و بهینهسازی آپاچی آیسبرگ
Operating and Optimizing Apache Iceberg
وارد کردن دادهها به آپاچی آیسبرگ
Ingesting Data into Apache Iceberg
بررسی Copy on Write و Merge on Read
Copy on Write and Merge on Read
مدیریت همزمانی (Concurrency) در آپاچی آیسبرگ
Handling Concurrency in Apache Iceberg
نگهداری از جداول آیسبرگ: مفاهیم پایه
Table Maintenance for Iceberg - The Basics
نگهداری از جداول آیسبرگ: فشردهسازی و پاکسازی فایلهای رها شده
Table Maintenance for Iceberg - Compaction and Abandoned File Cleanup
نوشتن بهینه در جداول آیسبرگ
Writing efficiently to Iceberg Tables
نمایش نظرات