لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش مبانی مهندسی داده و اسپارک برای هوش مصنوعی و یادگیری ماشین
- آخرین آپدیت
دانلود Data Engineering and Spark Foundations for AI and ML
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
این دوره یک پایه قوی در مهندسی داده مدرن با استفاده از Databricks، Apache Spark و معماری Lakehouse ایجاد میکند. شما خواهید آموخت که مهندسان داده چگونه دادهها را برای پشتیبانی از تحلیلها، هوش مصنوعی و جریانهای کاری یادگیری ماشین، طراحی، پردازش، سازماندهی و وارد میکنند.
شما با بررسی نقش مهندسی داده در سازمانهای مدرن، تفاوت آن با علوم داده و دلیل ضروری بودن خط لولههای داده (Data Pipelines) قابل اعتماد برای موفقیت AI/ML شروع خواهید کرد. سپس با Databricks، محیط فضای کاری، نوتبوکها و قابلیتهای اصلی این پلتفرم آشنا میشوید.
در ادامه، برای پردازش دادهها در مقیاس بزرگ با Apache Spark و PySpark کار خواهید کرد. شما DataFrames، تبدیلها (Transformations)، طرحوارهها (Schemas)، فرمتهای فایل پشتیبانی شده و جریانهای کاری عملی برای خواندن، تغییر و نوشتن دادهها در فرمتهایی مانند CSV، JSON و Parquet را بررسی میکنید.
همچنین مفاهیم مدرن ذخیرهسازی، از جمله دریاچههای داده (Data Lakes)، انبارهای داده (Data Warehouses) و معماری Lakehouse را بررسی خواهید کرد. از طریق Databricks، یاد میگیرید که چگونه دادهها را با استفاده از کاتالوگها، طرحوارهها و Volumeها سازماندهی کنید و درک کنید که مدیریت دادههای ساختاریافته چگونه از جریانهای مهندسی مقیاسپذیر پشتیبانی میکند.
در پایان این دوره، شما قادر خواهید بود:
- مفاهیم اصلی مهندسی داده و نقش Databricks را توضیح دهید.
- معماری Lakehouse و الگوهای مدرن ذخیرهسازی داده را توصیف کنید.
- دادهها را با استفاده از Apache Spark و PySpark پردازش و تبدیل کنید.
- دادههای پروژه را با استفاده از کاتالوگها، طرحوارهها و Volumeها سازماندهی کنید.
- دادهها را از طریق جریانهای کاری دستهای (Batch)، مبتنی بر API و بلادرنگ (Real-time) وارد کنید.
این دوره که برای مهندسان داده آینده، تحلیلگران داده، توسعهدهندگان نرمافزار و دانشجویانی که وارد حوزه داده میشوند طراحی شده است، شما را آماده میکند تا یک بنیاد فنی قوی برای توسعه پیشرفته Databricks، Delta Lake و خط لولههای AI/ML بسازید.
سرفصل ها و درس ها
مقدمهای بر مهندسی داده و دیتابریکس
Introduction to Data Engineering and Databricks
معرفی تخصص
Specialization Introduction
معرفی دوره
Course Introduction
مقدمهای بر مهندسی داده
Introduction to Data Engineering
نقش مهندسی داده در خط لولههای AI/ML
Role of Data Engineering in AI/ML Pipelines
بررسی چرخه عمر مهندسی داده
Exploring Data Engineering Lifecycle
جریانهای زیرین چرخه عمر مهندسی داده
Undercurrents of the Data Engineering Lifecycle
آشنایی با دیتابریکس
Introduction to Databricks
کاوش در پلتفرم دیتابریکس
Exploring the Databricks Platform
ساخت اولین نوتبوک در دیتابریکس
Building First Notebook in Databricks
دریاچه داده در مقابل انبار داده: مفاهیم بنیادی
Data Lake vs Data Warehouse: Foundational Concepts
معماری Lakehouse در سیستمهای داده مدرن
Lakehouse Architecture in Modern Data Systems
بررسی ساختار Lakehouse در دیتابریکس
Exploring the Lakehouse Structure in Databricks
پردازش دادهها با آپاچی اسپارک و پایاسپارک
Data Processing with Apache Spark and PySpark
آپاچی اسپارک: موتور پردازش دادههای بزرگ
Apache Spark: Engine Behind Big Data Processing
مفاهیم اجرا و APIهای هسته اسپارک
Spark Core APIs and Execution Concepts
دیتافریمهای PySpark و عملیاتهای اصلی
PySpark DataFrames and Core Operations
فرمتهای داده پشتیبانی شده در اسپارک
Supported Data Formats in Spark
استفاده از مجموعهدادههای داخلی در دیتابریکس
Using Built-in Datasets in Databricks
خواندن فایلهای CSV و JSON در اسپارک
Reading CSV and JSON in Spark
نوشتن دادههای تغییر یافته در فرمت Parquet
Writing Transformed Data in Parquet Format
سازماندهی و وارد کردن دادهها در دیتابریکس
Organizing and Ingesting Data in the Databricks
تکامل ذخیرهسازی در دیتابریکس
Evolution of Storage in Databricks
کار با کاتالوگها، طرحوارهها و Volumeها
Working with Catalogs, Schemas, and Volumes
سازماندهی فایلهای پروژه در Unity Catalog Volumes
Organizing Project Files in Unity Catalog Volumes
مقدمهای بر وارد کردن دادهها (Data Ingestion)
Introduction to Data Ingestion
سیستمهای منبع داده در خط لولههای مدرن
Data Source Systems in Modern Pipelines
بررسی گزینههای وارد کردن داده در دیتابریکس
Exploring Data Ingestion Options in Databricks
وارد کردن دادهها از یک API عمومی REST
Ingesting Data from a Public REST API
شبیهسازی وارد کردن دستهای (Batch) در دیتابریکس
Simulating Batch Ingestion in Databricks
وارد کردن بلادرنگ دادهها در دیتابریکس
Real-Time Ingestion in Databricks
نمایش نظرات