داده‌های آموزشی بازتولیدپذیر و خط لوله‌های داده آماده برای یادگیری ماشین - آخرین آپدیت

دانلود Reproducible Training Data and ML-Ready Data Pipelines

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: این دوره به زبان‌آموزان می‌آموزد که چگونه خط لوله‌های داده‌های آموزشی بازتولیدپذیر، ایمن در برابر نشت داده (Leakage) و مطابق با استانداردهای حاکمیتی را برای سیستم‌های یادگیری ماشین و هوش مصنوعی طراحی کنند. در این دوره، مفاهیمی چون نسخه‌بندی مجموعه داده‌ها، ساخت‌های قطعی (Deterministic Builds)، خط لوله‌های ویژگی و برچسب، صحت زمانی (Point-in-time correctness)، اعتبارسنجی برش‌ها، نظارت بر رانش داده‌ها (Drift Monitoring) و گیت‌های انتشار مبتنی بر CI بررسی می‌شوند. این دوره با مجموعه داده‌های آموزشی به عنوان محصولات داده‌ای مدیریت‌شده برخورد می‌کند که دارای مالک، معیارهای آمادگی، انتظارات کیفی و الزامات بازتولیدپذیری هستند. در پایان این دوره، فراگیران قادر خواهند بود نسخه‌های بازتولیدپذیر از مجموعه داده‌ها تولید کنند، ریسک‌های نشت زمانی و هدف را شناسایی نمایند، جریان‌های کاری ویژگی و برچسب را طراحی کنند، تغییرات را در نسخه‌های مختلف ردیابی کرده و گیت‌های انتشار را برای بررسی‌های طرحواره (Schema)، توزیع، برش، سوگیری و بازتولیدپذیری اعمال کنند. تمرکز اصلی بر ایجاد خط لوله‌های داده‌ای است که از نظر عملیاتی قابل اعتماد بوده و تیم‌ها بتوانند در توسعه سیستم‌های هوش مصنوعی در محیط عملیاتی بر آن‌ها تکیه کنند.

سرفصل ها و درس ها

خوش‌آمدگویی به دوره Welcome to the Course

  • ویدیو خوش‌آمدگویی Welcome Video

داده‌های آموزشی به عنوان یک محصول Training Data as a Product

  • داده‌های آموزشی به عنوان یک محصول Training Data as a Product

  • الزامات مجموعه داده، مصرف‌کنندگان و مالکان Dataset Requirements, Consumers, and Owners

  • قراردادها، SLAها، SLOها و معیارهای پذیرش Contracts, SLAs, SLOs, and Acceptance Criteria

  • کارت‌های مجموعه داده و تعاریف آمادگی Dataset Cards and Readiness Definitions

نسخه‌بندی و بازتولیدپذیری Versioning and Reproducibility

  • چرا بازتولیدپذیری در داده‌های آموزشی شکست می‌خورد Why Reproducibility Fails in Training Data

  • مفاهیم نسخه‌بندی مجموعه داده، اسنپ‌شات‌ها و سفر در زمان Dataset Versioning, Snapshots, and Time Travel Concepts

  • هشینگ و ساخت‌های قطعی Hashing and Deterministic Builds

  • نسب‌نامه (Lineage)، مصنوعات انتشار و بازسازی بازتولیدپذیر Lineage, Release Artifacts, and Reproducible Reconstruction

کنترل‌های نشت و آلودگی داده‌ها Leakage and Contamination Controls

  • نشت داده: حالت شکست خاموش در مجموعه‌داده‌ها Leakage: The Silent Dataset Failure Mode

  • نشت زمانی و هدف در خط لوله‌های واقعی Temporal and Target Leakage in Real Pipelines

  • یکپارچگی تقسیم‌بندی و صحت نقطه زمانی Split Integrity and Point-in-Time Correctness

  • آلودگی معنایی در متن، امبدینگ‌ها و جریان‌های کاری بازیابی Semantic Contamination in Text, Embeddings, and Retrieval Workflows

خط لوله‌های مهندسی ویژگی Feature Engineering Pipelines

  • خط لوله‌های ویژگی برای داده‌های آماده یادگیری ماشین Feature Pipelines for ML-Ready Data

  • الگوهای استخراج ویژگی برای داده‌های ساختاریافته و نیمه‌ساختاریافته Feature Extraction Patterns for Structured and Semi-Structured Data

  • تازگی، پیوند‌های نقطه زمانی و سازگاری آموزش/استنتاج Freshness, Point-in-Time Joins, and Training/Inference Consistency

  • کیفیت ویژگی، رانش (Drift) و آمادگی برای انتشار Feature Quality, Drift, and Release Readiness

خط لوله‌های برچسب‌گذاری و مدیریت حقیقت زمینی (Ground Truth) Label Pipelines and Ground Truth Management

  • خط لوله‌های برچسب‌گذاری و حقیقت زمینی Label Pipelines and Ground Truth

  • برچسب‌های انسانی، کمک‌گرفته از هوش مصنوعی و نظارت ضعیف Human, AI-Assisted, and Weakly Supervised Labels

  • بررسی‌های کیفیت برچسب و شواهد بازبینی Label Quality Checks and Review Evidence

  • رانش برچسب، نسخه‌بندی حقیقت زمینی و آمادگی برای انتشار Label Drift, Ground Truth Versioning, and Release Readiness

اعتبارسنجی CI برای کیفیت داده‌های سطح هوش مصنوعی CI Validation for AI-Grade Data Quality

  • چرا اعتبارسنجی CI برای انتشار مجموعه‌داده‌های آموزشی اهمیت دارد Why CI Validation Matters for Training Dataset Releases

  • بررسی‌های طرحواره و توزیع برای کیفیت داده‌های سطح هوش مصنوعی Schema and Distribution Checks for AI-Grade Data Quality

  • بررسی‌های برش، سوگیری و بازنمایی Slice, Bias, and Representation Checks

  • نشت، بازتولیدپذیری و گیت‌های انتشار Leakage, Reproducibility, and Release Gates

امتحان نهایی Final Exam

خلاصه دوره Course Summary

  • جمع‌بندی نهایی Wrap up

نمایش نظرات

داده‌های آموزشی بازتولیدپذیر و خط لوله‌های داده آماده برای یادگیری ماشین
جزییات دوره
21h 26m
26
(آخرین آپدیت)
1
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Chris Croft Chris Croft

مربی مدیریت، سخنران، نویسنده

Antonio Cangiano Antonio Cangiano