آموزش مهندسی داده‌های غیرساختاریافته برای هوش مصنوعی - آخرین آپدیت

دانلود Unstructured Data Engineering for AI

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: این دوره آموزشی، یادگیرندگان را برای طراحی و مهندسی خط لوله‌های داده‌های غیرساختاریافته و مدیریت‌شده جهت آموزش هوش مصنوعی، جستجوی معنایی و سیستم‌های RAG آماده می‌کند. در این دوره، شما گردش کارهای جذب داده برای اسناد و محتوای چندرسانه‌ای را طراحی کرده، پردازش‌های استخراجی و OCR-aware را پیاده‌سازی می‌کنید، متن‌ها را با حفظ ساختارهای کاربردی نرمال‌سازی کرده و اطلاعات حساس را شناسایی می‌کنید. همچنین استراتژی‌های تکه‌بندی (Chunking) را ایجاد کرده و مجموعه‌داده‌ها را با متادیتای لازم برای ارجاع، فیلترینگ، ردیابی происхождение (Lineage) و حاکمیت داده غنی می‌سازید. در پایان این دوره، شما قادر خواهید بود گردش کارهای جذب داده‌های غیرساختاریافته را تعریف کنید، کیفیت استخراج را ارزیابی نمایید، مجموعه‌داده‌ها را برای Embedding یا آموزش آماده کنید و گیت‌های ایمنی و کیفی را برای شناسایی اطلاعات شخصی (PII)، سوگیری، اعتماد به منبع و ریسک‌های لایسنس اعمال کنید. تمرکز اصلی این دوره بر کیفیت و حاکمیت مجموعه‌داده‌ها است تا بتوانید دارایی‌های داده‌ای قابل اعتمادی برای سیستم‌های هوش مصنوعی ایجاد کنید.

سرفصل ها و درس ها

خوش‌آمدگویی به دوره Welcome to the Course

  • ویدیو خوش‌آمدگویی Welcome Video

معماری جذب داده‌های غیرساختاریافته و ذخیره‌سازی اشیاء Unstructured Ingestion and Object Storage Architecture

  • چرا معماری جذب داده برای مجموعه‌داده‌های آماده هوش مصنوعی اهمیت دارد Why Ingestion Architecture Matters for AI-Ready Corpora

  • طراحی چیدمان اشیاء، پیشوندها و قراردادهای نام‌گذاری Designing Object Layouts, Prefixes, and Naming Conventions

  • ساخت گردش کارهای جذب داده مبتنی بر مانیفست Building Manifest-Driven Ingestion Workflows

  • شناسایی فایل‌های خراب، تکراری و با کیفیت پایین Detecting Corrupted, Duplicate, and Low-Quality Files

استخراج محتوا: اسناد، HTML، OCR و ساختار Content Extraction: Documents, HTML, OCR, and Structure

  • چرا کیفیت استخراج، تعیین‌کننده کیفیت مجموعه‌داده هوش مصنوعی است Why Extraction Quality Determines AI Corpus Quality

  • استخراج متن بومی و ساختار از PDF، Word، HTML و Markdown Extracting Native Text and Structure from PDFs, Word, HTML, and Markdown

  • پردازش OCR-aware برای اسناد اسکن شده و کیفیت پایین OCR-Aware Processing for Scanned and Low-Quality Documents

  • بسته‌بندی خروجی‌های استخراج برای پاک‌سازی، تکه‌بندی و حاکمیت Packaging Extraction Outputs for Cleaning, Chunking, and Governance

پاک‌سازی متن، نرمال‌سازی و مدیریت داده‌های حساس Text Cleaning, Normalization, and Sensitive Data Handling

  • چرا پاک‌سازی و مدیریت داده‌های حساس برای مجموعه‌داده‌های هوش مصنوعی حیاتی است Why Cleaning and Sensitive Data Handling Matter for AI Corpora

  • بررسی مشکلات کیفیت متن پس از استخراج Inspecting Text Quality Issues After Extraction

  • حذف متون تکراری و زائد (Boilerplate) بدون تخریب معنا Boilerplate Removal Without Destroying Meaning

  • شناسایی PII، سانسور و قابلیت حسابرسی داده‌های حساس PII Detection, Redaction, and Sensitive Data Auditability

تکه‌بندی (Chunking) و غنی‌سازی متاداده Chunking and Metadata Enrichment

  • چرا تکه‌بندی و متاداده تعیین‌کننده آمادگی مجموعه‌داده هوش مصنوعی است Why Chunking and Metadata Determine AI Corpus Readiness

  • الگوهای تکه‌بندی ثابت، معنایی و ترکیبی (Hybrid) Fixed, Semantic, and Hybrid Chunking Patterns

  • طراحی شمای تکه‌بندی برای ردیابی происхождение و قابلیت ارجاع Designing Chunk Schemas for Lineage and Citation Readiness

  • ارزیابی کیفیت تکه‌ها قبل از Embedding یا بازیابی Evaluating Chunk Quality Before Embedding or Retrieval

حاشیه‌نویسی، برچسب‌گذاری و حاکمیت مجموعه‌داده Annotation, Labeling, and Corpus Governance

  • چرا حاکمیت حاشیه‌نویسی برای مجموعه‌داده‌های هوش مصنوعی اهمیت دارد Why Annotation Governance Matters for AI Corpora

  • طراحی تاکسونومی برای داده‌های غیرساختاریافته Designing Taxonomies for Unstructured Data

  • بازبینی انسانی، توافق و کیفیت برچسب‌گذاری Human Review, Agreement, and Label Quality

  • برچسب‌های کمکی هوش مصنوعی، نسخه‌بندی و متادیتای حاکمیتی AI-Assisted Labels, Versioning, and Governance Metadata

گیت‌های ایمنی، گیت‌های کیفی و پروژه دوره Safety Gates, Quality Gates, and Course Project

  • از مجموعه‌داده آماده تا انتشار مدیریت‌شده From Prepared Corpus to Governed Release

  • طراحی گیت‌های ایمنی و کیفی برای مجموعه‌داده‌های غیرساختاریافته Designing Safety and Quality Gates for Unstructured Corpora

  • لایسنس، اعتماد به منبع و شواهد حسابرسی Licensing, Source Trust, and Audit Evidence

  • بسته‌بندی پروژه نهایی مجموعه‌داده مدیریت‌شده Packaging the Final Governed Corpus Project

جمع‌بندی دوره Course Summary

  • جمع‌بندی نهایی Wrap up

آزمون نهایی Final Exam

نمایش نظرات

آموزش مهندسی داده‌های غیرساختاریافته برای هوش مصنوعی
جزییات دوره
23h 55m
26
(آخرین آپدیت)
44
- از 5
دارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Chris Croft Chris Croft

مربی مدیریت، سخنران، نویسنده

Antonio Cangiano Antonio Cangiano