لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش مهندسی دادههای غیرساختاریافته برای هوش مصنوعی
- آخرین آپدیت
دانلود Unstructured Data Engineering for AI
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
این دوره آموزشی، یادگیرندگان را برای طراحی و مهندسی خط لولههای دادههای غیرساختاریافته و مدیریتشده جهت آموزش هوش مصنوعی، جستجوی معنایی و سیستمهای RAG آماده میکند. در این دوره، شما گردش کارهای جذب داده برای اسناد و محتوای چندرسانهای را طراحی کرده، پردازشهای استخراجی و OCR-aware را پیادهسازی میکنید، متنها را با حفظ ساختارهای کاربردی نرمالسازی کرده و اطلاعات حساس را شناسایی میکنید. همچنین استراتژیهای تکهبندی (Chunking) را ایجاد کرده و مجموعهدادهها را با متادیتای لازم برای ارجاع، فیلترینگ، ردیابی происхождение (Lineage) و حاکمیت داده غنی میسازید.
در پایان این دوره، شما قادر خواهید بود گردش کارهای جذب دادههای غیرساختاریافته را تعریف کنید، کیفیت استخراج را ارزیابی نمایید، مجموعهدادهها را برای Embedding یا آموزش آماده کنید و گیتهای ایمنی و کیفی را برای شناسایی اطلاعات شخصی (PII)، سوگیری، اعتماد به منبع و ریسکهای لایسنس اعمال کنید. تمرکز اصلی این دوره بر کیفیت و حاکمیت مجموعهدادهها است تا بتوانید داراییهای دادهای قابل اعتمادی برای سیستمهای هوش مصنوعی ایجاد کنید.
سرفصل ها و درس ها
خوشآمدگویی به دوره
Welcome to the Course
ویدیو خوشآمدگویی
Welcome Video
معماری جذب دادههای غیرساختاریافته و ذخیرهسازی اشیاء
Unstructured Ingestion and Object Storage Architecture
چرا معماری جذب داده برای مجموعهدادههای آماده هوش مصنوعی اهمیت دارد
Why Ingestion Architecture Matters for AI-Ready Corpora
طراحی چیدمان اشیاء، پیشوندها و قراردادهای نامگذاری
Designing Object Layouts, Prefixes, and Naming Conventions
ساخت گردش کارهای جذب داده مبتنی بر مانیفست
Building Manifest-Driven Ingestion Workflows
شناسایی فایلهای خراب، تکراری و با کیفیت پایین
Detecting Corrupted, Duplicate, and Low-Quality Files
استخراج محتوا: اسناد، HTML، OCR و ساختار
Content Extraction: Documents, HTML, OCR, and Structure
چرا کیفیت استخراج، تعیینکننده کیفیت مجموعهداده هوش مصنوعی است
Why Extraction Quality Determines AI Corpus Quality
استخراج متن بومی و ساختار از PDF، Word، HTML و Markdown
Extracting Native Text and Structure from PDFs, Word, HTML, and Markdown
پردازش OCR-aware برای اسناد اسکن شده و کیفیت پایین
OCR-Aware Processing for Scanned and Low-Quality Documents
بستهبندی خروجیهای استخراج برای پاکسازی، تکهبندی و حاکمیت
Packaging Extraction Outputs for Cleaning, Chunking, and Governance
پاکسازی متن، نرمالسازی و مدیریت دادههای حساس
Text Cleaning, Normalization, and Sensitive Data Handling
چرا پاکسازی و مدیریت دادههای حساس برای مجموعهدادههای هوش مصنوعی حیاتی است
Why Cleaning and Sensitive Data Handling Matter for AI Corpora
بررسی مشکلات کیفیت متن پس از استخراج
Inspecting Text Quality Issues After Extraction
حذف متون تکراری و زائد (Boilerplate) بدون تخریب معنا
Boilerplate Removal Without Destroying Meaning
شناسایی PII، سانسور و قابلیت حسابرسی دادههای حساس
PII Detection, Redaction, and Sensitive Data Auditability
تکهبندی (Chunking) و غنیسازی متاداده
Chunking and Metadata Enrichment
چرا تکهبندی و متاداده تعیینکننده آمادگی مجموعهداده هوش مصنوعی است
Why Chunking and Metadata Determine AI Corpus Readiness
الگوهای تکهبندی ثابت، معنایی و ترکیبی (Hybrid)
Fixed, Semantic, and Hybrid Chunking Patterns
طراحی شمای تکهبندی برای ردیابی происхождение و قابلیت ارجاع
Designing Chunk Schemas for Lineage and Citation Readiness
ارزیابی کیفیت تکهها قبل از Embedding یا بازیابی
Evaluating Chunk Quality Before Embedding or Retrieval
حاشیهنویسی، برچسبگذاری و حاکمیت مجموعهداده
Annotation, Labeling, and Corpus Governance
چرا حاکمیت حاشیهنویسی برای مجموعهدادههای هوش مصنوعی اهمیت دارد
Why Annotation Governance Matters for AI Corpora
طراحی تاکسونومی برای دادههای غیرساختاریافته
Designing Taxonomies for Unstructured Data
بازبینی انسانی، توافق و کیفیت برچسبگذاری
Human Review, Agreement, and Label Quality
برچسبهای کمکی هوش مصنوعی، نسخهبندی و متادیتای حاکمیتی
AI-Assisted Labels, Versioning, and Governance Metadata
گیتهای ایمنی، گیتهای کیفی و پروژه دوره
Safety Gates, Quality Gates, and Course Project
از مجموعهداده آماده تا انتشار مدیریتشده
From Prepared Corpus to Governed Release
طراحی گیتهای ایمنی و کیفی برای مجموعهدادههای غیرساختاریافته
Designing Safety and Quality Gates for Unstructured Corpora
لایسنس، اعتماد به منبع و شواهد حسابرسی
Licensing, Source Trust, and Audit Evidence
بستهبندی پروژه نهایی مجموعهداده مدیریتشده
Packaging the Final Governed Corpus Project
نمایش نظرات