لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش مقدمهای بر هوش مصنوعی چندوجهی (Multimodal AI) با Hugging Face
- آخرین آپدیت
دانلود Introduction to Multimodal AI with Hugging Face
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
در پایان این دوره، شما قادر خواهید بود:
• نحوه همترازی تصویر و متن توسط CLIP در یک فضای جاسازی مشترک را توضیح دهید، از مدلهای بینایی-زبانی (VLM) برای پاسخ به سوالات بصری، کپشننویسی تصاویر و درک اسناد استفاده کنید و در Hub برای مدلهای چندوجهی جستجو کنید.
• خط لولهای (Pipeline) بسازید که با Whisper صوت را به متن تبدیل کرده و با Diffusers تصویر تولید کند، و توضیح دهید که چگونه تنظیم دقیق LoRA و RAG چندوجهی قابلیتهای VLM را گسترش میدهند.
• یک جریان کاری عاملمحور (Agentic Workflow) با استفاده از smolagents همراه با پشتیبانی VLM و ادغام ابزار MCP برای اتوماتیکسازی وظایف چندمرحلهای نیازمند بینایی و استدلال بسازید.
• از ShieldGemma 2 برای فیلتر کردن ورودیها و خروجیهای یک خط لوله VLM استفاده کنید، آن را در برابر ورودیهای متخاصم تست کنید و حالتهای شکست را برای استقرار مسئولانه مستند کنید.
هوش مصنوعی که فقط بتواند متن بخواند، از رده خارج شده است. این دوره متوسط فرض میکند که شما با کتابخانه HF Transformers و توسعه پایه Gradio آشنایی دارید. دوره با یک چالش عملی شروع میشود: ۲۰۰۰ محصول با عکس اما بدون توضیحات، و مجموعهای از PDFهای فاکتور که نیاز به استخراج دادههای ساختاریافته دارند. شما یاد میگیرید که CLIP چگونه تصاویر و متن را در یک فضای مشترک همترازی میکند، سپس از مدلهای مدرن بینایی-زبانی برای کپشننویسی محصولات، پاسخ به سوالات درباره نمودارها و استخراج فیلدها از فاکتورها استفاده میکنید. سپس گستردهتر پیش میرویم: تبدیل تماسهای مشتریان به متن با Whisper، تولید تصاویر از دستورات متنی با Diffusers و یادگیری زمان مناسب برای تنظیم دقیق (Fine-tune) مدل در مقابل ارائه کانتکست بهتر از طریق بازیابی (Retrieval). جریانهای کاری عاملی بسازید که بتوانند اسکرینشاتها را ببینند، درباره آنچه روی صفحه است استدلال کنند و از طریق پروتکل کانتکست مدل (MCP) به ابزارهای خارجی متصل شوند تا بر اساس یافتههایشان اقدام کنند. دوره با بررسی آمادگی برای استقرار به پایان میرسد: مدیر فنی شما میخواهد خط لوله AI را هفته آینده لانچ کند و شما باید تصمیم بگیرید که آیا با توجه به فیلترینگ امنیتی، تستهای متخاصم و مستندات حالتهای شکست، ارسال محصول ایمن است یا خیر.
سرفصل ها و درس ها
مبانی چندوجهی و مدلهای VLM
Multimodal Foundations and VLMs
خوشآمدگویی: از متن تنها تا هوش مصنوعی چندوجهی
Welcome: From Text-Only to Multimodal AI
نحوه همترازی تصاویر و متن توسط CLIP در یک فضای مشترک
How CLIP Aligns Images and Text in a Shared Space
پاسخ به سوالات بصری و کپشننویسی تصاویر با VLMها
Visual Question Answering and Image Captioning with VLMs
هوش مصنوعی اسناد — OCR، تجزیه تحلیل Layout و استخراج ساختاریافته
Document AI — OCR, Layout Parsing, and Structured Extraction
صوت، تولید تصویر و استراتژیهای تطبیق
Audio, Generation, and Adaptation Strategies
تبدیل صوت به متن با Whisper
Transcribing Audio with Whisper
تولید تصویر از متن با Diffusers
Generating Images from Text with Diffusers
چه زمانی تنظیم دقیق کنیم و چه زمانی بازیابی کنیم — LoRA و RAG چندوجهی
When to Fine-Tune vs. When to Retrieve — LoRA and Multimodal RAG
عاملها، MCP و استفاده از ابزارها
Agents, MCP, and Tool Use
ساخت اولین عامل شما با smolagents
Building Your First Agent with smolagents
اتصال عاملها به ابزارهای خارجی از طریق MCP
Connecting Agents to External Tools via MCP
عاملهای مبتنی بر بینایی — اسکرینشات، استدلال، اقدام و تکرار
Vision-Powered Agents — Screenshot, Reason, Act, Iterate
استقرار مسئولانه
Responsible Deployment
ریسکهای امنیتی چندوجهی — چه مشکلاتی ممکن است پیش بیاید و چرا
Multimodal Safety Risks — What Can Go Wrong and Why
فیلترینگ با ShieldGemma 2 — امنیت ورودی و خروجی
Filtering with ShieldGemma 2 — Input and Output Safety
تست در برابر ورودیهای متخاصم و مستندسازی حالتهای شکست
Testing Against Adversarial Inputs and Documenting Failure Modes
آنچه میتوانید ببینید، بسازید و با اطمینان منتشر کنید
What You Can See, Build, and Ship Safely
نمایش نظرات