مشکل زیرساخت شبکه و افت سرعت کاملاً برطرف شده است. در حال حاضر فعالسازی و آمادهسازی دورهها در حال انجام است. از صبر و شکیبایی شما سپاسگزاریم.
لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش عاملهای چندوجهی با مدلهای بینایی-زبانی (VLM)
- آخرین آپدیت
دانلود Multimodal Agents with Vision Language Models
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
این دوره آموزشی به بررسی مدلهای بینایی-زبانی و هماهنگی بین عاملهای چندگانه میپردازد: اینکه چگونه عاملها تصاویر را در کنار متن تفسیر میکنند و وظایف را بین خود تقسیم میکنند. این ترکیب، قابلیتهای یک عامل هوشمند را فراتر از ورودیهای تکبعدی میبرد.
شما بررسی خواهید کرد که مدلهای بینایی-زبانی مانند CLIP، BLIP و LLaVA چگونه تصاویر را با متن همتراز میکنند و از این امبدینگها برای ساخت یک سیستم جستجوی چندوجهی استفاده مینمایید. سپس یک خط لوله RAG چندوجهی طراحی میکنید که قادر است به سوالات مربوط به نمودارها و جداول درون اسناد PDF (جایی که بازیابی متنی ساده شکست میخورد) پاسخ دهد. دوره با مبحث ارکستراسیون به پایان میرسد: الگوهای برنامهریز (Planner)، اجراکننده (Executor) و منتقد (Critic) که وظایف پیچیده را به مراحل کوچکتر تقسیم میکنند، طراحی طرحوارههای ابزار مطمئن با مدیریت خطا، و سیستمهای همکاری چند-عاملی که در آن عاملهای متخصص، بافتار (Context) را بین یکدیگر منتقل میکنند.
در پایان این دوره، شما قادر خواهید بود:
- نحوه همترازی نمایشهای تصویر و متن در مدلهای بینایی-زبانی را توضیح دهید.
- یک سیستم جستجوی چندوجهی با استفاده از فضاهای امبدینگ مشترک بسازید.
- یک خط لوله RAG چندوجهی برای اسناد حاوی نمودار پیادهسازی کنید.
- الگوهای برنامهریز، اجراکننده و منتقد را برای تجزیه وظایف پیچیده به کار ببرید.
- فراخوانی ابزارها را با طرحوارههای قابل اعتماد و مدیریت خطای دقیق اجرا کنید.
- چندین عامل را از طریق نقشهای تعریف شده، انتقال وظایف و بافتار مشترک هماهنگ کنید.
این دوره برای یادگیرندگانی طراحی شده است که دورههای هوش مصنوعی چندوجهی و مبانی عاملهای هوشمند را گذراندهاند.
همین حالا ثبتنام کنید تا به عاملهای خود قدرت بینایی، بازیابی پیشرفته و توانایی کار تیمی ببخشید.
سرفصل ها و درس ها
مبانی بینایی-زبانی و RAG چندوجهی
Vision-Language Foundations and Multimodal RAG
مرور کلی تخصص
Specialization Overview
معرفی دوره
Course Introduction
مدلهای بینایی-زبانی چگونه «میبینند»
How Vision-Language Models "See"
چرا بازیابی برای عاملها اهمیت دارد
Why Retrieval Matters for Agents
تولید محتوای تقویتشده با بازیابی (RAG) چیست؟
What is Retrieval-Augmented Generation (RAG)?
دمو: دستهبندی تصاویر به روش Zero Shot
Demonstration: Zero-Shot Image Classification
نمایش نظرات