آموزش بینایی ماشین: از پردازش تصویر تا هوش مصنوعی مولد و ویژن ترنسفورمرها [ویدئویی] - آخرین آپدیت

دانلود Computer Vision From Image Processing to Generative AI and Vision Transformers [Video]

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: این دوره یک مسیر جامع در بینایی ماشین را ارائه می‌دهد که از مفاهیم بنیادی پردازش تصویر، پیکسل‌ها، ماتریس‌ها و فضاهای رنگی شروع شده و به تکنیک‌های کلاسیک استخراج ویژگی و طبقه‌بندی‌های یادگیری ماشین می‌رسد. فراگیران با انجام تمرین‌های کدنویسی عملی با استفاده از OpenCV، تئوری را به کاربرد عملی پیوند می‌دهند. شرکت‌کنندگان وارد دنیای یادگیری عمیق شده و شبکه‌های عصبی پیچشی (CNN)، معماری‌های پیشرفته و یادگیری انتقالی (Transfer Learning) را بررسی می‌کنند. این دوره شامل ساخت مدل‌ها، توابع فعال‌ساز، پولینگ، اشتراک‌گذاری وزن‌ها و استراتژی‌های موثر برای بهبود عملکرد است. این برنامه برای توسعه‌دهندگان AI، مهندسان یادگیری عمیق و علاقه‌مندان به بینایی ماشین که دانش قبلی پایتون دارند، ایده‌آل است. شرکت‌کنندگان باید با مبانی یادگیری ماشین و جبر خطی آشنا باشند. محتوای دوره، فراگیران را از طریق پروژه‌های عملی و مرتبط با صنعت هدایت کرده و در عین حال درک مفهومی آن‌ها را تقویت می‌کند. در پایان دوره، شرکت‌کنندگان قادر خواهند بود تکنیک‌های بینایی ماشین را به کار بگیرند، CNNها را بسازند و بهینه کنند، یادگیری انتقالی را پیاده‌سازی نمایند، GANها را توسعه دهند، از ویژن ترنسفورمرها بهره ببرند و خط لوله‌های (pipelines) پیشرفته‌ای برای تشخیص اشیاء، بخش‌بندی و برنامه‌های جستجوی بصری ایجاد کنند. تمرین‌های عملی تضمین می‌کند که مهارت‌ها بلافاصله در پروژه‌های دنیای واقعی قابل پیاده‌سازی باشند. کاربرد مفاهیم بینایی ماشین و یادگیری عمیق روی داده‌های واقعی ساخت و آموزش CNNها برای وظایف طبقه‌بندی و شناسایی تصویر پیاده‌سازی یادگیری انتقالی برای بهبود عملکرد مدل توسعه و استقرار GANها برای کاربردهای هوش مصنوعی مولد بهره‌گیری از ویژن ترنسفورمرها برای درک بصری پیشرفته ایجاد خط لوله‌های جامع برای تشخیص اشیاء و بخش‌بندی ایده‌آل برای توسعه‌دهندگان AI، مهندسان بینایی ماشین و دانشمندان داده با تجربه پایتون. دانش پایه یادگیری ماشین و آشنایی با جبر خطی توصیه می‌شود. فراگیران در زمینه‌های پیش‌پردازش تصویر، طراحی CNN، مدل‌های AI مولد، یادگیری انتقالی، تشخیص اشیاء، بخش‌بندی، ویژن ترنسفورمرها و بازیابی تصاویر مبتنی بر Embedding تخصص کسب خواهند کرد. ساختار دوره به گونه‌ای است که تئوری را با پیاده‌سازی عملی برای توسعه مهارت‌های کاربردی در برنامه‌های پیشرفته بینایی ماشین پیوند دهد. پوشش جامع بینایی ماشین، CNNها، GANها و ویژن ترنسفورمرها با پایتون. * پروژه‌های عملی با استفاده از OpenCV و PyTorch برای تجربه کاربردهای واقعی AI. * راهنمای گام‌به‌گام برای طراحی، آموزش و بهینه‌سازی مدل‌های بینونی پیشرفته.

سرفصل ها و درس ها

مقدمه Introduction

  • مبانی بینایی ماشین و پردازش تصویر Foundations of CV & Image Processing

  • مقدمه‌ای بر بینایی ماشین - اهداف یادگیری Introduction to Computer Vision - Learning Objectives

  • آشنایی با بینایی ماشین Introduction to Computer Vision

  • بینایی ماشین چیست؟ What is Computer Vision?

  • شکاف معنایی: چالش اصلی بینایی ماشین The Semantic Gap The Core Challenge of CV

  • توضیح مثال کد 1.1.1 Code Eg 1.1.1 Explaination

  • تکامل بینایی ماشین The Evolution of Computer Vision

  • لبه‌یابی سوبل (Sobel) Sobel Edge Detection

  • لبه‌یابی کنی (Canny) Cannny Edge detection

  • توضیح مثال کد 1.1.2 Code Eg 1.1.2 Explaination

  • استخراج ویژگی‌های HoG Extracting HoG Features

  • تشخیص ویژگی‌های SIFT Detect SIFT Features

  • توضیح مثال کد 1.1.3 Code Eg 1.1.3 Explaination

  • طبقه‌بندی‌های یادگیری ماشین روی ویژگی‌های استخراج شده ML Classifiers on learned Features

  • آموزش ماشین‌های بردار پشتیبان (SVM) Train Support Vector Machines (SVM)

  • آموزش k-نزدیک‌ترین همسایه (KNN) Train k-Nearest neighbour ( KNN )

  • توضیح مثال کد 1.1.4 Code Eg 1.1.4 Explaination

  • دوران دوم: عصر یادگیری عمیق Era 2 - The Deep Learning Era

  • عصر هوش مصنوعی مولد The Generative AI Era

  • گردش کار جهانی بینایی ماشین The Universal Computer Vision Workflow

  • توضیح تمرین کد 1.1 Code Exercise 1.1 Explaination

  • مبانی تصویر دیجیتال - اهداف یادگیری Digital Image Fundamentals - Learning Objectives

  • اصول تصاویر دیجیتال Digital Image Fundamentals

  • پیکسل: اتمِ بینایی Pixel The Atom of Vision

  • تصویر به عنوان ماتریس: واقعیت ریاضی Image as Matrix - The Maths Reality

  • تصاویر رنگی به عنوان ماتریس‌های سه بعدی Color Images as 3D Matrices

  • توضیح مثال کد 1.2.1 Code Eg 1.2.1 Explaination

  • فضاهای رنگی: RGB (جمع‌شونده) Color Spaces RGB The Additive

  • فضاهای رنگی: HSV (تشخیص مقاوم) Color Spaces HSV Robust Detection

  • فضاهای رنگی: مقیاس خاکستری (Grayscale) Color Spaces Grayscale

  • توضیح مثال کد 1.2.2 Code Eg 1.2.2 Explaination

  • عمق تصویر (Bit Depth) Image Depth (Bit Depth)

  • توضیح مثال کد 1.2.3 Code Eg 1.2.3 Explaination

  • کار عملی بینایی ماشین با OpenCV Hands-On CV with OpenCV

  • توضیح مثال کد 1.2.4 Code Eg 1.2.4 Explaination

  • توضیح تمرین کد 1.2 Code Exercise 1.2 Explaination

  • تکنیک‌های ضروری پیش‌پردازش تصویر - اهداف یادگیری Essential Image Preprocessing Techniques - Learning Objectives

  • پیش‌پردازش تصویر Image Preprocessing

  • تغییر شکل تصویر (Transformation) Image Transformation

  • توضیح مثال کد 1.3.1 Code Eg. 1.3.1 Explaination

  • تبدیلات هندسی Geometric Transformations

  • تبدیل هندسی 1: مقیاس‌بندی (Scaling) Geometric Transform 1 - Scaling

  • تبدیل هندسی 2: چرخش و انتقال Geometric Transform 2 - Rotation & Translation

  • کار عملی تبدیل‌های هندسی در OpenCV Hands-On OpenCV Geometric Transformations

  • توضیح مثال کد 1.3.2 Code Eg. 1.3.2 Explaination

  • تبدیل هندسی 3: آفین در مقابل پرسپکتیو Geometric Transform 3 - Affine vs. Perspective

  • توضیح مثال کد 1.3.3 Code Eg. 1.3.3 Explaination

  • ریاضیات تبدیل‌های هندسی The Math of Geometric Transformations

  • تنظیمات فوتومتریک: اصلاح نور و کنتراست Photometric Adjustments Fixing Light & Contrast

  • تنظیم فوتومتریک: یکنواخت‌سازی هیستوگرام Photometric Adjustment Histogram Equalization

  • توضیح مثال کد 1.3.4 Code Eg. 1.3.4 Explaination

  • فیلترگذاری: جادوی کانولوشن Filtering The Magic of Convolution

  • کرنل‌ها: فیلترهای دست‌ساز برای بینایی The Kernels - Handcrafted Filters for Vision

  • توضیح مثال کد 1.3.5 Code Eg. 1.3.5 Explaination

  • کاربرد عملی: پیش‌پردازش برای تشخیص چهره Practical - Preprocessing for Face Recognition

  • توضیح مثال کد 1.3.6 Code Eg. 1.3.6 Explaination

  • توضیح تمرین کد 1.3 Code Exercise 1.3 Explaination

مبانی یادگیری عمیق و شبکه‌های عصبی پیچشی (CNNs) Deep Learning Foundations & Convolutional Neural Networks (CNNs)

  • مبانی یادگیری عمیق و شبکه‌های عصبی پیچشی (CNN) Deep Learning Foundations & Convolutional Neural Networks (CNN)

  • از پرسپترون‌ها تا شبکه‌های عصبی عمیق - اهداف یادگیری From Perceptrons to Deep Neural Networks - Learning Objectives

  • تاریخچه بینایی ماشین (1950 تا 1990) Computer Vision History 1950-1990s

  • عصر مدرن بینایی ماشین (1990 تا کنون) Computer Vision Modern Era 1990s - Present

  • توضیح مثال کد 2.1.1 Code Eg. 2.1.1 Explaination

  • لایه ورودی تا اولین لایه پنهان: ریاضیات کامل Input Layer to first hidden layer Complete Maths

  • تابع فعال‌ساز (Activation Function) Activation Function

  • لایه پنهان دوم در شبکه عصبی Hidden Layer 2 of Neural Network

  • نورون لایه خروجی: ریاضیات کامل Output Layer Neuron Complete Maths

  • انواع لایه‌ها و نقش آن‌ها Layer Types and Their Roles

  • توضیح مثال کد 2.1.2 Code Eg. 2.1.2 Explaination

  • فرآیند یادگیری دو مرحله‌ای: گذر رو به جلو (Forward Pass) The two step Learninng Process Forward Pass

  • تابع زیان Cross Entropy در طبقه‌بندی دوگانه Cross-Entropy Loss Binary Classification

  • تابع زیان Cross Entropy در طبقه‌بندی چندگانه Cross-Entropy Loss Multi-Class Classification

  • گذر رو به عقب: یادگیری از اشتباهات Backward Pass - Learning from mistakes

  • گرادیان کاهشی (Gradient Descent) Gradient Descent

  • توضیح مثال کد 2.1.3 Code Eg. 2.1.3 Explaination

  • خلاصه فرآیند یادگیری دو مرحله‌ای The two step Learninng Process - Summary

  • هایپرپارامتر نرخ یادگیری و نقش بهینه‌ساز (Optimizer) The Learning Rate Hyperparameter & Role of Optimizer

  • توضیح مثال کد 2.1.4 Code Eg. 2.1.4 Explaination

  • توضیح تمرین کد 2.1 Code Exercise 2.1 Explaination

  • معماری CNN - اهداف یادگیری The CNN Architecture - Learning Objectives

  • چرا شبکه‌های عصبی عمیق (DNN) در وظایف بینایی ماشین شکست می‌خورند؟ Why DNNs fail at Computer Vision Tasks

  • توضیح مثال کد 2.2.1 Code Eg. 2.2.1 Explaination

  • درک شبکه‌های عصبی پیچشی (CNNs) Understanding Convolutional Neural Networks (CNNs)

  • عملیات کانولوشن و فرآیند پنجره لغزان Convolution Operation & Sliding Window Process

  • انواع فیلترهای کانولوشن Types of convolution filters

  • گام‌ها (Strides) و پدینگ (Padding) Strides & Padding

  • توضیح مثال کد 2.2.2 Code Eg. 2.2.2 Explaination

  • فعال‌ساز ReLU و MaxPooling ReLU Activation & MaxPooling

  • فعال‌ساز ReLU - درک مفهومی ReLU Activation – Conceptual Understanding

  • پولینگ (Pooling) - درک مفهومی Pooling – Conceptual Understanding

  • توضیح مثال کد 2.2.3 Code Eg. 2.2.3 Explaination

  • مثال CNN دو لایه Two Layered CNN example

  • لایه متراکم (Dense) یا تمام متصل و لایه خروجی Dense or Fully Connected Layer & Output Layer

  • اتصالات محلی و اشتراک‌گذاری وزن‌ها در CNN CNN Local Connectivity & Weight Sharing

  • ناوردا بودن نسبت به انتقال و ساخت ویژگی‌های سلسله‌مراتبی Translation Invariance & Hierarchical Feature Building

  • توضیح مثال کد 2.2.4 Code Eg. 2.2.4 Explaination

  • توضیح تمرین کد 2.2 Code Exercise 2.2 Explaination

  • ساخت اولین CNN شما - اهداف یادگیری Building Your First CNN - Learning Objectives

  • هدف عملی: آموزش یک CNN برای دیدن! Hands-On Goal Train a CNN to See!

  • داده‌ها: مهم‌ترین جزء Data The Most Important Ingredient

  • تنسورها به عنوان ورودی داده و GPU به عنوان شتاب‌دهنده Tensors as Data Input, & GPU as accelerator

  • مزایای PyTorch The PyTorch Advantage

  • توضیح مثال کد 2.3.1 Code Eg. 2.3.1 Explaination

  • معماری CNN: اولین مدل ما CNN Architecture Our First Model

  • خروجی لایه‌به‌لایه معماری CNN CNN Architecture Layer wise Output

  • توضیح مثال کد 2.3.2 Code Eg. 2.3.2 Explaination

  • گذر رو به جلو، پس‌انتشار (Backpropagation) و ارزیابی Forward Pass, Backpropagation, and Evaluation

  • سه‌گانه آموزش (Training Triad) The Training Triad

  • استراتژی‌های موثر آموزشی و عیب‌یابی Effective Training Strategies and Diagnostics

  • حلقه آموزش: جایی که یادگیری واقعاً رخ می‌دهد The Training Loop Where Learning Actually Happens

  • مشکلات رایج و راهکارهای آن‌ها Common Issues and Solutions

  • توضیح مثال کد 2.3.3 Code Eg. 2.3.3 Explaination

  • فراتر از آموزش: مدل ما چقدر خوب است؟ Beyond Training How Good Is Our Model

  • چک‌لیست آموزش CNN CNN Training The Checklist

  • توضیح مثال کد 2.3.4 Code Eg. 2.3.4 Explaination

  • توضیح تمرین کد 2.3 Code Exercise 2.3 Explaination

معماری‌های پیشرفته CNN و یادگیری انتقالی Advanced CNN Architectures and Transfer Learning

  • مقدمه‌ای بر معماری‌های پیشرفته CNN و یادگیری انتقالی Advanced CNN Architectures and Transfer Learning - Introduction

  • معماری‌های شاخص CNN - اهداف درس Landmark CNN Architectures - Lecture Objectives

  • معماری CNN: مدل LeNet 5 (1998) CNN Architectures LeNet-5 (1998)

  • تکامل معماری‌های شاخص CNN Evolution of Landmark CNN Architectures

  • مدل AlexNet (2012) AlexNet (2012)

  • توضیح مثال کد 3.1.1 Code Eg 3.1.1 Explaination

  • مدل VGGNet (2014) VGGNet (2014)

  • مدل ResNet (2015) ResNet (2015)

  • توضیح مثال کد 3.1.2 Code Eg 3.1.2 Explaination

  • مدل Inception (GoogLeNet) 2014 Inception (GoogLeNet) - 2014

  • مدل DenseNet 2017 DenseNet - 2017

  • مدل EfficientNet (2019) EfficientNet (2019)

  • چگونه معماری CNN مناسب (Backbone) را انتخاب کنیم؟ How to choose suitable CNN architecture (Backbone)

  • یادگیری انتقالی و تنظیم دقیق (Fine Tuning) - اهداف یادگیری Transfer Learning and Fine-Tuning - Learning Objectives

  • دو رویکرد: یادگیری انتقالی و تنظیم دقیق Two Approaches Transfer Learning & Fine-Tuning

  • انگیزه: چرا از مدل‌های پیش‌آموزش‌دیده استفاده کنیم؟ The Motivation Why Reuse Pre-Trained Models

  • استخراج ویژگی (Feature Extraction): راهکار امن Feature Extraction The Safe Bet

  • مکانیسم: نحوه پیاده‌سازی استخراج ویژگی Mechanics How to Implement Feature Extraction

  • توضیح مثال کد 3.2.1 Code Eg 3.2.1 Explaination

  • تنظیم دقیق (Fine Tuning): راهکار با عملکرد بالا Fine-Tuning The High Performance Bet

  • مرحله جریان گرادیان The Gradient Flow Step

  • نرخ‌های یادگیری تفاضلی: کلید آموزش موفق Differential Learning Rates Key to Successful Training

  • تثبیت وزن‌های الاستیک (EWC) Elastic Weight Consolidation (EWC)

  • توضیح مثال کد 3.2.2 Code Eg 3.2.2 Explaination

  • درک CNNها: از پیکسل‌ها تا آموزش‌های پیشرفته Understanding CNNs From Pixels to Advanced Training

  • نکات حرفه‌ای برای آموزش موفق مدل در بینایی ماشین Pro-Tips for successful model training in Computer Vision

  • گردش کار عملی: از صفر تا صد Practical Workflow From Zero to Hero

  • توضیح مثال کد 3.2.3 Code Eg 3.2.3 Explaination

  • بهبود عملکرد مدل CNN - اهداف یادگیری Improving CNN Model Performance - Learning Objectives

  • عیب‌یابی مشکل: بیش‌برازش (Overfitting/واریانس بالا) Diagnosing the Problem Overfitting (High Variance)

  • عیب‌یابی مشکل: کم‌برازش (Underfitting/بایاس بالا) Diagnosing the Problem Underfitting (High Bias)

  • دو روش برای بهبود عملکرد مدل Two Methods for Improving Model Performance

  • بهبود عملکرد مدل: استحکام و تعمیم‌پذیری Improving Model Performance Robustness & Generalization

  • مثال کد 3.3.1 Code Eg 3.3.1

  • افزایش داده‌ها (Data Augmentation): چگونه و چرا؟ Data Augmentation How & Why

  • افزایش داده‌ها: شبیه‌سازی برای رسیدن به نتیجه Data Augmentation Fake It Till You Make It

  • افزایش داده‌ها: ابزارهای هندسی Data Augmentation The Geometric Arsenal

  • افزایش داده‌ها: ابزارهای فوتومتریک و MixUp Data Augmentation The Photometric Arsenal & MixUp

  • مثال کد 3.3.2 Code Eg. 3.3.2

  • منظم‌سازی (Regularization): محدود کردن مدل با Dropout Regularization Restraining the Model - Dropout

  • کاهش وزن (L2 Regularization) Weight Decay (L2 Regularization)

  • هموارسازی برچسب (Label Smoothing): مبارزه با اعتماد به نفس بیش از حد Label Smoothing - Fighting Overconfidence

  • مثال کد 3.3.3 Code Eg. 3.3.3

  • اثر هم‌افزایی: افزایش داده‌ها و منظم‌سازی The Synergy Effect Data Augmentation Regularization

  • جمع‌بندی نهایی Putting It All Together5:17

  • مثال کد 3.3.4 Code Eg. 3.3.4

تشخیص اشیاء با یادگیری عمیق Object Detection with Deep Learning

  • مقدمه تشخیص اشیاء با یادگیری عمیق Object Detection with Deep Learning - Intro

  • آشنایی با تشخیص اشیاء - اهداف درس Introduction to Object Detection - Lecture Objectives

  • مقدمه‌ای بر تشخیص اشیاء Introduction to Object Detection

  • تعریف وظیفه: «چیستی» و «کجایی» Defining the Task The What and the Where

  • ساختار خروجی تشخیص The Structure of Detection Output

  • بخش اول مثال کد 4.1 Code Eg. 4.1 part

  • مثال بصری: تلاقی روی اجتماع (IoU) در عمل Visual Example Intersection over Union (IoU) in Practice

  • معیارهای ارزیابی: تلاقی روی اجتماع (IoU) The Metrics Intersection over Union (IoU)

  • تحلیل مقادیر IoU: خوب، بد و زشت The Good, the Bad and the Ugly of IoU values

  • بخش دوم مثال کد 4.1 Code Eg. 4.1 part

  • تبادل دقت-فراخوانی و نمایش هندسی mAP Precision-Recall Tradeoff & mAP Geometrical Representation

  • میانگین دقت متوسط (mAP): محاسبه گام‌به‌گام Mean Average Precision (mAP) Step-wise calculation

  • تفسیر مقادیر میانگین دقت متوسط (mAP) Mean Average Precision (mAP) Values interpretation

  • بخش سوم مثال کد 4.1 Code Eg. 4.1 part

  • سرکوب غیربیشینه (NMS) Non Maximum Suppression

  • توضیح Non Maximum Suppression (NMS) با مثال Non-Maximum Suppression (NMS) Explained by an Example

  • تشخیص اشیاء: خط لوله سطح بالا Object Detection The High-Level Pipeline

  • بخش چهارم مثال کد 4.1 Code Eg. 4.1 part

  • تشخیص‌دهنده‌های دو مرحله‌ای (خانواده R-CNN) - اهداف یادگیری Two-Stage Detectors (R-CNN Family) - Learning Objectives

  • رویکرد و تکامل تشخیص‌دهنده‌های دو مرحله‌ای Two-Stage Detectors Approach & Evolution

  • تشخیص‌دهنده‌های دو مرحله‌ای: خانواده R-CNN Two-Stage Detectors The R-CNN Family

  • بخش اول مثال کد 4.2 Code Eg. 4.2 part

  • مدل R-CNN (2014) و مشکلات آن R-CNN (2014) & the problem

  • توضیح Fast R-CNN (2015) با مثال Fast R-CNN (2015) Explained with an example

  • مدل Fast R-CNN (2015): مغز مشترک Fast R-CNN (2015) The Shared Brain

  • بخش دوم مثال کد 4.2 Code Eg. 4.2 part

  • مدل Faster R-CNN (2015): نوآوری شبکه پیشنهاد منطقه (RPN) Faster R-CNN (2015) The Region Proposal Network (RPN) Innovation

  • مدل Faster R-CNN (2015): استاندارد مدرن Faster R-CNN (2015) The Modern Standard

  • مدل Faster R-CNN (2015): خط لوله کامل Faster R CNN (2015) The Full Pipeline

  • مقایسه خانواده R-CNN: مسیر تکامل R CNN Family Comparison The Evolution

  • بخش سوم مثال کد 4.2 Code Eg. 4.2 part

  • تشخیص‌دهنده‌های تک مرحله‌ای (YOLO, SSD) - اهداف یادگیری Single-Stage Detectors (YOLO, SSD) - Learning Objectives

  • تغییر از تشخیص‌دهنده دو مرحله‌ای به تک مرحله‌ای Shift from Two Stage to Single Stage Object Detector

  • انقلاب: رگرسیون در مقابل پیشنهاد The Revolution Regression vs. Proposal

  • تفاوت‌های ریاضی و عملیاتی R-CNN در مقابل YOLO Mathematical & Operational Differences R CNN vs Yolo

  • بخش اول مثال کد 4.3 Code Eg. 4.3 part

  • مدل YOLO: فقط یک بار نگاه کن YOLO You Only Look Once

  • ریاضیات تابع زیان در YOLO Yolo's Math of the Loss Function

  • محدودیت‌های مدل YOLOv1 The Limitation of YOLOv1 Model

  • بخش دوم مثال کد 4.3 Code Eg. 4.3 part

  • مدل SSD: هرم ویژگی‌های چند مقیاسی SSD The Multi Scale Feature Pyramid

  • باکس‌های لنگر (Anchor Boxes) در SSD SSD Anchor Boxes (Default Boxes)

  • بخش سوم مثال کد 4.3 Code Eg. 4.3 part

  • مقایسه تشخیص‌دهنده‌ها و راهنمای کاربردی Detector Comparison & Practical Guidance

  • بخش چهارم مثال کد 4.3 Code Eg. 4.3 part

  • معماری‌های مدرن: تشخیص‌دهنده‌های سرتاسری (DETR) - اهداف یادگیری Modern Architectures: End-to-End Detectors (DETR) - Learning Objectives

  • معماری‌های مدرن: تشخیص‌دهنده‌های سرتاسری (DETR) Modern Architectures End to End Detectors (DETR)

  • روش مدل ترنسفورمر تشخیص (DETR) Detection Transformer (DETR) Model method

  • نوآوری اصلی: ترنسفورمرها در بینایی The Core Innovation Transformers in Vision

  • بخش اول مثال کد 4.4 Code Eg. 4.4 part

  • خط لوله DETR (۱ از ۳): ستون فقرات (Backbone) The DETR Pipeline (1 of 3) The Backbone

  • خط لوله DETR (۲ از ۳): انکودر ترنسفورمر The DETR Pipeline (2 of 3) The Transformer Encoder

  • خط لوله DETR (۳ از ۳): دکودر و پیش‌بینی‌ها The DETR Pipeline (33) Decoder & Predictions

  • خط لوله DETR: شبکه‌های FFN پیش‌بینی The DETR Pipeline Prediction FFNs

  • بخش دوم مثال کد 4.4 Code Eg. 4.4 part

  • گردش کار کامل DETR DETR Complete workflow

  • ترکیب جادویی: زیان تطبیق دوقسمتی (Bipartite Matching Loss) The Secret Sauce Bipartite Matching Loss

  • مدل DETR در مقابل جهان: یک تغییر پارادایم DETR vs. The World A Paradigm Shift

  • بخش سوم مثال کد 4.4 Code Eg. 4.4 part

بخش‌بندی تصویر با یادگیری عمیق Image Segmentation with Deep Learning

  • مقدمه بخش‌بندی تصویر با یادگیری عمیق Image Segmentation with Deep Learning - Introduction

  • بخش‌بندی تصویر با یادگیری عمیق Image Segmentation with Deep Learning

  • بخش‌بندی معنایی (Semantic) در مقابل بخش‌بندی نمونه (Instance) Semantic vs. Instance Segmentation

  • هدف: طبقه‌بندی در سطح پیکسل The Goal Pixel-Level Classification

  • توضیح بخش اول مثال کد 5.1 Code Eg 5.1 part 1 Explaination

  • بخش‌بندی معنایی: معماری Semantic Segmentation The Architecture

  • بخش‌بندی معنایی: مفهوم Stuff Semantic Segmentation The Stuff

  • دیدگاه ریاضی (زیان پیکسل‌-محور) Mathematical Insight (Pixel-wise Loss)

  • توضیح بخش دوم مثال کد 5.1 Code Eg 5.1 part 2 Explaination

  • بخش‌بندی نمونه: معماری Instance Segmentation The Architecture

  • بخش‌بندی نمونه: مفهوم Things Instance Segmentation : "The Things"

  • دیدگاه ریاضی: زیان ترکیبی چند-وظیفه‌ای Mathematical Insight Hybrid Multi-Task Loss

  • توضیح بخش سوم مثال کد 5.1 Code Eg 5.1 part 3 Explaination

  • معماری‌های بخش‌بندی معنایی (FCN, U-Net) - اهداف یادگیری Architectures for Semantic Segmentation (FCN, U-Net) - Learning Objectives

  • تکامل معماری بخش‌بندی معنایی Semantic Segmentation Architecture Evolution

  • مشکل اصلی: از برچسب جهانی به نقشه پیکسلی The Core Problem From Global Label to Pixel Map

  • راهکار معماری‌ها The Architectures' Solution

  • توضیح بخش اول مثال کد 5.2 Code Eg 5.2 part 1 Explaination

  • طراحی انکودر-دکودر (۱ از ۲): انکودر The Encoder Decoder Design (1 of 2) The Encoder

  • طراحی انکودر-دکودر (۲ از ۲): دکودر The Encoder-Decoder Design (2 of 2) The Decoder

  • توضیح بخش دوم مثال کد 5.2 Code Eg 5.2 part 2 Explaination

  • روش شبکه کاملاً پیچشی (FCN) Fully Convolutional Network Method

  • طراحی شبکه کاملاً پیچشی (FCN) Fully Convolutional Network Design

  • مشکل گلوگاه (Bottleneck) و راهکار اتصالات جهشی (Skip Connection) The Bottleneck Problem & The Skip Connection Solution

  • توضیح بخش سوم مثال کد 5.2 Code Eg 5.2 part 3 Explaination

  • روش بخش‌بندی معنایی U-Net U-Net Semantic Segmentation Method

  • دقت جراحی U-Net (2015) U-Net Surgical Precision (2015)

  • چرا الحاق (Concatenation) بهتر است؟ Why Concatenation is Better

  • مقایسه FCN در مقابل U-Net و کاربردهای دنیای واقعی FCN vs. U-Net & Real-World Applications

  • توضیح بخش چهارم مثال کد 5.2 Code Eg 5.2 part 4 Explaination

  • معماری‌های بخش‌بندی نمونه (Mask R-CNN) - اهداف یادگیری Architectures for Instance Segmentation (Mask R-CNN) - Learning Objectives

  • معماری‌های بخش‌بندی نمونه (Mask R-CNN) Architectures for Instance Segmentation (Mask R-CNN)

  • گسترش معماری Faster R-CNN با سرِ ماسک (Mask Head) Extending Faster R-CNN Architecture with Mask Head

  • ترفند جداسازی: ماسک‌های مستقل از کلاس The Decoupling Trick Class-Agnostic Masks

  • توضیح بخش اول مثال کد 5.3 Code Eg 5.3 part 1 Explaination

  • مشکل خطای کوانتایزاسیون در ROI Pooling The Problem ROI Pooling's Quantization Error

  • راهکار ROI Align The Solution ROI Align

  • مکانیسم‌های ریاضی Mask R-CNN Mathematical Mechanics of Mask R-CNN

  • توضیح بخش دوم مثال کد 5.3 Code Eg 5.3 part 2 Explaination

  • مدل‌های پایه برای بخش‌بندی (SAM) - اهداف یادگیری Foundation Models for Segmentation (SAM) - Learning Objectives

  • مدل SAM به عنوان لحظه GPT برای تصاویر SAM as GPT moment for Images

  • مدل‌های پایه برای بخش‌بندی (SAM) Foundation Models for Segmentation (SAM)

  • تغییر از مدل‌های متخصص به مدل‌های همه‌منظوره The Shift From Specialists to Generalists

  • توضیح بخش اول مثال کد 5.4 Code Eg 5.4 part 1 Explaination

  • مرور کلی معماری SAM SAM Architecture Overview

  • معماری SAM (۱ از ۲): انکودر تصویر SAM Architecture (12) The Image Encoder

  • معماری SAM (۲ از ۲): انکودر پرامپت (مترجم) SAM Architecture (22) The Prompt Encoder (The Translator)

  • معماری SAM (۳ از ۳): دکودر ماسک (هنرمند) SAM Architecture (33) The Mask Decoder (The Artist)

  • توضیح بخش دوم مثال کد 5.4 Code Eg 5.4 part 2 Explaination

  • معماری و تکامل SAM 2 SAM 2 Architecture & Evolution

  • معماری و تکامل SAM 3 SAM 3 Architecture & Evolution

  • مقایسه SAM در مقابل SAM 2 و SAM 3 و کاربردهای واقعی Comparison SAM vs SAM 2 vs SAM 3 & Real world applications

  • توضیح بخش سوم مثال کد 5.4 Code Eg 5.4 part 3 Explaination

مدل‌های مولد و فراتر از CNNها Generative Models & Beyond CNNs

  • مقدمه مدل‌های مولد و فراتر از CNNها Generative Models & Beyond CNNs - Intro

  • اتوانکودرها (AEs) و اتوانکودرهای متغیر (VAEs) - اهداف یادگیری Autoencoders (AEs) and Variational Autoencoders (VAEs) - Learning Objectives

  • مقایسه اتوانکودرهای معمولی (AE) و متغیر (VAE) Autoencoders (AEs) vs. Variational Autoencoder

  • فضای محیطی (آشوب)، منیفولد و فضای نهفته (Latent Space) Ambient Space (The Chaos), Manifold,Latent Space

  • هسته AI مولد: منیفولد، فضای نهفته و اتوانکودرها The Core of Gen AI: Manifold, Latent Space & Autoencoders

  • دکودر: از نقشه به تصویر The Decoder - From Blueprint Back to Image

  • توضیح بخش اول مثال کد 6.1 Code Eg 6.1 part 1 Explaination

  • مرور کلی معماری اتوانکودر (AE) Autoencoder (AE) Architecture Overview

  • پیاده‌سازی و محدودیت‌های اتوانکودر Autoencoder Implementation & Limitations

  • تابع زیان اتوانکودر Autoencoder Loss function

  • توضیح بخش دوم مثال کد 6.1 Code Eg 6.1 part 2 Explaination

  • مرور کلی معماری اتوانکودر متغیر (VAE) Variational Auto-encoder (VAE) Architecture Overview

  • اتوانکودرهای متغیر: انقلاب احتمالات Variational Autoencoders The Probabilistic Revolution

  • ترفند بازپارامتری‌سازی در بینایی ماشین مولد (VAE) The Reparameterization Trick in Generative Computer Vision (VAE)

  • درک زیان VAE و تقابل AE در مقابل VAE Understanding VAE Loss & The AE vs VAE Showdown

  • توضیح بخش سوم مثال کد 6.1 Code Eg 6.1 part 3 Explaination

  • مقایسه AE در مقابل VAE AE vs. VAE Comparison

  • مدل β-VAE و بازنمایی‌های تفکیک‌شده β-VAE Disentangled Representations

  • اتوانکودر متغیر شرطی (cVAE) Conditional VAE (cVAE)

  • کاربردهای دنیای واقعی AEها و VAEها Real-World Applications of AEs & VAEs

  • توضیح بخش چهارم مثال کد 6.1 Code Eg 6.1 part 4 Explaination

  • شبکه‌های رقابتی مولد (GANs) - اهداف یادگیری Generative Adversarial Networks (GANs) - Learning Objectives

  • شبکه‌های رقابتی مولد (GANs) Generative Adversarial Networks (GANs)

  • حلقه آموزش GAN: مسیر رسیدن به تعادل نش GAN Training Loop Path to Nash Equilibrium

  • موتور ریاضی: بازی مین-مکس (Minimax) The Mathematical Engine - The Minimax Game

  • توضیح بخش اول مثال کد 6.2 Code Eg 6.2 part 1 Explaination

  • معماری DCGAN: نقشه راه برای GANهای پایدار DCGAN Architecture The Blueprint for Stable GANs

  • گام‌های آموزش GAN (۱): آموزش تشخیص‌دهنده (Discriminator) GAN Training Choreography 1 Discriminator Training

  • گام‌های آموزش GAN (۲): آموزش مولد (Generator) GAN Training Choreography Part 2 Generator Training

  • فرآیند کامل آموزش The Complete Choreography

  • توضیح بخش دوم مثال کد 6.2 Code Eg 6.2 part 2 Explaination

  • چالش‌های GAN: فروپاشی مود (Mode Collapse) و محو شدن گرادیان GAN Challenges - Mode Collapse & Vanishing Gradients

  • راهکار: Wasserstein GAN (WGAN) 6232 The Solution - Wasserstein GAN (WGAN)

  • مزایای WGAN و جزئیات پیاده‌سازی Advantages of WGAN & Implementation Details

  • توضیح بخش سوم مثال کد 6.2 Code Eg 6.2 part 3 Explaination

  • معماری StyleGAN: سنتز تفکیک‌شده StyleGAN Architecture The Disentangled Synthesis

  • معماری‌های پیشرفته GAN: مدل StyleGAN Advanced GAN Architectures StyleGAN

  • مدل CycleGAN: تبدیل تصویر به تصویر بدون جفت CycleGAN Unpaired Image to Image Translation

  • تبدیل CycleGAN بدون داده‌های جفت‌شده CycleGAN Translation Without Paired Data

  • ارزیابی معیارهای GAN بدون نظارت Evaluating the Unsupervised GAN Metrics

  • توضیح بخش چهارم مثال کد 6.2 Code Eg 6.2 part 4 Explaination

  • مقدمه‌ای بر ویژن ترنسفورمرها (ViT) - اهداف یادگیری Introduction to Vision Transformers (ViT) - Learning Objectives

  • ویژن ترنسفورمرها (ViT): تغییر پارادایم Vision Transformers (ViT) - The Paradigm Shift

  • معماری ویژن ترنسفورمر (ViT) The Vision Transformer ( ViT) Architecture

  • چرا بینایی به یک دید کلی (Global View) نیاز دارد؟ Why Vision Needs a Global View

  • مقایسه CNN در مقابل ViT: داستان دو دیدگاه CNN vs. ViT A Tale of Two Perspectives

  • توضیح بخش اول مثال کد 6.3 Code Eg 6.3 part 1 Explaination

  • موتور بینایی: توضیح Self-Attention The Engine of Vision - Self-Attention Explained

  • خود-توجهی (Self-Attention) و توجه چند-سره (Multi-head) Self-Attention & Multi-head attention

  • از پیکسل‌ها به توکن‌ها: فرآیند تکه-بندی (Patching) در ViT From Pixels to Tokens - The ViT Patching Process

  • گام ۱: تبدیل تکه‌ها به Embeddingهای توکن Step 1 - Flattening Patches to Token Embeddings

  • خط لوله کامل The Complete Pipeline

  • گام ۲: تصویر خطی از پیکسل‌ها به کلمات بصری Step -2 Linear Projection From Pixels to Visual Words

  • توضیح بخش دوم مثال کد 6.3 Code Eg 6.3 part 2 Explaination

  • گام ۳: کدگذاری موقعیتی (Positional Encoding) و حافظه فضایی Step 3 - Positional Encoding Vision Spatial Memor

  • گام ۴: انکودر ترنسفورمر - هسته پردازشی Step 4 - Transformer Encoder The Processing Core

  • نرمال‌سازی لایه، MLP و اتصالات باقی‌مانده (Residual) Layer Normalisation, MLP & Residual Connections

  • توضیح بخش سوم مثال کد 6.3 Code Eg 6.3 part 3 Explaination

  • مدل ELA ViT (آگاه از چشم‌انداز انرژی) Energy Landscape-Aware ViT (ELA-ViT)

  • ویژن ترنسفورمر هایپرگراف (HgVT) Hypergraph Vision Transformer (HgVT)

  • نوآوری‌های ویژن ترنسفورمر در سال ۲۰۲۵ 2025 Vision Transformer Innovations

  • ترنسفورمر تصویری بهینه در داده (DeiT) Data-efficient Image Transformer ( DeiT)

  • ترنسفورمر Swin: ویژن ترنسفورمر سلسله‌مراتبی Swin Transformer Hierarchial Vision Transformer

  • توضیح بخش چهارم مثال کد 6.3 Code Eg 6.3 part 4 Explaination

  • جاسازی‌های بصری (Visual Embeddings) و جستجوی تصویر - اهداف یادگیری Visual Embeddings and Image Search - Learning Objectives

  • درک مدل‌های Embedding در بینایی ماشین مولد Understanding Embedding Models in Generative CV

  • جاسازی‌های بصری و جستجوی تصویر: نقشه تصاویر Visual Embeddings & Image Search - The Map of Images

  • از پیکسل‌ها به بردارهای معنایی: خط لوله Embedding From Pixels to Semantic Vectors - The Embedding Pipeline

  • پیش‌پردازش تصویر در CV مولد: تغییر اندازه و نرمال‌سازی Image Pre-processing in Generative CV Resize & Normalize

  • نهایی کردن Embedding: تصویر (Projection) و نرمال‌سازی Finalizing the Embedding - Projection & Normalization

  • نرمال‌سازی L2 و ارتباط با شباهت کسینوسی L2 Normalization Resonance with Cosine Similarity

  • توضیح بخش اول مثال کد 6.4 Code Eg 6.4 part 1 Explaination

  • مدل SimCLR: یادگیری بازنمایی بصری از نماهای افزوده شده SimCLR Learning Visual Repr. From Augmented Views

  • یادگیری مقابله‌ای (Contrastive Learning) با SimCLR Contrastive Learning with SimCLRTeaching

  • زیان Triplet در تشخیص چهره Triplet Loss in Face Recognition

  • جستجوی بهینه: یافتن یک تصویر در میان میلیاردها تصویر Efficient Search - Finding an Image in Billion-Images

  • استراتژی‌های ایندکس‌گذاری FAISS FAISS Indexing strategies

  • توضیح بخش دوم مثال کد 6.4 Code Eg 6.4 part 2 Explaination

  • ایندکس فایل معکوس (IVF) برای جستجوی بهینه Inverted File Index ( IVF ) for Efficient Search

  • ایندکس کوانتایزاسیون محصول (PQI) برای جستجوی بهینه Product Quantization Index (PQI) for Efficient Search

  • مدل HNSW برای جستجوی بهینه Hierarchical Navigable Small World ( HNSW) for Efficient Search

  • توضیح بخش سوم مثال کد 6.4 Code Eg 6.4 part 3 Explaination

  • کاربرد ۱: جستجوی معکوس تصویر Application 1 Reverse Image Search

  • تشخیص چهره و ArcFace Face Recognition & ArcFace

  • معماری انکودر دوگانه CLIP CLIP Dual-Encoder Architecture

  • کاربردهای جستجوی چند-وجهی (Multimodal) با CLIP Applications of Multimodal search with CLIP

  • توضیح بخش چهارم مثال کد 6.4 Code Eg 6.4 part 4 Explaination

نمایش نظرات

آموزش بینایی ماشین: از پردازش تصویر تا هوش مصنوعی مولد و ویژن ترنسفورمرها [ویدئویی]
جزییات دوره
34h 6m
360
Packtpub Packtpub
(آخرین آپدیت)
از 5
ندارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Vinit Kumar Singh Vinit Kumar Singh

وینیت کومار سینگ مشاور و مدرس هوش مصنوعی با بیش از ۱۸ سال تجربه در علوم داده و هوش مصنوعی است که در زمینه‌های Fine-Tuning مدل‌های زبانی بزرگ (LLM)، هوش مصنوعی صوتی، مدل‌های زبانی گفتاری، هوش مصنوعی عامل‌محور (Agentic AI) و بینایی ماشین تخصص دارد. او فارغ‌التحصیل IIT بمبئی است و گواهینامه‌های استنفورد در یادگیری ماشین و یادگیری عمیق را داراست. در حال حاضر به عنوان مشاور در تیم گفتار و زبان در مرکز نرم‌افزاری سونی هند فعالیت می‌کند و بر راهکارهای پیشرفته AI و استقرار واقعی تمرکز دارد. پیش از این، او روی پروژه‌های بینایی ماشین با سخت‌افزار لبه Nvidia در Assert AI کار کرده و مشاوره جامع AI را در tvam Technologies مدیریت نموده است. آثار او شامل ساخت جریان‌های کاری FinTech عامل‌محور، یک ربات-مشاور با استفاده از LoRA روی DeepSeek-R1 و یک خط لوله تماس‌گیرنده هوش مصنوعی صوتی است. وینیت همچنین به عنوان یکی از ۳ درصد برتر تولیدکنندگان محتوای Udemy در سطح جهان شناخته می‌شود و زبان‌آموزانی از بیش از ۱۵۰ کشور دارد. دوره‌ها و تخصص او مورد اعتماد شرکت‌های پیشرو مانند آدیداس، بارکلیز و فولکس‌واگن است و او به فعالیت فعال خود در زمینه‌های Voice AI، Agentic AI، بینایی ماشین، NLP و LLMها ادامه می‌دهد.