آموزش هوش مصنوعی مولد برای صوت و تصاویر: مدل‌ها و کاربردها - آخرین آپدیت

دانلود Generative AI for Audio and Images: Models and Applications

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: دوره «هوش مصنوعی مولد برای صوت و تصاویر: مدل‌ها و کاربردها» کاوشی عمیق در نحوه استفاده از مدل‌های مولد مدرن مانند خودرمزگذار‌های متغیر (VAEs)، شبکه‌های مولد رقابتی (GANs)، ترنسفورمرها و مدل‌های انتشار (Diffusion) برای خلق، دستکاری و بهبود محتوای صوتی، تصویری و ویدئویی است. آموزش‌گیرندگان معماری‌ها، فرآیندهای آموزش و موارد استفاده از این مدل‌ها را در انواع حالات مختلف بررسی می‌کنند و از طریق فعالیت‌های عملی، هم درک مفهومی و هم بینش‌های کاربردی به دست می‌آورند. این دوره همچنین به بررسی پیامدهای اخلاقی و اجتماعی هوش مصنوعی مولد، از جمله سوگیری، شفافیت، مالکیت معنوی و چالش‌های فناوری‌های جعل عمیق (Deepfake) می‌پردازد. این دوره با پوشش تئوری‌های بنیادی و همچنین رویکردها و کاربردهای پیشرفته، یادگیرندگان را آماده می‌کند تا هوش مصنوعی مولد را به شکلی خلاقانه و مسئولانه در حوزه‌های صوت و تصویر به کار گرفته و توسعه دهند. در پایان این دوره، یادگیرندگان قادر خواهند بود: مفاهیم اصلی، چالش‌ها و تاریخچه صوت تولید شده توسط هوش مصنوعی را ترسیم کنند. مدل‌های بنیادی مهم تولید صوت، مانند خودرمزگذارهای متغیر و کوانتیزه شده برداری (VAE و VQ-VAE) را تحلیل کنند. نحوه ادغام این مدل‌ها با جدیدترین فناوری‌های GenAI برای ایجاد سیستم‌های ترکیبی و پیشرفته تولید صوت مبتنی بر ترنسفورمر و انتشار را بررسی کنند. معماری و عملکرد شبکه‌های مولد رقابتی (GANs) و انواع آن‌ها را مطالعه کنند. مدل‌های GAN را برای ایجاد و بهبود محتوای بصری پیاده‌سازی و آموزش دهند. تکنیک‌های پیشرفته مانند مدل‌های انتشار و ترنسفورمرها را برای خلق تصویر و ویدئو کشف کنند. درباره ملاحظات اخلاقی مربوط به هوش مصنوعی مولد برای صوت و تصاویر بحث و تبادل نظر کنند.

سرفصل ها و درس ها

مبانی صوت تولید شده توسط هوش مصنوعی The Fundamentals of AI-generated audio

  • مقدمه دوره Course Introduction

  • آشنایی با مدرس: آناهیتا دوستی Meet your instructor: Anahita Doosti

  • آشنایی با مدرس: نسیم اصغریان Meet your instructor: Nasimeh Asgarian

  • مروری بر هوش مصنوعی برای تولید صوت و موسیقی Overview of AI for Audio and Music Generation

  • چرا تولید صوت دشوار است؟ Why Is Audio Generation Difficult?

  • نمایش داده‌ها: شکل موج در مقابل نمادین Data representation: Waveform vs Symbolic

  • فرمت‌های داده Data Formats

  • ارزیابی (بخش ۱) Evaluation (part 1)

  • ارزیابی (بخش ۲) Evaluation (part 2)

  • دسته‌بندی رویکردهای تولید صوت Categorizing Audio Generation Approaches

  • اشکال مختلف تولید صوت The Many Forms of Audio Generation

  • عملکرد صوتی Audio Functionality

  • همکاری انسان و هوش مصنوعی Human-AI Collaboration

  • به کارگیری عملی Putting It into Practice

  • مروری بر پیشرفت‌ها در طول سال‌ها An Overview of the Progress Throughout the Years

  • رویکردهای پیش از یادگیری ماشین: الگوریتمی و مبتنی بر قانون Pre-ML Approaches: Algorithmic, Rule-Based

  • رویکردهای اولیه یادگیری ماشین: HMMها و شبکه‌های عصبی Feed-forward Early ML Approaches: HMMs, FF Neural Networks

  • رویکردهای مدرن ۱: RNNها و CNNها Modern Approaches 1: RNNs and CNNs

  • رویکردهای مدرن ۲: خودرمزگذارها/VAEs و GANها Modern Approaches 2: Autoencoders/VAEs and GANs

  • رویکردهای مدرن ۳: ترنسفورمرها و انتشار (Diffusion) Modern Approaches 3: Transformers and Diffusion

  • مرور فصل ۱ Module 1 Recap

تولید صوت پیشرفته با هوش مصنوعی مولد Advanced audio generation with Generative AI

  • مقدمه‌ای بر خودرمزگذارهای متغیر (VAEs) Introduction to Variational Autoencoders

  • خودرمزگذارها (Autoencoders) Autoencoders

  • فضای نهفته (Latent Space) Latent Space

  • ساختار بلوک‌های رمزگذار-رمزگشا Inside the Encoder-Decoder Blocks

  • آموزش VAEها (بخش ۱) Training VAEs (Part 1)

  • آموزش VAEها (بخش ۲) Training VAEs (Part 2)

  • خودرمزگذارهای متغیر کوانتیزه شده برداری (بخش ۱) Vector Quantized Variational Autoencoders (Part 1)

  • خودرمزگذارهای متغیر کوانتیزه شده برداری (بخش ۲) Vector Quantized Variational Autoencoders (Part 2)

  • استفاده از VAE برای تولید ملودی Using VAE to Generate Melodies

  • چگونه VAEها را با اطلاعات موسیقی اضافی مانند آکورد و گام مشروط کنیم؟ How to Condition VAEs with Additional Musical Information Such as Chord, Scale?

  • مثال: MusicVAE Example: MusicVAE

  • محاسبات بردار ویژگی برای ملودی‌ها Attribute Vector Arithmetic for Melodies

  • مثال: Jukebox Example: Jukebox

  • مثال: سنتز گفتار Example: Speech Synthesis

  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر VAE Strengths and limitations of VAE-based approaches

  • مبانی ترنسفورمر Transformer Primer

  • ترنسفورمرها برای تولید صوت Transformers for Audio Generation

  • مثال: Music Transformer Example: Music Transformer

  • بازبینی JukeBox: چگونه ترنسفورمرها می‌توانند صوت موجی تولید کنند! (بخش ۱) Revisiting JukeBox: How Transformers Can Generate Waveform Audio! (Part 1)

  • بازبینی JukeBox: چگونه ترنسفورمرها می‌توانند صوت موجی تولید کنند! (بخش ۲) Revisiting JukeBox: How Transformers Can Generate Waveform Audio! (Part 2)

  • یک پارادایم جدید: کدک صوتی + مدل زبانی (بخش ۱) A New Paradigm: Audio Codec + Language Model (Part 1)

  • یک پارادایم جدید: کدک صوتی + مدل زبانی (بخش ۲) A New Paradigm: Audio Codec + Language Model (Part 2)

  • مثال: FastSpeech Example: FastSpeech

  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر ترنسفورمر Strengths and Limitations of Transformer-Based Approaches

  • مدل‌های انتشار چیستند و چگونه می‌توانند صوت تولید کنند؟ What Are Diffusion Models, and How Can They Generate Audio?

  • مثال: Stable Audio Example: Stable Audio

  • مثال: DiffWave Example: DiffWave

  • نقاط قوت و محدودیت‌های رویکردهای مبتنی بر انتشار Strengths and Limitations of Diffusion-Based Approaches

  • مقایسه مدل‌های اخیر با یکدیگر How Do the Recent Models Compare to Each Other?

  • آینده چیست؟ به کجا می‌رویم؟ What Is on the Horizon? Where Are We Headed?

  • مرور فصل ۲ Module 2 Recap

مقدمه‌ای بر مدل‌های تصویر مولد Introduction to Generative Image Models

  • مروری بر هوش مصنوعی برای تولید تصویر و ویدئو Overview of AI for Image and Video Generation

  • کاربردهای تولید تصویر و ویدئو Applications of Image and Video Generation

  • مثال‌هایی از DALL-E و MidJourney DALL-E and MidJourney Examples

  • مثال‌هایی از Sora Sora Examples

  • تاریخچه کوتاه تولید تصویر A Short History of Image Generation

  • بازبینی VAE Revisit VAE

  • معرفی GAN Introducing GAN

  • تبعیض‌گذار (Discriminator) Discriminator

  • مولد (Generator) Generator

  • آموزش GAN GAN Training

  • چالش‌ها و بهترین روش‌ها برای آموزش GAN Challenges and Best Practices for GAN Training

  • GAN پیش‌رونده (Progressive GAN) Progressive GAN

  • GANهای مشروط (Conditional GANs) Conditional GANs

  • کاربردها، مزایا و محدودیت‌های cGANs Applications, Advantages and Limitations of cGANs

  • ترجمه تصویر به تصویر Image-to-Image Translation

  • چالش‌ها و کاربردهای ترجمه تصویر به تصویر Challenges and Applications of Image-to-Image Translation

  • GAN متن به تصویر Text to Image GAN

  • سایر انواع GAN: Cycle GAN, DCGAN, StyleGAN Other GAN Variations: Cycle GAN, DCGAN, StyleGAN

  • طراحی خلاقانه Creative design

  • موارد استفاده تجاری Commercial Use Cases

  • افزایش داده‌ها (Data Augmentation) Data Augmentation

  • مرور فصل ۳ Module 3 Recap

تولید پیشرفته تصویر و ویدئو با هوش مصنوعی مولد Advanced Image and Video Generation with Generative AI

  • مروری بر مدل‌ها و معماری‌های کلیدی Overview on Key Models and Architectures

  • مرور سطح بالای ویژن ترنسفورمر High-Level Overview of Vision Transformer

  • الگوی طراحی رمزگذار-رمزگشا Encoder-Decoder Design Pattern

  • رمزگذارهای کانولوشنال Convolutional Encoders

  • خود-توجهی (Self Attention) Self Attention

  • توجه مکانی در مقابل کانالی و زمانی Spatial vs. Channel vs. Temporal Attention

  • مرور سطح بالای معماری مدل انتشار Diffusion Model Architecture High-Level Overview

  • فرآیند رفت/انتشار Forward / Diffusion Process

  • فرآیند معکوس Reverse Process

  • آموزش مدل انتشار Diffusion Model Training

  • مثال‌هایی از مدل انتشار Examples of Diffusion Model

  • سوگیری در داده‌های آموزشی Bias in Training Data

  • شفافیت Transparency

  • مالکیت معنوی Intellectual Property

  • حریم خصوصی داده‌ها Data Privacy

  • مقدمه‌ای بر جعل عمیق (Deepfake) Deepfake Intro

  • جعل عمیق: تعویض چهره Deep Fake - Face Swap

  • شبیه‌سازی صدا (Voice Cloning) Voice Cloning

  • جعل عمیق ویدئویی Video Deep Fake

  • مرور فصل ۴ Module 4 Recap

  • جمع‌بندی دوره Course Wrap Up

نمایش نظرات

آموزش هوش مصنوعی مولد برای صوت و تصاویر: مدل‌ها و کاربردها
جزییات دوره
29h 17m
95
(آخرین آپدیت)
322
- از 5
دارد
دارد
دارد
Chris Croft
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Chris Croft Chris Croft

مربی مدیریت، سخنران، نویسنده