لطفا جهت اطلاع از آخرین دوره ها و اخبار سایت در
کانال تلگرام
عضو شوید.
آموزش تسلط بر هوش مصنوعی مولد صوت: از توکنها تا TTS عاملمحور
- آخرین آپدیت
دانلود Mastering Generative Voice AI: From Tokens to Agentic TTS
نکته:
ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره:
تسلط بر مدلهای زبانی صوت (SpeechLMs)، کدکهای صوتی عصبی، دیفیوژن و Flow Matching برای ساخت سیستمهای هوش مصنوعی صوتی عاملمحور و بلادرنگ
توضیح فیزیک، آواشناسی و ویژگیهای آکوستیکی که زیربنای تولید گفتار انسانی هستند
مقایسه خط لولههای سنتی TTS آبشاری با معماریهای مدرن مدلهای زبانی صوت (SpeechLM)
ساخت و بهکارگیری کدکهای صوتی عصبی و توکنسازی معنایی (EnCodec, HuBERT, wav2vec 2.0, RVQ)
پیادهسازی TTS مبتنی بر کدک خودبازگشتی با استراتژیهای رمزگشایی توکنهای چندجریانی
طراحی مدلهای یکپارچه متن-گفتار با ترازسازی متقاطع-مودال و کنترل پارالینگویستیک
بهکارگیری دیفیوژن نهفته و Flow Matching شرطی برای تولید مل-اسپکتروگرامهای با کیفیت بالا
ارزیابی توازن بین Flow Matching و دیفیوژن از نظر سرعت، کیفیت و کنترلپذیری
استقرار سیستمهای TTS عاملمحور با تأخیر کم و استریمینگ با قابلیت مدیریت وقفههای بلادرنگ
پيشنیازها: درک مناسب از مبانی یادگیری عمیق (شبکههای عصبی، پسانتشار و اصول آموزش)
تسلط کاربردی بر پایتون و یک فریمورک یادگیری عمیق مانند PyTorch
آشنایی اولیه با مفاهیم اصلی NLP یا LLM (توکنسازی، ترنسفورمرها، توجه) مفید است اما اجباری نیست — ایدههای کلیدی در دوره مرور میشوند
بدون نیاز به تجربه قبلی در پردازش سیگنالهای صوتی — ماژول ۱ این مباحث را از اصول اولیه میسازد
هوش مصنوعی مولد صوت بسیار فراتر از تبدیل ساده متن به گفتار حرکت کرده است — و این دوره شما را از فیزیک صدا تا ساخت سیستمهای صوتی عاملمحور در سطح تولید (Production) میبرد.
بسیاری از دورههای TTS در حد ووکودرهای ابتدایی یا APIهای آماده متوقف میشوند. این دوره عمیقتر میرود. شما با مبانی گفتار انسانی — آکوستیک، آواشناسی و بوطیقا — شروع میکنید و سپس به سراغ معماریهایی میروید که مدلهای صوتی پیشرفته امروز را قدرت میبخشند: یادگیری بازنمایی خود-نظارتی (wav2vec 2.0, HuBERT)، کدکهای صوتی عصبی (EnCodec, SoundStream, DAC) و استراتژیهای توکنسازی که به LLMها اجازه «صحبت کردن» میدهد.
از آنجا، شما بر دو پارادایم غالب مدرن مسلط خواهید شد — TTS مبتنی بر کدک خودبازگشتی و دیفیوژن نهفته / Flow Matching شرطی — و دقیقاً درک خواهید کرد که هر کدام چه زمانی و چرا در سیستمهای واقعی استفاده میشوند. همچنین مدلهای یکپارچه گفتار-متن، مدلسازی پارالینگویستیک (خنده، تنفس، عواطف) و کلونینگ صدای Zero-shot را بررسی خواهید کرد.
در ماژول نهایی، یاد میگیرید چگونه خط لولههای صوتی عاملمحور با تأخیر کم و استریمینگ بسازید — همان تکنیکهایی که پشت عوامل هوش مصنوعی مکالمهای بلادرنگ هستند — شامل استنتاج تکهای (Chunked)، رمزگشایی گمانهزن (Speculative Decoding)، استریمینگ WebSocket و مدیریت نوبتهای گفتگو.
آنچه خواهید آموخت:
علم تولید گفتار و استخراج ویژگیهای آکوستیک
نحوه عملکرد کدکهای صوتی عصبی و توکنسازی معنایی
معماریهای TTS خودبازگشتی و مبتنی بر دیفیوژن/فلو
تکنیکهای ترازسازی متقاطع-مودال گفتار-متن
ساخت عوامل صوتی مکالمهای با تأخیر کم و حساس به وقفه
چه مهندس ML باشید، چه پژوهشگر یا مؤسس تکنولوژیهای صوتی، این دوره تصویر کامل معماری را به شما میدهد — از توکنها تا عوامل.
سرفصل ها و درس ها
ماژول ۱: رمزگشایی صدای انسان — فیزیک، آواشناسی و ویژگیها
Module 1 : Decoding the Human Voice — Physics, Phonetics, and Features
مقدمهای بر درس ۱.۱ فیزیک گفتار
Intro to Lect 1.1 Physics of speech
۲۴۱۳ کدکهای صوتی عصبی — توازن بین اندازه کدبوک و وفاداری صوتی
2413 Neural Audio Codecs – Codebook Size vs. Fidelity Trade‑off
۲۴۲۱ توکنسازی آکوستیک — از برش صوتی به اعداد صحیح گسسته
2421 Acoustic Tokenization – From Audio Slice to Discrete Integers
۲۴۲۲ RVQ برای توکنسازی سلسلهمراتبی
2422 RVQ for Hierarchial Tokenization
۲۴۲۳ تئوری اصلی بازنمایی صوتی و جریان — کوانتیزاسیون برداری باقیمانده (RVQ)
2423 Core Theory of Audio Representation & Flow – Residual Vector Quantization R
۲۴۲۴ ساختار: از صوت خام به بردارهای پیوسته کاهش-نمونه شده
2424 The Setup - Raw Audio to Down-sampled Continuous Vectors
۲۴۲۵ از بردارهای پیوسته به کدبوکهای کوانتیزاسیون برداری باقیمانده (RVQ)
2425 Continuous Vectors to Residual Vector Quantisation RVQ Codebooks
۲۴۳۱ ویژگی سلسلهمراتبی RVQ
2431 Hierarchical Property of RVQ
۲۴۳۲ کوانتیزاسیون برداری باقیمانده — آنالوژی آدرس خانه
2432 Residual Vector Quantization – The House Address Analogy
۲۴۳۳ چرا RVQ برنده است
2433 Why RVQ wins
۲۴۴۱ Soundstream گوگل
2441 Google-s Soundstream
۲۴۴۲ Encodec متا
2442 Encodec -Meta
۲۴۴۳ مدل صوتی Descript (DAC)
2443 Descript Audio Model DAC
۲۴۵۱ چالشهای نظری و مسائل باز — کدکهای عصبی مبتنی بر RVQ
2451 Theoretical Challenges & Open Problems – RVQ-Based Neural Codecs
۳۱۷۱ چالشهای نظری و مسائل باز — توکنسازی چندجریانی RVQ
3171 Theoretical Challenges & Open Problems – RVQ Multi‑Stream Tokenization
۳۱۷۲ تکامل توالیبندی صدا — از رگرسیون پیوسته به RVQ درهمتنیده
3172 Evolution of Sound Sequencing – From Continuous Regression to Interleaved R
مثال کد ۳.۱ استراتژیهای توکن چندجریانی: تختسازی در مقابل درهمتنیدگی
Code Eg 3.1-Multi-stream token strategies: Flattening vs. interleaving RVQ codeb
مقدمه درس ۳.۲ رمزگشایی خودبازگشتی: نمونهبرداری، top-k و CFG برای صوت
Intro Lect 3.2 Autoregressive decoding: Sampling, top-k, and cfg for audio
۳۲۱۱ رمزگشایی خودبازگشتی — نمونهبرداری، Top-k و راهنمایی بدون طبقهبند (CFG)
3211 Autoregressive Decoding – Sampling, Top‑k, and Classifier‑Free Guidance for
۳۲۱۲ مقیاسبندی دما (Temperature) — کنترل تصادفی بودن آکوستیک
3212 Temperature Scaling – Controlling Acoustic Randomness
۳۲۱۳ نمونهبرداری Top-k و هستهای (Top-p) — فیلتر کردن دم بلند (Long Tail)
3213 Top‑k and Nucleus -Top‑p Sampling – Filtering the Long Tail
مثال کد ۳.۲ رمزگشایی خودبازگشتی: نمونهبرداری، top-k و CFG
Code Eg 3.2-Autoregressive decoding: Sampling, top-k, and cfg
مقدمه درس ۳.۳ شرطیسازی گوینده، کنترل احساس و تزریق بوطیقا (Prosody)
Intro Lect 3.3 Speaker conditioning, emotion control, and prosody injection
۳۳۱۱ شرطیسازی گوینده، کنترل احساس و تزریق بوطیقا
3311 Speaker Conditioning, Emotion Control & Prosody Injection
۳۳۱۲ روشهای شرطیسازی و مقایسه آنها
3312 Conditioning Methods & their Comparison
۳۳۲۱ مبانی نظری شرطیسازی گوینده، کنترل احساس و تزریق بوطیقا
3321 Speaker Conditioning, Emotion Control, Prosody Injection – Theoretical Foun
۳۳۲۲ مفاهیم اصلی — جاسازیهای گوینده (Speaker Embeddings) و پرامپتهای آکوستیک
3322 Core Concepts – Speaker Embeddings and Acoustic Prompts
۳۳۳۱ بوطیقا (Prosody) — چیست و انواع آن کدامند
3331 Prosody - What is it & its type
۳۳۳۲ راهنمایی بدون طبقهبند (CFG) برای استایل — تقویت احساس و شناسایی گوینده
3332 Classifier‑Free Guidance -CFG for Style – Amplifying Emotion & Speaker Iden
۳۳۴۱ شرطیسازی گوینده و احساس — تئوری دقیق عملکرد (گامهای ۱ تا ۳ از ۵)
3341 Speaker & Emotion Conditioning – Detailed Working Theory -Steps 1 to 3 of 5
۳۳۴۲ شرطیسازی گوینده و احساس — توجه خود-محور و تولید متوالی
3342 Speaker & Emotion Conditioning – Self‑Attention & Sequential Generation -St
۳۳۵۱ VALL-E توسط مایکروسافت
3351 VALL‑E by Microsoft
۳۳۵۲ Spear TTS توسط گوگل
3352 Spear-TTS by Google
۳۳۵۳ توکنهای استایل جهانی (GST) — جاسازیهای احساس پیوسته برای کنترل دقیق
3353 Global Style Tokens -GST Legacy – Continuous Emotion Embeddings for Granula
۳۳۶۱ چالشهای نظری و مسائل باز — کنترل گفتار اکسپرسیو
3361 Theoretical Challenges & Open Problems – Expressive Speech Control
۳۳۶۲ تکامل شرطیسازی صدا — از HMMها به SpeechLMهای در-بافت (In-Context)
3362 Evolution of Voice Conditioning – From HMMs to In‑Context SpeechLMs
۳۳۶۳ مسیرهای نظری آینده — کدکهای فاکتورگیری شده و جداسازی احساس بدون نظارت
3363 Future Theoretical Directions – Factorized Codecs & Unsupervised Emotion Di
مثال کد ۳.۳ شرطیسازی گوینده، کنترل احساس و تزریق بوطیقا
Code Eg 3.3-Speaker conditioning, emotion control, and prosody injection
ماژول ۴: پیوند متن و صوت — SpeechLMهای یکپارچه و ترازسازی متقاطع-مودال
Module 4: The Audio-Text Nexus — Unified SpeechLMs and Cross-Modal Alignment
۴۲۷۱ Flow-Matching پیوسته و مدلهای دیفیوژن — تولید گفتار هدایتشده با ODE
4271 Continuous Flow‑Matching & Diffusion Models – ODE‑Guided Speech Generation
۴۲۸۱ چالشهای نظری و مسائل باز
4281 Theoretical Challenges and Open Problems
۴۲۸۲ تکامل ترازسازی گفتار متقاطع-مودال — از HMMهای آبشاری به پیش-آموزش مشترک
4282 Evolution of Cross‑Modal Speech Alignment – From Cascaded HMMs to Joint Pre
۴۳۳۱ میکروبوطیقا در مقابل ماکروبوطیقا — مقیاسهای زمانی پارالینگویستیک
4331 Micro‑Prosody vs. Macro‑Prosody – Temporal Scales of Paralinguistics
۴۳۴۱ لکنت به عنوان یک نشانگر کاربردی — از نویز به سیگنال استراتژیک
4341 Disfluency as a Pragmatic Marker – From Noise to Strategic Signal
۴۳۵۱ گسستهسازی آکوستیک و توکنهای صوتی — تبدیل پارالینگویستیک به برچسبهای کاذب
4351 Acoustic Discretization & Audio Tokens – Turning Paralinguistics into Pseud
۴۳۵۲ پیشبینی خودبازگشتی مشترک و شرطیسازی نهفته — تولید پارالینگویستیک
4352 Joint Autoregressive Prediction & Latent Conditioning – Generating Paraling
۴۳۶۱ تئوری دقیق عملکرد — مدلسازی پارالینگویستیک در SpeechLMها
4361 Detailed Working Theory – Modeling Paralinguistics in SpeechLMs
۴۳۷۱ توکنهای استایل جهانی (GST) برای ماکروبوطیقا
4371 Global Style Tokens -GSTs for Macro‑Prosody
۴۳۷۲ اتوانکودرهای متغیر سلسلهمراتبی (VAEs) — فضاهای نهفته تودرتو برای مدلسازی
4372 Hierarchical Variational Autoencoders -VAEs – Nested Latent Spaces for Mult
۴۳۷۳ VAEهای سلسلهمراتبی — روش ELBO و ترفند بازپارامتریسازی
4373 Hierarchical VAEs - The ELBO Method & The Reparameterization Trick
۴۳۷۴ SpeechLMهای گسسته — یکپارچهسازی زبانشناسی و پارالینگویستیک
4374 Discrete SpeechLMs – Unifying Linguistics & Paralinguistics via Acoustic To
۴۳۷۵ Flow-Matching پیوسته و دیفیوژن — تغییر جریان احتمال با پارالینگویستیک
4375 Continuous Flow‑Matching & Diffusion – Warping the Probability Flow with Pa
۴۳۸۱ چالشهای نظری و مسائل باز — مدلسازی پارالینگویستیک
4381 Theoretical Challenges & Open Problems – Paralinguistic Modelin
۴۳۸۲ تکامل مدلسازی پارالینگویستیک — از قوانین دستی به تولید مشترک
4382 Evolution of Paralinguistic Modeling – From Hand‑Crafted Rules to Joint Gen
۴۳۸۳ مسیرهای نظری آینده — خودجوش بودن عاملمحور و ادغام عواطف چند-مودالی
4383 Future Theoretical Directions – Agentic Spontaneity & Multimodal Affect Int
مثال کد ۴.۳ مدلسازی پارالینگویستیک: خنده، تنفس و لکنت
Code Eg 4.3 Modeling paralinguistics: Laughter, breathing, disfluency, and affec
مثال کد ۴.۳ بخش دوم VAE سلسلهمراتبی و بوطیقای گسسته
Code Eg 4.3 ii Hierarichal VAE & Discrete Prosody-esv2-50p-bg-10p-music-
مقدمه ۵.۱ معماریهای DDPM، مدلهای مبتنی بر امتیاز (Score-based) و دیفیوژن نهفته برای مل-اسپکتروگرام
Intro 5.1 DDPM, score-based, and latent diffusion architectures for mel-spectrgm
۵۱۱۱ مکانیک دیفیوژن احتمالی — شهود اصلی
5111 Probabilistic Diffusion Mechanics – The Core Intuition
۵۲۳۲ NaturalSpeech 2 و 3 — دیفیوژن پیوسته با فضای نهفته فاکتورگیری شده
5232 NaturalSpeech 2 & 3 – Continuous Diffusion with Disentangled Factorized Lat
۵۲۳۴ TorToiSe TTS — پیشگام تکاملی سنتز گفتار هیبریدی
5234 TorToiSe-TTS – The Evolutionary Precursor of Hybrid Speech Synthesis
۵۲۴۱ چالشهای نظری و مسائل باز — پل زدن بین LLM گسسته و پیوسته
5241 Theoretical Challenges & Open Problems – Bridging Discrete LLM & Continuous
۵۲۴۲ تکامل و بافت تاریخی — پاندول تولید گفتار
5242 Evolution & Historical Context – The Pendulum of Speech Generation
مثال کد ۵.۲ پل زدن بین توکنهای معنایی گسسته و دیفیوژن آکوستیک پیوسته
Code Eg 5.2 Bridging discrete LLM semantic tokens with continuous acoustic diffu
ماژول ۶: تسلط بر مسیر — Flow Matching شرطی و حلکنندههای ODE
Module 6: Mastering the Trajectory — Conditional Flow Matching and ODE Solvers
مقدمه ۶.۱ گامهای زمانی پیوسته در مقابل گسسته، حلکنندههای ODE و Rectified Flow
Intro to 6.1 Continuous vs. discrete time steps, ODE solvers, and Rectified Flow
۶۱۱۱ دیفیوژن زمان پیوسته و حلکنندههای ODE
6111 Continuous-Time Diffusion & ODE Solvers
۶۱۱۲ گامهای زمانی گسسته — زنجیره مارکوف کلاسیک DDPM
6112 Discrete Time Steps – The Classical DDPM Markov Chain
۶۱۱۳ فرمولبندی زمان پیوسته — از گامهای گسسته به یک جریان نرم
6113 Continuous Time Formulation – From Discrete Steps to a Smooth Flow
۶۱۱۴ مزایای زمان پیوسته — رهایی از گامهای گسسته
6114 The Advantages of Continuous Time – Breaking Free from Discrete Steps
مثال کد ۱ دیفیوژن زمان پیوسته و حلکنندههای ODE
Code Eg 1 Continuous-Time Diffusion & ODE Solvers
۶۱۲۱ بررسی عمیق حلکنندههای ODE — ODE جریان احتمال
6121 Deep Dive into ODE Solvers – Probability Flow ODE
۶۱۲۲ مقایسه حلکنندههای محبوب ODE — سرعت در مقابل دقت
6122 Comparing Popular ODE Solvers – Speed vs. Accuracy
۶۱۲۳ روش اویلر مرتبه اول — پیشبین-اصلاحگر برای مسیرهای منحنی
6123 Eulers Method 1st Order – Predictor‑Corrector for Curved Paths
۶۱۲۴ روش هیون (Heun) مرتبه دوم — پیشبین-اصلاحگر برای مسیرهای منحنی
6124 Heun's Method 2nd Order – Predictor‑Corrector for Curved Paths
۶۱۲۵ حلکنندههای مرتبه بالاتر و تطبیقی — DPM-Solver, DOPRI و فراتر از آن
6125 Higher‑Order & Adaptive Solvers – DPM‑Solver, DOPRI, and Beyond
۶۱۲۶ پیوسته در مقابل گسسته — مقایسه رودررو
6126 Continuous vs Discrete – Head‑to‑Head Comparison
مثال کد ۲ حلکنندههای ODE، مدلهای ویدئویی و Rectified Flow
Code Eg 2 ODE Solvers ,Video Models & Rectified Flow
مقدمه ۶.۲ Flow Matching در مقابل دیفیوژن: توازن کیفیت، سرعت و کنترلپذیری
Intro 6.2 Flow matching vs. diffusion: Quality, speed, and controllability trade
۷۳۲۲ نمونهبرداری رد (Rejection) و تراز توزیع — تضمین کیفیت در رمزگشایی گمانهزن
7322 Rejection Sampling & Distribution Alignment – Guaranteeing Quality in Specu
۷۳۲۳ کشینگ Key-Value (KV) در فریمهای استریمینگ — حفظ تداوم آکوستیک
7323 Key‑Value - KV Caching in Streaming Frames – Preserving Acoustic Continuity
۷۳۲۴ کشینگ حالت و دوختن (Stitching) — نرم کردن مرزهای آکوستیک در TTS استریمینگ
7324 State Caching and Stitching – Smoothing Acoustic Boundaries in Streaming TT
۷۳۳۱ TTS یکپارچه سنتی در مقابل SpeechLMهای استریمینگ — تغییر پارادایم
7331 Traditional Monolithic TTS vs. Streaming SpeechLMs – The Paradigm Shift
۷۳۳۲ دیفیوژن نهفته استریمینگ و Flow Matching — تولید زمانی پنجره لغزان
7332 Streaming Latent Diffusion & Flow Matching – Sliding-Window Temporal Genera
۷۳۴۱ چالشهای نظری و مسائل باز — استریمینگ و رمزگشایی گمانهزن
7341 Theoretical Challenges & Open Problems – Streaming & Speculative Decoding
۷۳۴۲ تکامل سنتز گفتار بلادرنگ — از برش واجها به SpeechLM استریمینگ
7342 Evolution of RT Speech Synthesis – From Phoneme Splicing to Streaming Speec
۷۳۴۳ مسیرهای نظری آینده — سنتز گفتار با تأخیر بسیار کم
7343 Future Theoretical Directions – Low-Latency Speech Synthesis
مثال کد ۷.۳ به حداقل رساندن تأخیر سنتز
Code Eg 7.3 Minimizing synthesis latency: Chunked inference and speculative deco
نمایش نظرات