آموزش تسلط بر هوش مصنوعی مولد صوت: از توکن‌ها تا TTS عامل‌محور - آخرین آپدیت

دانلود Mastering Generative Voice AI: From Tokens to Agentic TTS

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: تسلط بر مدل‌های زبانی صوت (SpeechLMs)، کدک‌های صوتی عصبی، دیفیوژن و Flow Matching برای ساخت سیستم‌های هوش مصنوعی صوتی عامل‌محور و بلادرنگ توضیح فیزیک، آواشناسی و ویژگی‌های آکوستیکی که زیربنای تولید گفتار انسانی هستند مقایسه خط لوله‌های سنتی TTS آبشاری با معماری‌های مدرن مدل‌های زبانی صوت (SpeechLM) ساخت و به‌کارگیری کدک‌های صوتی عصبی و توکن‌سازی معنایی (EnCodec, HuBERT, wav2vec 2.0, RVQ) پیاده‌سازی TTS مبتنی بر کدک خودبازگشتی با استراتژی‌های رمزگشایی توکن‌های چندجریانی طراحی مدل‌های یکپارچه متن-گفتار با ترازسازی متقاطع-مودال و کنترل پارالینگویستیک به‌کارگیری دیفیوژن نهفته و Flow Matching شرطی برای تولید مل-اسپکتروگرام‌های با کیفیت بالا ارزیابی توازن بین Flow Matching و دیفیوژن از نظر سرعت، کیفیت و کنترل‌پذیری استقرار سیستم‌های TTS عامل‌محور با تأخیر کم و استریمینگ با قابلیت مدیریت وقفه‌های بلادرنگ پيش‌نیازها: درک مناسب از مبانی یادگیری عمیق (شبکه‌های عصبی، پس‌انتشار و اصول آموزش) تسلط کاربردی بر پایتون و یک فریمورک یادگیری عمیق مانند PyTorch آشنایی اولیه با مفاهیم اصلی NLP یا LLM (توکن‌سازی، ترنسفورمرها، توجه) مفید است اما اجباری نیست — ایده‌های کلیدی در دوره مرور می‌شوند بدون نیاز به تجربه قبلی در پردازش سیگنال‌های صوتی — ماژول ۱ این مباحث را از اصول اولیه می‌سازد

هوش مصنوعی مولد صوت بسیار فراتر از تبدیل ساده متن به گفتار حرکت کرده است — و این دوره شما را از فیزیک صدا تا ساخت سیستم‌های صوتی عامل‌محور در سطح تولید (Production) می‌برد.

بسیاری از دوره‌های TTS در حد ووکودرهای ابتدایی یا APIهای آماده متوقف می‌شوند. این دوره عمیق‌تر می‌رود. شما با مبانی گفتار انسانی — آکوستیک، آواشناسی و بوطیقا — شروع می‌کنید و سپس به سراغ معماری‌هایی می‌روید که مدل‌های صوتی پیشرفته امروز را قدرت می‌بخشند: یادگیری بازنمایی خود-نظارتی (wav2vec 2.0, HuBERT)، کدک‌های صوتی عصبی (EnCodec, SoundStream, DAC) و استراتژی‌های توکن‌سازی که به LLMها اجازه «صحبت کردن» می‌دهد.

از آنجا، شما بر دو پارادایم غالب مدرن مسلط خواهید شد — TTS مبتنی بر کدک خودبازگشتی و دیفیوژن نهفته / Flow Matching شرطی — و دقیقاً درک خواهید کرد که هر کدام چه زمانی و چرا در سیستم‌های واقعی استفاده می‌شوند. همچنین مدل‌های یکپارچه گفتار-متن، مدل‌سازی پارالینگویستیک (خنده، تنفس، عواطف) و کلونینگ صدای Zero-shot را بررسی خواهید کرد.

در ماژول نهایی، یاد می‌گیرید چگونه خط لوله‌های صوتی عامل‌محور با تأخیر کم و استریمینگ بسازید — همان تکنیک‌هایی که پشت عوامل هوش مصنوعی مکالمه‌ای بلادرنگ هستند — شامل استنتاج تکه‌ای (Chunked)، رمزگشایی گمانه‌زن (Speculative Decoding)، استریمینگ WebSocket و مدیریت نوبت‌های گفتگو.

آنچه خواهید آموخت:

  • علم تولید گفتار و استخراج ویژگی‌های آکوستیک

  • نحوه عملکرد کدک‌های صوتی عصبی و توکن‌سازی معنایی

  • معماری‌های TTS خودبازگشتی و مبتنی بر دیفیوژن/فلو

  • تکنیک‌های ترازسازی متقاطع-مودال گفتار-متن

  • ساخت عوامل صوتی مکالمه‌ای با تأخیر کم و حساس به وقفه

چه مهندس ML باشید، چه پژوهشگر یا مؤسس تکنولوژی‌های صوتی، این دوره تصویر کامل معماری را به شما می‌دهد — از توکن‌ها تا عوامل.


سرفصل ها و درس ها

ماژول ۱: رمزگشایی صدای انسان — فیزیک، آواشناسی و ویژگی‌ها Module 1 : Decoding the Human Voice — Physics, Phonetics, and Features

  • مقدمه‌ای بر درس ۱.۱ فیزیک گفتار Intro to Lect 1.1 Physics of speech

  • ۱۱۱۱ موج‌های صوتی 1111 Sound Waves

  • ۱۱۱۲ ویژگی‌های کلیدی موج‌های صوتی: دامنه 1112 Key Properties of Sound Waves - Amplitude

  • ۱۱۱۳ ویژگی‌های کلیدی موج‌های صوتی: فرکانس 1113 Key Properties of Sound Waves - Frequency

  • ۱۱۲۱ نمایش و بصری‌سازی دیجیتال صدا: شکل موج و طیف 1121 Representing & Visualizing Sound Digitally Waveform Spectrum

  • ۱۱۲۲ نمایش و بصری‌سازی دیجیتال صدا: اسپکتروگرام‌ها 1122 Representing & Visualizing Sound Digitally Spectograms

  • ۱۱۲۳ نمایش و بصری‌سازی دیجیتال صدا: سایر نمایش‌ها 1123 Representing & Visualizing Sound Digitally- Other Representations

  • ۱۱۳۱ کاربردها در یادگیری عمیق 1131 Applications in Deep Learning

  • ۱۱۳۲ چالش‌ها و ملاحظات 1132 Challenges and Considerations

  • ۱۱۳۳ راهکارهای SpeechLM 1133 SpeechLM Solutions

  • ۱۱۳۴ خلاصه و نکات کلیدی 1134 Summary & Key Takeaways

  • مثال کدنویسی ۱.۱ Coding Example 1.1

  • مقدمه‌ای بر درس ۱.۲ مدل منبع-فیلتر در تولید گفتار Intro to Lect 1.2 The Source-Filter Model of Speech Production

  • ۱۲۱۱ مدل منبع-فیلتر تولید گفتار: مقدمه 1211 The Source-Filter Model of Speech Production - Introduction

  • ۱۲۱۲ اجزای مدل: ۱. منبع 1212 Components of the Model - 1.The Source

  • ۱۲۱۳ اجزای مدل: ۲. فیلتر (مجرای صوتی) 1213 Components of the Model - 2.The Filter -Vocal Tract

  • ۱۲۲۱ خروجی گفتار 1221 Speech Output

  • ۱۲۲۲ مفاهیم کلیدی گفتار 1222 Key Concepts of Speech

  • ۱۲۲۳ ارتباط با پردازش گفتار 1223 Relevance to Speech Processing

  • ۱۲۲۴ چالش‌ها و ملاحظات 1224 Challenges and Considerations

  • ۱۲۲۵ خلاصه و نکات کلیدی 1225 Summary & Key Takeaways

  • مقدمه درس ۱.۳ آواشناسی و واج‌شناسی Intro Lect 1.3 Phonetics & Phonology

  • ۱۳۱۱ فون‌ها، واج‌ها و آلوفون‌ها 1311 Phones, Phonemes, and Allophones

  • ۱۳۱۲ آواشناسی و واج‌شناسی در گفتار 1312 Phonetics and Phonology in Speech

  • ۱۳۱۳ آواشناسی: مطالعه صداهای گفتار 1313 Phonetics The Study of Speech Sounds

  • ۱۳۱۴ ویژگی‌های آوایی 1314 Phonetic Features

  • ۱۳۱۵ واج‌شناسی: سیستم صوتی یک زبان 1315 Phonology the Sound System of a Language

  • ۱۳۲۱ نگاشت صداها به واج‌ها و ویژگی‌های آوایی 1321 Mapping Sounds to Phonemes and Phonetic Features

  • ۱۳۲۲ کاربردها در یادگیری عمیق 1322 Applications in Deep Learning

  • ۱۳۳۱ چالش‌ها و ملاحظات 1331 Challenges and Considerations

  • ۱۳۳۲ خلاصه و نکات کلیدی 1332 Summary & Key Takeaways

  • مثال کدنویسی ۱.۳ Coding Example 1.3

  • مقدمه درس ۱.۴ ویژگی‌های آکوستیک Intro Lect 1.4 Acoustic features

  • ۱۴۱۱ استخراج ویژگی‌های صوتی: مقدمه 1411 Audio Feature Extraction - Introduction

  • ۱۴۱۲ استخراج ویژگی‌های سنتی: ضرایب کپسترال فرکانس مل (MFCCs) 1412 Traditional Feature Extraction Mel Frequency Cepstral Coefficients - MFCCs

  • ۱۴۱۳ رویکردهای مدرن در SpeechLMها: شکل‌موج‌های خام 1413 Modern Approaches in SpeechLMs - Raw Waveforms

  • ۱۴۲۱ رویکردهای مدرن در SpeechLMها: بازنمایی‌های صوتی آموخته‌شده 1421 Modern Approaches in SpeechLMs - Learned Audio Representations

  • ۱۴۲۲ مقایسه استخراج ویژگی‌های سنتی در مقابل رویکردهای مدرن SpeechLM 1422 Comparison- Traditional Feature Extraction vs Modern Approaches in SpeechLM

  • ۱۴۲۳ چالش‌ها و ملاحظات 1423 Challenges and Considerations

  • ۱۴۲۴ خلاصه و نکات کلیدی 1424 Summary & Key Takeaways

  • مثال کدنویسی ۱.۴ ویژگی‌های آکوستیک Coding example 1.4 Acoustic features

ماژول ۲: چرخش مولد — از TTS آبشاری به مدل‌های زبانی صوت Module 2 : The Generative Shift — From Cascade TTS to Speech Language Models

  • مقدمه درس ۲.۱ تغییر پارادایم: آبشاری سنتی در مقابل SpeechLMها Intro Lect 2.1 The Paradigm Shift: Traditional Cascade vs. SpeechLMs

  • ۲۱۱۱ تغییر پارادایم — آبشاری سنتی در مقابل SpeechLMها 2111 The Paradigm Shift – Traditional Cascade vs. SpeechLMs

  • ۲۱۱۲ مبانی نظری — مدل‌سازی در TTS 2112 Theoretical Foundations – Modeling ? ?-? in TTS

  • ۲۱۲۱ پارادایم SpeechLM: توکن‌سازی گسسته 2121 SpeechLM Paradigm Discrete Tokenization

  • ۲۱۲۲ SpeechLM — توکن‌های آکوستیک گسسته و مدل‌سازی زبانی 2122 SpeechLM – Discrete Acoustic Tokens & Language Modeling

  • ۲۱۲۳ SpeechLM در مقابل آبشاری سنتی: مزایای کلیدی 2123 SpeechLM vs Traditional Cascade - Key Advantages

  • ۲۱۳۱ مفاهیم اصلی — معماری آبشاری و گلوگاه‌های آن 2131 Core Concepts – The Cascade Architecture & Its Bottleneck

  • ۲۱۳۲ راهکار SpeechLM — توکن‌سازی گسسته 2132 SpeechLM Solution – Discrete Tokenization

  • ۲۱۳۳ تفاوت آموزش: آبشاری در مقابل SpeechLM 2133 Training Difference Cascade vs SpeechLM

  • ۲۱۳۴ رویکرد آبشاری: Tacotron 2 + WaveGlow — گام به گام 2134 Cascade Approach - Tacotron 2 + WaveGlow – Step‑by‑Step Working

  • ۲۱۳۵ SpeechLM — نحوه عملکرد گام به گام 2135 SpeechLM – Step‑by‑Step Working

  • ۲۱۴۱ مدل‌های کلیدی — آبشاری کلاسیک Tacotron 2 + WaveGlow 2141 Key Models – Classic Cascade Tacotron 2 + WaveGlow

  • ۲۱۴۲ SpeechLM مدرن — AudioLM و VALL-E 2142 The Modern SpeechLM – AudioLM & VALL-E

  • ۲۱۵۱ SpeechLMها — چالش‌های نظری و مسائل باز 2151 SpeechLMs – Theoretical Challenges & Open Problems

  • ۲۱۵۲ SpeechLMها — تمرکز پژوهشی 2152 SpeechLMs – Research Focus

  • ۲۱۵۳ تکامل سنتز گفتار — از برش نوارهای مغناطیسی تا مدل‌های زبانی 2153 Evolution of Speech Synthesis – From Splicing Tapes to Language Models

  • ۲۱۵۴ مسیرهای نظری آینده — پل زدن بین گسسته و پیوسته 2154 Future Theoretical Directions – Bridging Discrete & Continuous

  • مثال کد ۲.۱ تغییر پارادایم: آبشاری سنتی در مقابل SpeechLMها Code Eg 2.1 The Paradigm Shift: Traditional Cascade vs. SpeechLMs

  • مقدمه درس ۲.۲ یادگیری خود-نظارتی (SSL) برای گفتار: wav2vec 2.0 و HuBERT Intro Lect 2.2 Self-Supervised Learning (SSL) for Speech: wav2vec 2.0 & HuBERT

  • ۲۲۱۱ یادگیری خود-نظارتی (SSL) برای بازنمایی صوتی 2211 Self-Supervised Learning -SSL for Audio Representation

  • ۲۲۱۲ مفاهیم اصلی — چرا SSL؟ گلوگاه داده‌ها 2212 Core Concepts – The Why- The Data Bottleneck

  • ۲۲۱۳ یادگیری خود-نظارتی SSL — مبانی نظری 2213 Self-Supervised Learning SSL – Theoretical Foundations

  • ۲۲۲۱ وظایف پیش‌متنی (Pretext Tasks) — موتور SSL 2221 Pretext Tasks – The Engine of SSL

  • ۲۲۲۲ یادگیری مقابله‌ای — تشخیص صحیح از عوامل مزاحم 2222 Contrastive Learning – Distinguishing Correct from Distractors

  • ۲۲۲۳ پیش‌بینی ماسک‌شده — یادگیری بافت آکوستیک از طریق پر کردن شکاف‌ها 2223 Masked Prediction – Learning Acoustic Context by Filling the Gaps

  • ۲۲۲۴ برچسب‌گذاری کاذب (Pseudo-Labeling) — تبدیل صوت پیوسته به اهداف گسسته 2224 Pseudo‑Labeling – Turning Continuous Audio into Discrete Targets

  • ۲۲۳۱ بازنمایی صوتی SSL — تئوری دقیق عملکرد 2231 SSL Audio Representation – Detailed Working Theory

  • ۲۲۳۲ چرا خط لوله ۴ مرحله‌ای بازنمایی صوتی SSL عمل می‌کند 2232 Why The 4 step SSL Audio Representation Pipeline Works

  • ۲۲۴۱ wav2vec 2.0 — یادگیری مقابله‌ای روی اهداف کوانتیزه شده 2241 wav2vec 2.0 -Contrastive Learning over Quantized Targets

  • ۲۲۴۲ HuBERT — پیش‌بینی ماسک‌شده از واحدهای پنهان 2242 HuBERT – Masked Prediction of Hidden Units

  • ۲۲۴۳ توکن‌های HuBERT به عنوان واژگان آکوستیک 2243 HuBERT Tokens as Acoustic Vocabulary

  • ۲۲۵۱ SSL برای صوت — چالش‌های نظری و مسائل باز 2251 SSL for Audio – Theoretical Challenges & Open Problems

  • ۲۲۵۲ تکامل بازنمایی صوتی — از MFCCها به SpeechLMهای خود-نظارتی 2252 Evolution of Audio Representation – From MFCCs to Self‑Supervised SpeechLMs

  • ۲۲۵۳ مسیرهای نظری آینده — چند-مودالی یکپارچه و گسسته‌سازی پیشرفته 2253 Future Theoretical Directions – Unified Multimodal & Advanced Discretizatio

  • مثال کد ۲.۲ یادگیری خود-نظارتی (SSL) برای بازنمایی صوتی Code Eg 2.2 (SSL) for Audio Representation: wav2vec 2.0 & HuBERT

  • مقدمه درس ۲.۳ توکن‌سازی معنایی: استخراج معنا از طریق K-Means Intro Lect 2.3 Semantic Tokenization: Extracting Meaning via K-Means

  • ۲۳۱۱ توکن‌سازی معنایی — استخراج معنا از گفتار پیوسته 2311 Semantic Tokenization – Extracting Meaning from Continuous Speech

  • ۲۳۱۲ گشودن گره‌های گفتار پیچیده: فرضیه منیفولد 2312 Untangling Complex speech The mani-fold hypothesis

  • ۲۳۱۳ مفاهیم اصلی — حالت‌های پنهان به عنوان متغیرهای نهفته پیوسته 2313 Core Concepts – Hidden States as Continuous Latents

  • ۲۳۲۱ کوانتیزاسیون برداری (VQ) — جهش از پیوسته به گسسته 2321 Vector Quantization VQ – Continuous to Discrete Leap

  • ۲۳۲۲ خوشه‌بندی K-Means برای گسسته‌سازی — ساخت لغت‌نامه صوتی 2322 K‑Means Clustering for Discretization – Building the Audio Dictionary

  • ۲۳۲۳ محدودیت‌ها و پیشرفت‌ها: مرکزهای استاتیک و مشتق‌پذیری E2E 2323 Limitations & Advances Static centroids , E2E Differentiability

  • ۲۳۳۱ توکن‌های معنایی در مقابل آکوستیک — «چه چیزی» در مقابل «چگونه» 2331 Semantic vs. Acoustic Tokens – The What vs. The How

  • ۲۳۳۲ توکن‌سازی معنایی — تئوری دقیق عملکرد 2332 Semantic Tokenization – Detailed Working Theory

  • ۲۳۳۳ توکن‌سازی معنایی — به‌روزرسانی مرکز، استنتاج و فروپاشی توالی 2333 Semantic Tokenization – Centroid Update, Inference & Sequence Collapse

  • ۲۳۴۱ wav2vec 2.0 — کوانتیزاسیون آنلاین 2341 wav2vec 2.0 - Online Quantization

  • ۲۳۴۲ HuBERT — خوشه‌بندی آفلاین برای توکن‌سازی معنایی 2342 HuBERT – Offline Clustering for Semantic Tokenization

  • ۲۳۵۱ چالش‌های نظری و مسائل باز — توکن‌سازی معنایی 2351 Theoretical Challenges & Open Problems – Semantic Tokenization

  • ۲۳۵۲ تکامل توکن‌سازی معنایی — از GMM-HMM به SpeechLMها 2352 Evolution of Semantic Tokenization – From GMM‑HMM to SpeechLMs

  • ۲۳۵۳ مسیرهای نظری آینده — کدبوک‌های End-to-End و فضای مشترک متن-صوت 2353 Future Theoretical Directions – End‑to‑End Codebooks & Joint Text‑Audio Spa

  • مقدمه درس ۲.۴ کدک‌های عصبی و توکن‌سازی: EnCodec, SoundStream, DAC و RVQ Intro Lect 2.4 Neural Codecs & Tokenization: EnCodec, SoundStream, DAC, and RVQ

  • ۲۴۱۱ کدک‌های صوتی عصبی و توکن‌سازی آکوستیک — نحوه بیان گفتار 2411 Neural Audio Codecs & Acoustic Tokenization – The How of Speech

  • ۲۴۱۲ مبانی نظری کدک‌های صوتی عصبی — توکن‌سازی آکوستیک 2412 Theoretical Foundations of Neural Audio Codecs – Acoustic Tokenization

  • ۲۴۱۳ کدک‌های صوتی عصبی — توازن بین اندازه کدبوک و وفاداری صوتی 2413 Neural Audio Codecs – Codebook Size vs. Fidelity Trade‑off

  • ۲۴۲۱ توکن‌سازی آکوستیک — از برش صوتی به اعداد صحیح گسسته 2421 Acoustic Tokenization – From Audio Slice to Discrete Integers

  • ۲۴۲۲ RVQ برای توکن‌سازی سلسله‌مراتبی 2422 RVQ for Hierarchial Tokenization

  • ۲۴۲۳ تئوری اصلی بازنمایی صوتی و جریان — کوانتیزاسیون برداری باقی‌مانده (RVQ) 2423 Core Theory of Audio Representation & Flow – Residual Vector Quantization R

  • ۲۴۲۴ ساختار: از صوت خام به بردارهای پیوسته کاهش-نمونه شده 2424 The Setup - Raw Audio to Down-sampled Continuous Vectors

  • ۲۴۲۵ از بردارهای پیوسته به کدبوک‌های کوانتیزاسیون برداری باقی‌مانده (RVQ) 2425 Continuous Vectors to Residual Vector Quantisation RVQ Codebooks

  • ۲۴۳۱ ویژگی سلسله‌مراتبی RVQ 2431 Hierarchical Property of RVQ

  • ۲۴۳۲ کوانتیزاسیون برداری باقی‌مانده — آنالوژی آدرس خانه 2432 Residual Vector Quantization – The House Address Analogy

  • ۲۴۳۳ چرا RVQ برنده است 2433 Why RVQ wins

  • ۲۴۴۱ Soundstream گوگل 2441 Google-s Soundstream

  • ۲۴۴۲ Encodec متا 2442 Encodec -Meta

  • ۲۴۴۳ مدل صوتی Descript (DAC) 2443 Descript Audio Model DAC

  • ۲۴۵۱ چالش‌های نظری و مسائل باز — کدک‌های عصبی مبتنی بر RVQ 2451 Theoretical Challenges & Open Problems – RVQ-Based Neural Codecs

  • ۲۴۵۲ وابستگی سلسله‌مراتبی — مسائل حل نشده 2452 Hierarchical Dependency – Unresolved Problems

  • ۲۴۵۳ تکامل و بافت تاریخی — از LPC تا کدک‌های صوتی RVQ 2453 Evolution & Historical Context – From LPC to RVQ Audio Codecs

  • ۲۴۵۴ مسیرهای نظری آینده — دیفیوژن نهفته غیر-خودبازگشتی 2454 Future Theoretical Directions – Non‑Autoregressive Latent Diffusion & Disen

  • مثال کد ۲.۴ بخش اول Code Eg 2.4 i

  • مثال کد ۲.۴ بخش دوم Code Eg 2.4 ii

  • مقدمه درس ۲.۵ رمزگشایی و ووکودینگ: تبدیل توکن‌ها به صوت Intro Lect 2.5 Decoding & Vocoding: Translating Tokens Back to Audio

  • ۲۵۱۱ رمزگشایی و ووکودینگ — از توکن‌های گسسته به صوت پیوسته 2511 Decoding & Vocoding – From Discrete Tokens to Continuous Audio

  • ۲۵۱۲ رمزگشایی و ووکودینگ — مبانی نظری بازسازی آکوستیک 2512 Decoding & Vocoding – Theoretical Foundations of Acoustic Reconstruction

  • ۲۵۱۳ رمزگشایی و ووکودینگ — هدف ژنراتور و بیش‌نمونه‌برداری (Upsampling) 2513 Decoding & Vocoding – The Generator’s Objective & Upsampling

  • ۲۵۲۱ مفاهیم اصلی — جمع‌بندی RVQ از شاخص‌های گسسته به نهفته‌های پیوسته 2521 Core Concepts – RVQ Summation From Discrete Indices to Continuous Latent

  • ۲۵۲۲ بیش‌نمونه‌برداری عصبی — کانولوشن‌های ترانهاده برای گسترش رزولوشن 2522 Neural Upsampling – Transposed Convolutions for Resolution Expansion

  • ۲۵۲۳ مسئله بازسازی فاز — از حدس فاز تا حفظ آن 2523 The Phase Reconstruction Problem – From Guessing Phase to Retaining It

  • ۲۵۳۱ تئوری دقیق عملکرد — تبدیل توکن‌های RVQ به صوت 2531 Detailed Working Theory – Translating RVQ Tokens Back to Audio

  • ۲۵۳۲ رمزگشایی و ووکودینگ — اتساع زمانی و نقد مقابله‌ای (Adversarial) 2532 Decoding & Vocoding – Temporal Dilation & Adversarial Critique

  • ۲۵۴۱ HiFi-GAN — استاندارد میراثی 2541 HiFi‑GAN- The Legacy Standard

  • ۲۵۴۲ EnCodec متا — معماری رمزگشا با LSTM برای انسجام زمانی 2542 EnCodec by Meta – Decoder Architecture with LSTM for Temporal Coherence

  • ۲۵۴۳ DAC (کدک صوتی Descript) — فعال‌سازهای Snake برای وفاداری در فرکانس بالا 2543 DAC - Descript Audio Codec – Snake Activations for High‑Frequency Fidelity

  • ۲۵۶۱ چالش‌های نظری و مسائل باز — رمزگشایی کدک RVQ 2561 Theoretical Challenges & Open Problems – RVQ Codec Decoding

  • ۲۵۶۲ تکامل رمزگشایی صوتی — از ووکودرهای پارامتریک به رمزگشاهای کدک 2562 Evolution of Audio Decoding – From Parametric Vocoders to Codec Decoders

  • ۲۵۶۳ مسیرهای نظری آینده — رمزگشاهای دیفیوژن نهفته 2563 Future Theoretical Directions – Latent Diffusion Decoders

  • مثال کد i تبدیل RVQ به صوت Code Eg i RVQ to audio

  • مثال کد ii Code Eg ii

ماژول ۳: توالی‌بندی صدا — TTS مبتنی بر کدک خودبازگشتی و استراتژی‌های رمزگشایی Module 3: Sequencing Sound — Autoregressive Codec TTS and Decoding Strategies

  • مقدمه ۳.۱ استراتژی‌های توکن چندجریانی: تخت‌سازی در مقابل درهم‌تنیدگی کدبوک‌های RVQ Intro 3.1 Multi-stream token stratgies: Flattening vs. interleavng RVQ codebooks

  • ۳۱۱۱ استراتژی‌های توکن چندجریانی — تخت‌سازی (Flattening) در مقابل درهم‌تنیدگی (Interleaving) کدبوک‌های RVQ 3111 Multi-Stream Token Strategies – Flattening vs. Interleaving RVQ Codebooks

  • ۳۱۱۲ مقایسه استراتژی‌ها: تخت‌سازی در مقابل درهم‌تنیدگی 3112 Comparison of Strategies - Flattening vs. Interleaving

  • ۳۱۲۱ مبانی نظری — فاکتورگیری از شبکه دو-بعدی توکن‌های صوتی 3121 Theoretical Foundations – Factorizing the 2D Audio Token Grid

  • ۳۱۲۲ مفاهیم اصلی — توکن‌های معنایی در مقابل آکوستیک 3122 Core Concepts – Semantic vs. Acoustic Tokens

  • ۳۱۳۱ تخت‌سازی توکن — سریال‌سازی Brute-Force از شبکه RVQ 3131 Token Flattening – Brute‑Force Serialization of the RVQ Grid

  • ۳۱۳۲ مزایا و معایب تخت‌سازی توکن — سریال‌سازی Brute-Force 3132 Pros & Cons Token Flattening – Brute‑Force Serialization

  • ۳۱۴۱ درهم‌تنیدگی: الگوی تأخیر — پیش‌بینی عمق موازی با جابجایی علی (Causal Shift) 3141 Interleaving - The Delay Pattern – Parallel Depth Prediction w Causal Shift

  • ۳۱۴۲ کاربرد در SpeechLMهای مدرن 3142 Use in Modern SpeechLMs

  • ۳۱۵۱ تئوری دقیق عملکرد — گام ۱: پیش‌فرض معنایی (رهبر ارکستر) 3151 Detailed Working Theory – Step 1 The Semantic Prior -The Conductor

  • ۳۱۵۲ گام ۲ و ۳ — تخت‌سازی در مقابل درهم‌تنیدگی شبکه‌های RVQ 3152 Step 2 & 3 – Flattening vs. Interleaving RVQ Grids

  • ۳۱۶۱ AudioLM — تخت‌سازی آبشاری سلسله‌مراتبی (پیشگام) 3161 AudioLM – Hierarchical Cascaded Flattening - The Pioneer

  • ۳۱۶۲ VALL-E — تفکیک AR و NAR: استراتژی هیبریدی 3162 VALL‑E – AR - NAR Splitting - Hybrid Strategy

  • ۳۱۶۳ MusicGen — الگوی تأخیر درهم‌تنیده: SpeechLM یکپارچه 3163 MusicGen – Interleaved Delay Pattern - Unified SpeechLM

  • ۳۱۷۱ چالش‌های نظری و مسائل باز — توکن‌سازی چندجریانی RVQ 3171 Theoretical Challenges & Open Problems – RVQ Multi‑Stream Tokenization

  • ۳۱۷۲ تکامل توالی‌بندی صدا — از رگرسیون پیوسته به RVQ درهم‌تنیده 3172 Evolution of Sound Sequencing – From Continuous Regression to Interleaved R

  • مثال کد ۳.۱ استراتژی‌های توکن چندجریانی: تخت‌سازی در مقابل درهم‌تنیدگی Code Eg 3.1-Multi-stream token strategies: Flattening vs. interleaving RVQ codeb

  • مقدمه درس ۳.۲ رمزگشایی خودبازگشتی: نمونه‌برداری، top-k و CFG برای صوت Intro Lect 3.2 Autoregressive decoding: Sampling, top-k, and cfg for audio

  • ۳۲۱۱ رمزگشایی خودبازگشتی — نمونه‌برداری، Top-k و راهنمایی بدون طبقه‌بند (CFG) 3211 Autoregressive Decoding – Sampling, Top‑k, and Classifier‑Free Guidance for

  • ۳۲۱۲ مقیاس‌بندی دما (Temperature) — کنترل تصادفی بودن آکوستیک 3212 Temperature Scaling – Controlling Acoustic Randomness

  • ۳۲۱۳ نمونه‌برداری Top-k و هسته‌ای (Top-p) — فیلتر کردن دم بلند (Long Tail) 3213 Top‑k and Nucleus -Top‑p Sampling – Filtering the Long Tail

  • ۳۲۱۴ نمونه‌برداری هسته‌ای Top-p — برش تطبیقی 3214 Nucleus -Top‑p Sampling - Adaptive truncation

  • ۳۲۱۵ راهنمایی بدون طبقه‌بند (CFG) برای صوت — هدایت تولید آکوستیک 3215 Classifier‑Free Guidance (CFG) for Audio – Steering Acoustic Generation

  • ۳۲۱۶ تئوری دقیق عملکرد — چرخه رمزگشایی SpeechLM 3216 Detailed Working Theory – The SpeechLM Decoding Cycle

  • ۳۲۲۱ مدل‌ها و معماری‌های کلیدی — استراتژی‌های رمزگشایی در SpeechLMها 3221 Key Models & Architectures – Decoding Strategies in SpeechLMs

  • ۳۲۲۲ چالش‌های نظری و مسائل باز — رمزگشایی در SpeechLMها 3222 Theoretical Challenges & Open Problems – Decoding in SpeechLMs

  • ۳۲۲۳ تکامل و بافت تاریخی — استراتژی‌های رمزگشایی در هوش مصنوعی گفتار 3223 Evolution & Historical Context – Decoding Strategies in Speech AI

  • ۳۲۲۴ مسیرهای نظری آینده — فراتر از رمزگشایی استاتیک 3224 Future Theoretical Directions – Beyond Static Decoding

  • مثال کد ۳.۲ رمزگشایی خودبازگشتی: نمونه‌برداری، top-k و CFG Code Eg 3.2-Autoregressive decoding: Sampling, top-k, and cfg

  • مقدمه درس ۳.۳ شرطی‌سازی گوینده، کنترل احساس و تزریق بوطیقا (Prosody) Intro Lect 3.3 Speaker conditioning, emotion control, and prosody injection

  • ۳۳۱۱ شرطی‌سازی گوینده، کنترل احساس و تزریق بوطیقا 3311 Speaker Conditioning, Emotion Control & Prosody Injection

  • ۳۳۱۲ روش‌های شرطی‌سازی و مقایسه آن‌ها 3312 Conditioning Methods & their Comparison

  • ۳۳۲۱ مبانی نظری شرطی‌سازی گوینده، کنترل احساس و تزریق بوطیقا 3321 Speaker Conditioning, Emotion Control, Prosody Injection – Theoretical Foun

  • ۳۳۲۲ مفاهیم اصلی — جاسازی‌های گوینده (Speaker Embeddings) و پرامپت‌های آکوستیک 3322 Core Concepts – Speaker Embeddings and Acoustic Prompts

  • ۳۳۳۱ بوطیقا (Prosody) — چیست و انواع آن کدامند 3331 Prosody - What is it & its type

  • ۳۳۳۲ راهنمایی بدون طبقه‌بند (CFG) برای استایل — تقویت احساس و شناسایی گوینده 3332 Classifier‑Free Guidance -CFG for Style – Amplifying Emotion & Speaker Iden

  • ۳۳۴۱ شرطی‌سازی گوینده و احساس — تئوری دقیق عملکرد (گام‌های ۱ تا ۳ از ۵) 3341 Speaker & Emotion Conditioning – Detailed Working Theory -Steps 1 to 3 of 5

  • ۳۳۴۲ شرطی‌سازی گوینده و احساس — توجه خود-محور و تولید متوالی 3342 Speaker & Emotion Conditioning – Self‑Attention & Sequential Generation -St

  • ۳۳۵۱ VALL-E توسط مایکروسافت 3351 VALL‑E by Microsoft

  • ۳۳۵۲ Spear TTS توسط گوگل 3352 Spear-TTS by Google

  • ۳۳۵۳ توکن‌های استایل جهانی (GST) — جاسازی‌های احساس پیوسته برای کنترل دقیق 3353 Global Style Tokens -GST Legacy – Continuous Emotion Embeddings for Granula

  • ۳۳۶۱ چالش‌های نظری و مسائل باز — کنترل گفتار اکسپرسیو 3361 Theoretical Challenges & Open Problems – Expressive Speech Control

  • ۳۳۶۲ تکامل شرطی‌سازی صدا — از HMMها به SpeechLMهای در-بافت (In-Context) 3362 Evolution of Voice Conditioning – From HMMs to In‑Context SpeechLMs

  • ۳۳۶۳ مسیرهای نظری آینده — کدک‌های فاکتورگیری شده و جداسازی احساس بدون نظارت 3363 Future Theoretical Directions – Factorized Codecs & Unsupervised Emotion Di

  • مثال کد ۳.۳ شرطی‌سازی گوینده، کنترل احساس و تزریق بوطیقا Code Eg 3.3-Speaker conditioning, emotion control, and prosody injection

ماژول ۴: پیوند متن و صوت — SpeechLMهای یکپارچه و ترازسازی متقاطع-مودال Module 4: The Audio-Text Nexus — Unified SpeechLMs and Cross-Modal Alignment

  • مقدمه درس ۴.۱ گسترش واژگان LLM: استراتژی‌های توکن‌سازی مشترک متن-صوت Intro to Lect 4.1 Expanding LLM vocab : Joint text–audio tokenization strategies

  • ۴۱۱۱ گسترش واژگان LLM — توکن‌سازی مشترک متن و صوت 4111 Expanding LLM Vocabularies – Joint Text-Audio Tokenization

  • ۴۱۲۱ مدل‌های کلیدی استفاده‌کننده از توکن‌سازی مشترک و تکامل آن‌ها 4121 Key Models Using Joint Tokenization & their Evolution

  • ۴۱۲۲ مبانی نظری — توکن‌سازی مشترک برای SpeechLMها 4122 Theoretical Foundations – Joint Tokenization for SpeechLMs

  • ۴۱۲۳ مفاهیم اصلی — توکن‌های متنی گسسته 4123 Core Concepts – Discrete Text Tokens

  • ۴۱۲۴ توکن‌های صوتی — معنایی در مقابل آکوستیک 4124 Audio Tokens – Semantic vs. Acoustic

  • ۴۱۳۱ نحوه همکاری واژگان مشترک متن-صوت در SpeechLMها 4131 How Joint Text‑Audio Vocabularies Work Together in SpeechLMs

  • ۴۱۳۲ فضای واژگان مشترک — یکپارچه‌سازی توکن‌های متن و صوت (تمام گام‌ها) 4132 The Joint Vocabulary Space – Unifying Text and Audio Tokens –All the steps

  • ۴۱۳۳ گسترش واژگان و درهم‌تنیدگی متقاطع-مودال 4133 Vocabulary Expansion & Cross-Modal Interleaving

  • ۴۱۴۱ سیستم‌های آبشاری سنتی در مقابل مدل‌های زبانی صوت (SpeechLM) 4141 Traditional Cascaded Systems vs. Speech Language Models

  • ۴۱۴۲ AudioPaLM و معماری‌های یکپارچه — واژگان مشترک با پیش‌فرض متنی منجمد 4142 AudioPaLM & Unified Architectures – Joint Vocabulary with Frozen Text Prior

  • ۴۱۴۳ AudioPaLM در مقابل سیستم‌های آبشاری سنتی 4143 AudioPaLM vs Traditional Cascaded Systems

  • ۴۱۵۱ چالش‌های نظری و مسائل باز — توکن‌سازی مشترک متن-صوت 4151 Theoretical Challenges & Open Problems – Joint Text‑Audio Tokenization

  • ۴۱۵۲ تکامل و بافت تاریخی — از HMMها به SpeechLMها 4152 Evolution & Historical Context – From HMMs to SpeechLMs

  • ۴۱۵۳ مسیرهای نظری آینده — فراتر از توکن‌سازی مشترک گسسته 4153 Future Theoretical Directions – Beyond Discrete Joint Tokenization

  • مثال کد ۴.۱ گسترش واژگان LLM: استراتژی‌های توکن‌سازی مشترک Code Eg 4.1 Expanding LLM vocabularies: Joint text–audio tokenization strategies

  • مقدمه درس ۴.۲ ترازسازی متقاطع-مودال و اهداف پیش-آموزش مشترک گفتار-متن Intro to Lect 4.2 Cross-modal alignment and joint speech–text pre-training objec

  • ۴۲۱۱ ترازسازی متقاطع-مودال و پیش-آموزش مشترک گفتار-متن 4211 Cross-Modal Alignment & Joint Speech–Text Pre-training

  • ۴۲۱۲ ترازسازی متقاطع-مودال — مبانی نظری 4212 Cross-Modal Alignment – Theoretical Foundations

  • ۴۲۲۱ یادگیری بازنمایی مقابله‌ای برای ترازسازی مودالیته: Loss InfoNCE 4221 Contrastive Representation Learning for Modality Alignment - InfoNCE loss

  • ۴۲۲۲ یادگیری بازنمایی مقابله‌ای برای ترازسازی مودالیته: کاربردها 4222 Contrastive Representation Learning for Modality Alignment - Applications

  • ۴۲۳۱ کوانتیزاسیون برداری (VQ) و گسسته‌سازی — پل زدن بین گفتار و متن 4231 Vector Quantization (VQ) & Discretization – Bridging Speech and Text via Co

  • ۴۲۳۲ CTC (طبقه‌بندی زمانی کانکشنیسم) — چارچوب احتمالی برای توالی‌ها 4232 CTC – Connectionist Temporal Classification A Probability Framework for Sh

  • ۴۲۴۱ پیش-آموزش مشترک گفتار-متن — تئوری دقیق عملکرد (گام‌های ۱-۲) 4241 Joint Speech‑Text Pre‑training – Detailed Working Theory Steps 1‑2

  • ۴۲۴۲ پیش-آموزش مشترک گفتار-متن — گام‌های ۳-۴ (InfoNCE + پیش‌بینی ماسک‌شده مشترک) 4242 Joint Speech‑Text Pre‑training – Steps 3‑4 InfoNCE + Joint Masked Predictio

  • ۴۲۵۱ ادغام زودهنگام (Early Fusion) در مقابل ادغام دیرهنگام برای ترازسازی متقاطع-مودال 4251 Early Fusion vs. Late Fusion for Cross‑Modal Alignment

  • ۴۲۶۱ مدل‌های کلیدی — SpeechLMهای گسسته: AudioLM, VALL-E 4261 Key Models – Discrete SpeechLMs - AudioLM, VALL‑E

  • ۴۲۷۱ Flow-Matching پیوسته و مدل‌های دیفیوژن — تولید گفتار هدایت‌شده با ODE 4271 Continuous Flow‑Matching & Diffusion Models – ODE‑Guided Speech Generation

  • ۴۲۸۱ چالش‌های نظری و مسائل باز 4281 Theoretical Challenges and Open Problems

  • ۴۲۸۲ تکامل ترازسازی گفتار متقاطع-مودال — از HMMهای آبشاری به پیش-آموزش مشترک 4282 Evolution of Cross‑Modal Speech Alignment – From Cascaded HMMs to Joint Pre

  • ۴۲۸۳ مسیرهای نظری آینده — توپولوژی‌های یکپارچه پیوسته-گسسته 4283 Future Theoretical Directions – Unified Continuous‑Discrete Topologies & An

  • مثال کد ۴.۲ ترازسازی متقاطع-مودال و اهداف پیش-آموزش مشترک Code Eg 4.2 Cross-modal alignment and joint speech–text pre-training objectives

  • مقدمه درس ۴.۳ مدل‌سازی پارالینگویستیک: خنده، تنفس، لکنت و عواطف Intro Lec 4.3 Modeling paralinguistics: Laughter, breathing, disfluency & affect

  • ۴۳۱۱ مدل‌سازی پارالینگویستیک — خنده، تنفس، لکنت و عواطف 4311 Modeling Paralinguistics – Laughter, Breathing, Disfluency & Affect

  • ۴۳۱۲ مدل‌سازی پارالینگویستیک — مبانی نظری 4312 Paralinguistic Modeling – Theoretical Foundations

  • ۴۳۲۱ تئوری جداسازی (Disentanglement) — فضاهای نهفته متعامد 4321 Disentanglement Theory -Orthogonal Latent Spaces

  • ۴۳۳۱ میکروبوطیقا در مقابل ماکروبوطیقا — مقیاس‌های زمانی پارالینگویستیک 4331 Micro‑Prosody vs. Macro‑Prosody – Temporal Scales of Paralinguistics

  • ۴۳۴۱ لکنت به عنوان یک نشانگر کاربردی — از نویز به سیگنال استراتژیک 4341 Disfluency as a Pragmatic Marker – From Noise to Strategic Signal

  • ۴۳۵۱ گسسته‌سازی آکوستیک و توکن‌های صوتی — تبدیل پارالینگویستیک به برچسب‌های کاذب 4351 Acoustic Discretization & Audio Tokens – Turning Paralinguistics into Pseud

  • ۴۳۵۲ پیش‌بینی خودبازگشتی مشترک و شرطی‌سازی نهفته — تولید پارالینگویستیک 4352 Joint Autoregressive Prediction & Latent Conditioning – Generating Paraling

  • ۴۳۶۱ تئوری دقیق عملکرد — مدل‌سازی پارالینگویستیک در SpeechLMها 4361 Detailed Working Theory – Modeling Paralinguistics in SpeechLMs

  • ۴۳۷۱ توکن‌های استایل جهانی (GST) برای ماکروبوطیقا 4371 Global Style Tokens -GSTs for Macro‑Prosody

  • ۴۳۷۲ اتوانکودرهای متغیر سلسله‌مراتبی (VAEs) — فضاهای نهفته تودرتو برای مدل‌سازی 4372 Hierarchical Variational Autoencoders -VAEs – Nested Latent Spaces for Mult

  • ۴۳۷۳ VAEهای سلسله‌مراتبی — روش ELBO و ترفند بازپارامتری‌سازی 4373 Hierarchical VAEs - The ELBO Method & The Reparameterization Trick

  • ۴۳۷۴ SpeechLMهای گسسته — یکپارچه‌سازی زبان‌شناسی و پارالینگویستیک 4374 Discrete SpeechLMs – Unifying Linguistics & Paralinguistics via Acoustic To

  • ۴۳۷۵ Flow-Matching پیوسته و دیفیوژن — تغییر جریان احتمال با پارالینگویستیک 4375 Continuous Flow‑Matching & Diffusion – Warping the Probability Flow with Pa

  • ۴۳۸۱ چالش‌های نظری و مسائل باز — مدل‌سازی پارالینگویستیک 4381 Theoretical Challenges & Open Problems – Paralinguistic Modelin

  • ۴۳۸۲ تکامل مدل‌سازی پارالینگویستیک — از قوانین دستی به تولید مشترک 4382 Evolution of Paralinguistic Modeling – From Hand‑Crafted Rules to Joint Gen

  • ۴۳۸۳ مسیرهای نظری آینده — خودجوش بودن عامل‌محور و ادغام عواطف چند-مودالی 4383 Future Theoretical Directions – Agentic Spontaneity & Multimodal Affect Int

  • مثال کد ۴.۳ مدل‌سازی پارالینگویستیک: خنده، تنفس و لکنت Code Eg 4.3 Modeling paralinguistics: Laughter, breathing, disfluency, and affec

  • مثال کد ۴.۳ بخش دوم VAE سلسله‌مراتبی و بوطیقای گسسته Code Eg 4.3 ii Hierarichal VAE & Discrete Prosody-esv2-50p-bg-10p-music-

ماژول ۵: تراشیدن نویز — دیفیوژن نهفته و معماری‌های هیبریدی LLM Module 5: Sculpting Noise — Latent Diffusion and Hybrid LLM Architectures

  • مقدمه ۵.۱ معماری‌های DDPM، مدل‌های مبتنی بر امتیاز (Score-based) و دیفیوژن نهفته برای مل-اسپکتروگرام Intro 5.1 DDPM, score-based, and latent diffusion architectures for mel-spectrgm

  • ۵۱۱۱ مکانیک دیفیوژن احتمالی — شهود اصلی 5111 Probabilistic Diffusion Mechanics – The Core Intuition

  • ۵۱۱۲ مکانیک دیفیوژن احتمالی — مقدمه ریاضی 5112 Probabilistic Diffusion Mechanics - Mathematical Introduction

  • ۵۱۱۳ مدل احتمالی دیفیوژن نویززدا (DDPM) 5113 Denoising Diffusion Probabilistic Model

  • ۵۱۱۴ نمونه‌برداری فرم بسته (ترفند بازپارامتری‌سازی) 5114 Closed form Sampling ( Reparametrization trick)

  • ۵۱۲۱ فرآیند پیشرو (Forward) — مبانی ریاضی 5121 Forward Process – The Mathematical Foundation

  • ۵۱۲۲ فرآیند پیشرو — نقش و مقادیر زمان‌بند (Scheduler) 5122 Forward Process – Role & Values of Scheduler

  • ۵۱۲۳ ترفند بازپارامتری‌سازی 5123 Reparametrization Trick

  • ۵۱۲۴ فرآیند معکوس — یادگیری نویززدایی 5124 The Reverse Process – Learning to Denoise

  • ۵۱۲۵ گام‌های آموزش و اهداف (Objectives) 5125 Training steps & Objectives

  • ۵۱۲۶ معماری U-Net: موتور یادگیری 5126 U-Net Architecture : The Learning Engine

  • ۵۱۲۷ نحوه یادگیری مدل — آموزش و تولید 5127 How the Model Learns – Training and Generation

  • مثال کد ۵.۱ بخش ۱ Code Eg 5.1 part 1

  • تمرین کد ۵.۱ بخش ۱ Code Ex 5.1 part 1

  • ۵۱۳۱ گلوگاه محاسباتی — چرا دیفیوژن در فضای پیکسل غیرعملی است 5131 The Compute Bottleneck – Why Pixel Space Diffusion Is Impractical

  • ۵۱۳۲ چالش تأخیر — چه چیزی آن را غیرعملی می‌کند 5132 The Latency challenge - What makes it impractical

  • ۵۱۳۳ مدل‌های دیفیوژن نهفته (LDM) — حل گلوگاه محاسباتی 5133 Latent Diffusion Models – Solving the Compute Bottleneck

  • ۵۱۳۴ فشرده‌سازی فضایی — چرا این راهکار درست است 5134 The Spatial compression - Why makes it the right solution

  • ۵۱۳۵ مدل‌های دیفیوژن نهفته — روش آموزش و تولید 5135 Latent Diffusion Models – Training & Generation method

  • ۵۱۳۶ دیفیوژن در فضای نهفته — انقلاب کاربردی 5136 Diffusion in the Latent Space – The Practical Revolution

  • ۵۱۳۷ LDM: مزیت محاسباتی و کاهش تأخیر 5137 LDM: Compute Advantage & Latency Gain

  • ۵۱۴۱ شرطی‌سازی (متن به تصویر) — هدایت فرآیند نویززدایی 5141 Conditioning (Text-to-Image) – Steering the Denoising Process

  • ۵۱۴۲ توجه متقاطع (Cross Attention): کاربرد و پیامد 5142 Cross Attention : Application & Implication

  • ۵۱۴۳ توجه متقاطع: ادغام در معماری U-Net 5143 Cross Attention : Integration in U-net architecture

  • ۵۱۴۴ خط لوله کامل LDM با ادغام توجه متقاطع 5144 The Complete LDM Pipeline with Cross Attention Integration

  • مثال کد ۵.۱ بخش ۲ Code Eg 5.1 part 2

  • تمرین کد ۵.۱ بخش ۲ Code Ex 5.1 part 2

  • ۵۱۵۱ تئوری دقیق عملکرد — دیفیوژن آکوستیک برای TTS 5151 Detailed Working Theory – Acoustic Diffusion for TTS

  • ۵۱۵۲ تئوری دقیق عملکرد — نویززدایی تکرارشونده در دیفیوژن آکوستیک 5152 Detailed Working Theory – Iterative Denoising in Acoustic Diffusion

  • ۵۱۶۱ مدل‌های احتمالی دیفیوژن نویززدا (DDPMs) 5161 Denoising Diffusion Probabilistic Models -DDPMs

  • ۵۱۶۲ مدل‌های مولد مبتنی بر امتیاز (SGMs) 5162 Score-Based Generative Models SGMs

  • ۵۱۶۳ مدل‌های دیفیوژن نهفته (LDMs) 5163 Latent Diffusion Models LDMs

  • ۵۱۷۱ چالش‌های نظری و مسائل باز — دیفیوژن برای هوش مصنوعی گفتار 5171 Theoretical Challenges & Open Problems – Diffusion for Speech AI

  • ۵۱۷۲ تکامل و بافت تاریخی — مدل‌های دیفیوژن در هوش مصنوعی گفتار 5172 Evolution & Historical Context – Diffusion Models in Speech AI

  • ۵۱۷۳ مسیرهای نظری آینده — Flow Matching، جریان‌های اصلاح‌شده و دیفیوژن گسسته 5173 Future Theoretical Directions – Flow Matching, Rectified Flows & Discrete D

  • مثال کد ۵.۱ بخش ۳ Code Eg 5.1 part 3

  • مقدمه ۵.۲ پل زدن بین توکن‌های معنایی گسسته LLM و دیفیوژن آکوستیک پیوسته Intro 5.2 Bridging discrete LLM semantic tokens w continuous acoustic diffusion

  • ۵۲۱۱ سنتز گفتار هیبریدی — توکن‌های معنایی گسسته LLM و آکوستیک پیوسته 5211 Hybrid Speech Synthesis – Discrete LLM Semantic Tokens & Continuous Acousti

  • ۵۲۱۲ مبانی نظری — پل زدن بین توکن‌های گسسته LLM و آکوستیک پیوسته 5212 Theoretical Foundations – Bridging Discrete LLM Tokens with Continuous Acou

  • ۵۲۲۱ مفاهیم اصلی — گلوگاه اطلاعات و توکن‌های معنایی 5221 Core Concepts – The Information Bottleneck and Semantic Tokens

  • ۵۲۲۲ منیفولد آکوستیک نهفته — فشرده‌سازی شکل‌موج‌های پیوسته برای پردازش 5222 The Latent Acoustic Manifold – Compressing Continuous Waveforms for Tractab

  • ۵۲۲۳ پل زدن بین توکن‌های معنایی گسسته LLM و دیفیوژن آکوستیک پیوسته — یک رویکرد هیبریدی 5223 Bridging Discrete LLM Semantic Tokens & Continuous Acoustic Diffusion – A H

  • ۵۲۲۴ تئوری دقیق عملکرد — LLM هیبریدی و دیفیوژن برای سنتز گفتار 5224 Detailed Working Theory – Hybrid LLM & Diffusion for Speech Synthesis

  • ۵۲۲۵ سنتز گفتار هیبریدی — نویززدایی هدایت‌شده شرطی و رمزگشایی نهفته 5225 Hybrid Speech Synthesis – Conditionally Guided Denoising & Latent Decoding

  • ۵۲۳۱ AudioLDM 2 — هیبریدی LLM و دیفیوژن نهفته 5231 AudioLDM 2 - LLM & Latent Diffusion Hybrid

  • ۵۲۳۲ NaturalSpeech 2 و 3 — دیفیوژن پیوسته با فضای نهفته فاکتورگیری شده 5232 NaturalSpeech 2 & 3 – Continuous Diffusion with Disentangled Factorized Lat

  • ۵۲۳۴ TorToiSe TTS — پیش‌گام تکاملی سنتز گفتار هیبریدی 5234 TorToiSe-TTS – The Evolutionary Precursor of Hybrid Speech Synthesis

  • ۵۲۴۱ چالش‌های نظری و مسائل باز — پل زدن بین LLM گسسته و پیوسته 5241 Theoretical Challenges & Open Problems – Bridging Discrete LLM & Continuous

  • ۵۲۴۲ تکامل و بافت تاریخی — پاندول تولید گفتار 5242 Evolution & Historical Context – The Pendulum of Speech Generation

  • ۵۲۴۳ مسیرهای نظری آینده — فراتر از هیبریدهای آبشاری 5243 Future Theoretical Directions – Beyond Cascaded Hybrids

  • مثال کد ۵.۲ پل زدن بین توکن‌های معنایی گسسته و دیفیوژن آکوستیک پیوسته Code Eg 5.2 Bridging discrete LLM semantic tokens with continuous acoustic diffu

ماژول ۶: تسلط بر مسیر — Flow Matching شرطی و حل‌کننده‌های ODE Module 6: Mastering the Trajectory — Conditional Flow Matching and ODE Solvers

  • مقدمه ۶.۱ گام‌های زمانی پیوسته در مقابل گسسته، حل‌کننده‌های ODE و Rectified Flow Intro to 6.1 Continuous vs. discrete time steps, ODE solvers, and Rectified Flow

  • ۶۱۱۱ دیفیوژن زمان پیوسته و حل‌کننده‌های ODE 6111 Continuous-Time Diffusion & ODE Solvers

  • ۶۱۱۲ گام‌های زمانی گسسته — زنجیره مارکوف کلاسیک DDPM 6112 Discrete Time Steps – The Classical DDPM Markov Chain

  • ۶۱۱۳ فرمول‌بندی زمان پیوسته — از گام‌های گسسته به یک جریان نرم 6113 Continuous Time Formulation – From Discrete Steps to a Smooth Flow

  • ۶۱۱۴ مزایای زمان پیوسته — رهایی از گام‌های گسسته 6114 The Advantages of Continuous Time – Breaking Free from Discrete Steps

  • مثال کد ۱ دیفیوژن زمان پیوسته و حل‌کننده‌های ODE Code Eg 1 Continuous-Time Diffusion & ODE Solvers

  • ۶۱۲۱ بررسی عمیق حل‌کننده‌های ODE — ODE جریان احتمال 6121 Deep Dive into ODE Solvers – Probability Flow ODE

  • ۶۱۲۲ مقایسه حل‌کننده‌های محبوب ODE — سرعت در مقابل دقت 6122 Comparing Popular ODE Solvers – Speed vs. Accuracy

  • ۶۱۲۳ روش اویلر مرتبه اول — پیش‌بین-اصلاح‌گر برای مسیرهای منحنی 6123 Eulers Method 1st Order – Predictor‑Corrector for Curved Paths

  • ۶۱۲۴ روش هیون (Heun) مرتبه دوم — پیش‌بین-اصلاح‌گر برای مسیرهای منحنی 6124 Heun's Method 2nd Order – Predictor‑Corrector for Curved Paths

  • ۶۱۲۵ حل‌کننده‌های مرتبه بالاتر و تطبیقی — DPM-Solver, DOPRI و فراتر از آن 6125 Higher‑Order & Adaptive Solvers – DPM‑Solver, DOPRI, and Beyond

  • ۶۱۲۶ پیوسته در مقابل گسسته — مقایسه رودررو 6126 Continuous vs Discrete – Head‑to‑Head Comparison

  • مثال کد ۲ حل‌کننده‌های ODE، مدل‌های ویدئویی و Rectified Flow Code Eg 2 ODE Solvers ,Video Models & Rectified Flow

  • مقدمه ۶.۲ Flow Matching در مقابل دیفیوژن: توازن کیفیت، سرعت و کنترل‌پذیری Intro 6.2 Flow matching vs. diffusion: Quality, speed, and controllability trade

  • ۶۲۱۱ چرا هندسه دیفیوژن اهمیت دارد 6211 Why Diffusion's Geometry Matters

  • ۶۲۱۲ Flow Matching و Rectified Flow: یک مقدمه 6212 Flow Matching & Rectified Flow An introducti

  • ۶۲۱۳ گلوگاه — چرا مسیرهای منحنی سرعت را می‌کشند 6213 The Bottleneck – Why Curved Paths Kill Speed

  • ۶۲۱۴ مقایسه تأخیر، محاسبات و عملکرد 6214 Latency Compute & Performance comparison

  • ۶۲۱۵ آنچه درباره تعداد گام‌های دیفیوژن آموختیم 6215 What we learned about Diffusion steps count

  • ۶۲۲۱ Flow Matching: چارچوب گسترده‌تر 6221 Flow Matching The Broader Framework

  • ۶۲۲۲ Rectified Flow — خط مستقیم به سوی سرعت بیشتر 6222 Rectified Flow – The Straight Line to Faster

  • ۶۲۲۳ Rectified Flow — تأثیر بر تأخیر 6223 Rectified Flow – Impact on Latency

  • ۶۲۲۴ Rectified Flow — تکامل و پذیرش صنعتی 6224 Rectified Flow – Evolution & Industry Adopti

  • ۶۲۲۵ ظرافت ریاضی Rectified Flow 6225 The Mathematical Elegance of Rectified Flow

  • ۶۲۲۶ Rectified Flow — هدف پیش‌بینی سرعت (Velocity Prediction) 6226 Rectified Flow – The Velocity Prediction Obj

  • ۶۲۲۷ چرا خطوط مستقیم برنده هستند — نمونه‌برداری اویلر 6227 Why Straight Lines Win – Euler Sampling

  • مثال کد ۶.۲ Flow Matching در مقابل دیفیوژن Code Eg 6.2-Flow matching vs. diffusion: Quality, speed, & controllability tra

  • مقدمه ۶.۳ Flow Matching شرطی برای TTS: یادگیری مسیر متن به مل Intro 6.3 Conditional flow matching for TTS: Text-to-mel trajectory learning

  • ۶۳۱۱ Flow Matching شرطی برای TTS — یادگیری مسیر متن به مل 6311 Conditional Flow Matching for TTS – Text-to-Mel Trajectory Learning

  • ۶۳۱۲ مبانی نظری — Flow Matching برای TTS 6312 Theoretical Foundations – Flow Matching for TTS

  • ۶۳۲۱ مفاهیم اصلی — مسیر چگالی احتمال و میدان‌های برداری 6321 Core Concepts – The Probability Density Path and Vector Fields

  • ۶۳۲۲ شرطی‌سازی جریان — حرف C در CFM 6322 Conditioning the Flow - The C in CFM

  • ۶۳۳۱ انتقال بهینه و راست کردن مسیر — پیشرفت CFM 6331 Optimal Transport & Trajectory Straightening – The Breakthrough of CFM

  • ۶۳۳۲ تئوری دقیق عملکرد — Flow Matching شرطی برای TTS 6332 Detailed Working Theory – Conditional Flow Matching for TTS

  • ۶۳۴۱ Matcha TTS: Flow Matching شرطی برای گفتار 6341 Matcha-TTS Conditional Flow Matching for Speech

  • ۶۳۴۲ Voicebox — اجزای جریان پیوسته برای تولید ماسک‌شده و شرطی 6342 Voicebox – Continuous Flow Components for Masked & Conditional Generation

  • ۶۳۵۱ چالش‌های نظری و مسائل باز — Flow Matching شرطی (CFM) 6351 Theoretical Challenges & Open Problems – Conditional Flow Matching - CFM

  • ۶۳۵۲ تکامل و بافت تاریخی — مدل‌سازی مسیر متن به مل 6352 Evolution & Historical Context – Text-to-Mel Trajectory Modeling

  • ۶۳۵۳ مسیرهای نظری آینده — Flow Matching برای TTS 6353 Future Theoretical Directions – Flow Matching for TTS

  • مثال کد ۶.۳ Flow Matching شرطی برای TTS Code Eg 6.3-Conditional flow matching for TTS: Text-to-mel trajectory learning

ماژول ۷: سرعت مکالمه — TTS عامل‌محور بومی و استریمینگ با تأخیر کم Module 7: Conversational Velocity — Native Agent TTS and Low-Latency Streaming

  • مقدمه ۷.۱ معماری‌های چند-مودالی End-to-End: حذف گلوگاه آبشاری Intro 7.1 End-to-end multimodal architectures: Eliminating the cascade bottlenec

  • ۷۱۱۱ معماری‌های چند-مودالی End-to-End — حذف گلوگاه آبشاری 7111 End-to-End Multimodal Architectures – Eliminating the Cascade Bottleneck

  • ۷۱۱۲ مبانی نظری — فرض استقلال شرطی در سیستم‌های آبشاری 7112 Theoretical Foundations – The Cascades Conditional Independence Assumption

  • ۷۱۱۳ چرخش نظری — مدل‌سازی مستقیم توزیع مشترک 7113 Theoretical Shift – Direct Joint Distribution Modeling

  • ۷۱۱۴ مفاهیم اصلی — گلوگاه آبشاری و انباشت خطا 7114 Core Concepts – The Cascade Bottleneck and Error Compounding

  • ۷۱۱۵ مفاهیم اصلی — تجمع تأخیر و مودالیته بومی صوت 7115 Core Concepts – Latency Accumulation and Native Audio Modality

  • ۷۱۲۱ تئوری دقیق عملکرد — توکن‌سازی آکوستیک و بازنمایی نهفته مشترک 7121 Detailed Working Theory – Acoustic Tokenization & Joint Latent Representati

  • ۷۱۲۲ گام ۳ و ۴ — تولید صوتی خودبازگشتی و بازسازی شکل‌موج 7122 Step 3 & 4 – Autoregressive Audio Generation & Waveform Reconstruction

  • ۷۱۳۱ مدل‌سازی زبان گفتاری مولد (GSLM) 7131 Generative Spoken Language Modeling - GSLM

  • ۷۱۳۲ ترنسفورمرهای چند-مودالی بومی — اوج یکپارچگی (مانند GPT-4o) 7132 Native Multimodal Transformers – The Unified Pinnacle e.g., GPT‑4o

  • ۷۱۴۱ چالش‌های نظری و مسائل باز — معماری چند-مودالی End-to-End 7141 Theoretical Challenges & Open Problems – End-to-End Multimodal Architecture

  • ۷۱۴۲ تکامل و بافت تاریخی — سفر به سوی یکپارچگی کامل معماری 7142 Evolution & Historical Context – The Journey Toward Total Architectural Uni

  • ۷۱۴۳ مسیرهای نظری آینده — معماری‌های چند-مودالی End-to-End 7143 Future Theoretical Directions – End-to-End Multimodal Architectures

  • مثال کد ۷.۱ معماری‌های چند-مودالی End-to-End Code Eg 7.1 End-to-end multimodal architectures: Eliminating the cascade bottlen

  • مقدمه ۷.۲ کلونینگ صدای Zero-shot و انتقال دینامیک احساس در عوامل بومی Intro 7.2 Zero-shot voice cloning and dynamic emotion transfer in native agents

  • ۷۲۱۱ کلونینگ صدای Zero-Shot و انتقال دینامیک احساس در عوامل بومی 7211 Zero‑Shot Voice Cloning & Dynamic Emotion Transfer in Native Agents

  • ۷۲۱۲ مبانی نظری — جداسازی شرطی و گلوگاه اطلاعات 7212 Theoretical Foundations – Conditional Disentanglement & Information Bottlen

  • ۷۲۱۳ گلوگاه اطلاعات برای تعمیم Zero-Shot 7213 The Information Bottleneck for Zero‑Shot Generalization

  • ۷۲۱۴ مفاهیم اصلی — بلوک‌های سازنده عوامل بومی اکسپرسیو 7214 Core Concepts – The Building Blocks of Expressive Native Agents

  • ۷۲۲۱ تئوری دقیق عملکرد — کلونینگ صدای Zero-Shot و انتقال احساس (گام ۱) 7221 Detailed Working Theory – Zero‑Shot Voice Cloning & Emotion Transfer - Step

  • ۷۲۲۲ گام ۴، ۵ و ۶ — ادغام شرطی، تحقق آکوستیک و ووکودینگ 7222 Step 4, 5 & 6 – Conditional Fusion, Acoustic Realization & Vocoding

  • ۷۲۳۱ تطبیق سنتی گوینده در مقابل مدل‌های زبانی گفتار 7231 Traditional Speaker Adaptation vs. Speech Language Models

  • ۷۲۳۲ توکن‌های استایل جهانی (GST) و اتوانکودرهای متغیر (VAE) 7232 Global Style Tokens -GST and Variational Autoencoders -VAE

  • ۷۲۳۳ کلونرهای مدرن مبتنی بر خودبازگشت و دیفیوژن — سطح پیشرفته (SOTA) 7233 Modern Autoregressive & Diffusion-Based Cloners – The State of the Art

  • ۷۲۴۱ چالش‌های نظری و مسائل باز — کلونینگ Zero-Shot و احساس 7241 Theoretical Challenges & Open Problems – Zero‑Shot Voice Cloning & Emotion

  • ۷۲۴۲ تکامل مدل‌سازی صدا — از آمار سخت به مدل‌های سیال و حساس به بافت 7242 Evolution of Voice Modeling – From Rigid Statistics to Fluid, Context‑Aware

  • ۷۲۴۳ مسیرهای نظری آینده — کلونینگ صدای اکسپرسیو 7243 Future Theoretical Directions – Expressive Voice Cloning

  • مثال کد ۷.۲ کلونینگ صدای Zero-shot و انتقال دینامیک احساس Code Eg 7.2 Zero-shot voice cloning and dynamic emotion transfer in native agent

  • مقدمه ۷.۳ به حداقل رساندن تأخیر سنتز: استنتاج تکه‌ای و رمزگشایی گمانه‌زن Intro 7.3 Minimizing synthesis latency: Chunked inference and speculative decodi

  • ۷۳۱۱ به حداقل رساندن تأخیر سنتز — استنتاج تکه‌ای و رمزگشایی گمانه‌زن 7311 Minimizing Synthesis Latency – Chunked Inference & Speculative Decoding

  • ۷۳۱۲ مبانی نظری — گلوگاه قانون زنجیره‌ای 7312 Theoretical Foundations – The Chain Rule Bottleneck

  • ۷۳۱۳ بینش اصلی پشت رمزگشایی گمانه‌زن (Speculative Decoding) 7313 The Core Insight Behind Speculative Decoding

  • ۷۳۱۴ ریاضیات پنجره‌های بافت محلی — خطی کردن پیچیدگی توجه 7314 The Mathematics of Localized Context Windows – Linearizing Attention Comple

  • ۷۳۲۱ مفاهیم اصلی — TTFB، نرخ بیت استریمینگ و مدل‌های Draft-Target 7321 Core Concepts – TTFB, Streaming Bitrate & DraftTarget Models

  • ۷۳۲۲ نمونه‌برداری رد (Rejection) و تراز توزیع — تضمین کیفیت در رمزگشایی گمانه‌زن 7322 Rejection Sampling & Distribution Alignment – Guaranteeing Quality in Specu

  • ۷۳۲۳ کشینگ Key-Value (KV) در فریم‌های استریمینگ — حفظ تداوم آکوستیک 7323 Key‑Value - KV Caching in Streaming Frames – Preserving Acoustic Continuity

  • ۷۳۲۴ کشینگ حالت و دوختن (Stitching) — نرم کردن مرزهای آکوستیک در TTS استریمینگ 7324 State Caching and Stitching – Smoothing Acoustic Boundaries in Streaming TT

  • ۷۳۳۱ TTS یکپارچه سنتی در مقابل SpeechLMهای استریمینگ — تغییر پارادایم 7331 Traditional Monolithic TTS vs. Streaming SpeechLMs – The Paradigm Shift

  • ۷۳۳۲ دیفیوژن نهفته استریمینگ و Flow Matching — تولید زمانی پنجره لغزان 7332 Streaming Latent Diffusion & Flow Matching – Sliding-Window Temporal Genera

  • ۷۳۴۱ چالش‌های نظری و مسائل باز — استریمینگ و رمزگشایی گمانه‌زن 7341 Theoretical Challenges & Open Problems – Streaming & Speculative Decoding

  • ۷۳۴۲ تکامل سنتز گفتار بلادرنگ — از برش واج‌ها به SpeechLM استریمینگ 7342 Evolution of RT Speech Synthesis – From Phoneme Splicing to Streaming Speec

  • ۷۳۴۳ مسیرهای نظری آینده — سنتز گفتار با تأخیر بسیار کم 7343 Future Theoretical Directions – Low-Latency Speech Synthesis

  • مثال کد ۷.۳ به حداقل رساندن تأخیر سنتز Code Eg 7.3 Minimizing synthesis latency: Chunked inference and speculative deco

  • مقدمه ۷.۴ الگوهای استقرار: استریمینگ WebSocket، مدیریت وقفه و نوبت‌گیری Intro 7.4 Deployment patterns: WebSocket streamng, interruption handlng, & turn-

  • ۷۴۱۱ الگوهای استقرار — استریمینگ WebSocket، مدیریت وقفه و نوبت‌گیری 7411 Deployment Patterns – WebSocket Streaming, Interruption Handling & Turn-Tak

  • ۷۴۱۲ مبانی استقرار — Full-Duplex و ماشین‌های حالت متناهی (FSM) 7412 Foundations of Deployment – Full‑Duplex & Finite State Machines

  • ۷۴۲۱ مفاهیم اصلی — استریمینگ دو-سویه پایدار 7421 Core Concepts – Persistent Bidirectional Streaming

  • ۷۴۲۲ تشخیص فعالیت صوتی (VAD) و Endpointing — محرک نوبت‌گیری 7422 Voice Activity Detection (VAD) and Endpointing – The Turn‑Taking Trigge

  • ۷۴۲۳ ورود ناگهانی (Barge In) و مدیریت وقفه — محور آکوستیک 7423 Barge-In and Interruption Handling – The Acoustic Pivot

  • ۷۴۲۴ دینامیک نوبت‌گیری و Backchanneling — رقص گفتگو 7424 Turn-Taking Dynamics & Backchanneling – The Dance of Dialogue

  • ۷۴۳۱ تئوری دقیق عملکرد — نوبت مکالمه دینامیک 7431 Detailed Working Theory – The Dynamic Conversational Turn

  • ۷۴۳۲ Barge In — وقفه، بازگشت و واگذاری نوبت گفتگو 7432 Barge-In – Interruption, Reversion, and Floor Yielding

  • ۷۴۴۱ مدل Half-Duplex 7441 The Half-Duplex Model

  • ۷۴۴۲ عامل بومی Full-Duplex — معماری مکالمه سیال 7442 The Full-Duplex Native Agent – The Architecture of Fluid Conversation

  • ۷۴۵۱ چالش‌های نظری و مسائل باز — استقرار بلادرنگ 7451 Theoretical Challenges & Open Problems – Real‑Time Deployment

  • ۷۴۵۲ تکامل و بافت تاریخی — معماری‌های استقرار صوتی 7452 Evolution & Historical Context – Voice Deployment Architectures

  • ۷۴۵۳ مسیرهای نظری آینده — نوبت‌گیری پیش‌بینانه 7453 Future Theoretical Directions – Anticipatory Turn-Taking

  • مثال کد ۷.۴ الگوهای استقرار: WebSocket و مدیریت وقفه Code Eg 7.4 Deployment patterns: WebSocket streaming, interruption handling, and

نمایش نظرات

آموزش تسلط بر هوش مصنوعی مولد صوت: از توکن‌ها تا TTS عامل‌محور
جزییات دوره
33 hours
374
(آخرین آپدیت)
137
4.8 از 5
دارد
دارد
دارد
Vinit Singh
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Vinit Singh Vinit Singh

مشاور و مدرس هوش مصنوعی