معماری، آموزش و کاربردهای مدل‌های زبانی گفتاری (SpeechLM) برای هوش مصنوعی صوتی مدرن [ویدیو] - آخرین آپدیت

دانلود Speech Language Models Architecture, Training, and Applications for Modern Voice AI [Video]

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد.
نمونه ویدیوها:
توضیحات دوره: سفری به دنیای مدل‌های زبانی گفتاری (Speech Language Models) آغاز کنید؛ از خط لوله‌های سنتی گفتار و محدودیت‌های آن‌ها در تاخیر، انتشار خطا و از دست رفتن اطلاعات شروع کرده و به بررسی معماری‌های SpeechLM می‌پردازیم که ASR، TTS و درک معنایی را با هم ادغام کرده و نشانه‌های فرازبانی را برای ایجاد هوش مصنوعی صوتی غنی‌تر به کار می‌گیرند. این دوره شامل تمرینات عملی در زمینه توکن‌سازی صوتی، ووکودرها (Vocoders) و خط لوله‌های تشخیص احساسات است. شما با مفاهیم پیشرفته گفتار مانند آواشناسی، آکوستیک، ویژگی‌های MFCC، تراز چندوجهی (Cross-modal alignment) و پیش‌بینی توکن مبتنی بر ترنسفورمر آشنا خواهید شد. مراحل مختلف آموزش شامل پیش‌آموزش (Pre-training)، تنظیم دستورالعمل (Instruction-tuning) و تراز پسین (Post-alignment) را همراه با استقرار در زمان واقعی و با تاخیر کم بیاموزید. ماژول‌ها بر روی مثال‌های کدنویسی، شبیه‌سازی‌ها و استراتژی‌های ارزیابی در وظایف معنایی، گوینده و فرازبانی تاکید دارند. در بخش مقیاس‌پذیری برای محیط عملیاتی، این دوره مباحثی چون ارکستراسیون چند-عاملی، زنجیره‌سازی ابزارها، ایمنی، ارزیابی سوگیری و مانیتورینگ را پوشش می‌دهد. شما در استقرار SpeechLMها با گاردریل‌های مستحکم، خط لوله‌های حافظه برداری و مدیریت تعاملات لحظه‌ای تخصص کسب خواهید کرد. در پایان این دوره، شما با اعتماد به نفس کامل قادر خواهید بود سیستم‌های هوش مصنوعی گفتاری مقیاس‌پذیر و آماده تولید را طراحی، پیاده‌سازی و مستقر کنید. - طراحی معماری‌های مدرن SpeechLM برای کاربردهای ASR و TTS - پیاده‌سازی توکن‌سازی صوتی و خط لوله‌های ووکودر برای سنتز گفتار - اعمال تراز چندوجهی برای وظایف معنایی و فرازبانی - آموزش SpeechLMها با استفاده از پیش‌آموزش، تنظیم دستورالعمل و تراز پسین - استقرار سیستم‌های چند-عاملی مقیاس‌پذیر با تعاملات صوتی کم‌تاخیر - ارزیابی و بنچ‌مارک مدل‌ها از نظر دقت، احساسات و شباهت گوینده این دوره برای مهندسان هوش مصنوعی، توسعه‌دهندگان نرم‌افزار و دانشمندان داده که به دنبال تخصص در هوش مصنوعی صوتی مدرن و SpeechLMها هستند، ایده‌آل است. متخصصانی که با پایتون و LLM آشنایی دارند می‌توانند به سمت ساخت سیستم‌های صوتی خودمختار پیش بروند. پژوهشگران، مدیران محصول و علاقه‌مندان به یادگیری ماشین که هدفشان طراحی، استقرار و مانیتورینگ هوش مصنوعی گفتاری در سطح تولید است، از کدنویسی عملی، ارکستراسیون چند-عاملی و استراتژی‌های ارزیابی ادغام شده در جریان‌های کاری واقعی بهره‌مند خواهند شد. پوشش جامع خط لوله‌های گفتار از ASR سنتی تا SpeechLMهای مدرن * تمرینات کدنویسی عملی برای نمایش استقرار واقعی و ارکستراسیون چند-عاملی * بررسی عمیق استراتژی‌های آموزش، ارزیابی و ایمنی برای سیستم‌های عملیاتی

سرفصل ها و درس ها

ماژول ۱ — انقلاب عامل‌محور: مبانی و تنظیمات ایمن Module 1 — The Agentic Revolution: Foundations & Safe Setup

  • مقدمه‌ای بر ماژول ۱: معرفی پردازش زبان گفتاری و ظهور مدل‌های SpeechLM Introduction to Module 1 - Intro to Speech LP and the Emergence of SpeechLM Model

  • پردازش سنتی گفتار ۱: تشخیص خودکار گفتار (ASR) Traditional Speech Processing - 1 Automatic Speech Recognition (ASR)

  • گفتار سنتی ۲: درک زبان طبیعی (NLU)، تبدیل متن به گفتار (TTS) و ادغام خط لوله Traditional Speech - 2 NLU, Text-to-Speech (TTS), Pipeline Integration

  • نحوه دانلود آناکوندا و ایجاد محیط مجازی How to download Anaconda and create environment

  • مثال کدنویسی و بحث: ساخت یک عامل گفتگو با قابلیت گفتاری Coding Eg & Ex. Discussion - Building a Speech-Enabled Conversational Agent

  • محدودیت‌های خط لوله سنتی ۱: از دست رفتن اطلاعات و تاخیر قابل توجه Limitations Traditional Pipeline - 1 Information Loss, Significant Latency

  • محدودیت‌های سنتی ۲: انتشار خطا و اثر متقابل محدودیت‌ها Limitations Traditional - 2 Error Propagation, Synergy of Limitations

  • بحث مثال کدنویسی: خط لوله گفتار با محدودیت‌های شبیه‌سازی شده Coding Example Discussion - Speech Pipeline with Simulated Limitations

  • مقدمه‌ای بر مدل‌های زبانی گفتاری (SpeechLMs) ۱: مدل‌های SpeechLM چیستند؟ Introduction to Speech Language Models (SpeechLMs) - 1 What are SpeechLMs?

  • مقدمه SpeechLMs ۲: نحوه عملکرد و استخراج اطلاعات غنی در SpeechLMها Introduction to SpeechLMs - 2 How do SpeechLMs work, capture Rich Info

  • مثال کدنویسی و بحث ۱.۳: توکن‌سازی و بازسازی صوتی + پهنای باند چندگانه Coding Eg & Ex Disc. 1.3- Audio Tokenization and Reconstruction + Multi-Bandwidth

  • مزایای SpeechLMs ۱: کاهش تاخیر و اطلاعات فرازبانی Advantages SpeechLMs - 1 Reduced Latency, Paralinguistic Information

  • مزایای SpeechLMs ۲: کاربرد در زبان‌های کم‌منبع (LRL) Advantages SpeechLMs - 2 Applicability to Low Resource Languages (LRL)

  • مثال کدنویسی ۱.۴: تشخیص گفتار و احساسات با SpeechLM (مدل wav2vec) Coding Eg & Ex 1.4 - Speech & Emotion Recognition with SpeechLM - wav2vec

  • مقایسه SpeechLM در مقابل TextLM ۱: مودالite ورودی، خروجی و معماری SpeechLM vs TextLM - 1 Input Modality, Output Modality, Architecture

  • مقایسه SpeechLM در مقابل TextLM ۲: نمایش‌های داخلی، داده‌های آموزشی و کاربردها SpeechLM vs TextLM - 2 Internal Representations, Training Data, Applications

  • بحث مثال کدنویسی ۱.۵: مقایسه مودالite مدل‌های متنی در برابر گفتاری Coding Example Discussion 1.5 - TextLM vs. SpeechLM Modality Comparison

  • کاربردهای SpeechLMs ۱: مقدمه و وظایف معنایی (تمرکز بر محتوا) Applications SpeechLMs - 1 Introduction, Semantic Tasks (Focus on Content)

  • کاربردهای SpeechLMs ۲: وظایف مربوط به گوینده و وظایف فرازبانی Applications SpeechLMs - 2 Speaker-Related Tasks, Paralinguistic Tasks

  • بحث مثال کدنویسی ۱.۶: دستیار گفتاری آگاه به احساسات Coding Example Discussion 1.6 - Emotion-Aware Speech Assistant

ماژول ۲ — تسلط بر مهندسی پرامپت: زبانِ عامل Module 2 — Mastering Prompt Engineering: The Agent's Language

  • مقدمه ماژول ۲: مبانی گفتار و زبان برای SpeechLMها Intro to Module 2 - Fundamentals of Speech and Language for SpeechLMs

  • اصول آکوستیک گفتار ۱: موج‌های صوتی، شکل موج، فرکانس و طیف Basics of Speech Acoustics - 1 Sound Waves, Waveform, Frequency, Spectrum

  • اصول گفتار ۲: اسپکتروگرام‌ها، MFCCها و کاربردها در یادگیری عمیق Basics of Speech - 2 Spectrograms, MFCCs, Applications in Deep Learning

  • مثال کدنویسی ۲.۱: تحلیل و ترنسکریپت گفتار + استخراج ویژگی‌های گفتاری Code Eg & Ex 2.1 - Speech Analysis & Transcription + Speech Feature Extraction

  • مدل منبع-فیلتر در تولید گفتار ۱: منبع و ۲: فیلتر The Source-Filter Model of Speech Production - 1 The Source, 2 The Filter

  • مدل منبع-فیلتر ۲: خروجی گفتار، مفاهیم کلیدی و اهمیت The Source-Filter Model - 2 Speech Output, Key Concepts of Speech, Relevance

  • آواشناسی و واج‌شناسی در گفتار ۱: فون‌ها، واج‌ها و آلوفون‌ها Phonetics and Phonology in Speech - 1 Phones, Phonemes, and Allophones

  • آواشناسی و واج‌شناسی ۲: نگاشت صداها به واج‌ها و ویژگی‌های آوایی Phonetics and Phonology - 2 Mapping Sounds to Phonemes and Phonetic Features

  • بحث مثال کدنویسی ۲.۳: سیستم تشخیص و تحلیل آوایی Code Eg Discussion - 2.3 Phonetic Recognition and Analysis System

  • استخراج ویژگی‌های صوتی ۱: ضرایب کپسترال فرکانس مل (MFCCs) Audio Feature Extraction - 1 Mel Frequency Cepstral Coefficients (MFCCs)

  • استخراج ویژگی‌های صوتی ۲: شکل‌موج‌های خام و نمایش‌های صوتی آموخته شده Audio Feature Extraction - 2 Raw Waveforms and Learned Audio Representations

  • بحث مثال کدنویسی ۲.۴: مقاوم‌سازی در برابر نویز در تحلیل ویژگی‌های گفتار Coding Eg Discussion 2.4 - Noise Robustness in Speech Feature Analysis

  • نمایش چندوجهی در SpeechLMs ۱: نمایش صوتی و نمایش متنی Cross-Modal Representation SpeechLMs - 1 Audio Representation, Text Representation

  • چندوجهی ۲: تراز چندوجهی، اهمیت در SpeechLMs و پیاده‌سازی Cross-Modal - 2 Cross-Modal Alignment, Relevance to SpeechLMs, Implementation

  • مثال کدنویسی ۲.۵: چارچوب تحلیل و بصری‌سازی تراز چندوجهی Code Eg & Ex 2.5 - Cross-Modal Alignment Visualization & Analysis Framework

ماژول ۳ — سیستم‌های حافظه عامل: RAG و فراتر از آن Module 3 — Agent Memory Systems: RAG and Beyond

  • مقدمه ماژول ۳: معماری‌ها و اجزای کلیدی SpeechLMs Introduction to Module 3 - Architectures and Key Components of SpeechLMs

  • معماری کلی SpeechLM مقدمه: ۱. توکن‌ساز گفتار، ۲. مدل زبانی General Architecture SpeechLM - Intro. 1 Speech Tokenizer, 2 Language Model

  • معماری SpeechLM ۲: سنتز توکن به گفتار (ووکودر) و هماهنگی Architecture SpeechLM - 2 Token-to-Speech Synthesizer (Vocoder), Coordination

  • مثال کدنویسی ۳.۱: شبیه‌سازی ساده خط لوله SpeechLM + مدل زبانی Bigram Code Eg & Ex 3.1 - Simplified SpeechLM Pipeline Simulation + Bigram Language Model

  • توکن‌سازهای گفتار ۱: روش‌های توکن‌سازی صوتی: مدل‌های کدک صوتی Speech Tokenizers - 1 Audio Tokenization Methods: Audio Codec Models

  • گفتار ۲: یادگیری خود-نظارتی (SSL) و سایر روش‌ها Speech - 2 Self-Supervised Learning (SSL) and Other Methods

  • مثال کدنویسی: مقایسه روش‌های توکن‌سازی گفتار + واژگان بهبودیافته Code Eg & Ex - Speech Tokenization Method Comparison + Enhanced Vocabulary

  • مدل‌های زبانی در SLMها ۱: معماری ترنسفورمر و پیش‌بینی خودبازگشتی Language Models in SLMs - 1 Transformer Architecture, Autoregressive Prediction

  • مدل‌های زبانی ۲: تطبیق LLMهای متنی برای گفتار و مدل‌های زبانی چند-جریانی Language Models - 2 Adaptation of Text-Based LLMs for Speech, Multi-Stream LM

  • مثال کدنویسی: پیش‌بینی توکن گفتار مبتنی بر ترنسفورمر + مدل‌سازی توکن گفتار Code Eg & Ex - Transformer-Based Speech Token Prediction + Speech Token Modeling

  • ووکودرها در SpeechLMs مقدمه ۱: عملکرد ووکودر و چرا به آن نیاز داریم؟ Vocoders in SpeechLMs - Intro 1 Function of the Vocoder, Why is it Needed?

  • ووکودرها ۲: مدل‌های MelGAN، HiFi GAN و WaveNet Vocoders - 2 MelGAN, HiFi-GAN, WaveNet

  • مثال کدنویسی ۳.۴: ووکودر عصبی برای سنتز صوتی + الگوریتم Griffin Lim Code Eg & Ex 3.4 - Neural Vocoder for Audio Synthesis + Griffin-Lim Algorithm

ماژول ۴ — ابزارها و اکشن‌ها: گسترش قابلیت‌ها Module 4 — Tools & Actions: Extending Capabilities

  • مقدمه ماژول ۴: متدولوژی‌های آموزش برای SpeechLMs Introduction to Module 4 - Training Methodologies for SpeechLMs

  • مراحل آموزش SpeechLMs مقدمه و پیش‌آموزش (Pre-Training) Training Stages for SpeechLMs - Intro, Pre-Training

  • مراحل آموزش: تنظیم دستورالعمل، تراز پسین و ملاحظات کلیدی Training Stages - Instruction-Tuning, Post-Alignment, Key Considerations

  • مثال کدنویسی: آموزش چند-مرحله‌ای برای SpeechLM + خط لوله جامع Code Eg & Ex - Multi-Stage Training for SpeechLM + Comprehensive Pipeline

  • پیش‌آموزش SpeechLMs ۱: داده‌های گفتاری در مقیاس بزرگ و مجموعه‌داده‌های رایج Pre-Training SpeechLMs - 1 Large-Scale Speech Data, Commonly Used Datasets

  • پیش‌آموزش SpeechLMs ۲: مجموعه‌داده‌های جفت‌شده گفتار-متن و پیش‌آموزش مشترک Pre-Training SpeechLMs - 2 Paired Speech-Text Datasets, Joint Pre-Training

  • مثال کدنویسی: پیش‌آموزش سبک‌وزن SpeechLM + استراتژی‌های رمزگشایی پیشرفته Code Eg & Ex - Lightweight SpeechLM Pre-Training + Advanced Decoding Strategies

  • تنظیم دستورالعمل SpeechLMs ۱: درک تنظیم دستورالعمل و فرآیند آن Instruction-Tuning SpeechLMs - 1 Understanding Instruction-Tuning, Process

  • تنظیم دستورالعمل ۲: ایجاد مجموعه‌داده‌های موثر و تکنیک‌های PEFT (مانند LoRA) Instruction-Tuning - 2 Creating Effective Datasets, PEFT Techniques: LoRA

  • کدهای ۴.۲: استفاده از LoRA برای PEFT در Wav2Vec2 + تنظیم تشخیص گفتار مبتنی بر دستور Codes 4.2 - PEFT of Wav2Vec2 with LoRA + Instruction-Based Speech Recognition Tuning

  • تکنیک‌های تراز پسین ۱: درک مفهوم تراز پسین (Post Alignment) Post-Alignment Techniques - 1 Understanding Post-Alignment

  • تکنیک‌های تراز پسین ۲: RLHF، DPO، وصله‌های ایمنی، متدهای Adversarial و RAG Post-Alignment Techniques - 2 RLHF, DPO, Safety Patches, Adversarial, RAG

  • کدهای ۴.۴: استقرار SpeechLM در دنیای واقعی با تکنیک‌های تراز پسین Codes 4.4 - Real-World SpeechLM Deployment with Post-Alignment Techniques

ماژول ۵ — سیستم‌های چند-عاملی: همکاری در مقیاس بالا Module 5 — Multi-Agent Systems: Collaboration at Scale

  • مقدمه ماژول ۵: بررسی دقیق قابلیت‌ها و کاربردهای SpeechLMs Introduction to Module 5 - Capabilities and Applications of SpeechLMs in Detail

  • قابلیت‌ها و کاربردهای SpeechLM در وظایف معنایی ۱: ASR سرتاسری (E2E) Capabilities & Applications of SpeechLM: Semantic-Related Tasks - 1 E2E ASR

  • قابلیت‌های معنایی ۲: TTS صفر-شات (Zero-Shot) و ترجمه گفتار (ST) Capabilities: Semantic-Related - 2 Zero-Shot TTS, Speech Translation (ST)

  • کدهای ۵.۱: برچسب زمانی سطح کلمه در Whisper ASR + شبیه‌سازی صدای صفر-شات با YourTTS Codes 5.1 - Whisper ASR Word-Level Timestamp + Zero-Shot Voice Cloning YourTTS

  • قابلیت‌ها و کاربردهای SpeechLM در وظایف گوینده ۱: مقدمه Capabilities & Applications SpeechLM: Speaker-Related Tasks - 1 Introduction

  • قابلیت‌ها ۲: شناسایی و تایید گوینده، گفتار شخصی‌سازی شده Capabilities - 2 Speaker Identification & Verification, Personalized Speech

  • کدهای ۵.۲: تایید گوینده با Embeddings مدل ECAPA TDNN + شبیه‌سازی صدا Codes 5.2 - Speaker Verification with ECAPA-TDNN Embeddings + Voice Cloning

  • کاربردهای فرازبانی SpeechLMs ۱: تشخیص احساسات گفتار (SER) Paralinguistic Applications SpeechLMs - 1 Speech Emotion Recognition (SER)

  • فرازبانی ۲: تولید گفتار احساسی، EMOVA، کنترل آهنگ (Prosody) و pGSLM Paralinguistic - 2 Emotional Speech Generation, EMOVA, Prosody Control, pGSLM

  • کدهای ۵.۳: تشخیص احساسات گفتار + سنتز گفتار با کنترل آهنگ Codes 5.3 - Speech Emotion Recognition + Prosody-Controlled Speech Synthesis

  • تعامل صوتی پیشرفته با SpeechLMs ۱: چالش تاخیر و صدای زمان-واقعی (RT Voice) Advanced Voice Interaction w SpeechLMs - 1 The Latency Challenge, RT Voice

  • پیشرفته ۲: مدل LSLM، تشخیص پیشرفته نوبت گفتگو و شناسایی دوره‌های تعاملی Adv. - 2 LSLM Model, Advanced Turn Detection, Interactive Period Recognition

  • کدهای ۵.۴: ASR زمان-واقعی با VAD و مدیریت وقفه‌ها + پیش‌بینی نوبت گفتگو Codes 5.4 - RT ASR w/ VAD & Interp. Handling + Turn-Taking Prediction in Conversation

ماژول ۶ — تست، دیباگ و ارزیابی Module 6 — Testing, Debugging & Evaluation

  • مقدمه ماژول ۶: معیارهای ارزیابی و بنچ‌مارکینگ SpeechLMs Introduction to Module 6 - Evaluation Metrics and Benchmarking of SpeechLMs

  • معیارهای ارزیابی برای SpeechLMs ۱: نرخ خطای کلمات (WER) Evaluation metrics for SpeechLMs - 1 Word Error Rate (WER)

  • ارزیابی ۲: شباهت گوینده (SS)، طبیعی بودن گفتار (MoS) و بنچ‌مارکینگ Eval.- 2 Speaker Similarity (SS), Speech Naturalness (MoS), Benchmarking

  • کدهای ۶.۱: ارزیابی جامع ASR + چارچوب ارزیابی کیفیت TTS Codes 6.1 - Comprehensive ASR Evaluation + TTS Quality Evaluation Framework

  • ارزیابی و بنچ‌مارک SpeechLMs ۱: ASR و TTS Evaluating & Benchmarking SpeechLMs - 1 ASR, TTS

  • ارزیابی ۲: تبدیل صدا (VC)، برنامه‌های فرازبانی و تشخیص قصد (Intent) Eval - 2 Voice Conversion (VC), Paralinguistic Apps, Intent Recognition

  • ارزیابی ۳: تحلیل احساسات، ترجمه گفتار به گفتار و بنچ‌مارکینگ Eval - 3 Sentiment Analysis, Speech-to-Speech Translation, Benchmarking

  • کدهای ۶.۲: ASR همراه با تشخیص احساسات + ارزیابی TTS/VC با تحلیل ویژگی‌های آکوستیک Codes 6.2 - ASR w/ Emotion Recognition + TTS/VC Evaluation w/ Acoustic Feature Analysis

  • مجموعه‌داده‌های بنچ‌مارک برای SpeechLMs ۱: اهمیت مجموعه‌داده‌های بنچ‌مارک Benchmarking Datasets for SpeechLMs - 1 Importance of Benchmarking Dataset

  • بنچ‌مارک ۲: مجموعه‌داده‌های رایج بر اساس هر قابلیت Benchmarking - 2 Commonly Used Benchmarking Datasets by Capability

  • کدهای ۶.۳: ASR سفارشی + چارچوب بنچ‌مارک TTS امن با SpeechT5 و Pyannote Codes 6.3 - Custom ASR + Secure TTS Benchmarking Framework w/ SpeechT5 and Pyannote

  • مقایسه SpeechLMها با سیستم‌های سنتی ASR، TTS و ترجمه ۱: مقدمه Comparing SpeechLMs w/ Traditional ASR, TTS, & Translation Systems - 1 Intro

  • مقایسه ۲: SpeechLM یکپارچه و متدولوژی‌های بنچ‌مارک قابلیت‌های ادغام شده Comparing - 2 Unified SpeechLM, Integrated Capability Benchmarking Methodologies

  • کدهای ۶.۴: مقایسه SpeechLM در مقابل سیستم ASR سنتی + حفظ احساسات Codes 6.4 - Comparing SpeechLM vs Traditional ASR System + Emotion Preservation

ماژول ۷ — سیستم‌های عملیاتی: ایمنی، مقیاس و استقرار Module 7 — Production Systems: Safety, Scale & Deployment

  • مقدمه ماژول ۷: چالش‌ها و مسیرهای آینده در تحقیقات SpeechLM Introduction to Module 7 - Challenges and Future Directions in SpeechLM Research

  • درک انتخاب اجزا در SpeechLMs ۱: اجزای کلیدی Understanding Component Choices in SpeechLMs - 1 Key Components

  • درک انتخاب‌ها ۲: اثر متقابل و اهمیت تصمیمات مربوط به اجزا Understanding Choices - 2 Interplay and Importance of Component Decisions

  • کدهای ۷.۱: مقایسه استخراج‌کننده‌های ویژگی گفتار + چارچوب مقایسه ووکودرها Codes 7.1 - Comparing Speech Feature Extractor + Vocoder Comparison Framework

  • آموزش سرتاسری (End-to-End) در SpeechLMs ۱: درک آموزش سرتاسری End-to-End Training of SpeechLMs - 1 Understanding End-to-End Training

  • سرتاسری ۲: اجزای اصلی: موتور SpeechLM و مزیت عملکردی End-to-End - 2 Core Components: The SpeechLM Engine, Performance Edge

  • کدهای ۷.۲: آموزش تشخیص گفتار سرتاسری + آموزش Lite Tacotron TTS Codes 7.2 - End-to-End Speech Recognition Training + Lite Tacotron TTS Training

  • مقیاس‌بندی SpeechLMs برای اندازه‌ها و داده‌های بزرگ‌تر ۱: اثر مقیاس‌بندی سه‌گانه Scaling SpeechLMs to Larger Sizes and Datasets - 1 Triple Scaling Effect

  • مقیاس‌بندی ۲: مکانیسم‌های مقیاس‌بندی داده‌ها، سه‌گانه مقیاس‌بندی SpeechLM و جمع‌بندی Scaling - 2 Data Scaling Mechanics, SpeechLM Scaling Triad, Summary

  • کدهای ۷.۳: آموزش تشخیص گفتار مقیاس‌پذیر + کشینگ داده‌ها و دسته‌بندی پویا Codes 7.3 - Scalable Speech Recognition Training + Dataset Caching, Dynamic Bucketing

  • بهبود مدل‌سازی اطلاعات فرازبانی در SpeechLMs ۱: چالش‌ها Improving Modeling Paralinguistic Information in SpeechLMs - 1 Challenges

  • بهبود ۲: تکنیک‌های پیشرفته فرازبانی و مدل Multimodal ParalinGPT Improving - 2 Advanced Paralinguistic Techniques, Multimodal ParalinGPT

  • کدهای ۷.۲: تشخیص احساسات با مدل HuBERT + سنتز کنترل شده با آهنگ در FastPitch Codes 7.2 - Emotion Recognition w/ HuBERT Model + Prosody-Controlled Synthesis FastPitch

  • مدیریت زبان‌های کم‌منبع ۱: یادگیری انتقالی (Transfer Learning) و خود-نظارتی Handling Low-Resource Languages - 1 Transfer Learning, Self-Supervised

  • مدیریت ۲: یادگیری نیمه‌نظارتی و بهره‌گیری از زبان‌های مرتبط Handling - 2 Semi-Supervised Learning, Leveraging Related Languages

  • کدهای ۷.۵: فاین‌تیونینگ XLS-R برای ASR + طبقه‌بندی احساسات با SpecAugment Codes 7.5 - Fine-Tuning XLS-R for ASR + Emotion Classification with SpecAugment

  • توسعه SpeechLMهای زمان-واقعی و دوطرفه (Duplex) ۱: معماری Duplex زمان-واقعی Developing Real-Time and Duplex SpeechLMs - 1 Real-Time Duplex Architecture

  • توسعه ۲: معماری‌های استریمینگ و بهینه‌سازی مدل، VAD و مدیریت Barge-In Developing - 2 Streaming Architectures & Model Optimization, VAD, Barge-In

  • کدهای ۷.۶: ASR استریمینگ با Causal Transformer کم‌تاخیر + VAD برای سیستم Barge-In Codes 7.6 - Streaming ASR w/ Causal Transformer Low-Latency + VAD for Barge-In System

  • پرداختن به مسائل ایمنی و اخلاقی در SpeechLMs ۱: ریسک‌های ایمنی SpeechLM Addressing Safety & Ethical Concerns in SpeechLMs - 1 SpeechLM Safety Risks

  • پرداختن ۲: لایه داده و مدل، لایه امنیت و حریم خصوصی، تضمین پاسخگویی Address - 2 Data & Model Layer, Security & Privacy Layer, Ensuring Accountability

  • کدهای ۷.۷: ارزیابی سوگیری در عدالت لهجه ASR + نظارت بر TTS با فیلترینگ توهین Codes 7.7 - Bias Evaluation ASR Accent Fairness + TTS Moderation with Toxicity Filtering

نمایش نظرات

معماری، آموزش و کاربردهای مدل‌های زبانی گفتاری (SpeechLM) برای هوش مصنوعی صوتی مدرن [ویدیو]
جزییات دوره
19h 35m
110
Packtpub Packtpub
(آخرین آپدیت)
از 5
ندارد
دارد
دارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Vinit Kumar Singh Vinit Kumar Singh

وینیت کومار سینگ مشاور و مدرس هوش مصنوعی با بیش از ۱۸ سال تجربه در علوم داده و هوش مصنوعی است که در زمینه‌های Fine-Tuning مدل‌های زبانی بزرگ (LLM)، هوش مصنوعی صوتی، مدل‌های زبانی گفتاری، هوش مصنوعی عامل‌محور (Agentic AI) و بینایی ماشین تخصص دارد. او فارغ‌التحصیل IIT بمبئی است و گواهینامه‌های استنفورد در یادگیری ماشین و یادگیری عمیق را داراست. در حال حاضر به عنوان مشاور در تیم گفتار و زبان در مرکز نرم‌افزاری سونی هند فعالیت می‌کند و بر راهکارهای پیشرفته AI و استقرار واقعی تمرکز دارد. پیش از این، او روی پروژه‌های بینایی ماشین با سخت‌افزار لبه Nvidia در Assert AI کار کرده و مشاوره جامع AI را در tvam Technologies مدیریت نموده است. آثار او شامل ساخت جریان‌های کاری FinTech عامل‌محور، یک ربات-مشاور با استفاده از LoRA روی DeepSeek-R1 و یک خط لوله تماس‌گیرنده هوش مصنوعی صوتی است. وینیت همچنین به عنوان یکی از ۳ درصد برتر تولیدکنندگان محتوای Udemy در سطح جهان شناخته می‌شود و زبان‌آموزانی از بیش از ۱۵۰ کشور دارد. دوره‌ها و تخصص او مورد اعتماد شرکت‌های پیشرو مانند آدیداس، بارکلیز و فولکس‌واگن است و او به فعالیت فعال خود در زمینه‌های Voice AI، Agentic AI، بینایی ماشین، NLP و LLMها ادامه می‌دهد.