پوشش جامع حوزههای آزمون
این بانک سوالات جامع به طور سیستماتیک به компетенسیهای فنی اصلی تقسیم شده است که در مصاحبههای مهندسی AI و یادگیری ماشین حرفهای مورد انتظار است.
پیشپردازش متن (۱۸٪): استراتژیهای توکنایزیشن (WordPiece, BPE)، ریشهیابی پیشرفته (Stemming)، لمتایزیشن (Lemmatization) با استفاده از درختهای وابستگی، فیلتراسیون کلمات توقف (Stopwords) و قوانین نرمالسازی متن.
تحلیل احساسات و استخراج نظر (۱۵٪): تحلیل احساسات مبتنی بر لغتنامه در مقابل ML، تشخیص احساسات، تحلیل احساسات مبتنی بر جنبه (ABSA) و معماریهای یادگیری عمیق برای استخراج نظر در سطح توالی.
یادگیری ماشین برای NLP (۲۰٪): مدلهای یادگیری نظارت شده، خوشهبندی ساختاری بدون نظارت، پارادایمهای توالی یادگیری عمیق، پروتکلهای تنظیم دقیق (Fine-tuning) یادگیری انتقالی و مکانیزمهای توجه (Attention Mechanisms).
کاربردهای NLP (۱۲٪): طبقهبندی متن چندکلاسه، ترجمه ماشینی عصبی (NMT)، یکپارچهسازی تشخیص گفتار، معماری چتباتها و بازیابی اطلاعات پیشرفته مبتنی بر بردار.
مدلها و معماریهای NLP (۱۵٪): چارچوبهای رمزگذار-رمزگشا (Encoder-Decoder)، معماری ترنسفورمر (خود-توجهی، کدگذاری موقعیتی)، شبکههای عصبی بازگشتی (RNNs)، شبکههای حافظه کوتاه-مدت طولانی (LSTMs) و جاسازیهای کلمات استاتیک در مقابل متنی (Contextualized Word Embeddings).
ارزیابی و بهینهسازی (۱۰٪): معیارهای اصلی NLP (BLEU, ROUGE, F1-score, Perplexity)، اعتبارسنجی متقاطع برای توالیهای متنی، تنظیم هایپرپارامترها، تفسیرپذیری و توضیحپذیری مدل.
مباحث تخصصی NLP (۵٪): مدلسازی چندوجهی (Multimodal)، انتقال بینزبانی و NLP چندزبانه، محدودیتهای زبانهای کممنبع، حملات خصمانه به مدلهای متنی و کاهش مسائل مربوط به عدالت و سوگیری.
ابزارها و چارچوبهای NLP (۵٪): اجرای خط لوله در سطح تولید با استفاده از NLTK, spaCy, Gensim, TensorFlow و PyTorch.
درباره این دوره
قبولی در مصاحبه برای جایگاه مهندس NLP یا توسعهدهنده AI نیازمند چیزی بیشتر از صرفاً اجرای متد .fit() روی یک مدل پیشآموزشدیده است. مراحل فنی مدرن، درک بنیادی شما از نحوه جریان یافتن توکنها در یک معماری عصبی، نحوه دستکاری وزنهای توکن توسط ماتریسهای توجه و تأثیر مستقیم انتخابهای پیشپردازش بر تأخیر و معیارهای کاربرد نهایی را میسنجند. من این بانک تستهای جامع را ایجاد کردم تا محیطی بسیار سختگیرانه و واقعبینانه فراهم کنم که بتوانید دانش خود را در برابر سناریوهای دقیقی که مصاحبهکنندگان صنعت میپرسند، آزمایش کنید.
این منبع شامل ۵۵۰ سوال منحصربهفرد و با دقت طراحی شده است و ازTriviaهای ساده سبک فلشکارت فاصله گرفته است. در عوض، شما مستقیماً وارد مسائل مهندسی دنیای واقعی میشوید: تشخیص گرادیانهای محوشونده در LSTMها، مدیریت عدم تطابق توکنایزیشن در مدلهای چندزبانه، عیبیابی لایههای خود-توجهی ترنسفورمر و انتخاب معیارهای ارزیابی مناسب برای مجموعهدادههای متنی به شدت نامتوازن. هر سوال شامل یک تحلیل فنی جامع است که واقعیت ریاضی یا الگوریتمی پشت گزینه صحیح را توضیح میدهد و تحلیل دقیقی ارائه میکند که چرا گزینههای جایگزین در اجرا شکست میخورند. چه در حال مرور معماریهای اصلی مدلسازی توالی باشید و چه برای سوالات پیشرفته طراحی سیستم شامل بازیابی اطلاعات در مقیاس بزرگ و چتباتها آماده شوید، این تستهای تمرینی به شما کمک میکنند نقاط ضعف خود را شناسایی کرده و در اولین تلاش از سد مصاحبه فنی عبور کنید.
نمونهای از سوالات تمرینی
سوال ۱: پیچیدگی ماتریس خود-توجهی و مقیاسپذیری در معماریهای ترنسفورمر
یک مهندس در حال استقرار یک مدل Encoder مبتنی بر ترنسفورمر ساده برای پردازش اسناد حقوقی طولانی است. در طول تستهای اولیه با ورودیهای طولانی، سیستم با خطای کمبود حافظه (OOM) بهویژه در هنگام محاسبه لایه خود-توجهی مواجه میشود. اگر طول توالی ورودی با N نشان داده شود، پیچیدگی محاسباتی و حافظهای بنیادی در مکانیزم توجه ضرب داخلی مقیاسبندی شده (scaled dot-product attention) که باعث این گلوگاه مقیاسپذیری میشود چیست؟
الف) به صورت خطی مقیاس میپذیرد، denoted as $O(N)$، زیرا توجه برای هر توکن در توالی ورودی به طور مستقل محاسبه میشود.
ب) به صورت لگاریتمی مقیاس میپذیرد، denoted as $O(\log N)$، به دلیل کاهش ساختار درختی اعمال شده در مرحله Softmax.
ج) به صورت درجه دوم مقیاس میپذیرد، denoted as $O(N^2)$، زیرا هر توکن باید ضرب داخلی را با هر توکن دیگر محاسبه کند تا ماتریس توجه ایجاد شود.
د) از نظر فضای حافظه به صورت $O(N^3)$ مقیاس میپذیرد به دلیل الحاق تصویر لایه پنهان در چندین سر (Head).
ه) به صورت نمایی مقیاس میپذیرد، denoted as $O(2^N)$، زیرا ویژگیهای بازگشتی لایه کدگذاری موقعیتی با طول توالی رشد میکند.
و) با پیچیدگی ثابت $O(1)$ مقیاس میپذیرد زیرا زمان اجرا کاملاً به اندازه ثابت واژگان بستگی دارد.
پاسخ صحیح و توضیح:
پاسخ صحیح: ج
دلیل correctness: هسته معماری ترنسفورمر بر محاسبه تعامل بین پرسوجوها (Q)، کلیدها (K) و مقادیر (V) استوار است. فرمول ماتریس توجه $\text{Softmax}(\frac{QK^T}{\sqrt{d_k}})V$ است. ضرب ماتریس Q (ابعاد $N \times d_k$) در ترانهاده ماتریس K (ابعاد $d_k \times N$) منجر به یک ماتریس $N \times N$ میشود. بنابراین، هم زمان مورد نیاز برای محاسبه این ضربهای داخلی و هم حافظه مورد نیاز برای ذخیره امتیازات توجه، نسبت به طول توالی N به صورت درجه دوم ($O(N^2)$) مقیاس میپذیرند.
دلیل نادرست بودن سایر گزینهها:
گزینه الف نادرست است: مدلهای توجه خطی وجود دارند (مانند Linformer)، اما توجه ترنسفورمر استاندارد در مورد طول توالی اکیداً غیرخطی است.
گزینه ب نادرست است: مقیاسبندی لگاریتمی در اینجا کاربرد ندارد زیرا توجه نیازمند تمام اتصالات جفتی است که نمیتواند به صورت یک جستجوی درختی ساده ساختار یابد.
گزینه د نادرست است: پیچیدگی مکعبی ($O(N^3)$) در برخی عملیات تجزیه ماتریس رخ میدهد، اما تخصیص فضایی خود-توجهی توسط ماتریس $N \times N$ محدود شده است.
گزینه ه نادرست است: کدگذاریهای موقعیتی بردارهای استاتیک یا توابع ریاضی سادهای هستند که به جاسازیهای توکن اولیه اضافه میشوند و باعث مقیاسبندی نمایی نمیشوند.
گزینه و نادرست است: اندازه واژگان ابعاد ماتریس لایه جاسازی اولیه را محدود میکند، اما هیچ تأثیری بر محاسبه طول توالی در بلوکهای توجه پنهان ندارد.
سوال ۲: ارزیابی خروجیهای سیستم ترجمه ماشینی عصبی با معیارهای BLEU
یک توسعهدهنده AI در حال ارزیابی یک مدل ترجمه زبان تازه آموزش دیده روی یک مجموعه داده اعتبارسنجی است. ترجمه مرجع هدف «The quick brown fox jumps over the lazy dog» است و مدل رشته متنی کاندید «The quick quick brown fox jumps over the dog» را تولید میکند. هنگام محاسبه امتیازات دقت (precision) برای معیار BLEU، این معیار چگونه از افزایش مصنوعی امتیاز دقت توسط کلمه تکراری «quick» جلوگیری میکند؟
الف) Occurrence دوم «quick» را با اعمال جریمه فاصله لوناشتاین در سطح کاراکتر حذف میکند.
ب) از دقت n-gram اصلاح شده استفاده میکند که حداکثر تعداد هر n-gram را توسط حداکثر فراوانی آن در متن مرجع محدود (clip) میکند.
ج) به طور خودکار یک فاکتور جریمه کوتاهی (brevity penalty) اعمال میکند که امتیاز کلی را بر اساس نسبت تکرار محلی کاهش میدهد.
د) اگر تکرار کلمات از آستانه ۱۰٪ فراتر رود، به طور پویا از محاسبه دقت به ارزیابی ROUGE مبتنی بر فراخوانی (recall) تغییر وضعیت میدهد.
ه) از وزنهای توکنایزیشن spaCy یا NLTK استفاده میکند تا تگهای صفت تکراری را به عنوان تخلفات نحوی علامتگذاری کند.
و) کاندید را با استفاده از تغییرات loss آنتروپی متقاطع که مستقیماً از تخصیص دیکشنری منبع محاسبه شده، جریمه میکند.
پاسخ صحیح و توضیح:
پاسخ صحیح: ب
دلیل correctness: دقت استاندارد صرفاً میشمارد که چه تعداد از کلمات کاندید در متن مرجع ظاهر شدهاند. در این مورد، «quick» دو بار در کاندید ظاهر شده و چون در مرجع وجود دارد، دقت استاندارد هر دو را درست میشمارد. BLEU با استفاده از دقت n-gram اصلاح شده از این اتفاق جلوگیری میکند. این معیار تعداد تکرار کلمه در متن کاندید را میشمارد، اما آن تعداد را به حداکثر تعداد دفعاتی که کلمه در هر جمله مرجع تکی ظاهر شده است (که برای «quick» برابر ۱ است) محدود میکند.
دلیل نادرست بودن سایر گزینهها:
گزینه الف نادرست است: فاصله لوناشتاین فاصله ویرایشی بین رشتههای مجزا را محاسبه میکند و با منطق تطبیق توکن BLEU یکپارچه نشده است.
گزینه ج نادرست است: جریمه کوتاهی در BLEU برای جریمه ترجمههای کاندیدی طراحی شده است که نسبت به مرجع بیش از حد کوتاه هستند؛ این معیار تکرار داخلی کلمات را اندازه نمیگیرد یا جریمه نمیکند.
گزینه د نادرست است: BLEU اکیداً یک معیار مبتنی بر دقت با جریمه کوتاهی است؛ هرگز منطق داخلی خود را برای تبدیل شدن به ROUGE (که یک معیار متمرکز بر recall و عمدتاً برای خلاصهسازی است) تغییر نمیدهد.
گزینه ه نادرست است: BLEU یک معیار تطبیق رشته در سطح ظاهری است؛ این معیار نسبت به تگهای نقش کلمه (POS)، تجزیه وابستگی یا قوانین چارچوبهای خارجی NLP کاملاً بیتفاوت است.
گزینه و نادرست است: loss آنتروپی متقاطع یک تابع زیان مشتقپذیر است که در طول آموزش مدل استفاده میشود، در حالی که BLEU یک معیار غیرمشتقپذیر است که در طول ارزیابی پس از آموزش محاسبه میشود.
سوال ۳: عدم تطابق استراتژی توکنایزیشن در رویدادهای خارج از واژگان (OOV)
در هنگام استقرار یک برنامه تحلیل احساسات با استفاده از یک مدل پیشآموزشدیده، سیستم با کلمات نادر خاص دامنه و اصطلاحات عامیانه مانند «un-machine-learnable» مواجه میشود. اگر معماری زیربنایی از Byte-Pair Encoding (BPE) برای توکنایزیشن استفاده کند، سیستم چگونه این توالی متنی را بدون ایجاد خطای خارج از واژگان (OOV) پردازش میکند؟
الف) از یک توکن جایگزین <UNK> برای جایگزینی فوری کل توالی کلمه استفاده میکند.
ب) رشته کامل را با استفاده از یک زیر-روال Soundex به نزدیکترین کد معادل صوتی آن تبدیل میکند.
ج) پیکربندی کلمه را به صورت پویا از یک لغتنامه جایگزین خارجی مانند WordNet میخواند.
د) کلمه پیچیده و ناشناخته را به صورت تکرار شونده به واحدهای زیر-کلمه (sub-word) کوچکتر و رایج یا کاراکترهای تکتک موجود در پایگاه واژگان خود تجزیه میکند.
ه) به طور خودکار از کلمه عبور کرده و به آن یک نمایش برداری خنثی شامل صفر مطلق اختصاص میدهد.
و) یک exception در زمان اجرا ایجاد میکند که باید از طریق بلوکهای صریح try-catch در PyTorch یا TensorFlow مدیریت شود.
پاسخ صحیح و توضیح:
پاسخ صحیح: د
دلیل correctness: کدگذاری جفت-بایت (BPE) یک الگوریتم توکنایزیشن زیر-کلمه است. این الگوریتم با یک واژگان پایه از کاراکترهای تک را شروع کرده و به طور تکراری رایجترین جفتها را ادغام میکند. وقتی BPE با یک کلمه دیده نشده مواجه میشود، شکست نمیخورد؛ در عوض، کلمه را به کوچکترین قطعات زیر-کلمه (مانند «un»، «##machine»، «##learn»، «##able») که از قبل در واژگان آموزشی خود میشناسد تجزیه میکند و از مشکلات OOV جلوگیری میکند.
دلیل نادرست بودن سایر گزینهها:
گزینه الف نادرست است: توکنایزرهای سنتی سطح کلمه به شدت به توکن <UNK> برای کلمات ناشناخته متکی هستند. توکنایزرهای زیر-کلمه مانند BPE، WordPiece و SentencePiece صراحتاً از این رویکرد اجتناب میکنند.
گزینه ب نادرست است: Soundex الگوریتمی برای ایندکس کردن نامها بر اساس صدا است و در خط لولههای توکنایزیشن مدرن ترنسفورمر یا یادگیری ماشین استفاده نمیشود.
گزینه ج نادرست است: توکنایزرها در هنگام استنتاج (Inference) از پایگاههای داده معنایی خارجی مانند WordNet پرسوجو نمیکنند؛ آنها اکیداً به آرایههای واژگان ثابت و کامپایلشده خود متکی هستند.
گزینه ه نادرست است: نادیده گرفتن یا صفر کردن توکنها، ابعاد توالی ماتریس را تغییر داده و منطق معنایی ساختاری متنی را تخریب میکند.
گزینه و نادرست است: توکنایزرهای زیر-کلمه مدرن دقیقاً برای جلوگیری از exceptionهای OOV در زمان اجرا ساخته شدهاند تا اجرای روان را صرفنظر از تغییرات ورودی متن تضمین کنند.
چه انتظاراتی داشته باشید
به تستهای سوالات مصاحبه خوش آمدید تا به شما در آماده شدن برای آزمون تمرینی سوالات مصاحبه پردازش زبان طبیعی کمک کنیم.
میتوانید آزمونها را هر چند بار که بخواهید تکرار کنید
این یک بانک سوالات گسترده و اورجینال است
در صورت داشتن سوال، از پشتیبانی مدرسان بهرهمند میشوید
هر سوال دارای یک توضیح دقیق است
سازگار با موبایل از طریق اپلیکیشن Udemy
امیدواریم تا الان متقاعد شده باشید! و سوالات بسیار بیشتری در داخل دوره وجود دارد.
Interview Questions Tests
مربی در Udemy
نمایش نظرات