پوشش دقیق حوزههای آزمون
این مخزن آزمون تمرینی دقیقاً با حوزههای تمرکز فنی و توزیع ریاضیات مورد انتظار در مصاحبههای مدرن بینایی ماشین، یادگیری عمیق و تحقیقات AI مطابقت دارد.
مفاهیم بنیادی (۲۰%): شبکههای عصبی کانولوشنال (CNNs)، مکانیسمهای رزولوشن تصویر، دستکاری در سطح پیکسل، تبدیل فوریه گسسته دوبعدی (DFT) و جریانهای کاری پیشرفته یادگیری انتقالی (Transfer Learning).
پردازش تصویر (۱۸%): مبانی پردازش سیگنال دیجیتال شامل هموارسازی (کاهش نویز)، فیلترهای تیزکننده، تقویت لبه، پردازش هیستوگرام و تنظیمات فضای رنگ/بهبود رنگ.
تشخیص اشیاء (۱۵%): تکامل مکانیابی از تکنیکهای قدیمی پنجره لغزان (Sliding Window) به نسخههای R-CNN و چارچوبهای مدرن YOLO، به همراه مدیریت پیچیده انسداد و تنظیمات تشخیص اشیاء در زمان واقعی.
بخشبندی تصویر (۱۲%): کاربردهای واقعی بخشبندی تصویر، تکنیکهای آستانهگذاری/بخشبندی، تشخیص لبه پیشرفته، جداسازی ناحیه و خطلولههای بخشبندی معنایی (Semantic) و نمونهای (Instance).
یادگیری ماشین و شبکههای عصبی (۱۰%): شبکههای مولد رقابتی (GANs)، اتصالات باقیمانده (ResNet)، ترنسفورمرهای بینایی (ViTs)، مدلهای دیفیوژن (Stable Diffusion) و معماریهای پیچیده یادگیری عمیق.
مدلها و الگوریتمهای بینایی ماشین (۸%): مهندسی ویژگیهای کلاسیک شامل SIFT، SURF، ORB و هیستوگرام گرادیانهای جهتدار (HOG) در کنار خطلولههای سنتی تشخیص ویژگی.
استقرار و ارزیابی (۷%): بهینهسازی سختافزاری برای استقرار مدلها روی دستگاههای Edge، ارزیابی معیارهای عملکرد مدل (mAP, IoU)، استراتژیهای افزونگی دادهها و کوانتیزاسیون برای بهینهسازی مدل.
مباحث پیشرفته (۱۰%): تخصص در الگوریتمهای تشخیص چهره، ردیابی در زمان واقعی، مکانیابی و نقشهبرداری همزمان (SLAM)، اپلیکیشنهای موبایل و کاربردهای دقیق در حوزه بهداشت و درمان.
درباره این دوره
قبولی در مصاحبه فنی برای جایگاه مهندس بینایی ماشین، متخصص AI یا دانشمند پژوهشی، نیازمند چیزی فراتر از دانستن نحوه فراخوانی یک مدل پیشآموزشدیده است. تیمهای مهندسی تراز اول به دنبال متخصصانی هستند که اصول ریاضی زیربنایی، تکنیکهای کلاسیک پردازش تصویر و جدیدترین چارچوبهای یادگیری عمیق مولد را عمیقاً درک کرده باشند. من این بانک سوالات جامع را برای بازتاب دقیق چالشهای فنی، مسائل تحلیل ساختاری و معماهای معماری که مصاحبهکنندگان استاندارد مطرح میکنند، ایجاد کردهام.
این دوره شامل ۵۵۰ سوال تمرینی بسیار دقیق و اورجینال است و از تعاریف سطحی فراتر میرود. تمرکز من بر موانع مهندسی دنیای واقعی است: بهینهسازی تشخیصدهندههای اشیاء برای استقرار در لبه (Edge)، مدیریت انسداد در ردیابیهای با سرعت بالا، پردازش نمایشهای پیچیده فرکانسی دوبعدی و ایجاد تعادل در عملکرد بین ترنسفورمرهای بینایی و شبکههای کانولوشن عمیق. هر سوال دارای یک تحلیل دقیق است که تمام گزینهها را بررسی میکند. من توضیح میدهم که چرا گزینه صحیح در شرایط سخت تولید (Production) پذیرفته است و دقیقاً کجا رویکردهای جایگزین شکست میخورند یا باعث ایجاد تأخیر (Latency) ناخواسته میشوند. این منبع، لبه فنی دقیقی را به شما میدهد که برای قبولی در مصاحبه در اولین تلاش به آن نیاز دارید.
پیشنمایش نمونه سوالات تمرینی
برای کمک به درک شما از سختگیری و عمق آموزشی این بانک سوالات، سه نمونه سوال را گنجاندهام که دقیقاً نحوه ساختار توضیحات فنی در این دوره را نشان میدهد.
سوال ۱: مبانی ریاضی تبدیل فوریه گسسته دوبعدی (DFT)
یک مهندس تصویری را از طریق تبدیل فوریه گسسته دوبعدی (DFT) عبور میدهد تا الگوهای دورهای را در دامنه فرکانس تحلیل کند. اگر یک جفت متقارن از پیکهای با دامنه بالا دور از مبدأ در امتداد محور فرکانس افقی ظاهر شود، این موضوع نشاندهنده چه ویژگی مکانی در تصویر ورودی اصلی است؟
الف) خطوط یا لبههای عمودی با فرکانس بالا که به سرعت در صفحه افقی تکرار میشوند.
ب) یک ناحیه بزرگ و یکنواخت از رنگ استاتیک با تغییرات شدت نزدیک به صفر.
ج) یک انتقال گرادینت آرام و مداوم که از بالا به پایین حرکت میکند.
د) الگوهای افقی پهن که در فواصل زیاد در صفحه عمودی تکرار میشوند.
ه) نویز نمک و فلفل با فرکانس بالا که به طور تصادفی در تمام پیکسلها پخش شده است.
و) یک جابجایی فاز معکوس که کنتراست تصویر را کاملاً خنثی میکند.
پاسخ صحیح و توضیحات:
پاسخ صحیح: الف
چرا صحیح است: در یک DFT دوبعدی، مبدأ (مرکز) نشاندهنده پایینترین فرکانسها (مؤلفه DC) است. پیکهای دور از مبدأ نشاندهنده جزئیات با فرکانس بالا هستند که با تغییرات شدید و سریع شدت نور مرتبط هستند. از آنجایی که محورهای فرکانس بر جهتهای مکانی عمود هستند، فرکانسهای افقی بالا نشاندهنده تغییرات سریع هنگام حرکت افقی در تصویر هستند که با لبهها یا خطوط عمودی تیز مطابقت دارد.
چرا گزینههای دیگر نادرست هستند:
گزینه ب نادرست است: نواحی بزرگ و یکنواخت بدون تغییر شدت، مستقیماً به نقطه مبدأ فرکانس پایین تبدیل نگاشت میشوند.
گزینه ج نادرست است: انتقالهای عمودی آرام نشاندهنده فرکانسهای عمودی پایین هستند که در نزدیکی مبدأ در امتداد محور عمودی ظاهر میشوند.
گزینه د نادرست است: تکرارهای افقی پهن به دلیل جابجایی جهت مکانی-فرکانسی، به صورت پیکهایی در امتداد محور فرکانس عمودی نزدیک به مرکز ظاهر میشوند.
گزینه ه نادرست است: نویز تصادفی نمک و فلفل به طور یکنواخت در تمام فرکانسها پخش میشود و به جای پیکهای متقارن و تیز، یک کف نویز گسترده ایجاد میکند.
گزینه و نادرست است: نمودارهای دامنه (Magnitude) اطلاعات فاز را کاملاً حذف میکنند؛ جابجایی فاز مقادیر زاویه مختلط را تغییر میدهد اما به صورت پیکهای مجزای منحصر به فرد در نقشه دامنه ظاهر نمیشود.
سوال ۲: ارزیابی گلوگاههای معماری در ترنسفورمرهای بینایی مدرن (ViTs)
هنگام تطبیق معماری ترنسفورمر بینایی (ViT) برای تصاویر ورودی با رزولوشن بالا، یک پژوهشگر متوجه گلوگاه بزرگی در پردازش محاسباتی و تخصیص حافظه در مرحله توجه به خود (Self-Attention) میشود. علت ریاضی بنیادی این مشکل مقیاسبندی چیست؟
الف) لایه جاسازی توکن (Token Embedding) به صورت نمایی با تعداد کانالهای رنگ ورودی مقیاس میبندد.
ب) پیچیدگی محاسباتی مکانیسم استاندارد توجه به خود، به صورت مربعی با تعداد کل پچهای تصویر مقیاس میبندد.
ج) بردارهای کدگذاری موقعیتی باید به صورت دینامیک با استفاده از یک حلقه اجرای فاکتوریل برای هر دسته ورودی مجدداً محاسبه شوند.
د) ماژولهای توجه چند-سره (Multi-Head Attention) به افزایش خطی در لایههای Dropout نیاز دارند که کارایی پردازش را کاهش میدهد.
ه) سر طبقهبندی MLP یک معکوس ماتریسی متوالی را تحمیل میکند که توسط سختافزار قابل شتابدهی نیست.
و) فرآیند استخراج پچ بر یک پنجره لغزان تکرار شونده متکی است که ضرب ماتریسی موازی GPU را باطل میکند.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ب
چرا صحیح است: در یک ترنسفورمر بینایی استاندارد، مکانیسم توجه به خود جهانی، نمرات شباهت را بین تک تک توکنها (پچها) و تمام توکنهای دیگر محاسبه میکند. با افزایش رزولوشن تصویر، تعداد پچها ($N$) به تناسب رشد میکند. از آنجایی که اندازه ماتریس توجه $N \times N$ است، هم پیچیدگی زمانی محاسباتی و هم ردپای حافظه به صورت مربعی ($O(N^2)$) مقیاس میبندند و باعث ایجاد گلوگاههای قابل توجه در ورودیهای بزرگ میشوند.
چرا گزینههای دیگر نادرست هستند:
گزینه الف نادرست است: لایه جاسازی یک نگاشت خطی بر اساس اندازههای ثابت پچ ($P \times P \times C$) را مدیریت میکند و به صورت نمایی با کانالهای خام مقیاس نمیبندد.
گزینه ج نادرست است: کدگذاریهای موقعیتی معمولاً افزودنیهای استاتیک یا درونیابیشده خطی هستند و هرگز به صورت فاکتوریل محاسبه نمیشوند.
گزینه د نادرست است: تنظیمات Dropout در طول استنتاج ثابت میمانند و از نظر ساختاری باعث ایجاد گلوگاه مقیاسبندی نمیشوند.
گزینه ه نادرست است: لایه نهایی طبقهبندی از تبدیلات خطی استاندارد و لایههای softmax تشکیل شده است، نه معکوسهای ماتریسی پیچیده.
گزینه و نادرست است: استخراج پچ به طور بهینه به عنوان یک عملیات کانولوشن استراید شده غیرهمپوشان انجام میشود که به صورت بومی و موازی روی GPUهای مدرن اجرا میگردد.
سوال ۳: سرکوب غیربیشینه (NMS) در تشخیص اشیاء در زمان واقعی YOLO
در طول استقرار یک مدل تشخیص اشیاء YOLO در زمان واقعی روی سیستم لبه یک خودروی خودران، چندین باکس محاطی (Bounding Box) همپوشان در اطراف یک هدف عابر پیاده ظاهر میشوند. سیستم عملیات سرکوب غیربیشینه (NMS) را با آستانه Intersection over Union (IoU) برابر با ۰.۴۵ اعمال میکند. این فرآیند چگونه تشخیصهای تکراری را پاکسازی میکند؟
الف) مختصات تمام باکسهایی که IoU کمتر از ۰.۴۵ دارند را میانگین میگیرد تا یک نقطه مرکزی پیدا کند.
ب) بلافاصله هر باکس محاطی را که نمره اطمینان کلاس آن زیر ۴۵٪ است، بدون در نظر گرفتن موقعیت، دور میریزد.
ج) باکسی را با بالاترین نمره اطمینان انتخاب میکند، سپس هر باکس همپوشانی که IoU آن با باکس انتخاب شده بیشتر از ۰.۴۵ باشد را دور میریزد.
د) از یک کرنل پنجره لغزان برای کوچک کردن خطوط مرزی تمام باکسها استفاده میکند تا همپوشانی متقابل آنها دقیقاً به ۰.۴۵ برسد.
ه) نواحی همپوشان را به یک فضای رنگ جایگزین منتقل میکند تا بررسی کند آیا توزیعهای پیکسلی زیربنایی کاملاً مطابقت دارند یا خیر.
و) کل ساختار شبکه لنگر (Anchor Grid) را کاهش نمونه (Downsample) میدهد تا تمام باکسهای تشخیص را به یک نقطه مختصاتی واحد مجبور کند.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ج
چرا صحیح است: سرکوب غیربیشینه تمام باکسهای کاندید را بر اساس نمرات اطمینان آنها مرتب میکند. باکسی با بالاترین اطمینان به عنوان تشخیص قطعی حفظ میشود. سپس الگوریتم IoU تمام باکسهای همپوشان باقیمانده را نسبت به این باکس برتر محاسبه میکند. هر باکسی که IoU آن بیشتر از آستانه ۰.۴۵ باشد، تکراری تلقی شده و سرکوب میشود و بدین ترتیب فریم خروجی پاکسازی میگردد.
چرا گزینههای دیگر نادرست هستند:
گزینه الف نادرست است: NMS مختصات را میانگین نمیگیرد؛ میانگینگیری باعث انحراف دقت مرزها میشود، به خصوص زمانی که باکسهای با اطمینان پایین بد تراز شده باشند.
گزینه ب نادرست است: اگرچه یک آستانه اطمینان پایه در خطلولههای تشخیص اشیاء وجود دارد، اما این یک مرحله مجزا است که قبل از اجرای حلقه NMS مربوط به IoU موقعیتی اتفاق میافتد.
گزینه د نادرست است: NMS یک مکانیسم انتخاب و فیلترینگ است؛ این روش به طور دینامیک مرزهای پیشبینیهای موجود را تغییر اندازه نمیدهد یا اصلاح نمیکند.
گزینه ه نادرست است: NMS صرفاً روی مختصات هندسی باکسهای محاطی و اسکالرهای اطمینان عمل میکند و مقادیر پیکسل یا توزیع رنگ را تحلیل نمیکند.
گزینه و نادرست است: شبکههای لنگر اجزای معماری ثابت در مرحله پیشرو (Feedforward) هستند و نمیتوانند در طول حلقههای سرکوب پسپردازش، به طور ساختاری کاهش نمونه یابند.
چه انتظاراتی داشته باشید
به آزمونهای سوالات مصاحبه خوش آمدید تا شما را برای آزمون تمرینی سوالات مصاحبه بینایی ماشین آماده کنیم
شما میتوانید هر تعداد بار که بخواهید در آزمونها شرکت کنید
این یک بانک سوالات اورجینال و بسیار گسترده است
در صورت داشتن سوال، از پشتیبانی مدرسان بهرهمند میشوید
هر سوال دارای یک توضیح دقیق است
سازگار با موبایل از طریق اپلیکیشن Udemy
امیدواریم تا الان متقاعد شده باشید! سوالات بسیار بیشتری در داخل دوره وجود دارد.
Interview Questions Tests
مربی در Udemy
نمایش نظرات