پوشش تفصیلی حوزههای آزمون
این مخزن تستهای تمرینی به طور سیستماتیک سازماندهی شده تا دقیقاً منعکسکننده توزیعهای فنی و معیارهای ارزیابی سختگیرانه در پنلهای مصاحبه نخبگان دیتاساینس باشد.
آمار (۲۰٪): تسلط بر آمار توصیفی در مقابل استنباطی، دینامیکهای رگرسیون خطی و لجستیک، طراحی آزمایشهای مستحکم (پروتکلهای A/B Testing)، فرمولهای آزمون فرضیه، تفسیر p-value و فواصل اطمینان آماری.
یادگیری ماشین (۲۵٪): بررسی عمیق معماریهای یادگیری نظارت شده در مقابل نظارت نشده، مقابله با بیشبرازش (Overfitting) از طریق Regularization ($L_1$/$L_2$)، مدیریت tradeoff بایاس-واریانس، معیارهای انتخاب مدل ساختاری و استراتژیهای تنظیم خودکار هایپرپارامترها.
مدیریت دادهها (۱۵٪): استراتژیهای پاکسازی دادهها در دنیای واقعی، خط لولههای پیشپردازش پیچیده، مدیریت دادههای مفقود یا پرت (Outliers)، چارچوبهای ذخیرهسازی کارآمد و مکانیسمهای بازیابی مقیاسپذیر دادهها.
SQL و پایگاه داده (۱۰٪): مدیریت پیشرفته پایگاه دادههای رابطهای، Joinهای پیچیده چندجدولی، تجمیعهای رابطهای، توابع پنجرهای ساختاری، زیرپرسوجوهای تودرتو و بهینهسازی اجرای کوئریها.
برنامهنویسی (۱۰٪): مفاهیم مهندسی پایتون و R در سطح تولید، ساختارهای داده ساختاری، پیچیدگی الگوریتمی (محدودیتهای زمان/فضا) و پارادایمهای تمیز برنامهنویسی شیگرا (OOP).
تحلیل دادهها (۱۰٪): گردشهای کاری تحلیل اکتشافی دادهها (EDA)، استراتژیهای بصریسازی موثر، تحلیلهای آماری کلاسیک، کشف الگوها از طریق دادهکاوی و ساخت مدلهای پیشبینی پایه.
دانش دامنه/کسبوکار (۵٪): بهکارگیری هوش تجاری در اعداد خام، شناسایی روندهای صنعت، تحلیل کلان بازار و تبدیل تعاملات کاربر به معیارهای کمی رفتار مشتری.
ارتباطات و روایتگری (۵٪): مهارتهای ارائه به مدیران ارشد، روایتگری دادهمحور، مکانیسمهای تولید بینش و تبدیل معیارهای سرد به توصیههای استراتژیک تجاری با تاثیر بالا.
درباره این دوره
قبولی در مراحل فنی مصاحبه دیتاساینس در شرکتهای تراز اول، بسیار فراتر از صرفاً فراخوانی یک مدل از کتابخانه یا نوشتن کدهای ساده است. پنلهای مصاحبه میخواهند ببینند شما تحت فشار چگونه فکر میکنید؛ چگونه نشت دادهها (Data Leakage) را تشخیص میدهید، توزیع آماری مناسب را انتخاب میکنید، با مجموعهدادههای شدیداً نامتوازن برخورد میکنید یا مبادلات پیچیده الگوریتمی را برای ذینفعان تجاری توضیح میدهید. من این چارچوب تمرینی جامع با ۵۵۰ سوال را طراحی کردهام تا دقیقاً همین مزیت رقابتی را به شما بدهم و دانش تئوری شما را به اعتمادبهنفس عملی در آزمون تبدیل کنم.
به جای کوئیزهای معمولی، من چالشهای مفهومی عمیقی ارائه میدهم که نیازمند حل مسئله ساختاری هستند. هر سوال در این مجموعه، منعکسکننده سناریویی است که در ارزیابیهای فنی واقعی شرکتی با آن مواجه خواهید شد؛ از آمار سختگیرانه گرفته تا مکانیسمهای End-to-End یادگیری ماشین، معماری پایگاه داده و مبانی برنامهنویسی. هر سوال شامل یک تحلیل فنی دقیق و گامبهگام است که هیچ جای حدسی باقی نمیگذارد. من دقیقاً توضیح میدهم که چرا رویکرد صحیح از نظر منطقی و ریاضی درست است و گزینههای جایگزین را کالبدشکافی میکنم تا یاد بگیرید تلههای رایج مصاحبهکنندگان را فوراً شناسایی کنید. چه هدف شما جایگاه یک Applied Scientist نخبه باشد، چه نقش Core Data Scientist یا مسیر فنی Data Analyst، این مجموعه تستهای تمرینی به عنوان یک شبیهساز هدفمند عمل میکند تا اطمینان حاصل شود که موانع مصاحبه خود را در اولین تلاش با اعتمادبهنفس کامل پشت سر میگذارید.
پیشنمایش نمونه سوالات تمرینی
برای ارزیابی دقت ساختاری و شفافیت توضیحات این دوره، این سه نمونه سوال مصاحبه با کیفیت بالا را بررسی کنید.
سوال ۱: ارزیابی خطاهای نوع اول و نوع دوم در تست A/B آنلاین
یک تحلیلگر روی یک لندینگ پیج پریمیوم برای افزایش نرخ تبدیل، تست A/B اجرا میکند. تغییر واقعی در نرخ تبدیل پایه دقیقاً صفر است (فرضیه صفر $H_0$ درست است). با این حال، به دلیل نویز نمونهبرداری تصادفی، ارزیابی تجربی مقدار p-value برابر با ۰.۰۳۲ را نشان میدهد. با توجه به آستانه معناداری سختگیرانه ($\alpha = 0.05$)، تحلیلگر فرضیه صفر را رد میکند. چه خطای آماری رخ داده است و تیم چگونه میتواند احتمال وقوع آن را در آینده کاهش دهد؟
الف) خطای نوع دوم رخ داده است؛ تیم میتواند با افزایش قابل توجه اندازه نمونه کلی، این مورد را کاهش دهد.
ب) خطای نوع اول رخ داده است؛ تیم میتواند با اعمال یک آستانه معناداری سختگیرانهتر و پایینتر مانند ۰.۰۱، این مورد را کاهش دهد.
ج) خطای نوع اول رخ داده است؛ تیم میتواند با گسترش مدت زمان تست بدون تغییر در آلفا، این مورد را کاهش دهد.
د) خطای نوع دوم رخ داده است؛ تیم میتواند با انتخاب یک جایگزین تست ناپارامتریک، این مورد را کاهش دهد.
ه) عدم تطابق توان آماری رخ داده است؛ تیم باید معیار عملکرد اصلی خود را کاملاً تغییر دهد.
و) هیچ خطایی رخ نداده است؛ p-value پایینتر از آستانه تضمین میکند که اثر تجربی واقعی است.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ب
چرا درست است: خطای نوع اول زمانی رخ میدهد که شما به اشتباه یک فرضیه صفر درست را رد کنید (مثبت کاذب). در اینجا، اثر واقعی صفر است، اما واریانس تصادفی باعث تولید p-value کمتر از آلفا شد و منجر به رد نادرست شد. تنها راه ساختاری برای کاهش احتمال خطای نوع اول، پایین آوردن آستانه معناداری آلفا ($\alpha$) است که حاشیه پذیرش برای مثبتهای کاذب را کاهش میدهد.
چرا گزینههای دیگر نادرست هستند:
گزینه الف نادرست است: این توصیف مربوط به خطای نوع دوم (منفی کاذب) است که زمانی رخ میدهد که شما در رد یک فرضیه صفر نادرست شکست بخورید.
گزینه ج نادرست است: صرفاً افزایش مدت زمان تست بدون تغییر آلفا، احتمال صریح خطای نوع اول را کاهش نمیدهد؛ بلکه فقط دادههای بیشتری را تحت همان حاشیه خطا جمعآوری میکند.
گزینه د نادرست است: جایگزینی با توزیعهای ناپارامتریک، مفروضات درباره شکل دادهها را تغییر میدهد اما سقف ثابت خطای نوع اول را که توسط آلفا تعیین شده، کنترل نمیکند.
گزینه ه نادرست است: توان آماری صراحتاً به خطاهای نوع دوم ($1 - \beta$) مرتبط است، نه نرخ مثبت کاذب که توسط آلفا تعریف میشود.
گزینه و نادرست است: p-value پایین هرگز واقعیت را تضمین نمیکند؛ بلکه صرفاً نشان میدهد که الگوی دادههای مشاهده شده بسیار بعید است که تنها بر اساس شانس تصادفی تحت مفروضات فرضیه صفر رخ داده باشد.
سوال ۲: ارزیابی مکانیسمهای Loss در مدلهای Tree Ensemble در Gradient Boosting
یک مهندس یادگیری ماشین متوجه میشود که یک مدل Gradient Boosting Machine (GBM) سفارشی، به طور مداوم وزن نامتناسبی به دادههای پرت (Outliers) شدید در یک مجموعه داده رگرسیونی میدهد و باعث تعمیم ضعیف روی مجموعههای تست میشود. کدام تغییر در استراتژی بهینهسازی تابع Loss، این حساسیت ساختاری را به بهترین شکل کاهش میدهد؟
الف) تغییر هدف Loss داخلی از Mean Absolute Error (MAE) به Mean Squared Error (MSE).
ب) افزایش نرخ یادگیری (پارامتر shrinkage) برای اینکه درختهای فردی سریعتر با نمونههای نادر سازگار شوند.
ج) تغییر هدف Loss داخلی از Mean Squared Error (MSE) به یک تابع Huber Loss مقاوم.
د) غیرفعال کردن تمامی پارامترهای منظمسازی $L_2$ در ساختارهای درخت تصمیم تشکیلدهنده.
ه) تغییر الگوریتم اصلی از یک چارچوب Boosting به پارادایم کلاسیک Random Forest بدون هرس (Unpruned).
و) اعمال قطع دادههای سختگیرانه با جایگزینی تمام آیتمهای پرت عددی با مقادیر صفر استاتیک.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ج
چرا درست است: MSE خطاهای باقیمانده را به توان دو میرساند، که باعث میشود بهروزرسانیهای گرادینت به صورت درجه دو با خطاهای بزرگ مقیاس شوند و مدل را مجبور کند مرزهای خود را برای پذیرش دادههای پرت شدید تغییر دهد. Huber loss این مشکل را با عمل کردن به صورت درجه دو برای خطاهای کوچک و تغییر به جریمه خطی برای خطاهای بزرگتر از یک آستانه خاص ($\delta$) حل میکند. این کار تأثیر دادههای پرت شدید را بر گرادینت بهینهسازی محدود میکند.
چرا گزینههای دیگر نادرست هستند:
گزینه الف نادرست است: تغییر از MAE به MSE به دلیل مؤلفه توان دو، مشکل دادههای پرت را به شدت تشدید میکند.
گزینه ب نادرست است: افزایش نرخ یادگیری باعث میشود مدل حتی سریعتر با خطاهای هر درخت سازگار شود و بیشبرازش روی دادههای پرت را تسریع کند.
گزینه د نادرست است: حذف Regularization واریانس مدل را افزایش میدهد و به درختها اجازه میدهد به جای نادیده گرفتن دادههای پرت نویزی، کاملاً با آنها منطبق شوند.
گزینه ه نادرست است: اگرچه Random Forest واریانس را از طریق میانگینگیری کاهش میدهد، اما انتقال به درختهای بدون هرس همچنان اجازه میدهد تخمینزنهای فردی ساختارهای عمیق دادههای پرت را بدون پرداختن به حساسیت بنیادی Loss مدلسازی کنند.
گزینه و نادرست است: جایگزینی کورکورانه دادههای پرت با مقادیر صفر، یکپارچگی فیزیکی ویژگیها را تخریب کرده و بایاس مصنوعی شدیدی را به توزیع دادهها وارد میکند.
سوال ۳: بهینهسازی بازیابی ذخیرهسازی دادههای با ابعاد بالا از طریق Spatial Windowing
یک تیم داده، یک خط لوله تحلیلی تولیدی را اجرا میکند که تجمیعهای مکانی-زمانی روزانه را روی میلیاردها مختصات ردیابی انجام میدهد. کوئریها به شدت از توابع پنجرهای پیچیده چندجدولی و فیلترهای مبتنی بر Partition استفاده میکنند. زمان اجرا در حال کاهش کیفیت است. کدام تغییر در معماری پایگاه داده، بیشترین سود بهینهسازی را برای این حجم کاری خاص فراهم میکند؟
الف) تبدیل فرمت ذخیرهسازی فیزیکی از چیدمان ستونی (Columnar) به یک ذخیرهساز سنتی سطر-محور (Row-oriented heap store).
ب) حذف تمام ایندکسهای خوشهای ترکیبی (Composite Clustered Indexes) و تکیه صرف بر اسکنهای موازی کل جدول.
ج) اعمال یک ایندکس خوشهای (Clustered Index) روی کلیدهای Partition مورد استفاده در توابع پنجرهای برای حذف مراحل مرتبسازی فیزیکی.
د) قرار دادن توابع پنجرهای داخل زیرپرسوجوهای تودرتو و مرتبط (Correlated Subqueries) در عبارت اصلی WHERE.
ه) انتقال کل آرایه دادهها به یک ذخیرهساز سند (Document Store) غیررابطهای که فاقد پشتیبانی بومی از Windowing است.
و) تغییر سینتکس کوئری برای جایگزینی تمام توابع پنجرهای رابطهای با Self-joinهای صریح داخلی روی ویژگیهای بدون ایندکس.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ج
چرا درست است: توابع پنجرهای (OVER (PARTITION BY ... ORDER BY ...)) نیازمند این هستند که موتور پایگاه داده سطرهای زیربنایی را قبل از محاسبه تجمیعهای جاری، در گروههای مرتبشده سازماندهی کند. اگر دادههای فیزیکی از قبل روی دیسک با استفاده از یک Clustered Index که با همان کلیدهای Partition و مرتبسازی مطابقت دارد سازماندهی شده باشند، موتور پایگاه داده مرحله گرانقیمت مرتبسازی فیزیکی را کاملاً حذف میکند و مصرف CPU و تأخیر I/O را به شدت کاهش میدهد.
چرا گزینههای دیگر نادرست هستند:
گزینه الف نادرست است: ذخیرهسازهای سطر-محور در مقایسه با فرمتهای ستونی که در اسکن ستونهای خاص روی میلیاردها سطر عالی هستند، در تجمیعهای تحلیلی مقیاس بزرگ عملکرد ضعیفی دارند.
گزینه ب نادرست است: حذف ایندکسهای ساختاریافته، موتور اجرا را مجبور میکند برای هر حلقه تجمیع پنجرهای روزانه، خواندنهای I/O گرانقیمت کل جدول را انجام دهد.
گزینه د نادرست است: زیرپرسوجوهای مرتبط تودرتو، سطر به سطر اجرا میشوند که باعث کندیهای نمایی فاجعهبار در جداول عظیم میشود.
گزینه ه نادرست است: انتقال به یک Document Store بدون پشتیبانی بومی، شما را مجبور میکند تمام دادهها را به حافظه منتقل کرده و منطق پنجره را در کد اپلیکیشن محاسبه کنید که مقیاسپذیر نیست.
گزینه و نادرست است: جایگزینی توابع پنجرهای بهینهشده با Self-joinها روی ستونهای بدون ایندکس، ضرب دکارتیهای عظیمی ایجاد میکند که میتواند به سرعت حافظه پایگاه داده و فضای موقت را مصرف کند.
آنچه در انتظار شماست
به تستهای سوالات مصاحبه خوش آمدید تا شما را برای ارزیابی سوالات مصاحبه دیتاساینس آماده کنیم
شما میتوانید هر تعداد بار که بخواهید در آزمونها شرکت کنید
این یک بانک سوالات عظیم و اورجینال است
در صورت داشتن سوال، از پشتیبانی مدرسان بهرهمند میشوید
هر سوال دارای یک توضیح دقیق است
سازگار با موبایل از طریق اپلیکیشن Udemy
امیدواریم تا الان متقاعد شده باشید! سوالات بسیار بیشتری در داخل دوره وجود دارد.
Interview Questions Tests
مربی در Udemy
نمایش نظرات