آموزش ۵۰۰+ سوال و جواب مصاحبه دیتاساینس (علم داده) ۲۰۲۶ - آخرین آپدیت

دانلود 500+ Data Science Interview Questions with Answers 2026

نکته: ممکن هست محتوای این صفحه بروز نباشد ولی دانلود دوره آخرین آپدیت می باشد. این دوره صرفا آزمون یا تمرین می باشد و ویدیو ندارد.
نمونه ویدیویی برای نمایش وجود ندارد.
توضیحات دوره: تست‌های تمرینی سوالات مصاحبه دیتاساینس | مناسب برای افراد تازه‌کار تا متخصص | همراه با توضیحات جامع برای هر سوال بر مفاهیم پیچیده فنی، فرمول‌های ریاضی و تحلیل‌های الگوریتمی که توسط شرکت‌های تراز اول در مصاحبه‌های دیتاساینس مورد پرسش قرار می‌گیرند، مسلط شوید. با بهره‌گیری از این منابع جامع آموزشی، نقاط ضعف دانش شخصی خود را در توزیع‌های آماری کلیدی و تئوری‌های مدل‌سازی شناسایی و برطرف کنید. در مجموعه‌ای جامع از تست‌های تمرینی که دقیقاً برای شبیه‌سازی توزیع سوالات در ارزیابی‌های رقابتی صنعت طراحی شده است، مهارت یابید. غریزه حل مسئله سریع و شفافیت فنی لازم برای قبولی در ارزیابی‌های سخت‌گیرانه چندمرحله‌ای را در اولین تلاش به دست آورید. مبادلاتی (Trade-offs) در یادگیری ماشین، از جمله بهینه‌سازی هایپرپارامترها، مرزهای منظم‌سازی (Regularization) و معضل بایاس-واریانس را به صورت سیستماتیک تحلیل کنید. پرس‌وجوهای (Queries) بهینه و تمیز SQL را با استفاده از توابع پنجره‌ای (Window Functions) پیچیده، Joinهای چندجدولی و تجمیع‌ها برای حل سناریوهای واقعی استخراج داده بنویسید. خط لوله‌های (Pipelines) موثر مدیریت، پاک‌سازی و پیش‌پردازش داده‌ها را برای مدیریت داده‌های خراب، منحرف یا مفقود در محیط تولید پیاده‌سازی کنید. خروجی‌های تحلیلی خام را به بینش‌های تجاری تاثیرگذار، چارچوب‌های روایت‌گری داده‌ها (Storytelling) و توصیه‌های استراتژیک برای مدیران ارشد تبدیل کنید. پیش‌نیازها: درک پایه‌ای از احتمالات، تحلیل اکتشافی داده‌ها (EDA) و گردش‌های کاری مقدماتی یادگیری ماشین به شدت توصیه می‌شود. آشنایی با منطق برنامه‌نویسی پایه (مانند سینتکس پایتون یا R) و دستورات ابتدایی استخراج داده در SQL، یادگیری شما را به حداکثر می‌رساند.

پوشش تفصیلی حوزه‌های آزمون

این مخزن تست‌های تمرینی به طور سیستماتیک سازماندهی شده تا دقیقاً منعکس‌کننده توزیع‌های فنی و معیارهای ارزیابی سخت‌گیرانه در پنل‌های مصاحبه نخبگان دیتاساینس باشد.

  • آمار (۲۰٪): تسلط بر آمار توصیفی در مقابل استنباطی، دینامیک‌های رگرسیون خطی و لجستیک، طراحی آزمایش‌های مستحکم (پروتکل‌های A/B Testing)، فرمول‌های آزمون فرضیه، تفسیر p-value و فواصل اطمینان آماری.

  • یادگیری ماشین (۲۵٪): بررسی عمیق معماری‌های یادگیری نظارت شده در مقابل نظارت نشده، مقابله با بیش‌برازش (Overfitting) از طریق Regularization ($L_1$/$L_2$)، مدیریت tradeoff بایاس-واریانس، معیارهای انتخاب مدل ساختاری و استراتژی‌های تنظیم خودکار هایپرپارامترها.

  • مدیریت داده‌ها (۱۵٪): استراتژی‌های پاک‌سازی داده‌ها در دنیای واقعی، خط لوله‌های پیش‌پردازش پیچیده، مدیریت داده‌های مفقود یا پرت (Outliers)، چارچوب‌های ذخیره‌سازی کارآمد و مکانیسم‌های بازیابی مقیاس‌پذیر داده‌ها.

  • SQL و پایگاه داده (۱۰٪): مدیریت پیشرفته پایگاه داده‌های رابطه‌ای، Joinهای پیچیده چندجدولی، تجمیع‌های رابطه‌ای، توابع پنجره‌ای ساختاری، زیرپرس‌وجوهای تودرتو و بهینه‌سازی اجرای کوئری‌ها.

  • برنامه‌نویسی (۱۰٪): مفاهیم مهندسی پایتون و R در سطح تولید، ساختارهای داده ساختاری، پیچیدگی الگوریتمی (محدودیت‌های زمان/فضا) و پارادایم‌های تمیز برنامه‌نویسی شی‌گرا (OOP).

  • تحلیل داده‌ها (۱۰٪): گردش‌های کاری تحلیل اکتشافی داده‌ها (EDA)، استراتژی‌های بصری‌سازی موثر، تحلیل‌های آماری کلاسیک، کشف الگوها از طریق داده‌کاوی و ساخت مدل‌های پیش‌بینی پایه.

  • دانش دامنه/کسب‌وکار (۵٪): به‌کارگیری هوش تجاری در اعداد خام، شناسایی روندهای صنعت، تحلیل کلان بازار و تبدیل تعاملات کاربر به معیارهای کمی رفتار مشتری.

  • ارتباطات و روایت‌گری (۵٪): مهارت‌های ارائه به مدیران ارشد، روایت‌گری داده‌محور، مکانیسم‌های تولید بینش و تبدیل معیارهای سرد به توصیه‌های استراتژیک تجاری با تاثیر بالا.

درباره این دوره

قبولی در مراحل فنی مصاحبه دیتاساینس در شرکت‌های تراز اول، بسیار فراتر از صرفاً فراخوانی یک مدل از کتابخانه یا نوشتن کدهای ساده است. پنل‌های مصاحبه می‌خواهند ببینند شما تحت فشار چگونه فکر می‌کنید؛ چگونه نشت داده‌ها (Data Leakage) را تشخیص می‌دهید، توزیع آماری مناسب را انتخاب می‌کنید، با مجموعه‌داده‌های شدیداً نامتوازن برخورد می‌کنید یا مبادلات پیچیده الگوریتمی را برای ذینفعان تجاری توضیح می‌دهید. من این چارچوب تمرینی جامع با ۵۵۰ سوال را طراحی کرده‌ام تا دقیقاً همین مزیت رقابتی را به شما بدهم و دانش تئوری شما را به اعتمادبه‌نفس عملی در آزمون تبدیل کنم.

به جای کوئیزهای معمولی، من چالش‌های مفهومی عمیقی ارائه می‌دهم که نیازمند حل مسئله ساختاری هستند. هر سوال در این مجموعه، منعکس‌کننده سناریویی است که در ارزیابی‌های فنی واقعی شرکتی با آن مواجه خواهید شد؛ از آمار سخت‌گیرانه گرفته تا مکانیسم‌های End-to-End یادگیری ماشین، معماری پایگاه داده و مبانی برنامه‌نویسی. هر سوال شامل یک تحلیل فنی دقیق و گام‌به‌گام است که هیچ جای حدسی باقی نمی‌گذارد. من دقیقاً توضیح می‌دهم که چرا رویکرد صحیح از نظر منطقی و ریاضی درست است و گزینه‌های جایگزین را کالبدشکافی می‌کنم تا یاد بگیرید تله‌های رایج مصاحبه‌کنندگان را فوراً شناسایی کنید. چه هدف شما جایگاه یک Applied Scientist نخبه باشد، چه نقش Core Data Scientist یا مسیر فنی Data Analyst، این مجموعه تست‌های تمرینی به عنوان یک شبیه‌ساز هدفمند عمل می‌کند تا اطمینان حاصل شود که موانع مصاحبه خود را در اولین تلاش با اعتمادبه‌نفس کامل پشت سر می‌گذارید.

پیش‌نمایش نمونه سوالات تمرینی

برای ارزیابی دقت ساختاری و شفافیت توضیحات این دوره، این سه نمونه سوال مصاحبه با کیفیت بالا را بررسی کنید.

سوال ۱: ارزیابی خطاهای نوع اول و نوع دوم در تست A/B آنلاین

یک تحلیل‌گر روی یک لندینگ پیج پریمیوم برای افزایش نرخ تبدیل، تست A/B اجرا می‌کند. تغییر واقعی در نرخ تبدیل پایه دقیقاً صفر است (فرضیه صفر $H_0$ درست است). با این حال، به دلیل نویز نمونه‌برداری تصادفی، ارزیابی تجربی مقدار p-value برابر با ۰.۰۳۲ را نشان می‌دهد. با توجه به آستانه معناداری سخت‌گیرانه ($\alpha = 0.05$)، تحلیل‌گر فرضیه صفر را رد می‌کند. چه خطای آماری رخ داده است و تیم چگونه می‌تواند احتمال وقوع آن را در آینده کاهش دهد؟

  • الف) خطای نوع دوم رخ داده است؛ تیم می‌تواند با افزایش قابل توجه اندازه نمونه کلی، این مورد را کاهش دهد.

  • ب) خطای نوع اول رخ داده است؛ تیم می‌تواند با اعمال یک آستانه معناداری سخت‌گیرانه‌تر و پایین‌تر مانند ۰.۰۱، این مورد را کاهش دهد.

  • ج) خطای نوع اول رخ داده است؛ تیم می‌تواند با گسترش مدت زمان تست بدون تغییر در آلفا، این مورد را کاهش دهد.

  • د) خطای نوع دوم رخ داده است؛ تیم می‌تواند با انتخاب یک جایگزین تست ناپارامتریک، این مورد را کاهش دهد.

  • ه) عدم تطابق توان آماری رخ داده است؛ تیم باید معیار عملکرد اصلی خود را کاملاً تغییر دهد.

  • و) هیچ خطایی رخ نداده است؛ p-value پایین‌تر از آستانه تضمین می‌کند که اثر تجربی واقعی است.

پاسخ صحیح و توضیحات:

  • پاسخ صحیح: ب

  • چرا درست است: خطای نوع اول زمانی رخ می‌دهد که شما به اشتباه یک فرضیه صفر درست را رد کنید (مثبت کاذب). در اینجا، اثر واقعی صفر است، اما واریانس تصادفی باعث تولید p-value کمتر از آلفا شد و منجر به رد نادرست شد. تنها راه ساختاری برای کاهش احتمال خطای نوع اول، پایین آوردن آستانه معناداری آلفا ($\alpha$) است که حاشیه پذیرش برای مثبت‌های کاذب را کاهش می‌دهد.

  • چرا گزینه‌های دیگر نادرست هستند:

    • گزینه الف نادرست است: این توصیف مربوط به خطای نوع دوم (منفی کاذب) است که زمانی رخ می‌دهد که شما در رد یک فرضیه صفر نادرست شکست بخورید.

    • گزینه ج نادرست است: صرفاً افزایش مدت زمان تست بدون تغییر آلفا، احتمال صریح خطای نوع اول را کاهش نمی‌دهد؛ بلکه فقط داده‌های بیشتری را تحت همان حاشیه خطا جمع‌آوری می‌کند.

    • گزینه د نادرست است: جایگزینی با توزیع‌های ناپارامتریک، مفروضات درباره شکل داده‌ها را تغییر می‌دهد اما سقف ثابت خطای نوع اول را که توسط آلفا تعیین شده، کنترل نمی‌کند.

    • گزینه ه نادرست است: توان آماری صراحتاً به خطاهای نوع دوم ($1 - \beta$) مرتبط است، نه نرخ مثبت کاذب که توسط آلفا تعریف می‌شود.

    • گزینه و نادرست است: p-value پایین هرگز واقعیت را تضمین نمی‌کند؛ بلکه صرفاً نشان می‌دهد که الگوی داده‌های مشاهده شده بسیار بعید است که تنها بر اساس شانس تصادفی تحت مفروضات فرضیه صفر رخ داده باشد.

سوال ۲: ارزیابی مکانیسم‌های Loss در مدل‌های Tree Ensemble در Gradient Boosting

یک مهندس یادگیری ماشین متوجه می‌شود که یک مدل Gradient Boosting Machine (GBM) سفارشی، به طور مداوم وزن نامتناسبی به داده‌های پرت (Outliers) شدید در یک مجموعه داده رگرسیونی می‌دهد و باعث تعمیم ضعیف روی مجموعه‌های تست می‌شود. کدام تغییر در استراتژی بهینه‌سازی تابع Loss، این حساسیت ساختاری را به بهترین شکل کاهش می‌دهد؟

  • الف) تغییر هدف Loss داخلی از Mean Absolute Error (MAE) به Mean Squared Error (MSE).

  • ب) افزایش نرخ یادگیری (پارامتر shrinkage) برای اینکه درخت‌های فردی سریع‌تر با نمونه‌های نادر سازگار شوند.

  • ج) تغییر هدف Loss داخلی از Mean Squared Error (MSE) به یک تابع Huber Loss مقاوم.

  • د) غیرفعال کردن تمامی پارامترهای منظم‌سازی $L_2$ در ساختارهای درخت تصمیم تشکیل‌دهنده.

  • ه) تغییر الگوریتم اصلی از یک چارچوب Boosting به پارادایم کلاسیک Random Forest بدون هرس (Unpruned).

  • و) اعمال قطع داده‌های سخت‌گیرانه با جایگزینی تمام آیتم‌های پرت عددی با مقادیر صفر استاتیک.

پاسخ صحیح و توضیحات:

  • پاسخ صحیح: ج

  • چرا درست است: MSE خطاهای باقی‌مانده را به توان دو می‌رساند، که باعث می‌شود به‌روزرسانی‌های گرادینت به صورت درجه دو با خطاهای بزرگ مقیاس شوند و مدل را مجبور کند مرزهای خود را برای پذیرش داده‌های پرت شدید تغییر دهد. Huber loss این مشکل را با عمل کردن به صورت درجه دو برای خطاهای کوچک و تغییر به جریمه خطی برای خطاهای بزرگتر از یک آستانه خاص ($\delta$) حل می‌کند. این کار تأثیر داده‌های پرت شدید را بر گرادینت بهینه‌سازی محدود می‌کند.

  • چرا گزینه‌های دیگر نادرست هستند:

    • گزینه الف نادرست است: تغییر از MAE به MSE به دلیل مؤلفه توان دو، مشکل داده‌های پرت را به شدت تشدید می‌کند.

    • گزینه ب نادرست است: افزایش نرخ یادگیری باعث می‌شود مدل حتی سریع‌تر با خطاهای هر درخت سازگار شود و بیش‌برازش روی داده‌های پرت را تسریع کند.

    • گزینه د نادرست است: حذف Regularization واریانس مدل را افزایش می‌دهد و به درخت‌ها اجازه می‌دهد به جای نادیده گرفتن داده‌های پرت نویزی، کاملاً با آن‌ها منطبق شوند.

    • گزینه ه نادرست است: اگرچه Random Forest واریانس را از طریق میانگین‌گیری کاهش می‌دهد، اما انتقال به درخت‌های بدون هرس همچنان اجازه می‌دهد تخمین‌زن‌های فردی ساختارهای عمیق داده‌های پرت را بدون پرداختن به حساسیت بنیادی Loss مدل‌سازی کنند.

    • گزینه و نادرست است: جایگزینی کورکورانه داده‌های پرت با مقادیر صفر، یکپارچگی فیزیکی ویژگی‌ها را تخریب کرده و بایاس مصنوعی شدیدی را به توزیع داده‌ها وارد می‌کند.

سوال ۳: بهینه‌سازی بازیابی ذخیره‌سازی داده‌های با ابعاد بالا از طریق Spatial Windowing

یک تیم داده، یک خط لوله تحلیلی تولیدی را اجرا می‌کند که تجمیع‌های مکانی-زمانی روزانه را روی میلیاردها مختصات ردیابی انجام می‌دهد. کوئری‌ها به شدت از توابع پنجره‌ای پیچیده چندجدولی و فیلترهای مبتنی بر Partition استفاده می‌کنند. زمان اجرا در حال کاهش کیفیت است. کدام تغییر در معماری پایگاه داده، بیشترین سود بهینه‌سازی را برای این حجم کاری خاص فراهم می‌کند؟

  • الف) تبدیل فرمت ذخیره‌سازی فیزیکی از چیدمان ستونی (Columnar) به یک ذخیره‌ساز سنتی سطر-محور (Row-oriented heap store).

  • ب) حذف تمام ایندکس‌های خوشه‌ای ترکیبی (Composite Clustered Indexes) و تکیه صرف بر اسکن‌های موازی کل جدول.

  • ج) اعمال یک ایندکس خوشه‌ای (Clustered Index) روی کلیدهای Partition مورد استفاده در توابع پنجره‌ای برای حذف مراحل مرتب‌سازی فیزیکی.

  • د) قرار دادن توابع پنجره‌ای داخل زیرپرس‌وجوهای تودرتو و مرتبط (Correlated Subqueries) در عبارت اصلی WHERE.

  • ه) انتقال کل آرایه داده‌ها به یک ذخیره‌ساز سند (Document Store) غیررابطه‌ای که فاقد پشتیبانی بومی از Windowing است.

  • و) تغییر سینتکس کوئری برای جایگزینی تمام توابع پنجره‌ای رابطه‌ای با Self-joinهای صریح داخلی روی ویژگی‌های بدون ایندکس.

پاسخ صحیح و توضیحات:

  • پاسخ صحیح: ج

  • چرا درست است: توابع پنجره‌ای (OVER (PARTITION BY ... ORDER BY ...)) نیازمند این هستند که موتور پایگاه داده سطرهای زیربنایی را قبل از محاسبه تجمیع‌های جاری، در گروه‌های مرتب‌شده سازماندهی کند. اگر داده‌های فیزیکی از قبل روی دیسک با استفاده از یک Clustered Index که با همان کلیدهای Partition و مرتب‌سازی مطابقت دارد سازماندهی شده باشند، موتور پایگاه داده مرحله گران‌قیمت مرتب‌سازی فیزیکی را کاملاً حذف می‌کند و مصرف CPU و تأخیر I/O را به شدت کاهش می‌دهد.

  • چرا گزینه‌های دیگر نادرست هستند:

    • گزینه الف نادرست است: ذخیره‌سازهای سطر-محور در مقایسه با فرمت‌های ستونی که در اسکن ستون‌های خاص روی میلیاردها سطر عالی هستند، در تجمیع‌های تحلیلی مقیاس بزرگ عملکرد ضعیفی دارند.

    • گزینه ب نادرست است: حذف ایندکس‌های ساختاریافته، موتور اجرا را مجبور می‌کند برای هر حلقه تجمیع پنجره‌ای روزانه، خواندن‌های I/O گران‌قیمت کل جدول را انجام دهد.

    • گزینه د نادرست است: زیرپرس‌وجوهای مرتبط تودرتو، سطر به سطر اجرا می‌شوند که باعث کندی‌های نمایی فاجعه‌بار در جداول عظیم می‌شود.

    • گزینه ه نادرست است: انتقال به یک Document Store بدون پشتیبانی بومی، شما را مجبور می‌کند تمام داده‌ها را به حافظه منتقل کرده و منطق پنجره را در کد اپلیکیشن محاسبه کنید که مقیاس‌پذیر نیست.

    • گزینه و نادرست است: جایگزینی توابع پنجره‌ای بهینه‌شده با Self-joinها روی ستون‌های بدون ایندکس، ضرب دکارتی‌های عظیمی ایجاد می‌کند که می‌تواند به سرعت حافظه پایگاه داده و فضای موقت را مصرف کند.

آنچه در انتظار شماست

  • به تست‌های سوالات مصاحبه خوش آمدید تا شما را برای ارزیابی سوالات مصاحبه دیتاساینس آماده کنیم

  • شما می‌توانید هر تعداد بار که بخواهید در آزمون‌ها شرکت کنید

  • این یک بانک سوالات عظیم و اورجینال است

  • در صورت داشتن سوال، از پشتیبانی مدرسان بهره‌مند می‌شوید

  • هر سوال دارای یک توضیح دقیق است

  • سازگار با موبایل از طریق اپلیکیشن Udemy

امیدواریم تا الان متقاعد شده باشید! سوالات بسیار بیشتری در داخل دوره وجود دارد.


تمرین ها و آزمونها

تست‌های تمرینی Practice Tests

  • تست تمرینی ۱ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 1

  • تست تمرینی ۲ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 2

  • تست تمرینی ۳ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 3

  • تست تمرینی ۴ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 4

  • تست تمرینی ۵ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 5

  • تست تمرینی ۶ سوالات مصاحبه دیتاساینس همراه با جواب Data Science Interview Questions with Answers Practice Test 6

نمایش نظرات

آموزش ۵۰۰+ سوال و جواب مصاحبه دیتاساینس (علم داده) ۲۰۲۶
جزییات دوره
آزمون یا تمرین
538
(آخرین آپدیت)
117
از 5
ندارد
ندارد
ندارد
جهت دریافت آخرین اخبار و آپدیت ها در کانال تلگرام عضو شوید.

Google Chrome Browser

Internet Download Manager

Pot Player

Winrar

Interview Questions Tests Interview Questions Tests

مربی در Udemy