پوشش جامع حوزههای آزمون
این محیط تستهای تمرینی جامع، مستقیماً با چارچوبهای ارزیابی فنی مورد استفاده توسط تیمهای داده نخبه مطابقت دارد. سوالات از نظر ریاضی دقیق هستند و تئوریهای بنیادی تا سناریوهای پیچیده تولید را در هشت حوزه مجزا پوشش میدهند.
مبانی احتمالات (۱۸٪): معیارهای مرکز و پراکندگی، توزیعهای احتمالی پیوسته و گسسته (نرمال، دوجملهای، پوآسون، هندسی)، کاربردهای قضیه بیز، ماتریسهای احتمال شرطی و پیامدهای عملی قانون اعداد بزرگ.
آمار استنباطی (۲۰٪): جریانهای پیشرفته آزمون فرضیه، تخمین فواصل اطمینان، کاهش ریاضی خطاهای نوع اول و دوم، رفتار توزیعهای نمونهبرداری تحت قضیه حد مرکزی و تفسیر دقیق p-valueها.
پیشپردازش دادهها (۱۰٪): مکانیسمهای عملی پاکسازی دادهها، استراتژیهای پیشرفته تبدیل دادهها (log, Box-Cox)، مدیریت ساختاری مقادیر گمشده، پارامترهای نرمالسازی دادهها و تاثیرات مقیاسبندی ویژگیها بر تخمینگرهای مبتنی بر فاصله.
تحلیل رگرسیون (۱۵٪): حداقل مربعات معمولی (OLS) و تشخیصهای رگرسیون خطی، مکانیسمهای تخمین بیشینه احتمال (MLE)، زیرساختهای آمار بیزی، معیارهای جامع ارزیابی مدل و چارچوبهای منظمسازی L1/L2.
آزمایش و تست A/B (۱۲٪): طراحی آزمایشهای آماری، پارامترهای اجرای تست A/B زنده، ردیابی معناداری آماری تحت محدودیتهای تستهای متعدد، ردیابی فواصل اطمینان و معادلات دقیق اندازه نمونه با استفاده از تحلیل توان (Power Analysis).
یادگیری ماشین و مدلسازی (۱۰٪): معیارهای ارزیابی یادگیری نظارت شده و نظارت نشده، پروتکلهای سختگیرانه انتخاب مدل، اعتبارسنجی مدل خارج از نمونه، تشخیصهای ساختاری بیشبرازش (Overfitting) و کمبرازش (Underfitting) و تحلیل ریاضی توازن بایاس-واریانس.
تفسیر دادهها و ارتباطات (۸٪): اصول پیشرفته بصریسازی دادهها، تفسیر زمینهای نتایج ریاضی، استخراج نتایج مستدل مبتنی بر داده، ارائه توصیههای محصولی و انتقال بینشها به ذینفعان فنی و غیرفنی.
مباحث پیشرفته آماری (۷٪): اجزای تحلیل سریهای زمانی (ایستایی، ARIMA)، معیارهای تحلیل بقا (نرخهای خطر)، شبکههای استنباط علی، آزمونهای ناپارامتریک قدرتمند (Mann-Whitney U, Kruskal-Wallis) و تکنیکهای پیشرفته رگرسیون.
درباره این دوره
کسب جایگاهی به عنوان دانشمند داده (Data Scientist)، پژوهشگر کمی (Quantitative Researcher) یا تحلیلگر داده اصلی، نیازمند چیزی فراتر از فراخوانی کتابخانههای سطح بالای فریمورکها است. تیمهای مهندسی برتر، چرخههای فنی خود را به گونهای طراحی میکنند تا بررسی کنند آیا شما مبانی ریاضی را تحت فشار درک میکنید یا خیر. مصاحبهکنندگان مکرراً مرزهای اجرا را میکاوند و از شما میخواهند رفتار غیرمنتظره p-value را تشخیص دهید، تخصیص نمونهها را در تنظیمات پیچیده تست A/B بهینه کنید یا انتخاب تخمینگرهای منظمشده خود را در مواجهه با ویژگیهای همخط توجیه نمایید.
من این مخزن فنی گسترده را طراحی کردم تا حدس و گمان را از آمادگی شما برای مصاحبه حذف کنم. این شبیهساز شامل ۵۵۰ سوال بسیار تخصصی و الهامگرفته از محیطهای عملیاتی است و کاملاً از بررسی اصطلاحات سطحی فاصله گرفته است. سوالات، پارادوکسهای واقعی دادهها، شکستهای اعتبارسنجی مدل و موارد خاص (Edge Cases) آزمایشگاهی را ارائه میدهند. هر سوال شامل یک توضیح جامع و مبتنی بر ریاضیات است که جزئیات دلیل درست بودن مسیر صحیح و دلیل شکست گزینههای جایگزین را در مفروضات عملیاتی شرح میدهد. چه هدف شما قبولی در یک چرخه غربالگری فنی متمرکز باشد، چه بخواهید به تحلیلهای کمی تغییر مسیر دهید یا پیش از یک پنل مصاحبه بزرگ، آزمونهای ناپارامتریک را مرور کنید، این منبع تمرینات سختگیرانهای را فراهم میکند که برای عبور با اعتماد به نفس از مراحل فنی در اولین تلاش به آنها نیاز دارید.
نمونه سوالات تمرینی
برای ارزیابی عمق ریاضی و شفافیت این بانک سوالات، این سه نمونه سوال با کیفیت بالا را مرور کنید.
سوال ۱: تشخیصهای ریاضی تحت تغییرات p-value و اندازه نمونه
یک پژوهشگر کمی، اندازه نمونه یک آزمایش معیارهای محصول پیوسته را از ۱,۰۰۰ مشاهده به ۱۰۰,۰۰۰ مشاهده افزایش میدهد، در حالی که اندازه اثر (effect size) مشاهده شده را یکسان نگه میدارد. در طول ارزیابی، p-value محاسبه شده از ۰.۰۶ به کمتر از ۰.۰۰۱ کاهش مییابد که نشاندهنده معناداری آماری بالا است. این نتیجه چگونه باید تفسیر شود؟
الف) تاثیر فیزیکی واقعی تغییرات به دلیل گسترش نمونه به شدت افزایش یافته است.
ب) آزمایش با تورم نرخ خطای نوع اول مواجه شده است که مستقیماً ناشی از تراکم بالای نمونه است.
ج) افزایش توان (Power) به تست اجازه میدهد تا تفاوتی را که از نظر عملی ناچیز است شناسایی کند و بدین ترتیب معناداری آماری را از معناداری عملی جدا کند.
د) توزیع نمونهبرداری زیربنایی تقارن خود را از دست داده و مفروضات پایه قضیه حد مرکزی را نقض کرده است.
ه) خطای استاندارد تخمین افزایش یافته و باعث شده فاصله اطمینان جدید گستردهتر و کمتر قابل اعتماد شود.
و) معیار اصلی از یک پروفایل توزیع احتمالی پیوسته به یک ساختار ناپارامتریک گسسته تغییر یافته است.
پاسخ صحیح و توضیح:
پاسخ صحیح: ج
دلیل صحت: خطای استاندارد یک توزیع نمونهبرداری بهصورت معکوس با جذر اندازه نمونه تغییر میکند. با رشد اندازه نمونه به سمت تراکمهای بالا، خطای استاندارد به شدت کاهش مییابد، که این امر آماره تست را بالا برده و p-value را حتی برای تغییرات بسیار کوچک پایین میآورد. در حالی که معناداری ریاضی تایید شده است، اما تاثیر واقعی در دنیای واقعی (اندازه اثر) کوچک باقی میماند؛ این نشان میدهد که نمونههای عظیم اغلب انحرافات عملی بیمعنی را به عنوان موارد معنادار آماری علامتگذاری میکنند.
دلیل عدم صحت گزینههای دیگر:
گزینه الف نادرست است: اندازه اثر مشاهده شده یکسان باقی ماند؛ بزرگی فیزیکی تفاوت تغییر نکرد.
گزینه ب نادرست است: نرخ خطای نوع اول توسط آستانه آلفای انتخاب شده توسط پژوهشگر کنترل میشود، نه توسط تغییرات اندازه نمونه.
گزینه د نادرست است: نمونههای بزرگتر در واقع مفروضات قضیه حد مرکزی را تقویت میکنند و توزیع نمونهبرداری را به نرمال نزدیکتر میکنند.
گزینه ه نادرست است: با افزایش اندازه نمونه، خطای استاندارد کاهش مییابد که باعث باریکتر شدن فاصله اطمینان میشود، نه گستردهتر شدن آن.
گزینه و نادرست است: تغییر در مقدار نمونه، معیارهای دقت را تغییر میدهد اما مقیاس پیوسته بنیادی خودِ معیار اصلی را تغییر نمیدهد.
سوال ۲: ارزیابی نقض مفروضات استقلال در رگرسیون خطی
هنگام اجرای تشخیصها روی یک مدل رگرسیون خطی حداقل مربعات معمولی که دادههای فروش خردهفروشی وابسته به زمان را ردیابی میکند، نمودار باقیات (residual plot) یک الگوی موجی تکرارشونده واضح را در ترتیب توالی نشان میدهد. کدام مفروضه اصلی آماری نقض شده است و تاثیر خاص آن بر معیارهای استنباط چیست؟
الف) همسانی واریانس (Homoscedasticity) نقض شده است و باعث میشود ضرایب پارامترها خود به تخمینگرهای بسیار تورشدار تبدیل شوند.
ب) مفروضه استقلال باقیات نقض شده است که منجر به تخمین کمتر از حد واقعی خطاهای استاندارد و افزایش مصنوعی آمارههای t میشود.
ج) خطی بودن از نظر ساختاری به خطر افتاده است که باعث ابطال کامل محاسبه مرز تخمین بیشینه احتمال میشود.
د) همخطی چندگانه بین ویژگیها ظاهر شده است و باعث میشود واریانس مدل به زیر محدودههای تخمین قابل قبول سقوط کند.
ه) نرمال بودن خطاها از بین رفته است، به این معنی که مدل دیگر نمیتواند پیشبینیهای نقطهای برای نتایج پیوسته ارائه دهد.
و) تبدیل مقیاسبندی ویژگیها نادیده گرفته شده است که باعث میشود جریمه منظمسازی (regularization penalty) ترم عرض از مبدا را نادیده بگیرد.
پاسخ صحیح و توضیح:
پاسخ صحیح: ب
دلیل صحت: یک الگوی موجی در باقیات در طول زمان یا ترتیب توالی نشاندهنده خودهمبستگی (autocorrelation) است که مستقیماً این مفروضه را که جملات خطا مستقل هستند، نقض میکند. وقتی همبستگی سریالی وجود داشته باشد، جملات خطای متوالی اطلاعاتی را به اشتراک میگذارند که باعث میشود فرمولهای استاندارد حداقل مربعات معمولی، واریانس واقعی را کمتر از حد تخمین بزنند. این تخمین کمتر، خطاهای استاندارد ضرایب را باریک کرده، آمارههای t را به صورت مصنوعی گسترش میدهد و باعث ایجاد مثبتهای کاذب در تستهای معناداری میشود.
دلیل عدم صحت گزینههای دیگر:
گزینه الف نادرست است: همسانی واریانس به معنای ثابت بودن واریانس خطا در تمام پیشبینیها است؛ در حالی که نقض آن بر محاسبات واریانس تاثیر میگذارد، اما باعث ایجاد تورش در ضرایب نمیشود.
گزینه ج نادرست است: روابط غیرخطی در نمودارها متفاوت به نظر میرسند؛ الگوی خودهمبستگی به طور خاص مفروضات استقلال را میشکند بدون اینکه الگوریتم بیشینه احتمال را متوقف کند.
گزینه د نادرست است: همخطی چندگانه مربوط به همبستگی بین متغیرهای پیشبین است، نه بین خطاهای باقیات متوالی.
گزینه ه نادرست است: انحراف از نرمال بودن، اعتبار تستهای فرضیه در نمونههای کوچک را تغییر میدهد، اما مانع از تولید پیشبینیهای نقطهای ریاضی توسط مدل نمیشود.
گزینه و نادرست است: خودهمبستگی یک رابطه ساختاری ذاتی در نقاط داده در طول زمان است و مستقل از انتخابهای مقیاسبندی ویژگیهاست.
سوال ۳: دینامیک اندازه نمونه و کنترل توان در تست A/B چند متغیره
یک آزمایشکننده، یک طرح تست A/B/C/D را برای ارزیابی سه تغییر متفاوت در چیدمان در مقابل یک خط پایه (Control) پیکربندی میکند. اگر ارزیابی اصلی بر اساس اجرای چندین تست t مجزا با سطح آلفای ۰.۰۵ بدون هیچ اصلاحی باشد، چه ریسک ساختاری برای چارچوب آزمایش ایجاد میشود؟
الف) توان آماری کل آزمایش به طور متناسب با هر تغییر جدید اضافهشده کاهش مییابد.
ب) احتمال مواجهه با نتیجه منفی کاذب در مقایسهها به نزدیکی صفر میرسد.
ج) نرخ خطای خانواده (family-wise error rate) به شدت افزایش مییابد و احتمال ارتکاب حداقل یک خطای نوع اول را بالا میبرد.
د) معادله اندازه نمونه باید با استفاده از توزیعهای ناپارامتریک به جای مدلهای توان نرمال استاندارد محاسبه شود.
ه) فواصل اطمینان پیرامون اثرات تخمینی درمان با هم ادغام میشوند و از نظر ریاضی غیرقابل تفسیر میگردند.
و) الگوریتمهای تخمین بیشینه احتمال به دلیل همپوشانی معیارهای احتمالی، در همگرایی شکست میخورند.
پاسخ صحیح و توضیح:
پاسخ صحیح: ج
دلیل صحت: وقتی مقایسههای زوجی مستقل متعددی را اجرا میکنید، هر تست احتمال تولید یک مثبت کاذب (خطای نوع اول) را دارد. برای چهار متغیر، شش مقایسه زوجی منحصربهفرد وجود دارد. بدون یک پروتکل اصلاحی (مانند Bonferroni یا Tukey)، نرخ خطای خانواده به $1 - (1 - 0.05)^6 \approx 26.5\%$ میرسد که بسیار فراتر از آستانه ۵٪ مورد نظر است.
دلیل عدم صحت گزینههای دیگر:
گزینه الف نادرست است: افزودن متغیرها اندازه نمونه موجود را تقسیم میکند (کاهش توان هر تست اگر ترافیک کل ثابت باشد)، اما ظرفیت تئوریک ساختارهای واریانس فردی را به طور یکنواخت کاهش نمیدهد.
گزینه ب نادرست است: ریسک مثبتهای کاذب افزایش مییابد که دقیقاً نقطه مقابل رساندن منفیهای کاذب به صفر است.
گزینه د نادرست است: توزیعهای دادههای پیوسته زیربنایی نرمال باقی میمانند؛ مشکل در ریاضیات تستهای متعدد است نه در شکل معیارها.
گزینه ه نادرست است: فواصل اطمینان برای هر مقایسه متغیر مجزا باقی میمانند؛ آنها به طور ساختاری ادغام نمیشوند یا هویت ریاضی فردی خود را از دست نمیدهند.
گزینه و نادرست است: الگوریتمهای تخمین بدون مشکل روی تغییرات دادهها اجرا میشوند؛ خطا به صورت منطق تفسیر نادرست پس از تست ظاهر میشود، نه شکست در همگرایی ریاضی.
چه انتظاری داشته باشید
به تستهای سوالات مصاحبه خوش آمدید تا به شما در آماده شدن برای ارزیابی سوالات مصاحبه آمار کمک کنیم.
میتوانید هر چند بار که بخواهید در آزمونها شرکت کنید
این یک بانک سوالات عظیم و اورجینال است
در صورت داشتن سوال، از پشتیبانی مدرسان بهرهمند میشوید
هر سوال دارای یک توضیح دقیق است
سازگار با موبایل از طریق اپلیکیشن Udemy
امیدواریم تا الان متقاعد شده باشید! و سوالات بسیار بیشتری در داخل دوره وجود دارد.
Interview Questions Tests
مربی در Udemy
نمایش نظرات