پوشش جامع حوزههای آزمون
این مخزن آزمونهای تمرینی دقیقاً به گونهای ساختار یافته است که بازتابدهنده توزیعهای فنی و تحلیلی مورد انتظار در مصاحبههای فنی تحلیلگر داده در سازمانهای مدرن باشد.
برنامهنویسی و کدنویسی (۲۰٪): اسکریپتنویسی اصلی پایتون و R برای خط لولههای داده، کوئریهای پیشرفته SQL، Joinهای رابطهای، ساختارهای داده بنیادی و الگوریتمهای رایج برای پردازش دادهها.
بصریسازی دادهها و ارتباطات (۱۸٪): داشبوردسازی پیشرفته با Tableau و Power BI، داستانسرایی استراتژیک با دادهها، چیدمان ارائههای مدیریتی و گزارشنویسی فنی ساختاریافته.
آمار و روشهای کمی (۱۵٪): طراحی آزمون فرض، ساخت بازههای اطمینان، تشخیص همبستگی در مقابل علیت، ساخت مدلهای تحلیل رگرسیون و ارزیابی تحلیل سریهای زمانی برای پیشبینی.
مدیریت دادهها و سیستمهای پایگاه داده (۱۲٪): کار با سیستمهای مدیریت پایگاه داده رابطهای (RDBMS)، مدلسازی ساختاری دادهها (طرحهای ستارهای/دانهبرفی)، اصول انبار داده (Data Warehousing)، حاکمیت دادههای سازمانی و چارچوبهای کیفیت داده.
تحلیل و تفسیر دادهها (۱۵٪): پاکسازی جامع دادهها، تبدیل برنامهنویسی شده دادهها، کشف الگوهای دادهکاوی، مدلسازی تحلیلهای پیشبینانه و استراتژی تحلیلهای تجویزی.
شم تجاری و دانش دامنه (۱۰٪): رصد روندهای صنعت، انجام تحلیل بازار، ترسیم تحلیل رقبا، تدوین استراتژی کسبوکار و رصد معیارهای بهرهوری عملیاتی.
مهارتهای رفتاری و نرم (۵٪): همکاری در تیمهای چندوظیفهای، مهارتهای ارتباطی تاثیرگذار، حل مسئله تحلیلی ساختاریافته، مدیریت زمان پروژه و سازگاری فنی.
ابزارها و فناوریها (۵٪): تحلیلهای پیشرفته اکسل سازمانی (VLOOKUP/XLOOKUP، Pivot Tables، Power Query)، طراحی کوئری SQL و کتابخانههای حیاتی پایتون (Pandas, NumPy, Scikit-Learn, Matplotlib).
درباره دوره
به دست آوردن یک موقعیت شغلی با رشد بالا در تحلیل داده، نیازمند نمایش ترکیبی هوشمندانه از اجرای فنی، دقت آماری و ترجمه دادهها به زبان تجاری است. استخدام شدن تنها به معنای دانستن نحوه نوشتن یک کوئری ساده SQL یا ساخت یک داشبورد ابتدایی نیست؛ پنلهای مهندسی و هوش تجاری تراز اول ارزیابی میکنند که شما چگونه مجموعهدادههای نامنظم دنیای واقعی را پاکسازی میکنید، آزمایشهای آماری معتبر طراحی میکنید و معیارهای خام را به تصمیمات استراتژیک شرکتی تبدیل مینمایید. من این بانک سوالات گسترده را طراحی کردم تا فاصله بین دانش تئوری و چالشهای فنی واقعی که مصاحبهکنندگان ارشد در مراحل استخدامی رقابتی مطرح میکنند را پر کنم.
با ۵۵۰ سوال اصلی و بسیار مفصل، این منبع بسیار فراتر از بررسیهای لغوی ساده است. من سناریوهای واقعی اجرای کوئری SQL، دشواریهای طراحی داشبورد پیچیده، تبدیلهای داده و چارچوبهای حل مسئله رفتاری را تحلیل کردهام. هر سوال شامل یک توضیح جامع است که دقیقاً شرح میدهد چرا پاسخ صحیح مسئله را به طور بهینه حل میکند و چرا گزینههای جایگزین در محیط عملیاتی ناکارآمد هستند. چه هدف شما جایگاه تحلیلگر داده باشد، چه برای ارزیابی فنی دانشمند داده آماده شوید و چه در حال تغییر مسیر از یک حوزه تجاری به تحلیلهای کمی باشید، این مخزن هدفمند، تمرین جامع لازم برای عبور با اعتماد به نفس از مراحل فنی را در اولین تلاش به شما میدهد.
نمونهای از سوالات تمرینی
این سه نمونه سوال را بررسی کنید تا با عمق فنی، سبک فرمتبندی و توضیحات جامعی که در این آزمونها ارائه شده است آشنا شوید.
سوال ۱: بهینهسازی توابع Window در SQL برای پارتیشنبندی
یک تحلیلگر داده نیاز دارد میانگین متحرک ۳ ماهه فروش کل را برای هر دسته محصول مجزا از یک جدول تراکنشی محاسبه کند. کوئری باید فروش ماه جاری را در کنار این میانگین محاسبه شده برگرداند. کدام عبارت SQL این کار را به صورت تمیز و بدون تغییر در بافت ردیفهای پایه انجام میدهد؟
الف) استفاده از عبارت استاندارد GROUP BY روی ستونهای دسته محصول و تاریخ سفارش.
ب) اعمال تابع ()AVG در ترکیب با عبارت (OVER (PARTITION BY category ORDER BY order_date ROWS BETWEEN 2 PRECEDING AND CURRENT ROW.
ج) اجرای یک زیر-کوئری مرتبط (Correlated Subquery) در عبارت WHERE که بر اساس دسته فیلتر کرده و بر اساس تاریخ گروهبندی میکند.
د) اجرای یک CROSS JOIN بین جدول فروش پایه و یک جدول موقت حاوی میانگینهای ماهانه پیش-تجمیع شده.
ه) بهرهگیری از تابع تحلیلی ()LEAD برای کشیدن ردیفهای منطبق از فصل قبل.
و) استفاده از عبارت HAVING حاوی یک شرط تودرتوی (COUNT(DISTINCT category برای حذف ماههای خالی.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ب
دلیل صحت: توابع Window با استفاده از عبارت OVER به شما اجازه میدهند تجمیعها را روی مجموعهای از ردیفهای مشخص مرتبط با ردیف فعلی انجام دهید، بدون اینکه خروجی کوئری را به یک ردیف خلاصه تبدیل کنید. تعیین PARTITION BY category محاسبه را برای هر گروه مجزا جدا میکند، در حالی که ROWS BETWEEN 2 PRECEDING AND CURRENT ROW پنجره میانگین متحرک را دقیقاً به دو ماه گذشته و ماه جاری محدود میکند.
دلیل نادرستی گزینههای دیگر:
گزینه الف نادرست است: GROUP BY استاندارد ردیفهای تراکنشی فردی را ادغام میکند، به این معنی که نمیتوانید جزئیات خاص فروش ماه جاری را در کنار معیار تجمیعی در یک ردیف بدون Joinهای ثانویه نمایش دهید.
گزینه ج نادرست است: زیر-کوئریهای مرتبط در عبارت WHERE ردیفها را فیلتر میکنند نه اینکه ویژگیهای محاسباتی متحرک را برای هر رکورد ایجاد کنند، که باعث ایجاد گلوگاههای شدید در عملکرد میشود.
گزینه د نادرست است: CROSS JOIN یک ضرب دکارتی ایجاد میکند که ردیفها را به طور غیرضروری تکثیر کرده و ساختار گزارشدهی مجموعهداده را مخدوش میکند.
گزینه ه نادرست است: تابع ()LEAD به دادههای ردیفهای بعدی دسترسی دارد، نه اینکه میانگینهای متحرک را در دورههای تاریخی گذشته محاسبه کند.
گزینه و نادرست است: عبارت HAVING به عنوان یک فیلتر پس از تجمیع برای گروهها عمل میکند و برای ساختن مرزهای محاسباتی متحرک کاملاً نامناسب است.
سوال ۲: اعتبارسنجی آماری و کنترل خطای نوع اول در تست A/B
یک تحلیلگر یک تست A/B روی جریان پرداخت پلتفرم جدید برای بهبود نرخ تبدیل اجرا میکند. تیم یک p-value معادل ۰.۰۳ نسبت به سطح معناداری تعیینشده (α) ۰.۰۵ محاسبه میکند. تیم مدیریت میخواهد ویژگی را فوراً به صورت جهانی عرضه کند، اما تحلیلگر هشدار میدهد که اندازه نمونه هنوز به توان (Power) هدف نرسیده است. این موضوع چه خطر خاصی ایجاد میکند؟
الف) احتمال بالای ارتکاب خطای نوع اول از طریق حفظ نادرست فرض صفر در حالی که تفاوت واقعی وجود دارد.
ب) ریسک بالای نتیجه مثبت کاذب به دلیل Data Snooping، در کنار افزایش احتمال خطای نوع دوم (Underpowered) اگر اندازه اثر واقعی کوچک باشد.
ج) تبدیل ساختاری فوری آزمایش از یک ارزیابی دو-دامنه به یک تحلیل واریانس یکطرفه.
د) ابطال کامل بازههای اطمینان زیرا انحراف معیار به طور خودکار به صفر کاهش مییابد.
ه) یک سوگیری سیستماتیک که در آن معیار تبدیل بدون هیچ همبستگی زیربنایی، دقیقاً با علیت منطبق میشود.
و) نیاز به تعویض کامل دادههای گروه کنترل با معیارهای خط پایه تاریخی از یک فصل متفاوت.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ب
دلیل صحت: متوقف کردن زودهنگام تست A/B زمانی که p-value قبل از رسیدن به اندازه نمونه برنامهریزی شده به زیر α میرسد، باعث ایجاد سوگیری شدید در انتخاب میشود که به عنوان Data Snooping یا "سرک کشیدن" شناخته میشود. این کار نرخ خطای نوع اول (مثبت کاذب) را به طور مصنوعی افزایش میدهد. علاوه بر این، اگر مطالعه به دلیل حجم کم نمونه دچار ضعف در توان (Underpowered) باشد، همزمان ریسک خطای نوع دوم (منفی کاذب) را افزایش میدهد، در صورتی که اثر واقعی جمعیت ظریف اما موجود باشد.
دلیل نادرستی گزینههای دیگر:
گزینه الف نادرست است: خطای نوع اول شامل رد کردن فرض صفر است در حالی که در واقعیت درست است، نه حفظ کردن آن.
گزینه ج نادرست است: اجرای آزمایش برای مدت کوتاهتر، به طور جادویی تست آماری پایه را به مدل ANOVA تبدیل نمیکند.
گزینه د نادرست است: اندازه نمونه بر خطای استاندارد تأثیر میگذارد، اما توقف زودهنگام باعث نمیشود انحراف معیار مجموعهداده به صفر برسد.
گزینه ه نادرست است: نادیده گرفتن کنترلهای مناسب توان آماری، روابط واقعی را میپوشاند و هرگز یک پیوند علیِ کامل و بهدستآمده ایجاد نمیکند.
گزینه و نادرست است: تعویض دادههای کنترل فعال با خطهای پایه تاریخی دلخواه، ماهیت تصادفی طراحی آزمایشی را باطل میکند.
سوال ۳: چالشهای تبدیل دادهها با مقادیر گمشده در خط لولههای پیشبینانه
قبل از آموزش یک مدل تحلیل پیشبینانه، تحلیلگری متوجه میشود که یک ویژگی پیوسته کلیدی به نام Customer_Income در ۱۲٪ از رکوردها دارای مقادیر گمشده است. مشخص میشود که این گمشودگی از نوع Missing at Random (MAR) است و همبستگی شدیدی با ویژگی Education_Level دارد. کدام استراتژی پاکسازی دادهها، عملکرد پیشبینانه را بدون ایجاد سوگیری در مدل، به بهترین شکل حفظ میکند؟
الف) حذف تمام ردیفهای حاوی مقدار گمشده برای ویژگی درآمد از مجموعهداده فعال.
ب) جایگزینی تمام مقادیر گمشده با یک مقدار جایگزین ثابت مانند ۰ یا ۱- در کل ستون.
ج) اجرای جایگزینی شرطی (Conditional Imputation) با محاسبه میانه درآمد گروهبندی شده در هر دسته سطح تحصیلات خاص.
د) تعویض مقادیر عددی گمشده با مُد (Mode) کلی ویژگیهای دستهای متنی.
ه) استفاده از استراتژی Forward-fill که دادهها را مستقیماً از ردیفهای مجاور بدون توجه به گروهبندی دموگرافیک کپی میکند.
و) حذف کل ستون سطح تحصیلات از مدل برای مجبور کردن خط لوله به نادیده گرفتن رکوردهای گمشده.
پاسخ صحیح و توضیحات:
پاسخ صحیح: ج
دلیل صحت: چون دادههای گمشده از الگوی MAR پیروی میکنند که به یک ویژگی شناخته شده دیگر (سطح تحصیلات) مرتبط است، جایگزینی شرطی با استفاده از میانههای محلی به حفظ توزیع داخلی دادهها کمک میکند. این کار از دست رفتن ۱۲٪ از حجم آموزش خط لوله پیشبینانه را جلوگیری کرده و در عین حال از اعوجاجهایی که یک میانگین کلی یا جایگزین صفر دلخواه ایجاد میکند، اجتناب مینماید.
دلیل نادرستی گزینههای دیگر:
گزینه الف نادرست است: حذف ۱۲٪ از ردیفها حجم آموزش را محدود میکند، سوگیری شدید در انتخاب ایجاد میکند و دقت کلی مدل را کاهش میدهد.
گزینه ب نادرست است: جایگزینی یک ثابت دلخواه مانند ۰ یک پیک مصنوعی بزرگ در توزیع ایجاد میکند که ضرایب رگرسیون بعدی را منحرف میکند.
گزینه د نادرست است: شما نمیتوانید مُد یک ستون دستهای متنی را در یک متغیر عددی پیوسته مانند درآمد قرار دهید.
گزینه ه نادرست است: استراتژیهای Forward-fill برای ردیابی سریهای زمانی متوالی طراحی شدهاند؛ اعمال آنها روی ردیفهای جدولی غیرمرتبط، مقادیر تصادفی و نامعتبر ایجاد میکند.
گزینه و نادرست است: حذف ستون پیشبین با همبستگی بالا، بافت مفید را از بین میبرد و قدرت تبیینی کلی مدل را بدون حل مشکل اصلی دادههای گمشده کاهش میدهد.
چه انتظاراتی داشته باشید
به آزمونهای سوالات مصاحبه خوش آمدید تا شما را برای آزمون تمرینی سوالات مصاحبه تحلیلگر داده آماده کنیم.
شما میتوانید هر تعداد بار که بخواهید در آزمونها شرکت کنید.
این یک بانک سوالات اصلی و بسیار حجیم است.
اگر سوالی داشته باشید، از پشتیبانی مدرسان بهرهمند خواهید شد.
هر سوال دارای یک توضیح مفصل است.
سازگار با موبایل از طریق اپلیکیشن یودمی.
امیدواریم تا الان متقاعد شده باشید! سوالات بسیار بیشتری در داخل دوره وجود دارد.
Interview Questions Tests
مربی در Udemy
نمایش نظرات