डेटा साइंस इंटरव्यू प्रश्न: क्या अपेक्षा करें और कैसे तैयारी करें
एक डेटा साइंस इंटरव्यू लूप कैसा दिखता है
डेटा साइंस इंटरव्यू प्रश्न अधिकांश भूमिकाओं से अधिक भिन्न होते हैं क्योंकि काम स्वयं भिन्न होता है। तैयारी से पहले, स्पष्ट करें कि आप किस प्रकार की DS भूमिका लक्षित कर रहे हैं:
- प्रोडक्ट/एप्लाइड DS: मेट्रिक्स, A/B परीक्षण, SQL और प्रोडक्ट समझ पर भारी
- ML इंजीनियरिंग-आसन्न DS: फीचर इंजीनियरिंग, मॉडल परिनियोजन, प्रयोग डिज़ाइन
- रिसर्च DS: सांख्यिकी, ML सिद्धांत, एल्गोरिदम डिज़ाइन
अधिकांश लूप में 4–5 राउंड शामिल होते हैं: एक तकनीकी स्क्रीन (सांख्यिकी + संभाव्यता), SQL/कोडिंग, प्रोडक्ट/व्यावसायिक केस, ML मूल बातें, और व्यवहारिक। मिश्रण जानना आपको तैयारी के समय को ठीक से आवंटित करने देता है।
डेटा साइंस इंटरव्यू प्रश्न: तकनीकी राउंड
सांख्यिकी और संभाव्यता
ये प्रश्न आपकी सांख्यिकीय अंतर्ज्ञान का परीक्षण करते हैं, सूत्रों को याद करने की आपकी क्षमता का नहीं।
सामान्य प्रश्न प्रकार:
- p-मान और विश्वास अंतराल को बिना शब्दजाल के समझाएँ
- किसी विशिष्ट उत्पाद परिवर्तन के लिए एक A/B परीक्षण डिज़ाइन करें
- टाइप I और टाइप II त्रुटियों के बीच अंतर क्या है और प्रत्येक कब अधिक मायने रखता है?
कुंजी: हमेशा सांख्यिकीय अवधारणाओं को व्यावसायिक निर्णयों से जोड़ें। "कम महत्व सीमा टाइप I त्रुटियों को कम करती है — कम झूठे सकारात्मक — जो तब मायने रखता है जब झूठे संकेत पर कार्य करने की लागत अधिक हो, जैसे एक फीचर जारी करना जो रिटेंशन को खराब करता है।"
SQL और कोडिंग
प्रोडक्ट DS भूमिकाओं के लिए, SQL अक्सर प्राथमिक तकनीकी स्क्रीन है। अपेक्षा करें:
- विंडो फ़ंक्शन (RANK, LAG, LEAD)
- कोहोर्ट विश्लेषण क्वेरी
- सेल्फ-जॉइन और CTE
- शर्तों के साथ समुच्चयन (CASE WHEN)
ML-आसन्न भूमिकाओं के लिए, Python कोडिंग सामान्य है: ग्रेडिएंट डिसेंट चरण लागू करें, खरोंच से k-means फ़ंक्शन लिखें, या एक pandas DataFrame में हेरफेर करें।
ML मूल बातें
इंटरव्यू लेने वाले परीक्षण करते हैं कि क्या आप मॉडल के पीछे की अंतर्ज्ञान समझते हैं, न कि केवल sklearn.fit() को कैसे कॉल करें।
तैयार रहने के लिए प्रश्न:
- मुझे बताइए कि ग्रेडिएंट बूस्टिंग कैसे काम करता है
- आप रैंडम फ़ॉरेस्ट के ऊपर लॉजिस्टिक रिग्रेशन कब उपयोग करेंगे?
- आपके मॉडल की उच्च सटीकता है लेकिन व्यवसाय खुश नहीं है — क्या गलत हो सकता है?
- आप वर्ग असंतुलन को कैसे संभालते हैं?
- नियमितीकरण समझाएँ और L1 बनाम L2 कब उपयुक्त है
जाल: गणित को अति-समझाना। वे चाहते हैं: "L1 वज़न को शून्य तक लाकर विरल मॉडल उत्पन्न करता है — बेहतर जब आपको संदेह हो कि केवल कुछ फीचर मायने रखते हैं। L2 वज़न को अधिक समान रूप से फैलाता है — बेहतर जब अधिकांश फीचर कुछ योगदान देते हैं।"
प्रोडक्ट और व्यावसायिक केस प्रश्न
यहीं तकनीकी रूप से मज़बूत DS उम्मीदवार अक्सर लड़खड़ाते हैं। इंटरव्यू लेने वाला यहाँ आपके SQL कौशल का परीक्षण नहीं कर रहा — वे आपके व्यावसायिक विवेक का परीक्षण कर रहे हैं।
मेट्रिक परिभाषा प्रश्न
"आप एक नए अनुशंसा फीचर की सफलता कैसे मापेंगे?"
केवल एक मेट्रिक का नाम न दें। इसे संरचित करें:
- हम किस व्यवहार को बढ़ाने की कोशिश कर रहे हैं? (लंबे सत्र, अधिक खरीदारी)
- प्राथमिक मेट्रिक क्या है? (अनुशंसाओं पर क्लिक-थ्रू दर)
- गार्डरेल मेट्रिक्स क्या हैं? (हमें सत्र गुणवत्ता की कीमत पर CTR को अनुकूलित नहीं करने दें)
- कौन से प्रति-मेट्रिक खेल के खिलाफ सुरक्षा करते हैं? (यदि CTR बढ़ता है लेकिन रूपांतरण घटता है, तो हम उपयोगकर्ताओं को गुमराह कर रहे हैं)
प्रयोग डिज़ाइन प्रश्न
"आप चेकआउट फ़्लो में बदलाव के लिए एक A/B परीक्षण कैसे चलाएँगे?"
कवर करें: यादृच्छिकरण इकाई (उपयोगकर्ता बनाम सत्र), नियंत्रण/उपचार विभाजन, न्यूनतम पता लगाने योग्य प्रभाव, परीक्षण अवधि, विश्लेषण विधि, और आप नवीनता प्रभाव पूर्वाग्रह को कैसे संभालेंगे।
व्यवहारिक प्रश्न: जहाँ DS उम्मीदवार मेज़ पर अंक छोड़ते हैं
अधिकांश DS उम्मीदवार अपनी तैयारी का 90% तकनीकी प्रश्नों पर खर्च करते हैं और व्यवहारिक राउंड के लिए कम तैयार दिखते हैं। यह एक गलती है — वरिष्ठ स्तरों पर, व्यवहारिक राउंड उन्मूलन राउंड हैं, औपचारिकताएँ नहीं।
डेटा वैज्ञानिकों के लिए मुख्य व्यवहारिक प्रश्न कुछ ऐसा है:
"एक ऐसा समय बताइए जब आपके विश्लेषण ने एक व्यावसायिक निर्णय को प्रभावित किया।"
कमज़ोर उत्तर: "मैंने एक चर्न भविष्यवाणी मॉडल बनाया और हमने इसका उपयोग जोखिम-में उपयोगकर्ताओं को लक्षित करने के लिए किया।"
मज़बूत उत्तर: "हमारी रिटेंशन टीम अपने आउटरीच बजट का 40% उन उपयोगकर्ताओं पर खर्च कर रही थी जो वास्तव में जोखिम में नहीं थे — केवल कम गतिविधि वाले। मैंने एक चर्न मॉडल बनाया जो रद्द करने के इरादे के वास्तविक संकेतों को प्राकृतिक निष्क्रियता से पहचानता था। हमने मॉडल का उपयोग करके आउटरीच सूची को विभाजित किया। एक तिमाही के भीतर, हमने 35% कम आउटरीच लागत के साथ समान रिटेंशन परिणाम देखे। मॉडल की सटीकता (प्रेसिजन) यहाँ रिकॉल से अधिक महत्वपूर्ण थी क्योंकि हम पहुँच पर नहीं, बजट पर सीमित थे।"
अंतर: मज़बूत उत्तर व्यावसायिक प्रभाव को संख्यात्मक बनाता है, ट्रेडऑफ़ विवेक की व्याख्या करता है, और तकनीकी निर्णय को व्यावसायिक बाधाओं से जोड़ता है।
48-घंटे का इंटरव्यू-पूर्व चेकलिस्ट
- 10 सबसे सामान्य संभाव्यता ब्रेन टीज़र की समीक्षा करें (Monty Hall, सिक्का उछाल, जन्मदिन समस्या)
- अपना रिज़्यूमे फिर से पढ़ें और आपके द्वारा सूचीबद्ध हर प्रोजेक्ट पर गहराई से जाने के लिए तैयार रहें
- संख्यात्मक व्यावसायिक प्रभाव के साथ 2–3 व्यवहारिक कहानियाँ तैयार करें
- SQL विंडो फ़ंक्शन की समीक्षा करें — वे लगभग हर DS स्क्रीन में दिखाई देते हैं
- बुनियादी प्रयोग डिज़ाइन चेकलिस्ट को अच्छी तरह जानें
इसे अभी अभ्यास करें
तकनीकी तैयारी आवश्यक है लेकिन पर्याप्त नहीं है। व्यावसायिक और व्यवहारिक राउंड वे हैं जहाँ इंटरव्यू हारे जाते हैं — और उन्हें लाइव रिप की आवश्यकता होती है।