शुरुआत
एक सवाल से शुरू करता हूँ — इस स्टेज पर linear algebra और statistics क्यों पढ़ रहा हूँ?
जवाब सीधा है। AI हर industry में आ चुका है। Fraud detection, automation, customer service, decision support — हर जगह models चल रहे हैं या चलने वाले हैं। और मैंने notice किया कि इन conversations में दो तरह के लोग होते हैं: वो जो अपना domain समझते हैं लेकिन technology नहीं, और वो जो technology समझते हैं लेकिन domain नहीं।
पहली category वाले meeting में बैठकर सिर हिलाते हैं। दूसरी category वाले technically सही solution बना देते हैं जो असली problem solve नहीं करता।
मुझे तीसरी category में जाना है।
पहले मैंने shortcut try किया था
ईमानदारी से — मैंने सीधे tools से शुरुआत की थी।
ChatGPT, Claude, कुछ no-code platforms। Prompt लिखो, output लो। कुछ हफ्ते तक लगा कि काम बन रहा है। Demos अच्छे लग रहे थे।
फिर एक meeting में किसी ने पूछा — “यह model गलत जवाब कब देगा?”
मेरे पास जवाब नहीं था। मुझे यह भी नहीं पता था कि जवाब कहाँ से ढूँढा जाए।
यही वो moment था। Tool चलाना और tool समझना — दो अलग चीज़ें हैं। पहला एक हफ्ते में आ जाता है। दूसरे में महीने लगते हैं। और असली value दूसरे में है, क्योंकि पहला तो कोई भी कर लेगा।
Maths को skip क्यों नहीं कर सकते
यह सबसे common सवाल है, और मेरा जवाब बदल चुका है।
पहले मुझे लगता था maths एक formality है — जैसे कोई पुराना syllabus जो किसी ने हटाया नहीं। Library import कीजिए, model.fit() लिखिए, काम हो गया। बीच में क्या हुआ, कौन पूछता है।
समस्या तब आती है जब model कुछ अजीब करता है। और वो करेगा।
Model बोलता है इस region में fraud ज़्यादा है। सही है या data की गड़बड़ है? Model 94% accuracy दिखा रहा है — शानदार लगता है, जब तक आपको पता न चले कि सिर्फ 6% claims fraudulent हैं, यानी “कोई fraud नहीं है” कहने वाला model भी 94% पर पहुँच जाता।
इन सवालों के जवाब library में नहीं हैं। नींव में हैं।
दूसरी बात — बिना नींव के आप हमेशा किसी और पर depend रहेंगे। जो vendor demo दे रहा है, जो consultant deck बना रहा है, जो data scientist number बता रहा है। उनमें से ज़्यादातर ईमानदार हैं। लेकिन आपको फर्क करना आना चाहिए।
Plan क्या है
छह महीने। तीन हिस्से।
पहला हिस्सा — Maths की नींव
Linear algebra: vectors, matrices, transformations। यह वो भाषा है जिसमें data लिखा जाता है। हर customer एक vector है, हर model एक transformation।
Statistics: probability, distributions, hypothesis testing, regression। यह वो भाषा है जिसमें uncertainty की बात होती है। “यह फर्क असली है या संयोग” — इसका जवाब यहीं से आता है।
यह हिस्सा सबसे boring है और सबसे ज़रूरी। ज़्यादातर लोग यहीं छोड़ देते हैं। मैं भी छोड़ना चाहता था।
दूसरा हिस्सा — Python और असली data
Colab में code। Pandas, numpy, scipy, matplotlib।
यहाँ एक चीज़ जल्दी समझ आई — असली मेहनत code लिखने में नहीं है। Test चलाने का code तीन line का है। मेहनत data को सही shape में लाने की है। Missing values, गलत dates, एक ही चीज़ के चार अलग spellings। यही 80% काम है, और यही किसी tutorial में नहीं सिखाया जाता।
तीसरा हिस्सा — Models बनाना
Logistic regression से शुरुआत। “हाँ या नहीं” वाले सवालों के लिए — approve होगा या नहीं, fraud है या नहीं, customer छोड़ेगा या नहीं।
फिर decision trees, ensemble methods। और साथ में वो हिस्सा जो असल में सबसे ज़रूरी है — model को कैसे judge करें। Accuracy अकेले झूठ बोलती है। Precision, recall, confusion matrix — ये असली numbers हैं।
दिन कैसा दिखता है
Realistic रहते हैं। Full-time job है। कोई 6 घंटे नहीं मिलते।
रोज़ एक घंटा, ज़्यादातर सुबह। Weekend पर दो-तीन घंटे, जब code लिखना हो।
एक घंटे में यह होता है: एक नया concept, दो-तीन problems हाथ से, और फिर वही चीज़ अपने शब्दों में लिखना। तीसरा हिस्सा सबसे ज़रूरी निकला — जब तक लिखने न बैठो, लगता रहता है समझ आ गया।
कागज़ और pen रखता हूँ। Matrix screen पर देखना और खुद हाथ से लिखना — बहुत फर्क है। मैंने column और row वाली गलती इसीलिए पकड़ी क्योंकि हाथ से लिखा था।
यह blog क्या है
यह expert का course नहीं है। मैं खुद सीख रहा हूँ, साथ-साथ लिख रहा हूँ।
हर post में उस दिन का concept होगा — इस तरह explain किया हुआ कि आप भी समझ सकें। एक example, एक practice problem, और जहाँ मैं अटका वो भी।
गलतियाँ नहीं छुपाऊँगा। यह decision सोच-समझकर लिया है।
ज़्यादातर learning content ऐसे लिखा जाता है जैसे लेखक को कभी कुछ मुश्किल नहीं लगा। सब कुछ साफ, सीधा, आसान। पढ़ने वाला अटकता है तो सोचता है — शायद मैं ही slow हूँ।
असल में हर कोई अटकता है। बस कोई लिखता नहीं।
तो जब मैं matrix multiplication गलत करूँगा — और कर चुका हूँ — वो post में रहेगा। पूरी calculation के साथ, यह भी कि मैंने क्या सोचकर गलत किया। मेरे हिसाब से वही सबसे काम का हिस्सा है।
किसके लिए है
अगर आप technical नहीं हैं लेकिन AI समझना चाहते हैं — यह आपके लिए है। मैं भी वहीं से आ रहा हूँ। कोई भी चीज़ बिना समझाए इस्तेमाल नहीं करूँगा।
अगर आप शुरुआत कर रहे हैं — साथ चलिए। एक साथ सीखना अकेले सीखने से आसान है।
अगर आप पहले से data scientist हैं — शायद कुछ नया न मिले। लेकिन अगर मैं कहीं गलत हूँ, ज़रूर बताइए। मैं सीख रहा हूँ, correction का स्वागत है।
जो मुझे उम्मीद है
यह उम्मीद नहीं है कि छह महीने में मैं data scientist बन जाऊँगा। नहीं बनूँगा। जो लोग साल लगाते हैं उनकी depth अलग होती है।
यह उम्मीद है कि मैं सही सवाल पूछ सकूँ। किसी model का output देखकर बता सकूँ कि यह भरोसे लायक है या नहीं। Vendor की demo में गड़बड़ पकड़ सकूँ। छोटा सा कुछ खुद बना सकूँ — जो चले, भले खूबसूरत न हो।
तीन-चार असली solutions बनाने का target है। Tutorial copy करके नहीं — असली problem, असली data, असली output। एक भी चल गया तो पूरी exercise वसूल।
एक बात और
मैं यह public में लिख रहा हूँ, private notebook में नहीं। इसकी वजह है।
Private में लिखो तो आधा-अधूरा समझकर आगे बढ़ जाना आसान है। खुद को धोखा देना आसान है। लेकिन जब पता हो कि कोई पढ़ेगा, तो ठीक से समझना पड़ता है। अस्पष्ट लिखना पकड़ में आ जाता है।
तो यह blog आपके लिए भी है, और मेरे लिए भी। शायद मेरे लिए ज़्यादा।
अगली post
Linear algebra से शुरुआत। Matrix असल में करता क्या है — बिना formula के, पहले intuition। चार numbers का box देखकर यह बताना कि पूरा graph paper कैसे खिंचेगा।
चलिए शुरू करते हैं।
Hi, this is a comment.
To get started with moderating, editing, and deleting comments, please visit the Comments screen in the dashboard.
Commenter avatars come from Gravatar.