Build your ultimate AI agent
कोर्स विवरण
इंटरनेट पर बिखरी जानकारी को हासिल करने और पार्स करने वाले टूल बनाना डेटा साइंस की कई दिशाओं में पहले से ही अहम रहा है और आज भी है। इस कोर्स में, आप HTML कोड को नेविगेट और पार्स करना सीखेंगे, और ऐसी स्क्रिप्ट्स बनाएँगे जो वेबसाइट्स को अपने-आप क्रॉल कर सकें। हालाँकि हम अपना स्क्रैपिंग काम बहुउपयोगी Python लाइब्रेरी scrapy से करेंगे, लेकिन इस कोर्स में सीखी गई कई तकनीकें अन्य लोकप्रिय Python लाइब्रेरियों, जैसे BeautifulSoup और Selenium, पर भी लागू होती हैं। कोर्स के अंत तक, आपके पास HTML संरचना का मजबूत मानसिक मॉडल होगा, आप HTML कोड पार्स करके मनचाही जानकारी निकाल पाएँगे, और बड़े पैमाने पर वेब क्रॉल करने के लिए एक साधारण scrapy स्पाइडर बना पाएँगे।
पूर्वापेक्षाएँ
पाठ्यक्रम
कोर्स रूपरेखा
1
HTML परिचय
HTML की संरचना जानें। शुरुआत में हम समझाएँगे कि वेब स्क्रैपिंग आपके डेटा साइंस टूलबॉक्स में उपयोगी जोड़ क्यों है, और फिर HTML की कुछ बुनियादी बातें देखेंगी। अध्याय के अंत में हम XPath नोटेशन का छोटा परिचय देंगे, जिसका उपयोग HTML कोड के भीतर एलिमेंट्स को नेविगेट करने के लिए किया जाता है।
2
XPaths और Selectors
XPath सिंटैक्स का उपयोग करके scrapy selectors को एक्सप्लोर करें। ये दोनों अवधारणाएँ आपको एक HTML डॉक्यूमेंट को स्क्रैप करने के काबिल बनाती हैं।
3
CSS Locators, Chaining, और Responses
CSS Locator सिंटैक्स सीखें और XPath के साथ CSS Locators को चेन करने के विचार को आज़माना शुरू करें। हम Response ऑब्जेक्ट्स भी पेश करते हैं, जो Selectors की तरह काम करते हैं लेकिन हमें कई वेबसाइट्स पर अपनी स्क्रैपिंग को आगे बढ़ाने के लिए अतिरिक्त टूल देते हैं।
4
Spiders
scrapy के साथ वेब क्रॉलर बनाना सीखें। ये scrapy स्पाइडर्स कई पेजों पर लिंक फॉलो करते हुए वेब को क्रॉल करेंगे, और पिछले अध्यायों में सीखी प्रक्रियाओं के अनुसार हर पेज को अपने-आप स्क्रैप करेंगे।
Python में Web Scraping
कोर्स
पूरा

