Build your ultimate AI agent
Описание курса
Умение создавать инструменты для извлечения и обработки информации из интернета было и остаётся ценным навыком во многих областях науки о данных. В этом курсе вы научитесь ориентироваться в HTML-коде и разбирать его структуру, а также создавать инструменты для автоматического обхода сайтов. Скрапинг выполняется с помощью универсальной библиотеки Python — scrapy, однако большинство приёмов, которые вы освоите, применимы и к другим популярным библиотекам: BeautifulSoup и Selenium. По завершении курса вы будете хорошо понимать структуру HTML, сможете создавать инструменты для разбора HTML-кода и извлечения нужных данных, а также разрабатывать простых scrapy-пауков для масштабного обхода веба.
Предварительные требования
Программа
Структура курса
1
Введение в HTML
Изучите структуру HTML. Сначала мы объясним, почему веб-скрапинг — ценный инструмент в арсенале специалиста по данным, а затем рассмотрим основы HTML. В завершение главы вы познакомитесь с нотацией XPath, которая используется для навигации по элементам HTML-кода.
2
XPath и селекторы
Используйте синтаксис XPath для работы с селекторами scrapy. Оба этих инструмента помогут вам шаг за шагом овладеть навыком скрапинга HTML-документов.
3
CSS-локаторы, цепочки вызовов и объекты Response
Освойте синтаксис CSS-локаторов и научитесь объединять их с XPath в цепочки вызовов. Кроме того, в этой главе мы познакомим вас с объектами Response, которые работают подобно селекторам, но предоставляют дополнительные возможности для организации скрапинга сразу на нескольких сайтах.
4
Пауки
Научитесь создавать веб-краулеры с помощью scrapy. Эти пауки будут обходить несколько страниц, переходить по ссылкам и автоматически извлекать данные с каждой из них — применяя всё, что вы изучили в предыдущих главах.
Веб-скрапинг на Python
Курс
завершён

