Build your ultimate AI agent
รายละเอียดคอร์ส
ความสามารถในการสร้างเครื่องมือสำหรับดึงและแยกวิเคราะห์ข้อมูลจากอินเทอร์เน็ตเป็นทักษะที่มีคุณค่าในงาน data science มาโดยตลอด และยังคงเป็นเช่นนั้นต่อไป ในคอร์สนี้ จะได้เรียนรู้การนำทางและแยกวิเคราะห์โค้ด HTML รวมถึงสร้างเครื่องมือสำหรับ crawl เว็บไซต์โดยอัตโนมัติ แม้การ scraping ในคอร์สนี้จะใช้ไลบรารี Python ที่ยืดหยุ่นอย่าง scrapy แต่เทคนิคหลายอย่างที่ได้เรียนรู้สามารถนำไปประยุกต์ใช้กับไลบรารี Python ยอดนิยมอื่น ๆ ได้ด้วย ไม่ว่าจะเป็น BeautifulSoup หรือ Selenium เมื่อเรียนจบคอร์สนี้ จะมีความเข้าใจอย่างลึกซึ้งเกี่ยวกับโครงสร้าง HTML สามารถสร้างเครื่องมือสำหรับแยกวิเคราะห์โค้ด HTML และเข้าถึงข้อมูลที่ต้องการได้ รวมถึงสร้าง scrapy spider อย่างง่ายสำหรับ crawl เว็บในระดับขนาดใหญ่
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
HTML เบื้องต้น
เรียนรู้โครงสร้างของ HTML เริ่มต้นด้วยการอธิบายว่าเหตุใด web scraping จึงเป็นทักษะที่มีประโยชน์ในการทำงาน data science จากนั้นเจาะลึกพื้นฐานของ HTML และปิดท้ายบทด้วยการแนะนำ XPath notation ซึ่งใช้สำหรับนำทางภายในองค์ประกอบต่าง ๆ ของโค้ด HTML
- ภาพรวมของ Web Scraping50 XP
- Web scraping ไม่ใช่เรื่องไร้สาระ!50 XP
- HyperText Markup Language50 XP
- การนำทางใน HTML Tree ด้วยคำอธิบาย50 XP
- จาก Tree สู่ HTML100 XP
- แอตทริบิวต์50 XP
- ทำความรู้จัก Class100 XP
- การค้นหา href50 XP
- XPath แบบเร่งรัด50 XP
- ฉันอยู่ที่ไหน?100 XP
- ถึงเวลาของ P แล้ว100 XP
- span แบบมี class100 XP
2
XPath และ Selector
ใช้ syntax ของ XPath เพื่อสำรวจ scrapy selector ทั้งสองแนวคิดนี้จะช่วยให้พร้อมสำหรับการ scrape เอกสาร HTML ได้อย่างมีประสิทธิภาพ
3
CSS Locator, การเชื่อมต่อ, และ Response
เรียนรู้ syntax ของ CSS Locator และเริ่มทดลองเชื่อมต่อ CSS Locator กับ XPath เข้าด้วยกัน พร้อมทั้งแนะนำ Response object ซึ่งทำงานคล้าย Selector แต่มีเครื่องมือเพิ่มเติมที่ช่วยขยายการ scraping ไปยังหลายเว็บไซต์ได้
4
Spider
เรียนรู้การสร้าง web crawler ด้วย scrapy โดย scrapy spider เหล่านี้จะ crawl เว็บผ่านหลายหน้า ติดตามลิงก์เพื่อ scrape แต่ละหน้าโดยอัตโนมัติตามกระบวนการที่ได้เรียนรู้ในบทก่อนหน้า
Web Scraping ด้วย Python
เรียนจบแล้ว

