Build your ultimate AI agent
รายละเอียดคอร์ส
ในคอร์สนี้ คุณจะได้เรียนรู้เทคนิคการดึงข้อมูลที่มีประโยชน์จากข้อความ และแปลงข้อมูลเหล่านั้นให้อยู่ในรูปแบบที่เหมาะสมสำหรับการนำ ML มาใช้งาน โดยเฉพาะอย่างยิ่ง จะได้เรียนรู้เรื่อง POS tagging, named entity recognition, คะแนนความอ่านง่าย, โมเดล n-gram และ tf-idf รวมถึงวิธีนำไปใช้งานด้วย scikit-learn และ spaCy นอกจากนี้ยังจะได้เรียนรู้วิธีวัดความคล้ายคลึงระหว่างเอกสารสองชิ้น ตลอดคอร์สจะได้ฝึกทำนายความรู้สึกของรีวิวภาพยนตร์ และสร้างระบบแนะนำภาพยนตร์กับ TED Talk เมื่อจบคอร์ส คุณจะสามารถสร้าง feature ที่สำคัญจากข้อความใด ๆ และแก้ปัญหาที่ท้าทายที่สุดบางอย่างใน data science ได้!
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
Feature พื้นฐานและคะแนนความอ่านง่าย
เรียนรู้วิธีคำนวณ feature พื้นฐาน เช่น จำนวนคำ จำนวนตัวอักษร ความยาวเฉลี่ยของคำ และจำนวนอักขระพิเศษ (เช่น แฮชแท็กและการกล่าวถึงใน Twitter) นอกจากนี้ยังจะได้เรียนรู้วิธีคำนวณคะแนนความอ่านง่าย เพื่อประเมินระดับการศึกษาที่จำเป็นสำหรับการทำความเข้าใจข้อความแต่ละชิ้น
- แนะนำการสกัดคุณลักษณะสำหรับ NLP50 XP
- รูปแบบข้อมูลสำหรับอัลกอริทึม ML50 XP
- One-hot encoding100 XP
- การดึงคุณลักษณะพื้นฐาน50 XP
- การนับจำนวนตัวอักษรในทวีตภาษารัสเซีย100 XP
- จำนวนคำในการบรรยาย TED100 XP
- แฮชแท็กและการกล่าวถึงในทวีตภาษารัสเซีย100 XP
- การทดสอบความสามารถในการอ่าน50 XP
- ความสามารถในการอ่าน 'The Myth of Sisyphus'100 XP
- ความอ่านง่ายของสิ่งพิมพ์ประเภทต่าง ๆ100 XP
2
การประมวลผลข้อความ, POS tagging และ NER
ในบทนี้จะได้เรียนรู้เรื่อง tokenization และ lemmatization จากนั้นจะได้เรียนรู้วิธีทำความสะอาดข้อความ, part-of-speech tagging และ named entity recognition โดยใช้ไลบรารี spaCy เมื่อเข้าใจแนวคิดเหล่านี้แล้ว จะได้ฝึกแปลงสุนทรพจน์ Gettysburg ให้เครื่องอ่านได้, วิเคราะห์การใช้คำนามในข่าวปลอม และระบุบุคคลที่ถูกกล่าวถึงในบทความจาก TechCrunch
3
โมเดล N-Gram
เรียนรู้เรื่อง n-gram modeling และนำไปใช้วิเคราะห์ความรู้สึก (sentiment analysis) จากรีวิวภาพยนตร์
4
TF-IDF และคะแนนความคล้ายคลึง
เรียนรู้วิธีคำนวณค่าน้ำหนัก tf-idf และคะแนน cosine similarity ระหว่างเวกเตอร์สองตัว จากนั้นจะได้นำแนวคิดเหล่านี้ไปสร้างระบบแนะนำภาพยนตร์และ TED Talk และยังจะได้เรียนรู้เรื่อง word embeddings รวมถึงการใช้การแทนค่าด้วย word vector เพื่อคำนวณความคล้ายคลึงระหว่างเพลงของ Pink Floyd
Feature Engineering for NLP in Python
เรียนจบแล้ว

