Build your ultimate AI agent
รายละเอียดคอร์ส
เรียนรู้การรู้จำเสียงพูดและการประมวลผลภาษาพูดด้วย Python
เราเรียนรู้ที่จะพูดก่อนที่จะเรียนรู้ที่จะอ่านเสียอีก แม้ในยุคดิจิทัล วิธีหลักในการสื่อสารของเราก็คือการพูด Spoken Language Processing ใน Python จะช่วยให้คุณโหลด แปลง และถอดเสียงไฟล์เสียงได้ คุณจะเริ่มต้นด้วยการดูว่าเสียงดิบมีลักษณะอย่างไรใน Python จากนั้นจะไปสำรวจไลบรารีที่ได้รับความนิยมและทำงานผ่านกรณีการใช้งานทางธุรกิจตัวอย่างใช้ Python SpeechRecognition และ PyDub เพื่อถอดเสียงไฟล์เสียง
Python มีไลบรารีที่ได้รับความนิยมหลายตัวซึ่งช่วยให้คุณประมวลผลภาษาพูดได้ SpeechRecognition ช่วยให้คุณผสานรวมกับ API แปลงเสียงเป็นข้อความได้อย่างง่ายดาย ขณะที่ PyDub ช่วยให้คุณปรับเปลี่ยนคุณสมบัติของไฟล์เสียงด้วยโปรแกรม เพื่อเตรียมไฟล์ให้พร้อมสำหรับการถอดเสียง ไลบรารีแต่ละรายการเหล่านี้ได้รับการครอบคลุมในบทที่เจาะลึก เปิดโอกาสให้คุณได้นำทฤษฎีไปใช้จริงเพื่อเสริมสร้างความรู้ของคุณให้มั่นคงยิ่งขึ้นฝึกถอดเสียงพูดด้วยโปรเจกต์ภายในคอร์ส
บทสุดท้ายของหลักสูตรนี้เปิดโอกาสให้คุณนำทุกสิ่งที่ได้เรียนรู้มารวมกัน ด้วยการสร้างต้นแบบการประมวลผลเสียงพูดสำหรับบริษัทเทคโนโลยีสมมติ คุณจะสร้างระบบที่ถอดเสียงเสียงการสนทนาทางโทรศัพท์เป็นข้อความ จากนั้นทำการวิเคราะห์ความรู้สึกเพื่อทบทวนการโทรศัพท์ฝ่ายสนับสนุนลูกค้าเมื่อจบหลักสูตรนี้ คุณจะมีทั้งความรู้และประสบการณ์ลงมือปฏิบัติจริง เพื่อสามารถนำสิ่งที่เรียนไปใช้ได้จริงในงานของคุณหรือโปรเจกต์ส่วนตัวของคุณ
ข้อกำหนดเบื้องต้น
หลักสูตร
โครงสร้างคอร์ส
1
แนะนำ Spoken Language Processing ด้วย Python
ไฟล์เสียงแตกต่างจากข้อมูลประเภทอื่นอยู่มาก ก่อนจะนำไปใช้งานได้ จำเป็นต้องผ่านการเตรียมข้อมูลเบื้องต้นก่อน ในบทนี้จะได้เรียนรู้ขั้นตอนแรกของการทำงานกับไฟล์เสียง โดยแปลงไฟล์เสียงสองรูปแบบให้อยู่ในรูปคลื่นเสียง แล้วนำมาเปรียบเทียบกันในเชิงภาพ
- ข้อมูลเสียงเบื้องต้นใน Python50 XP
- หน่วยวัดความถี่ที่ถูกต้อง50 XP
- นำเข้าไฟล์เสียงด้วย Python100 XP
- การแปลงไบต์ของคลื่นเสียงเป็นจำนวนเต็ม50 XP
- ชนิดข้อมูลที่ถูกต้อง50 XP
- แปลง Bytes เป็น Integers100 XP
- การหาค่าตำแหน่งเวลา100 XP
- การแสดงผลคลื่นเสียง50 XP
- รักษาความสอดคล้องของข้อมูล50 XP
- การประมวลผลข้อมูลเสียงด้วย Python100 XP
2
การใช้ไลบรารี SpeechRecognition ของ Python
การรู้จำเสียงพูดยังห่างไกลจากความสมบูรณ์แบบ แต่ไลบรารี SpeechRecognition ช่วยให้เชื่อมต่อกับ API แปลงเสียงเป็นข้อความได้หลายตัวอย่างสะดวก ในส่วนนี้จะได้เรียนรู้วิธีใช้ไลบรารี SpeechRecognition เพื่อเริ่มแปลงภาษาพูดในไฟล์เสียงให้เป็นข้อความได้อย่างรวดเร็ว
3
การจัดการไฟล์เสียงด้วย PyDub
ไฟล์เสียงไม่ได้มาในรูปแบบ ขนาด หรือฟอร์แมตเดียวกันเสมอไป โชคดีที่ไลบรารี PyDub ของ James Robert มีเครื่องมือที่ช่วยปรับแต่งคุณสมบัติต่าง ๆ ของไฟล์เสียงด้วยโค้ด ไม่ว่าจะเป็นเฟรมเรต จำนวนช่องสัญญาณ ฟอร์แมตไฟล์ และอื่น ๆ ในบทนี้จะได้เรียนรู้การใช้ไลบรารีนี้เพื่อจัดเตรียมไฟล์เสียงทั้งหมดให้พร้อมสำหรับการถอดความ
4
การประมวลผลข้อความที่ถอดจากภาษาพูด
ในบทนี้จะนำทุกสิ่งที่ได้เรียนมารวมกัน เพื่อสร้างโปรเจกต์ต้นแบบด้านการประมวลผลเสียงพูดสำหรับบริษัทเทคโนโลยีแห่งหนึ่งชื่อ Acme Studios โดยเริ่มจากการถอดความตัวอย่างไฟล์เสียงการโทรศัพท์ฝ่ายบริการลูกค้าให้เป็นข้อความ จากนั้นจะทำการวิเคราะห์ความรู้สึกด้วย NLTK การรู้จำชื่อเฉพาะด้วย spaCy และการจำแนกประเภทข้อความด้วย scikit-learn บนข้อความที่ถอดความได้
Spoken Language Processing ด้วย Python
เรียนจบแล้ว

