Build your ultimate AI agent
Descrierea cursului
Învață recunoașterea vorbirii și procesarea limbajului vorbit în Python
Învățăm să vorbim cu mult înainte să învățăm să citim. Chiar și în era digitală, principalul nostru mod de comunicare este vorbirea. Procesarea limbajului vorbit în Python te va ajuta să încarci, să transformi și să transcrii fișiere audio. Vei începe prin a vedea cum arată audio-ul brut în Python, apoi vei explora biblioteci populare și vei parcurge un exemplu de caz de utilizare în business.Folosește Python SpeechRecognition și PyDub pentru a transcrie fișiere audio
Python are o serie de biblioteci populare care te ajută să procesezi limbajul vorbit. SpeechRecognition îți oferă o modalitate ușoară de a te integra cu API-uri speech-to-text, iar PyDub te ajută să modifici programatic atributele fișierelor audio pentru a le pregăti pentru transcriere. Fiecare dintre aceste biblioteci este acoperită într-un capitol detaliat, oferindu-ți oportunitatea de a pune teoria în practică pentru a-ți consolida cunoștințele.Exersează transcrierea vorbirii cu un proiect din curs
Ultimul capitol din acest curs îți oferă ocazia să pui cap la cap tot ce ai învățat, construind un proof of concept pentru procesarea vorbirii pentru o companie fictivă de tehnologie. Vei construi un sistem care transcrie audio-ul apelurilor telefonice în text și apoi efectuează analiză de sentiment pentru a evalua apelurile telefonice de suport pentru clienți.Până la finalul acestui curs, vei avea atât cunoștințele, cât și experiența practică necesare pentru a pune în aplicare ceea ce ai învățat în cadrul jobului tău sau în proiectele personale.
Cerințe prealabile
Curriculum
Structura cursului
1
Introducere în procesarea limbajului vorbit cu Python
Fișierele audio sunt diferite de majoritatea celorlalte tipuri de date. Înainte de a putea lucra cu ele, necesită o etapă de preprocesare. În acest capitol, vei învăța primii pași pentru a lucra cu fișiere audio: vei converti două fișiere audio diferite în unde sonore și le vei compara vizual.
- Introducere în datele audio în Python50 XP
- Frecvența potrivită50 XP
- Importarea unui fișier audio cu Python100 XP
- Conversia octeților undei sonore în numere întregi50 XP
- Tipul de date potrivit50 XP
- Din bytes în numere întregi100 XP
- Găsirea marcajelor de timp100 XP
- Vizualizarea undelor sonore50 XP
- Menținerea consistenței50 XP
- Procesarea datelor audio cu Python100 XP
2
Utilizarea bibliotecii SpeechRecognition în Python
Recunoașterea vorbirii este departe de a fi perfectă. Totuși, biblioteca SpeechRecognition oferă o modalitate simplă de a interacționa cu multe API-uri de conversie a vorbirii în text. În această secțiune, vei învăța cum să folosești biblioteca SpeechRecognition pentru a converti cu ușurință limbajul vorbit din fișierele tale audio în text.
3
Manipularea fișierelor audio cu PyDub
Nu toate fișierele audio au același format, dimensiune sau structură. Din fericire, biblioteca PyDub, creată de James Robert, îți pune la dispoziție instrumente cu care poți modifica programatic diferite atribute ale fișierelor audio, precum rata de cadre, numărul de canale, formatul fișierului și altele. În acest capitol, vei învăța cum să folosești această bibliotecă pentru a te asigura că toate fișierele tale audio sunt în formatul potrivit pentru transcriere.
4
Procesarea textului transcris din limbajul vorbit
În acest capitol, vei combina tot ce ai învățat pentru a construi un proiect demonstrativ de procesare a vorbirii pentru o companie de tehnologie, Acme Studios. Vei începe prin transcrierea fragmentelor audio din apelurile de asistență clienți în text. Apoi vei aplica analiza sentimentelor cu NLTK, recunoașterea entităților denumite cu spaCy și clasificarea textului cu scikit-learn pe textul transcris.
Procesarea limbajului vorbit în Python
Curs
finalizat

