Après avoir suivi ces cours, je me sens confiant dans la création de visualisations et de tableaux de bord professionnels.
Description du cours
Dans ce cours, vous apprendrez des techniques pour extraire des informations utiles d’un texte et les transformer dans un format adapté à l’application de modèles de ML. Plus précisément, vous verrez le POS tagging, la reconnaissance d’entités nommées, les scores de lisibilité, les modèles n-gram et tf-idf, ainsi que leur implémentation avec scikit-learn et spaCy. Vous apprendrez aussi à mesurer la similarité entre deux documents. Au fil des exercices, vous prédirez le sentiment de critiques de films et construirez des systèmes de recommandation pour des films et des TED Talks. À l’issue du cours, vous saurez concevoir des features essentielles à partir de n’importe quel texte et résoudre certaines des tâches les plus exigeantes de la data science !
Prérequis
Programme de formation
Plan du cours
1
Features de base et scores de lisibilité
Apprenez à calculer des features de base comme le nombre de mots, le nombre de caractères, la longueur moyenne des mots et le nombre de caractères spéciaux (comme les hashtags et mentions Twitter). Vous apprendrez également à calculer des scores de lisibilité et à déterminer le niveau d’études nécessaire pour comprendre un texte.
- Introduction à l’ingénierie des fonctionnalités pour le NLP50 XP
- Format des données pour les algorithmes de ML50 XP
- Encodage one-hot100 XP
- Extraction de caractéristiques de base50 XP
- Nombre de caractères des tweets russes100 XP
- Nombre de mots des conférences TED100 XP
- Hashtags et mentions dans des tweets en russe100 XP
- Tests de lisibilité50 XP
- Lisibilité de « Le Mythe de Sisyphe »100 XP
- Lisibilité de différentes publications100 XP
2
Prétraitement du texte, POS tagging et NER
Dans ce chapitre, vous découvrirez la tokenisation et la lemmatisation. Vous verrez ensuite comment effectuer le nettoyage de texte, l’étiquetage grammatical (part-of-speech) et la reconnaissance d’entités nommées avec la bibliothèque spaCy. Une fois ces notions maîtrisées, vous rendrez le discours de Gettysburg exploitable par machine, analyserez l’usage des noms dans de fausses informations et identifierez les personnes mentionnées dans un article de TechCrunch.
3
Modèles N-gram
Découvrez la modélisation n-gram et utilisez-la pour effectuer une analyse de sentiment sur des critiques de films.
4
TF-IDF et scores de similarité
Apprenez à calculer les pondérations tf-idf et le score de similarité cosinus entre deux vecteurs. Vous utiliserez ces notions pour construire un système de recommandation de films et de TED Talks. Enfin, vous découvrirez aussi les word embeddings et, à partir de représentations vectorielles de mots, vous calculerez des similarités entre différentes chansons de Pink Floyd.
Feature Engineering pour le NLP en Python
Cours
terminé

