Accéder au contenu principal

Les meilleurs articles que vous avez peut-être manqués le mois dernier

Cet article revient sur les principales actualités et mises à jour en science des données et apprentissage automatique survenues le mois dernier. Il couvre différents sujets : tutoriels, recherche, nouveaux packages, cas d’usage, et plus encore.
Actualisé 18 sept. 2026  · 7 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

La science des données est l’un des secteurs qui évoluent le plus vite. De nouveaux articles de recherche, packages, tutoriels et technologies voient le jour chaque jour, ce qui rend parfois la veille difficile. Pour tout praticien des données, rester à jour sur les dernières avancées est essentiel pour continuer à apprendre et progresser. Dans cet article, vous trouverez une sélection des actualités, tutoriels, travaux de recherche et analyses que vous avez peut-être manqués le mois dernier. 

Nouveaux tutoriels publiés

Deux méthodes pour créer des transformateurs sur mesure avec scikit-learn

Ce billet sur Towards Data Science propose un tutoriel accessible pour créer un transformateur personnalisé avec scikit-learn. Scikit-learn est l’un des packages les plus utilisés en science des données, et sans doute le plus populaire en apprentissage automatique. Il offre de nombreuses fonctionnalités de prétraitement comme le One-Hot Encoding, le MinMax Scaling, et bien plus. Il est toutefois parfois nécessaire d’utiliser des fonctions de prétraitement sur mesure plutôt que des fonctions prêtes à l’emploi comme OneHotEncoder. Ce tutoriel vous montre comment créer des transformateurs personnalisés dans scikit-learn afin de fluidifier le prétraitement des données pour le machine learning.

MLOps dans BigQuery ML avec Vertex AI

Au cours de l’année passée, les grandes entreprises technologiques ont réalisé de grands progrès en MLOps. Mettre des modèles d’apprentissage automatique en production demeure l’un des plus grands défis pour les équipes data. Cette vidéo propose un tutoriel rapide sur l’utilisation conjointe de Vertex AI et BigQuery ML sur Google Cloud pour construire un pipeline Vertex AI prêt pour la production.

Les nouveaux tutoriels Power BI de DataCamp

Avec le lancement de son parcours Data Analyst in Power BI en partenariat avec Microsoft, DataCamp a publié plusieurs tutoriels sur Power BI le mois dernier. Power BI est l’un des outils de business intelligence les plus répandus, et si votre entreprise utilise Microsoft Office, il y a de fortes chances que vous y ayez déjà accès. C’est aussi un excellent tremplin pour aller au-delà d’Excel et plonger davantage dans l’univers des données. Ces tutoriels couvrent l’ensemble de l’usage de Power BI, de la transition d’Excel vers Power BI, à un guide approfondi Power BI pour débutants, en passant par la modélisation des données dans Power BI, ainsi qu’un tutoriel sur les formules DAX de Power BI pour débutants. Vous pouvez également télécharger cette antisèche pratique pour accompagner votre progression. 

Recherches pionnières en apprentissage automatique

DALLE-2 par OpenAI

Le mois dernier, OpenAI a impressionné le monde avec son algorithme de génération d’images DALLE-2. OpenAI a entraîné ce nouveau modèle d’apprentissage automatique à créer des images et des œuvres d’art photoréalistes à partir d’un simple texte naturel. DALLE-2, successeur de DALLE-1, atteint un haut niveau de photoréalisme grâce à un processus dit de « diffusion » qui génère un motif de points aléatoires et le modifie progressivement pour former une image reconnue à partir du texte. Vous pouvez en lire davantage ici et regarder Isabella Leslie Miller, Data Journalist chez DataCamp, en proposer une analyse dans notre Weekly Roundup News Video.

Pathways Language Model (PaLM)

PaLM illustre la première utilisation à grande échelle du système Pathways. L’architecture Pathways, présentée par Google l’an dernier, vise à entraîner efficacement une nouvelle génération de modèles capables d’effectuer une variété de tâches sur différents domaines. Avec PaLM, Google a créé un gigantesque modèle Transformer de 540 milliards de paramètres, qui atteint l’état de l’art sur de nombreuses tâches de langage et de raisonnement. Ces tâches vont de la génération de code à l’explication de blagues, en passant par l’identification des relations de cause à effet. Consultez l’article pour une plongée en profondeur dans Pathways et les cas d’usage que PaLM rend possibles. 

Nouveaux packages et modèles

Sortie de PyTorch 1.11

La sortie de PyTorch version 1.11 apporte de nombreuses améliorations. Cette version propose désormais en bêta TorchData, le successeur de l’API DataLoader, et functorch, qui offre des transformations de fonctions composables pour les modules PyTorch. Au-delà de ces ajouts, PyTorch 1.11 affiche diverses améliorations de performances, comme un démarrage 40 % plus rapide pour les déploiements mobiles et en périphérie, et plus encore. Pour en savoir plus sur PyTorch, découvrez ce cours DataCamp pour débutants. 

EpyNN 1.2.7

EpyNN signifie « Educational python for Neural Networks ». Il s’adresse aux enseignants, étudiants, scientifiques, et à toute personne disposant de compétences Python relativement modestes qui souhaite comprendre et construire des réseaux de neurones à partir de zéro. Il propose de nombreux modèles d’architectures et des exemples pratiques qui réduisent le temps nécessaire pour apprendre à développer des réseaux de neurones depuis la base. 

Entraînement du grand modèle de langage BigScience (tr11-176B-ml-logs)

BigScience est un espace très suivi sur Hugging Face, dont la mission est de créer, en open source et avec des milliers de chercheurs dans le monde, des modèles de langage à grande échelle. L’entraînement du modèle principal de BigScience a démarré le 11 mars 2022 et se poursuivra pendant trois à quatre mois sur 384 GPU A100 80 Go du supercalculateur public Jean Zay. Ce modèle open source comptera 176 milliards de paramètres et adoptera une architecture de type GPT avec décodeur seul. Vous pouvez suivre les mises à jour de l’entraînement sur Twitter, et vous devriez pouvoir utiliser le modèle aux alentours de juin. 

Cas d’usage en science des données et machine learning

La Liga s’associe à Databricks pour l’analyse du football

L’équipe d’analytique de La Liga s’est associée à Databricks pour déployer un data lakehouse au sein de l’infrastructure analytique du championnat. Cela permettra à La Liga Tech — la nouvelle entité analytique unifiée de la ligue — de structurer et gérer ses données bien plus efficacement, et d’exploiter le machine learning pour des cas d’usage tels que la prédiction des blessures, des recommandations de contenus pour les fans, et plus encore. 

Annoter l’univers des protéines grâce au deep learning

Les scientifiques utilisent depuis longtemps des outils informatiques pour déduire et annoter la fonction des protéines directement à partir de leur séquence. L’équipe IA de Google a réussi à prédire de manière fiable la fonction des protéines avec le deep learning ; ils appellent ce modèle ProtENN, ce qui leur a permis d’ajouter environ 6,8 millions d’entrées à la base de données de Pfam. L’équipe IA de Google a publié le modèle ProtENN et un article interactif de type distill pour expérimenter, accessible ici. Résoudre ce type de problèmes permettra d’accélérer la découverte de nouveaux médicaments et traitements, de façon plus fiable, grâce au machine learning. 

Analyses et opinions

Donner plus de pouvoir au data analyst moderne

Dans le dernier épisode du podcast DataFramed, Peter Fishman, CEO de Mozart Data, décrypte l’état du modern data stack et explique comment les outils les plus récents en science des données sont conçus pour renforcer le rôle du data analyst d’aujourd’hui. Il revient également sur son expérience à la tête d’équipes data, ce qui fait un excellent analyste, l’importance de l’expertise métier et de l’écoute des utilisateurs, et plus encore. Écoutez et abonnez-vous à DataFramed sur votre plateforme de podcasts.

Le MLOps est chaotique, et c’est normal

Dans cet article, Mihail Eric, fondateur de Confetti AI, partage son point de vue sur l’état actuel des outils MLOps. Comme le titre l’indique, il décrit avec clarté un paysage d’outillage en apprentissage automatique encore fragmenté. Étant donné que les opérations de machine learning en sont encore à leurs débuts, les standards, outils et bonnes pratiques qui l’entourent sont en cours de formation, et il n’existe pas encore de pile de référence sur laquelle les praticiens puissent s’appuyer. Par ailleurs, la résolution des pénuries de talents et l’adoption d’une culture orientée machine learning au sein des organisations façonneront l’adoption du MLOps dans les années à venir. 

Pour aller plus loin

Nous espérons que vous avez apprécié cette sélection d’actualités, d’analyses, de tutoriels et de recherches. Pour suivre l’actualité de la science des données, découvrez ces ressources :

Sujets
Science des données
Apprentissage automatique