Cet article a été rédigé par Richie Cotton, avec des contributions de Ramnath Vaidyanathan, Dieter De Mesmaeker et Martijn Theuwissen.
La formation en ligne est aujourd’hui un domaine particulièrement stimulant, porté par une innovation constante. Tous les acteurs, y compris DataCamp, cherchent encore la meilleure manière d’aider chacun à apprendre. Nos équipes produit et ingénierie développent en continu de nouveaux outils pour enseigner la science des données plus efficacement, que nos équipes éditoriales intègrent à nos contenus actuels et à venir.
Quatre instructeurs DataCamp — Ben Baumer, Andrew Bray, Mine Çetinkaya-Rundel et Jo Hardin — ont récemment publié un article dans le Journal of Statistical Education sur leur expérience de création de cours chez DataCamp, et leur point de vue sur les différences entre l’apprentissage en présentiel et en ligne. Ces instructeurs ont fait partie des premiers soutiens de DataCamp et nous les remercions d’avoir formalisé leur retour d’expérience.
Dans ce billet, nous revenons sur leurs retours, présentons notre approche pédagogique, montrons certaines améliorations apportées depuis la création de leurs cours DataCamp et clarifions notre position sur quelques remarques de l’article.
Les cours
Entre 2016 et 2018, les instructeurs ont créé huit cours. D’abord, une série de quatre cours sur les statistiques descriptives : Introduction to Data in R, Exploratory Data Analysis in R, Correlation and Regression in R, et Multiple and Logistic Regression in R, inclus dans le parcours de compétences Statistics Fundamentals with R. Puis quatre cours sur les statistiques inférentielles : Foundations of Inference, Inference for Categorical Data, Inference for Numerical Data et Inference for Linear Regression, qui forment le parcours Statistical Inference with R.
Au total, ces cours ont touché plus de 94 000 apprenants. Le cours le mieux noté affiche une note de 4,55 (sur 5) et le moins bien noté 4,33. Étant parmi nos cours à fort volume, ils ont généré à ce jour 475 000 $ de redevances cumulées pour les quatre instructeurs.
Les atouts de DataCamp
L’article met en lumière plusieurs forces de DataCamp. Pour commencer, les quatre universitaires rappellent que l’université coûte cher.
nos établissements [...] affichent un coût annuel moyen de scolarité et de vie de 71 156,25 $
C’est le prix d’une voiture de luxe chaque année, ce qui souligne la valeur de DataCamp, proposé à une fraction du coût d’un abonnement au métro de New York. Bien que nous soyons une entreprise à but lucratif, nous tenons à souligner notre programme gratuit DataCamp for the Classroom, qui offre aux enseignants et aux étudiants un accès illimité à l’ensemble de notre bibliothèque de cours. Depuis son lancement, plus de 200 000 étudiants y ont participé. Cela nous distingue des frais de scolarité élevés des établissements privés, et nous en sommes fiers.
Pour les apprenants, ils notent qu’utiliser la vidéo présente un avantage majeur par rapport à l’enseignement en présentiel : chacun peut maîtriser le rythme.
D’abord, avoir des vidéos plutôt qu’un instructeur en face-à-face permet à l’étudiant d’arrêter, de ralentir et/ou de revenir en arrière. Chacun peut ainsi assimiler les idées à son propre rythme. De plus, contrairement à une salle de classe classique, un étudiant peut mettre la vidéo en pause pour chercher une définition ou contextualiser un exemple.
Le retour instantané grâce aux tests automatisés dans nos exercices de code est également cité positivement.
Les étudiants reçoivent un feedback immédiat sur les exercices de code DataCamp. Cela réduit leur frustration et évite à l’instructeur une partie des e-mails urgents des étudiants.
Pour les enseignants, responsables L&D et autres formateurs, l’évolutivité de DataCamp est un atout déterminant. Notre plateforme libère les enseignants de la pression et de la monotonie de la correction.
Chaque étudiant supplémentaire exige plus de temps et d’efforts pour corriger ses devoirs, le recevoir en permanence, lui faire de la place en classe, etc. À l’inverse, DataCamp diffuse le contenu de manière asynchrone à un nombre illimité d’étudiants.
Quoi de neuf ?
Depuis 2016, DataCamp a investi dans de nombreuses améliorations.
La boucle évaluer–apprendre–pratiquer–appliquer
En 2016, DataCamp proposait un seul produit : nos cours, conçus pour aider les apprenants à acquérir de nouvelles compétences. Au fil du temps, notre vision pédagogique s’est structurée autour d’un cycle : évaluer ses acquis, apprendre de nouvelles compétences, les pratiquer, les appliquer dans de nouveaux contextes, puis revenir à l’évaluation pour mesurer les progrès. L’illustration ci-dessous montre cette boucle évaluer–apprendre–pratiquer–appliquer.

Figure 1 : la boucle évaluer–apprendre–pratiquer–appliquer, fondement de la philosophie pédagogique de DataCamp.
Pour aider les apprenants à compléter cette boucle, nous avons ajouté trois nouveaux produits.
Practice
En 2017, nous avons lancé DataCamp Practice, qui propose de courts défis de code, étroitement alignés sur le contenu des cours, pour renforcer les acquis. L’exemple ci-dessous montre une question à choix multiples évaluant des compétences vues dans le cours Introduction to the Tidyverse.

Figure 2 : un exercice DataCamp Practice évaluant des compétences en visualisation de données.
Projects
La même année, nous avons lancé DataCamp Projects, qui permet aux apprenants d’appliquer leurs compétences à de nouveaux problèmes concrets dans l’un des environnements les plus populaires en science des données : les Jupyter Notebooks.

Figure 3 : un Project permettant d’appliquer ses compétences en SQL.
Assessments
La dernière étape de la boucle est arrivée en 2019 avec le lancement de DataCamp Signal, notre solution d’évaluation des compétences qui permet de mesurer ses progrès. Conceptuellement, ces évaluations ressemblent au mode pratique, mais en conditions d’examen : le contenu est lié aux cours correspondants, chaque question est chronométrée et un score est attribué en fonction du nombre de bonnes réponses et de leur difficulté. Vous pouvez en savoir plus sur l’utilisation des tests adaptatifs et de la psychométrie par Signal ici.

Figure 4 : une question d’évaluation Signal mesurant des compétences en machine learning avec Python, sous contrainte de temps.
Améliorations des cours
En plus de ces trois nouveaux produits, DataCamp a enrichi ses cours avec plusieurs nouveaux types d’exercices. L’article du JSE a eu le nez fin en soulignant le besoin d’exercices graphiques « point & click ».
Certaines stratégies pédagogiques n’étaient pas possibles sur la plateforme DataCamp, mais nous pouvions imaginer qu’elle les intégrerait à mesure que ses capacités de présentation se sophistiqueraient. En particulier, il n’était pas possible d’utiliser la plateforme pour parcourir un applet afin d’expliquer un concept.
Explorable exercises
En 2019, DataCamp a conçu un nouveau type d’exercice, l’« explorable exercise ». Il permet d’intégrer des tableaux de bord, des visualisations interactives, voire des logiciels web, directement dans les exercices. Une façon de les créer s’appuie sur Shiny — une version moderne des applets Java auxquels l’article fait référence. (Nous proposons aussi une série de cours sur Shiny pour celles et ceux qui souhaitent créer les leurs.)
Ces exercices sont particulièrement utiles dans la série « For Everyone » de DataCamp, conçue pour les personnes qui doivent comprendre les données sans avoir de bagage en data science ou analytics. Le cours Data Visualization For Everyone exploite notamment des tableaux de bord pour aider les apprenants à explorer comment des modifications de graphiques influencent leur capacité à répondre à des questions.
Dans l’exemple ci-dessous, les apprenants peuvent explorer comment un changement de couleurs dans un graphique influe sur l’interprétation de réponses à une enquête.

Figure 5 : un explorable exercise avec tableau de bord pour explorer l’impact des choix de couleurs dans un histogramme empilé.
Un reproche adressé à DataCamp à ses débuts était que, si nos exercices de code excellent pour apprendre à écrire des blocs de code, il était facile de se perdre sans savoir comment les enchaîner. Nous avons toujours reconnu l’importance d’enseigner des workflows et encouragé les instructeurs à les décrire en vidéo, mais il nous fallait un outil plus puissant. L’an dernier, nous avons donc introduit un nouveau type d’exercice : les exercices de glisser-déposer, qui invitent à résoudre un problème en déplaçant des éléments à l’écran. La variante la plus importante pour enseigner les workflows est l’« ordering exercise ».
Dans l’exemple ci-dessous, tiré du cours Introduction to Writing Functions in R, les apprenants doivent réordonner les étapes d’un workflow pour transformer un script en fonction réutilisable. En s’éloignant de l’écriture de code, ils peuvent se concentrer sur le concept.

Figure 6 : un exercice de glisser-déposer pour enseigner un workflow en ordonnant des étapes.
Outre les explorable exercises et les exercices de glisser-déposer, nous avons ajouté de nombreux autres formats. Parmi les plus notables :
Exercices IDE
L’exercice IDE utilise l’un des éditeurs de code les plus populaires, Visual Studio Code. Ce format est utilisé dans nos contenus d’ingénierie des données les plus avancés.

Figure 7 : un exercice IDE évaluant des compétences « devops » pour déployer du code dans l’environnement Visual Studio Code.
Exercices VM
Plus récemment, nous avons créé l’exercice VM, qui exécute une machine virtuelle Windows avec des logiciels préinstallés. Ils sont principalement utilisés dans nos contenus Tableau.

Figure 8 : un exercice VM montrant comment manipuler des données dans l’outil de business intelligence Tableau.
Certaines suggestions de l’article restent cependant délicates à mettre en œuvre pour une plateforme en ligne comme DataCamp, par exemple :
En classe, nous divisons les étudiants en équipes et chaque équipe reçoit un sac contenant 20 papiers, chacun indiquant le loyer d’un appartement échantillonné. Chaque équipe tire ensuite un bootstrap de 20 appartements avec remise, calcule la médiane et l’inscrit au tableau en plaçant un point sur un dotplot. Ce processus donne une expérience concrète de l’échantillonnage avec remise pour construire une distribution bootstrap de médianes d’échantillon.
Si les instructeurs ne peuvent pas interagir de la même manière avec les apprenants sur notre plateforme, nous convenons que les jeux pédagogiques sont un ingrédient clé du présentiel. C’est pourquoi, lors de notre dernier hackathon, une équipe d’ingénierie a exploré la création de DataCamp VR. Même si cela prendra quelques années, l’innovation fait partie de notre ADN (et nous nous sommes bien amusés !).
Plus sérieusement, croire que l’enseignement en ligne et le présentiel sont en concurrence est une idée reçue. Chez DataCamp, nous les voyons comme complémentaires. C’est pourquoi nous avons lancé une série de webinaires de live coding, où les apprenants peuvent interagir de plus près avec un instructeur. Retrouvez nos prochains webinaires et formations en direct ici.
Amélioration continue
Contrairement à d’autres médias éducatifs comme les manuels, considérés comme « achevés » une fois publiés, sur DataCamp, le développement des supports pédagogiques ne s’arrête pas au lancement d’un cours. Les instructeurs sont activement encouragés à améliorer leurs cours pour offrir une meilleure expérience : réécriture d’énoncés ambigus, clarification de notions, mise à jour du contenu dans un domaine — la science des données — en perpétuelle évolution.
Fait intéressant, la série de cours de statistiques inférentielles créée par les auteurs de l’article a fortement motivé certaines améliorations techniques et de processus chez DataCamp. Bien que populaires, des données quantitatives comme les notes et les taux de complétion montraient une marge de progression. Le défi majeur est que les statistiques inférentielles sont exigeantes sur le plan conceptuel et requièrent des compétences de programmation d’un niveau intermédiaire pour exposer ces concepts.
Pour y remédier, l’équipe Content Quality de DataCamp a travaillé avec les instructeurs pour réécrire entièrement les quatre cours. Les Content Quality Analysts ont adapté le rythme pour introduire le code plus progressivement, réécrit les consignes et simplifié le code, afin d’aider les apprenants à se concentrer sur les concepts. Résultat : ce sont désormais quatre excellents cours — pour un public avancé.
Dans l’esprit d’amélioration continue, le prochain défi pour l’équipe contenu de DataCamp est de trouver comment enseigner les statistiques inférentielles à des débutants complets. À suivre !
Améliorations pour les responsables Learning & Development
L’article du JSE dresse un bon panorama des avantages et limites de l’enseignement sur DataCamp, mais comporte une légère imprécision en affirmant que
les cours DataCamp sont asynchrones et à rythme libre, donc [il n’y a] pas de dates butoirs pour les étudiants.
C’est vrai pour la majorité des apprenants. Avec un abonnement individuel, vous apprenez à votre rythme, selon vos disponibilités. Cependant, pour nos clients entreprises et établissements académiques, DataCamp a développé un ensemble d’outils d’administration pour aider responsables et enseignants à suivre la progression de leurs équipes et de leurs classes :
- Assignments : nous permettons aux instructeurs et administrateurs de définir des travaux (cours ou objectifs XP) avec une date limite. À l’échéance, l’administrateur de groupe reçoit automatiquement une exportation des données pertinentes.
- Reporting : depuis le lancement de DataCamp pour les entreprises et le monde académique, nous avons considérablement enrichi nos capacités de reporting, avec des insights automatisés sur l’engagement, l’adoption, la consommation de contenu, l’usage des évaluations, etc., directement dans l’application.
- Données granulaires : les administrateurs peuvent exporter des données détaillées de leurs groupes et classes pour créer, s’ils le souhaitent, leurs propres tableaux de bord en local.
- Intégrations LMS et SSO : en 2019, nous avons étendu nos intégrations LMS à d’autres fournisseurs comme SAP SuccessFactors et Degreed, et ajouté le single sign-on (SSO) pour renforcer la sécurité.
Améliorations pour les instructeurs
Au lancement de DataCamp, nous avons accéléré la création de cours, car sans cours, pas d’apprenants. À mesure que notre bibliothèque s’est étoffée et que notre audience s’est diversifiée, combler les trous du programme n’est plus aussi prioritaire que des questions telles que « où ce cours se situe-t-il par rapport aux autres ? » et « qui aura intérêt à le suivre ? »
Concrètement, en amont du développement, nous passons du temps à préciser la cible avec l’instructeur. Par exemple, la manière d’expliquer un concept à des experts en machine learning diffère de l’approche adaptée à des managers de data scientists, moins techniques mais amenés à évaluer de façon critique les résultats d’une analyse.
Nous constatons aussi que nombre d’apprenants préfèrent suivre des séquences via nos career tracks et skill tracks. Pendant la conception, nous clarifions donc ce que les apprenants sont censés savoir en amont, les cours préalables recommandés, ce qu’ils doivent maîtriser à l’issue du cours et vers quels autres cours il peut mener. On n’apprend pas en silo — c’est un parcours vers une meilleure culture des données.
Une fois le périmètre défini, il faut garantir l’apprentissage effectif. DataCamp travaille avec ses instructeurs pour définir des objectifs pédagogiques à l’aide de la taxonomie de Bloom — un cadre décrivant les niveaux de maîtrise. Ces objectifs alimentent les évaluations de compétences DataCamp Signal.
Tout cela peut sembler beaucoup pour un nouvel instructeur. C’est pourquoi DataCamp offre un accompagnement conséquent pendant la création : chaque instructeur reçoit en général plus de 80 heures de guidance par des salariés DataCamp — data scientists et pédagogues — sur la structuration du récit, la rédaction d’exercices efficaces et la relecture technique des contenus. Nous proposons également un méta-cours sur la création de cours chez DataCamp, ainsi qu’une documentation détaillée pour trouver des jeux de données intéressants, enregistrer un son de qualité, etc.
Après le lancement, DataCamp offre un autre avantage par rapport au présentiel : des retours quantitatifs sur la performance des cours. La difficulté de chaque exercice est estimée via la proportion d’apprenants demandant des indices et des solutions, ce qui permet d’identifier où ils bloquent. Les mauvaises réponses sont également enregistrées, afin de repérer les erreurs fréquentes et d’améliorer la clarté. Découvrez notre approche d’amélioration de la qualité des cours dans cet article.
Dans certains cas, nous avons constaté que des exercices sont difficiles simplement parce que le code sous-jacent est complexe à utiliser. Les cours de statistiques inférentielles évoqués dans l’article du JSE étaient basés sur le package R infer, et plusieurs employés de DataCamp ont contribué à son développement pour le rendre plus simple. Nous sommes fiers de ce cercle vertueux où l’enseignement inspire le développement. Identifier des points de friction dans le code et aider les développeurs à les résoudre rend les logiciels plus accessibles à tous.
Conclusion
Nous sommes ravis que nos instructeurs aient pris le temps de partager leur expérience de création de contenus pour DataCamp. Deux cent soixante-seize personnes ont désormais suivi ce processus, contribuant à notre mission de démocratiser la science des données.
L’éducation en ligne est plus que jamais pertinente alors que beaucoup travaillent depuis chez eux. Fidèles à notre mission de démocratiser la culture des données pour les individus et les entreprises, nos équipes produit, contenu et ingénierie cherchent en permanence à améliorer la manière dont nous enseignons les compétences data. Restez à l’écoute des prochaines évolutions !
Bon apprentissage.
Annexe : clarification de la position de DataCamp sur certaines remarques de l’article
Nous souhaitons préciser notre position sur quelques points abordés dans l’article du JSE.
- L’article interroge la durée maximale des vidéos DataCamp et suggère que les instructeurs devraient pouvoir « consacrer 10–20 min à certains sujets ». La limite que nous imposons s’appuie sur une publication de recherche d’edX sur la durée vidéo optimale pour l’engagement. Nous proposons des formats longs via des enregistrements de webinaires, mais estimons que des vidéos plus longues casseraient le rythme des cours.
- Chez DataCamp, nous soutenons l’open source. Des membres actuels et anciens de l’équipe ont contribué au package infer sur leur temps libre et de travail : Chester Ismay, Nick Solomon et Richie Cotton (source).
- Bien que cela soit évoqué dans l’article, nous n’avons aucun contrat d’exclusivité avec les instructeurs. La propriété intellectuelle reste à l’instructeur.
- Nous reconnaissons qu’en tant qu’entreprise à but lucratif, nous décidons différemment, mais toujours dans l’intérêt de l’apprenant. Nos incitations sont pleinement alignées sur la création de contenus de haute qualité, qui conditionnent directement la valeur pour nos clients. C’est pourquoi nous suivons des métriques détaillées, comme le mentionne l’article.
- De même que la relation commerciale avec DataCamp a été divulguée, nous pensons qu’il aurait été pertinent de mentionner la relation commerciale de l’un des auteurs avec RStudio lors de la référence à LearnR, un package créé par l’équipe de RStudio.
- Concernant l’article de BuzzFeed cité : DataCamp a mandaté une évaluation indépendante menée par des tiers sur les événements d’octobre 2017, dirigée par Anurima Bhargava, ancienne responsable au Department of Justice sous l’administration Obama, et Pamela Coukos de Working IDEAL. Le rapport a été publié et partagé en ligne via ce billet. Les membres de l’Instructor Advisory Board (« IAB ») (dont un des auteurs de l’article) ont été invités à y participer, ainsi que d’autres parties prenantes, notamment des membres de notre communauté d’instructeurs.