
Pourquoi nous développons un produit de collaboration pour les professionnels des données et les équipes à forte culture data
Lorsque nous avons lancé DataCamp, notre ambition était de rendre l’apprentissage de la data science en ligne simple, agréable et abordable pour tous. Aujourd’hui, nous avons accompagné plus de 7 millions d’apprenants et contribué à développer la culture des données de plus de 1¦000 organisations. Plus de 150 000 abonnés ont accès à DataCamp, et encore davantage gratuitement via DataCamp Donates et DataCamp for the Classroom. Pourtant, presque tous rencontrent de vraies difficultés lorsqu’il s’agit de faire, concrètement, du travail de données.
Les difficultés des professionnels et des équipes data : pourquoi c’est un enjeu majeur
Tout comme l’apprentissage, la pratique de la data science devrait être simple, agréable et collaborative. Même si le nombre de professionnels des données a explosé, il existe très peu d’outils à la fois faciles à utiliser, simples à faire évoluer et conçus pour la réalité de pratiques variées, de technologies différentes et d’environnements de développement intégrés (IDE) hétérogènes.
Conséquence : les data scientists ne sont pas aussi productifs qu’ils pourraient l’être. Soyons honnêtes, nous passons trop de temps sur l’infrastructure et l’ingénierie : configurer une machine, trouver et accéder aux bonnes données, déployer des tableaux de bord et des rapports… Nous entendons ces difficultés chez nos apprenants et nos clients, et nous les avons nous-mêmes vécues chez DataCamp.
De plus, les data scientists ne travaillent pas isolés. En équipe, faire de la data science ne devrait pas être aussi pénible qu’aujourd’hui. La plupart des outils utilisés par les data scientists manquent des fonctionnalités collaboratives les plus basiques. De manière surprenante, la collaboration se fait souvent en partageant code et données par e-mail, Slack ou autres messageries. Le contrôle de version repose sur des outils conçus pour les workflows des ingénieurs logiciels, peu intuitifs pour les data scientists — et ne parlons même pas du manque d’assurance qualité dans nombre d’équipes data. Savoir quelle analyse, quel tableau de bord ou quel rapport est toujours à jour est essentiel pour une équipe. Ces obstacles sont bien réels et surgissent dès le premier jour dans une nouvelle équipe.
Les organisations y perdent aussi, faute d’un lieu central où rassembler tous les insights et où les professionnels des données peuvent apprendre les uns des autres. Certains insights restent dans des notebooks, d’autres dans des rapports PDF, d’autres encore dans des outils analytiques propriétaires comme Looker et Metabase, etc. Résultat : des enseignements qui se perdent, des efforts dupliqués, et une frustration croissante chez les utilisateurs métiers et les directions au contact des équipes data.
Ce déficit d’outillage empêche les professionnels des données d’être pleinement productifs et freine l’émergence d’organisations véritablement data fluent. Certes, il y a eu beaucoup d’innovations pour les utilisateurs proches de la BI, mais c’est bien moins vrai pour les professionnels qui veulent aller plus loin et tirer parti de Python et R pour produire leurs insights.
Notre objectif chez DataCamp
Nous voulons permettre à chacun, de n’importe où et sur n’importe quel appareil, d’accéder en ligne aux données pertinentes, de créer des visualisations, des rapports et des tableaux de bord avec son outil ou IDE favori, puis de les partager avec d’autres professionnels des données. Nous voulons que les équipes collaborent de façon fluide, en temps réel comme en asynchrone. Nous voulons que les équipes bénéficient automatiquement d’un minimum de contrôle de version et de qualité. L’issue visée : une couche centralisée d’insights pour des organisations de toute taille.
En d’autres termes, nous voulons qu’il soit aussi simple de faire de la data science sur vos propres données (ou celles de votre entreprise) que de suivre un cours DataCamp.
Comment nous allons y parvenir
Rome ne s’est pas faite en un jour. Nous construisons actuellement ce produit et prévoyons un déploiement progressif sur les 12 à 18 prochains mois.
Première étape : faciliter au maximum le passage de l’apprentissage sur DataCamp — que ce soit via des projets ou des cours — vers un IDE populaire comme Jupyter. Travailler avec les outils déjà largement utilisés dans l’industrie et le monde académique est essentiel pour mettre en pratique les compétences acquises dans un environnement réaliste. En outre, les utilisateurs pourront publier et partager leur travail au sein d’un workspace.
Ensuite, nous simplifierons la connexion à vos données et le dépôt de jeux de données, afin de permettre l’usage de DataCamp pour le travail data du quotidien. Par ailleurs, lorsque des utilisateurs inviteront des collaborateurs à relire ou éditer leur travail, le code et l’environnement seront liés et autonomes : les problèmes de versions de packages, d’un projet à l’autre et entre utilisateurs, appartiendront au passé.
Nous nous attacherons aussi à améliorer considérablement la collaboration en temps réel et en asynchrone pour les équipes data. Presque tous les produits d’équipe actuels offrent coédition en temps réel, commentaires et tags. Rien ne justifie que les équipes data en soient privées, et pourtant c’est souvent le cas aujourd’hui.
Enfin, à mesure que le produit gagnera en maturité, nous ajouterons des fonctionnalités pour les organisations, en nous appuyant sur l’architecture robuste de gestion des utilisateurs déjà développée pour notre plateforme d’apprentissage entreprise. Par exemple, les administrateurs ne définiront qu’une seule fois une connexion à la base de données et géreront les droits d’accès aux données. Côté utilisateurs, les data scientists disposeront des bonnes connexions dès le démarrage de leurs analyses.
Améliorer la culture des données et démocratiser la data science est au cœur de la mission de DataCamp. Ce produit est une étape clé pour y parvenir, et c’est pourquoi nous pensons que sa version de base doit rester gratuite, pour toujours.
Si vous souhaitez transformer la manière dont les équipes data collaborent, écrivez-nous à rocketship@datacamp.com. Vous pouvez également contacter directement Filip Schouwenaars, qui pilote le développement de ce nouveau produit, ou notre CTO, Dieter De Mesmaeker. Nous recherchons en permanence des ingénieurs talentueux pour nous rejoindre. Postulez maintenant !