
#1 Les organisations accélèrent leurs programmes de transformation de la culture data
La culture data regroupe les comportements et convictions de celles et ceux qui valorisent, pratiquent et encouragent l'usage des données pour améliorer la prise de décision. Elle pose les bases et l'état d'esprit nécessaires pour permettre aux entreprises de capter efficacement la valeur de jeux de données toujours plus volumineux.
Malheureusement, le déficit de culture data constitue un frein majeur sur la feuille de route des organisations vers une prise de décision basée sur les données.

En 2022, nous anticipons que les chief data officers (CDO) concentreront leurs efforts sur les briques essentielles de la culture data : une gouvernance des données solide, des programmes de culture des données et l'instauration d'un état d'esprit fondé sur les données. Autant de leviers pour diffuser des processus de décision data-driven à l'échelle de l'entreprise.
#2 Les organisations vont étendre leur gouvernance des données
La montée en puissance de l'analytique en libre-service renforce l'exigence de données conformes, exploitables et de haute qualité. Or, mesurer et maintenir la qualité des données devient d'autant plus complexe que les jeux de données croissent en taille et en complexité. Les entreprises adaptent donc leurs stratégies de gouvernance des données.
Parmi ces approches : l'adoption de l'observabilité des données au sein des pipelines. En bref, l'observabilité vise à identifier, diagnostiquer et résoudre les problèmes de données quasi en temps réel.
En 2022 et au-delà, davantage d'entreprises industrialiseront leurs programmes de gouvernance des données et adopteront des outils modernes pour surveiller et détecter les problèmes de qualité.
#3 Le NLP ouvre la voie à une nouvelle génération d'outils low-code
Le traitement du langage naturel (NLP) a connu une croissance fulgurante ces dernières années, porté par la course aux modèles de langage de très grande taille (LLM) comme T5, GPT-3 et Megatron-Turing NLG.
Les grands modèles de langage grossissent au fil des ans (Source)Les LLM repoussent les limites du NLP. Les modèles les plus récents ont surpris la communauté par leur capacité à générer divers types de textes (comme du code informatique ou des tablatures de guitare) sans entraînement spécifique.
Ces modèles NLP pourraient inaugurer l'ère des outils low-code et no-code. Aujourd'hui, Power App de Microsoft permet à des profils non techniques de créer des applications à la voix. Ce type d'outils continuera d'abaisser les barrières au code et de favoriser l'émergence de citizen developers et de citizen data scientists au sein des organisations.
#4 La formation L&D s'inscrit au cœur de la culture d'entreprise
Face à l'inquiétude des directions sur le manque de compétences clés dans leurs organisations, les entreprises continueront d'investir massivement dans les programmes de learning and development (L&D) en 2022. Les bénéfices sont clairs : le Forum économique mondial estime que 38 % du PIB pourraient être gagnés d'ici 2030 grâce à la montée en compétences.
Alors que les équipes poursuivent leur adaptation à la pandémie, nous anticipons un fléchage des budgets L&D vers des écosystèmes d'apprentissage virtuels, propices à un apprentissage efficace et à des communautés de pratique. Les entreprises qui souhaitent renforcer à grande échelle la culture des données de leurs collaborateurs peuvent s'appuyer sur leurs programmes L&D existants comme sur de véritables académies internes de compétences en data science.
Tendance data n° 5 : le MLOps continue de mûrir dans les organisations
Le MLOps regroupe des pratiques qui combinent apprentissage automatique, ingénierie des données et DevOps. Il s'appuie sur des processus standardisés qui automatisent le cycle de vie de l'apprentissage automatique.
Les entreprises ne peuvent réellement créer de la valeur à grande échelle avec l'apprentissage automatique qu'avec des systèmes d'IA industrialisés. Cela explique pourquoi la demande en MLOps devrait croître fortement. Le marché est d'ailleurs estimé à 126,1 milliards de dollars d'ici 2025.
Dans l'année à venir, des outils MLOps comme KubeFlow et MLFlow vont continuer de gagner en maturité. Ce n'est qu'une question de temps avant qu'ils ne deviennent incontournables pour toutes les équipes de data science.
Tendance data n° 6 : l'IA responsable devient plus opérationnelle
Beaucoup de systèmes d'IA actuels recèlent encore des biais cachés. Les régulateurs au sein de l'UE entendent les encadrer, et d'autres suivront. Les entreprises doivent garantir l'équité et la responsabilité de leurs systèmes d'IA. À défaut, elles risquent d'écorner leur réputation et de contribuer à l'aggravation des inégalités.
C'est pourquoi les principes d'IA responsable sont de plus en plus intégrés dans l'opérationnel, pour assurer une IA équitable, explicable, respectueuse de la vie privée et sécurisée. On peut citer, par exemple, le Responsible AI Toolkit de PwC, qui couvre les différentes dimensions de l'IA responsable.
Tendance data n° 7 : émergence de la data mesh
La plupart des architectures de données actuelles reposent sur des data lakes. Cela pourrait évoluer avec l'arrivée d'un nouveau modèle qui répond aux limites des data lakes.
Cette alternative, proposée par Zhamak Dehghani, est la data mesh. Une data mesh s'organise en « produits de données » distribués, chacun piloté par une équipe pluridisciplinaire d'ingénieurs data et de product owners. Adopter cette architecture permet de livrer la donnée plus vite et de gagner en agilité métier.
À mesure que les limites des data lakes se font plus criantes, les entreprises vont expérimenter la data mesh, à l'instar de Zalando et Intuit.
Tendance data n° 8 : une nouvelle génération d'outils booste la productivité des équipes data
De nombreux outils de productivité pour la data science ont émergé en 2021 et continueront de gagner en popularité dans les années à venir. Ils réduisent le travail manuel et permettent aux data scientists de se concentrer sur des tâches à plus forte valeur ajoutée.
Parmi eux : les outils AutoML (comme H2O AutoML et Auto PyTorch), qui automatisent la sélection de modèles et même l'optimisation des hyperparamètres.
On observe aussi une forte progression des outils de génération de données synthétiques. Leur capacité à produire à grande échelle des jeux de données équilibrés et annotés séduit particulièrement les entreprises gourmandes en données.
Les grandes équipes data apprécieront également des outils de collaboration comme Databricks et DataCamp Workspace, qui permettent de collaborer de manière asynchrone sur l'exploration de données et le modélisation ML.

Tendance data n° 9 : la pénurie de talents et le travail flexible élargissent et améliorent la recherche de profils data
Avec la « Grande démission », la pénurie de talents s'aggrave. Ce phénomène pousse les organisations à repenser leurs stratégies de recrutement et de fidélisation des talents data.
Nous nous attendons notamment à ce que les entreprises privilégient les compétences plutôt que la localisation dans leurs politiques d'embauche, comme en témoigne la hausse de 280 % des offres d'emploi à distance sur LinkedIn depuis mars 2020. Par ailleurs, à mesure que les entreprises FAANG pérennisent le télétravail, d'autres acteurs technologiques devraient suivre et offrir, eux aussi, davantage de flexibilité.
Pour en savoir plus sur nos tendances et prévisions data 2022, téléchargez le livre blanc gratuit, ou inscrivez-vous à notre prochain webinaire où nous approfondirons ce qui vous attend en data science cette année !
