Misez sur des bases de données solides et les bons outils
Disposer de données de qualité est déjà un défi majeur. Nous recommandons aux entreprises qui souhaitent tirer parti de l'apprentissage automatique, de l'intelligence artificielle et de la science des données de se référer à la hiérarchie des besoins en IA de Monica Rogati, où l'apprentissage automatique figure presque au sommet, parmi les dernières briques à mettre en place.

Source : Hackernoon
Cette hiérarchie montre qu'avant de pouvoir faire de l'apprentissage automatique, vous devez disposer de bases de données robustes et d'outils d'extraction, de chargement et de transformation des données (ETL), ainsi que d'outils de nettoyage et d'agrégation de données issues de sources hétérogènes.
Cela suppose de solides pratiques d'ingénierie des données : savoir exploiter des bases de données, traiter correctement les données, orchestrer vos workflows et vous appuyer sur le cloud computing.
Avant même de recruter votre premier ingénieur en apprentissage automatique, commencez par structurer vos fonctions d'ingénierie des données, de data science et d'analyse de données.
Méfiez-vous des biais dans vos données et vos algorithmes
L'apprentissage automatique ne vaut que par la qualité des données que vous lui fournissez. Si vos données sont biaisées, votre modèle le sera aussi. Par exemple, Amazon a conçu un outil de recrutement en ML pour prédire la réussite des candidats à partir de dix ans de CV, un historique qui favorisait les hommes en raison de la domination masculine dans la tech ; l'outil s'est donc retrouvé biaisé à l'encontre des femmes.
C'est pourquoi l'éthique des données s'est imposée comme un sujet central ces dernières années. À mesure que le volume de données augmente, l'impact de leur utilisation croît tout autant. Cela exige une réflexion de principe et une surveillance continue. Comme l'a illustré Cassie Kozyrkov, Chief Decision Scientist chez Google, un enseignant n'est jamais meilleur que les livres dont il se sert : si les livres sont biaisés, les leçons le seront aussi.
Surveillez votre modèle et améliorez-le
N'oubliez pas que le travail en apprentissage automatique ne s'arrête pas une fois le modèle en production, qu'il fasse des prédictions ou des classifications. Les modèles déployés et opérationnels doivent être suivis et maintenus.
Si vous avez un modèle qui prédit la fraude à la carte bancaire à partir des données de transactions, vous obtenez des informations précieuses à chaque prédiction mise en action. De plus, l'activité que vous cherchez à surveiller et à anticiper — ici, la fraude à la carte bancaire — peut évoluer dans le temps. Ce phénomène, où les données générées varient en permanence, s'appelle le data drift ; il démontre l'importance d'actualiser régulièrement votre modèle.

Source : DataBricks
