Accéder au contenu principal

Guide des cas d'usage en data science

Découvrez des cas d'usage en data science et comment la data science s'applique dans différents secteurs pour stimuler la croissance et guider la décision.
Actualisé 31 août 2026  · 15 min lire

Explorer avec l’IA

ChatGPTClaudePerplexity

Artificial Intelligence Concept Art

Data science : définition et applications pratiques

La data science est un domaine relativement récent, en forte croissance et pluridisciplinaire, utilisé dans de nombreux secteurs. Elle mobilise des techniques d’analyse avancée et des algorithmes de modélisation prédictive pour extraire des insights exploitables à partir des données, afin de répondre à des questions stratégiques métier ou scientifiques. La data science conjugue un large éventail de compétences, des plus techniques (programmation, algèbre linéaire, statistiques, modélisation) aux plus transverses (visualisation et communication des résultats). Par ailleurs, selon le secteur d’application, une solide expertise métier est essentielle pour interpréter correctement l’information disponible et les enseignements obtenus.

Les algorithmes de data science s’appliquent avec succès partout où de grands volumes de données sont collectés ou peuvent l’être : finance, commerce, marketing, gestion de projet, assurance, médecine, éducation, production, RH, linguistique, sociologie, etc. En pratique, tout secteur peut bénéficier de la collecte, de l’analyse et de la modélisation de ses données.

Qu’est-ce qu’un cas d’usage en data science ?

Un cas d’usage en data science correspond à une tâche concrète du monde réel à résoudre à partir des données disponibles. Au sein d’une entreprise, de nombreuses variables sont analysées à l’aune de son secteur. Un cas d’usage peut être un problème à résoudre, une hypothèse à vérifier ou une question à laquelle répondre. En substance, faire de la data science, c’est résoudre des cas d’usage réels.

Si chaque cas d’usage a ses spécificités, gardez en tête quelques constantes :

  • La planification d’un cas d’usage comprend : la définition d’un objectif clair et de résultats attendus, la délimitation du périmètre, l’évaluation des ressources disponibles, la mise à disposition des données nécessaires, l’évaluation des risques et la définition d’indicateurs de succès (KPI).
  • Les approches les plus fréquentes sont : prévision, classification, détection de motifs et d’anomalies, recommandations, reconnaissance d’images.
  • Certains cas d’usage sont transverses à de nombreux domaines et se résolvent avec des approches proches : prédiction du churn, segmentation client, détection de fraude, systèmes de recommandation, optimisation des prix.

Comment résoudre une étude de cas en data science ?

La réponse dépend fortement du contexte, de la stratégie de l’entreprise et de la nature même du cas. Néanmoins, voici une feuille de route générale applicable à tout cas d’usage :

  1. Formuler la bonne question. Cette étape, cruciale, inclut la revue de la littérature et des cas existants, l’étude des bonnes pratiques, l’élaboration d’hypothèses de travail et la complétion des lacunes d’expertise métier. L’objectif est d’arriver à une question nette à laquelle répondre.
  2. Collecter les données. On inventorie et rassemble les données utiles. En pratique, les données sont souvent incomplètes, bruitées et non structurées : loin d’un tableau propre et prêt à analyser. Il faut donc identifier toutes les sources pertinentes : archives de l’entreprise, web scraping, partenariats, etc.
  3. Préparer les données. C’est souvent l’étape la plus chronophage. On évalue la qualité et la représentativité des données, on explore, on nettoie, on pré-traite et on transforme pour obtenir un format exploitable.
  4. Analyser et modéliser. On analyse les données préparées puis on ajuste un modèle prédictif approprié. On évalue sa précision et, si besoin, on teste d’autres approches jusqu’à retenir le modèle le plus performant. Le processus est itératif.
  5. Communiquer les résultats. Cette étape mobilise surtout les compétences de communication. Il s’agit de partager les conclusions clés avec la direction, les parties prenantes, etc., via rapports, articles ou présentations, et de proposer des pistes d’action.

Cas d’usage par secteur

Les cas d’usage en data science concernent pratiquement tous les secteurs où de grands volumes de données sont (ou peuvent être) accumulés. Concentrons-nous sur des cas typiques dans trois domaines très demandés : logistique, santé et télécommunications. Plusieurs cas présentés sont interdisciplinaires et se rencontrent aisément ailleurs : ils sont donc d’autant plus utiles à connaître. Nous citerons également, pour chaque secteur, d’autres thématiques modélisables avec des méthodes de data science.

La data science dans la santé

Dans les trois chapitres précédents, nous avons vu comment les méthodes de data science peuvent aider des entreprises de différents secteurs à augmenter leurs revenus. En santé, au-delà des bénéfices marketing, la bonne exploitation et interprétation des données peut permettre des diagnostics précoces de maladies graves et, in fine, sauver des vies.

Les acteurs de la médecine et de la santé agrègent d’énormes volumes de données : dossiers médicaux électroniques (EHR), objets connectés, études cliniques, facturation, etc. L’adoption des techniques innovantes de data science et d’analyse des données transforme progressivement tout le secteur, avec des solutions prometteuses pour son avenir. Des spécialités comme la génétique, la médecine de la reproduction, l’oncologie, la biotechnologie, la radiographie, le diagnostic prédictif et la pharmacie ont franchi un cap grâce à l’exploitation de leurs données.

Pour mieux comprendre la valeur de la data science en médecine, examinons un cas d’école.

Cas d’usage en santé : prédiction du cancer du sein

Selon le World Cancer Research Fund International, le cancer du sein est le plus fréquent chez la femme et le deuxième tous sexes confondus. Un diagnostic précoce, bénin ou malin, augmente fortement les chances de succès du traitement et la survie. C’est là que la data science apporte une aide précieuse.

Les progrès du data mining associés au machine learning permettent d’évaluer le risque, de détecter très tôt des anomalies, d’en estimer l’évolution et de définir un plan de prise en charge optimal. Techniquement, il s’agit d’un problème classique de classification. La bonne nouvelle : du fait de sa prévalence, ce cancer a fait l’objet d’études approfondies dans le monde entier, générant des jeux de données considérables.

Le principal enjeu avec ces jeux de données en classification est souvent leur déséquilibre. Par exemple, pour une sortie binaire cancer / pas de cancer, la probabilité d’une pathologie (classe minoritaire) est beaucoup plus faible que l’absence de pathologie (classe majoritaire). L’algorithme aura tendance à privilégier la classe majoritaire. Pour évaluer plus finement la performance, on s’intéresse donc à la F1-score, qui tient compte des faux positifs (erreur de type I) et des faux négatifs (erreur de type II), plutôt qu’au seul taux de précision globale.

Examinons un jeu de données réel sur le cancer du sein provenant d’un État américain. Les variables (détaillées dans la documentation) sont notamment les valeurs moyennes, écarts types et maxima d’attributs extraits d’images numérisées de noyaux cellulaires d’une masse mammaire. Chaque entrée correspond à une femme ayant une tumeur maligne ou bénine (toutes ont une tumeur). Les attributs incluent rayon cellulaire, texture, lissage, compacité, concavité, symétrie, etc.

import pandas as pd

cancer_data = pd.read_csv('data.csv')
pd.options.display.max_columns = len(cancer_data)
print(f'Number of entries: {cancer_data.shape[0]:,}\n'
      f'Number of features: {cancer_data.shape[1]:,}\n\n'
      f'Number of missing values: {cancer_data.isnull().sum().sum()}\n\n'
      f'{cancer_data.head(2)}')
Number of entries: 569
Number of features: 33

Number of missing values: 569

      id diagnosis  radius_mean  texture_mean  perimeter_mean  area_mean  \
0  842302         M        17.99         10.38           122.8     1001.0  
1  842517         M        20.57         17.77           132.9     1326.0  

  smoothness_mean  compactness_mean  concavity_mean  concave points_mean  \
0          0.11840           0.27760          0.3001              0.14710  
1          0.08474           0.07864          0.0869              0.07017  

  symmetry_mean  fractal_dimension_mean  radius_se  texture_se  perimeter_se  \
0         0.2419                 0.07871     1.0950      0.9053         8.589  
1         0.1812                 0.05667     0.5435      0.7339         3.398  

  area_se  smoothness_se  compactness_se  concavity_se  concave points_se  \
0   153.40       0.006399         0.04904       0.05373            0.01587  
1    74.08       0.005225         0.01308       0.01860            0.01340  

  symmetry_se  fractal_dimension_se  radius_worst  texture_worst  \
0      0.03003              0.006193         25.38          17.33  
1      0.01389              0.003532         24.99          23.41  

  perimeter_worst  area_worst  smoothness_worst  compactness_worst  \
0            184.6      2019.0            0.1622             0.6656  
1            158.8      1956.0            0.1238             0.1866  

  concavity_worst  concave points_worst  symmetry_worst  \
0           0.7119                0.2654          0.4601  
1           0.2416                0.1860          0.2750  

  fractal_dimension_worst  Unnamed: 32 
0                  0.11890          NaN 
1                  0.08902          NaN 

Supprimons la dernière colonne qui ne contient que des valeurs manquantes :

cancer_data = cancer_data.drop('Unnamed: 32', axis=1)

Quel pourcentage de femmes ont un cancer confirmé (tumeur maligne) ?

round(cancer_data['diagnosis'].value_counts()*100/len(cancer_data)).convert_dtypes()
B    63
M    37
Name: diagnosis, dtype: Int64

37 % des personnes répondantes présentent un cancer du sein : le jeu de données est donc plutôt équilibré.

Les valeurs de la variable de diagnostic étant catégorielles, il faut les encoder en numérique pour l’apprentissage automatique. Avant cela, séparons les variables prédictrices de la cible diagnosis :

X = cancer_data.iloc[:, 2:32].values
y = cancer_data.iloc[:, 1].values

# Encoding categorical data
from sklearn.preprocessing import LabelEncoder

labelencoder_y = LabelEncoder()
y = labelencoder_y.fit_transform(y)

Créons ensuite les jeux d’entraînement et de test, puis standardisons les variables :

from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=1)

sc = StandardScaler()
X_train = sc.fit_transform(X_train)
X_test = sc.transform(X_test)

Pour modéliser, appliquons deux algorithmes avec leurs paramètres par défaut : k-plus proches voisins (KNN) et régression logistique :

from sklearn.neighbors import KNeighborsClassifier
from sklearn.linear_model import LogisticRegression

# KNN
knn = KNeighborsClassifier()
knn.fit(X_train, y_train)
knn_predictions = knn.predict(X_test)

# Logistic regression
lr = LogisticRegression()
lr.fit(X_train, y_train)
lr_predictions = lr.predict(X_test)

Nous avons vu que le jeu de données est plutôt équilibré : on peut donc comparer les modèles avec l’accuracy :

from sklearn.metrics import accuracy_score

print(f'Accuracy scores:\n'
      f'KNN model:\t\t   {accuracy_score(y_test, knn_predictions):.3f}\n'
      f'Logistic regression model: {accuracy_score(y_test, lr_predictions):.3f}')
Accuracy scores:
KNN model:         0.956
Logistic regression model: 0.974

Sur ces données, la régression logistique offre les meilleures performances pour prédire le caractère malin/bénin d’une tumeur chez une femme présentant une pathologie mammaire.

Pour aller plus loin, la régression logistique offrant peu de paramètres à régler, on peut varier les stratégies de split train/test et tester d’autres techniques de modélisation.

Autres cas d’usage fréquents en santé :

  • suivi en temps réel des données issues des wearables
  • analytique prédictive
  • analyse d’imagerie médicale
  • découverte de médicaments
  • recherche en génétique
  • assistants virtuels
  • gestion des données patients

La data science dans le transport et la logistique

La logistique organise l’acheminement d’un produit d’un point à un autre, tandis que le transport est l’acte de déplacer des personnes ou des marchandises. Selon l’activité (livraison de repas, courrier, fret international, compagnies aériennes, taxis ou bus), les sources de données incluent horaires, feuilles de route, détails d’itinéraires, inventaires d’entrepôt, rapports, contrats, documents légaux, avis clients. Les données, structurées ou non, portent sur les timings, itinéraires, coordonnées, données client, caractéristiques des marchandises, coûts et prix.

La performance dans la chaîne d’approvisionnement et le transport dépend de nombreux facteurs : trafic, qualité des routes, météo, urgences, fluctuations du prix du carburant, ruptures de stock, incidents techniques, retards liés à la sécurité, réglementations, etc. La concurrence s’est également intensifiée. Pour rester compétitifs et améliorer l’efficacité opérationnelle, l’analyse de données massives est devenue incontournable.

Comment la data science aide-t-elle concrètement le transport et la logistique ? Exemples d’applications :

  • pilotage de bout en bout du processus de transport,
  • automatisation et transparence des opérations,
  • respect des délais de livraison,
  • optimisation des itinéraires,
  • tarification dynamique,
  • gestion des stocks d’approvisionnement,
  • protection des denrées périssables,
  • surveillance de l’état des véhicules,
  • optimisation des réseaux de production,
  • amélioration du service client.

Cas d’usage en transport/logistique : positionnement optimal des taxis

Uber Technologies Inc. est une entreprise américaine de services de mobilité et logistique. Dans cette étude de cas, nous allons regrouper des données GPS de trajets Uber pour identifier le positionnement optimal des véhicules. Cela permet notamment :

  • D’affecter chaque nouvelle demande au cluster le plus proche et d’envoyer le véhicule le plus proche à la position du client.
  • D’analyser la charge des clusters (par heure/jour) pour réallouer les voitures vers les zones les plus stratégiques.
  • D’adapter dynamiquement les tarifs selon le ratio offre/demande par cluster.

Nous utilisons un jeu de données de FiveThirtyEight sur les trajets Uber à New York en avril 2014 :

import pandas as pd

uber_data = pd.read_csv('uber-raw-data-apr14.csv')
print(f'Number of trips: {uber_data.shape[0]:,}\n\n'
      f'{uber_data.head()}')
Number of trips: 564,516

          Date/Time      Lat      Lon    Base
0  4/1/2014 0:11:00  40.7690 -73.9549  B02512
1  4/1/2014 0:17:00  40.7267 -74.0345  B02512
2  4/1/2014 0:21:00  40.7316 -73.9873  B02512
3  4/1/2014 0:28:00  40.7588 -73.9776  B02512
4  4/1/2014 0:33:00  40.7594 -73.9722  B02512

Visualisons schématiquement tous les points de prise en charge (longitude en abscisse, latitude en ordonnée) :

import matplotlib.pyplot as plt

plt.scatter(uber_data.iloc[:, 2], uber_data.iloc[:, 1])
plt.show()

Graph of Uber Trip Data

Pour regrouper ces données, utilisons l’algorithme non supervisé k-means. L’idée est de partitionner les observations en plusieurs groupes de variance similaire. On spécifie un nombre de clusters n_clusters (8 par défaut) et l’algorithme sépare les données en conséquence. Pour déterminer le nombre optimal de clusters, on emploie la méthode du coude :

  • Entraîner plusieurs modèles avec des nombres de clusters différents et relever la somme des carrés intra-cluster (WCSS) de chacun.
  • Tracer la WCSS en fonction du nombre de clusters.
  • Sélectionner le plus petit nombre où la WCSS chute nettement.
from sklearn.cluster import KMeans

wcss = []
for i in range(1, 11):
    kmeans = KMeans(n_clusters=i, random_state=1)
    kmeans.fit(uber_data[['Lat', 'Lon']])
    wcss.append(kmeans.inertia_)

plt.figure(figsize=(12, 5))
plt.plot(range(1, 11), wcss)
plt.title('Elbow Method', fontsize=25)
plt.xlabel('Number of clusters', fontsize=18)
plt.ylabel('WCSS', fontsize=18)
plt.xticks(ticks=list(range(1, 11)),
          labels=['1', '2', '3', '4', '5', '6', '7', '8', '9', '10'])
plt.show()

Number of clusters graph

Ici, 7 clusters semblent appropriés. Ajustons le modèle et prédisons le cluster de chaque prise en charge, puis affichons les centroides :

kmeans = KMeans(n_clusters=7, random_state=1)
kmeans.fit_predict(df[['Lat', 'Lon']])
plt.scatter(uber_data.iloc[:, 2], uber_data.iloc[:, 1])
plt.scatter(kmeans.cluster_centers_[:, 1], kmeans.cluster_centers_[:, 0], s=100, c='lime')
plt.show()

Seven cluster centroid graph

Extrayons les coordonnées précises de tous les centroides et affichons-les séparément :

centroids = pd.DataFrame(kmeans.cluster_centers_)
centroids.columns = ['Lat', 'Lon']
print(centroids)
plt.scatter(centroids['Lon'], centroids['Lat'])
plt.show()
  Lat        Lon
0  40.688588 -73.965694
1  40.765423 -73.973165
2  40.788001 -73.879858
3  40.656997 -73.780035
4  40.731074 -73.998644
5  40.700541 -74.201673
6  40.971229 -73.611288

Plotted coordinates for all the centroids

Ce sera plus parlant sur une carte de New York :

import folium

centroids_values = centroids.values.tolist()
nyc_map = folium.Map(location=[40.79659011772687, -73.87341741832425], zoom_start=50000)
for point in range(0, len(centroids_values)):
    folium.Marker(centroids_values[point], popup=centroids_values[point]).add_to(nyc_map)
nyc_map

NYC Map

Avec ce modèle, on peut prédire le cluster le plus proche pour toute position à New York (coordonnées géographiques). Concrètement, Uber enverra le taxi disponible le plus proche, pour un service plus rapide.

Par exemple, trouvons le cluster le plus proche du Lincoln Center for the Performing Arts à Manhattan :

lincoln_center = [(40.7725, -73.9835)]
kmeans.predict(lincoln_center)
array([1])

Et pour Howard Beach dans l’arrondissement du Queens :

howard_beach = [(40.6571, -73.8430)]
kmeans.predict(howard_beach)
array([3])

Pour aller plus loin : tester d’autres algorithmes de clustering, analyser des sous-périmètres (par heure/jour/mois), identifier les clusters les plus/moins chargés, étudier les liens entre clusters et la variable Base du dataframe.

Autres cas d’usage fréquents en transport/logistique :

  • ajustement dynamique des prix selon l’offre et la demande
  • prévision de la demande
  • automatisation des opérations manuelles
  • véhicules autonomes
  • visibilité chaîne d’approvisionnement
  • détection de dommages
  • gestion d’entrepôt
  • analyse du sentiment client
  • chatbots de service client

La data science dans les télécoms

Ces deux dernières décennies, les télécommunications ont connu une croissance fulgurante et ont changé d’échelle. Nous sommes entourés d’équipements électroniques et nombreux sont ceux dépendants d’Internet, notamment des réseaux sociaux et messageries. Si cette « dépendance » est parfois critiquée, force est de constater que les télécoms ont grandement facilité nos vies, en nous connectant en quelques secondes.

Cela a été encore plus vrai pendant la pandémie de COVID-19, lorsque entreprises et établissements scolaires ont massivement adopté le travail et l’enseignement à distance. La qualité et la fluidité de la connectivité numérique sont alors devenues cruciales. Ces usages accrus ont entraîné une explosion des volumes de télécommunications, générant des masses de données.

Exploiter la data science aide le secteur à :

  • rationaliser les opérations,
  • optimiser le réseau,
  • filtrer le spam,
  • améliorer les transmissions,
  • faire de l’analyse temps réel,
  • définir des stratégies métier efficaces,
  • créer des campagnes marketing performantes,
  • accroître les revenus.

Explorons un cas classique : la détection et le filtrage des messages indésirables.

Cas d’usage en télécoms : construire un filtre anti-spam

Le filtrage du spam est essentiel à tout canal de communication écrit moderne pour nous protéger des tentatives d’arnaque quotidiennes. Techniquement, c’est un problème de classification : sur la base des historiques, chaque nouveau message est étiqueté ham (légitime) — il parvient alors directement au destinataire — ou spam — il est bloqué ou dirigé vers le dossier spam.

Un algorithme très populaire est le classificateur Naive Bayes. Il repose sur le théorème de Bayes et l’hypothèse (naïve) d’indépendance des mots d’un message. Cette hypothèse ignore le contexte et les représentations sémantiques, mais fonctionne souvent très bien pour des tâches de classification de textes avec peu de données.

Plusieurs variantes existent : multinomiale, Bernoulli, gaussienne, flexible Bayes. Pour la détection de spam, la version multinomiale est la plus adaptée, car elle s’appuie sur les comptages discrets de mots.

Appliquons Naive Bayes multinomial au jeu de données SMS Spam Collection de l’UCI Machine Learning Repository.

import pandas as pd

sms_data = pd.read_csv('SMSSpamCollection', sep='\t', header=None, names=['Label', 'SMS'])
print(f'Number of messages: {sms_data.shape[0]:,}\n\n'
      f'{sms_data.head()}')
Number of messages: 5,572

  Label                                                SMS
0   ham  Go until jurong point, crazy.. Available only ...
1   ham                      Ok lar... Joking wif u oni...
2  spam  Free entry in 2 a wkly comp to win FA Cup fina...
3   ham  U dun say so early hor... U c already then say...
4   ham  Nah I don't think he goes to usf, he lives aro...

Il y a 5 572 messages étiquetés par des humains. Quelle part (en %) sont des spams ?

round(sms_data['Label'].value_counts()*100/len(sms_data)).convert_dtypes()
ham     87
spam    13
Name: Label, dtype: Int64

13 % des SMS ont été identifiés comme spam.

Pour préparer les données au classificateur Naive Bayes multinomial, suivons ces étapes :

  1. Encoder les labels en format numérique (binaire 0/1 ici).
  2. Extraire prédicteurs et variable cible.
  3. Scinder en jeux d’entraînement et de test.
  4. Vectoriser les messages de la colonne SMS des jeux train/test pour obtenir des matrices CSR.

Sur le point 4 : on crée un objet de vectorisation, on l’ajuste sur le vocabulaire (mots uniques du train et leurs fréquences), puis on transforme les jeux train/test en matrices. Les colonnes représentent les mots uniques, les lignes les messages, et les cellules les fréquences par message.

from sklearn.model_selection import train_test_split
from sklearn.feature_extraction.text import CountVectorizer

# Encoding labels
sms_data = sms_data.replace('ham', 0).replace('spam', 1)

X = sms_data['SMS'].values
y = sms_data['Label'].values

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.2, random_state=1)

# Vectorizing strings from the 'SMS' column
cv = CountVectorizer(max_df=0.95)
cv.fit(X_train)
X_train_csr_matrix = cv.transform(X_train)
X_test_csr_matrix = cv.transform(X_test)

Construisons ensuite un Naive Bayes multinomial avec les paramètres par défaut et évaluons sa performance :

from sklearn.naive_bayes import MultinomialNB
from sklearn.metrics import accuracy_score, f1_score

clf = MultinomialNB()
clf.fit(X_train_csr_matrix, y_train)
predictions = clf.predict(X_test_csr_matrix)

print(f'Model accuracy:\n'
      f'Accuracy score: {accuracy_score(y_test, predictions):.3f}\n'
      f'F1-score:       {f1_score(y_test, predictions):.3f}\n')
Model accuracy:
Accuracy score: 0.990
F1-score:       0.962

On obtient ainsi un filtre anti-spam très précis.

Pour améliorer encore le résultat, on peut tester d’autres stratégies de split, ajuster la vectorisation (par ex. seüil d’élagage des mots trop fréquents), analyser les rares erreurs du classificateur, visualiser les mots les plus fréquents (après nettoyage et suppression des stopwords) via un nuage de mots, ou comparer avec d’autres algorithmes (SVM, arbres de décision, réseaux de neurones).

Autres cas d’usage fréquents en télécoms :

  • segmentation client
  • développement produit
  • analyse des détails d’appels (CDR)
  • systèmes de recommandation
  • prédiction du churn
  • marketing ciblé
  • détection de fraude
  • gestion et optimisation de réseau
  • sécurité réseau renforcée
  • optimisation des prix
  • prédiction de la valeur vie client

Études de cas en data science : formations

Nous avons parcouru de nombreux cas d’application de la data science dans différents domaines. Si vous souhaitez maintenant approfondir, à partir de jeux de données réels, et appliquer vos nouvelles compétences à vos propres enjeux, ces cours courts et accessibles constituent un excellent point de départ :

  1. Case Study: School Budgeting with Machine Learning in Python. Ce cours, basé sur une étude de cas issue d’une compétition DrivenData, traite d’un problème de budgétisation dans des districts scolaires et de la façon de faciliter la comparaison des dépenses. En appliquant des techniques de traitement du langage, vous préparerez les budgets et construirez un modèle qui classe automatiquement les postes, d’une version simple vers une version avancée. Vous pourrez étudier la solution gagnante et analyser d’autres soumissions.
  2. Analyzing Marketing Campaigns with pandas. Pandas est la bibliothèque Python la plus populaire : la maîtriser est indispensable. Dans ce cours très pratique, vous consoliderez les fondamentaux de Python et pandas (ajout de colonnes, jointures/découpe de jeux de données, manipulation de dates, visualisation avec matplotlib) sur un jeu de données marketing d’un service d’abonnement en ligne. Vous apprendrez à traduire des questions marketing en indicateurs mesurables : « Comment la campagne a-t-elle performé ? », « Pourquoi tel canal sous-performe ? », « Quel canal génère le plus d’abonnés ? », etc.
  3. Analyzing US Census Data in Python. Apprenez à naviguer facilement dans le Decennial Census et l’American Community Survey pour en extraire des données démographiques et socioéconomiques (revenus des ménages, mobilité, composition familiale, etc.). Vous utiliserez Python pour requêter l’API du Census, pandas pour manipuler les données, et pratiquerez la cartographie avec geopandas.
  4. Case Study: Exploratory Data Analysis in R. Idéal si vous connaissez déjà les bases de la manipulation et de la visualisation de données en R. Vous exercerez vos compétences sur un jeu réel concernant les votes à l’Assemblée générale de l’ONU : tendances par pays, dans le temps et selon les enjeux internationaux. Vous mènerez une analyse exploratoire de bout en bout, avec dplyr et ggplot2, et apprendrez de nouvelles techniques.
  5. Human Resources Analytics: Exploring Employee Data in R. R est particulièrement adapté à l’analyse statistique. Dans ce cours, vous exploiterez cet atout pour manipuler, visualiser et tester statistiquement une série d’études de cas RH. L’analyse de données en RH s’est imposée récemment et constitue un axe prometteur : les entreprises attendent de plus en plus de leurs équipes RH des recommandations fondées sur les données employés.
  6. Data-Driven Decision Making in SQL. Apprenez à utiliser SQL pour appuyer la prise de décision et reporter vos résultats au management. L’étude de cas porte sur une plateforme de location de films en ligne (données clients, notes, informations sur les acteurs, etc.). Vous écrirez des requêtes pour analyser préférences, engagement et évolution des ventes. Vous verrez aussi des extensions SQL pour l’OLAP afin d’obtenir des insights clés à partir de données multidimensionnelles complexes.

Que vous visiez l’expertise en data science ou que vous souhaitiez simplement acquérir des compétences de codage utiles pour générer des insights basés sur les données dans votre domaine, ces ressources sont un excellent point de départ.

Conclusion

En résumé, nous avons défini la data science sous plusieurs angles, distingué ses usages de ceux de l’analyse de données, précisé ce qu’est un cas d’usage et décrit une feuille de route générale pour le résoudre avec succès. Nous avons illustré son utilité sur des tâches concrètes dans des secteurs porteurs, en détaillant les cas les plus courants et la façon de les aborder via des algorithmes d’analyse et de data science. Pour d’autres secteurs, consultez nos articles de cas d’usage en banque, marketing et vente. Enfin, nous avons listé plusieurs cours en ligne pour approfondir d’autres études de cas.

Derniere observation : aucun des secteurs abordés n’est nouveau. Certains, comme la médecine ou la vente, existent depuis des siècles. Tout au long de leur histoire, bien avant l’ère de la numérisation, des données étaient déjà consignées dans des documents, archivées et conservées. Ce qui a changé récemment avec les nouvelles technologies, c’est la prise de conscience du formidable potentiel de toute donnée et de l’importance de la collecter et de la stocker correctement. Ces efforts, alliés à l’amélioration continue des systèmes de gestion des données, ont rendu possible l’accumulation de big data dans tous les secteurs, au service de l’analyse et de la prévision.

Sujets
Science des données
Maîtrise des données
Contenus associés

blog

Architecture de l'entrepôt de données : Tendances, outils et techniques

Apprenez l'essentiel de l'architecture d'un entrepôt de données, des composants clés aux meilleures pratiques, pour construire un système de données évolutif et efficace !
Kurtis Pykes 's photo

Kurtis Pykes

15 min

blog

2022-2023 Rapport annuel DataCamp Classrooms

À l'aube de la nouvelle année scolaire, DataCamp Classrooms est plus motivé que jamais pour démocratiser l'apprentissage des données, avec plus de 7 650 nouveaux Classrooms ajoutés au cours des 12 derniers mois.
Nathaniel Taylor-Leach's photo

Nathaniel Taylor-Leach

8 min

Tutoriel

Python Switch Case Statement : Guide du débutant

Découvrez le match-case de Python : un guide sur sa syntaxe, ses applications en data science, ML, et une analyse comparative avec le switch-case traditionnel.
Matt Crabtree's photo

Matt Crabtree

5 min

cursor ai code editor

Tutoriel

Cursor AI : Un guide avec 10 exemples pratiques

Apprenez à installer Cursor AI sur Windows, macOS et Linux, et découvrez comment l'utiliser à travers 10 cas d'utilisation différents.

Tutoriel

Données JSON Python : Un guide illustré d'exemples

Apprenez à utiliser JSON en Python, notamment la sérialisation, la désérialisation, le formatage, l'optimisation des performances, la gestion des API, ainsi que les limites et les alternatives de JSON.
Moez Ali's photo

Moez Ali

6 min

Tutoriel

Normalisation vs. Standardisation: comment faire la différence

Découvrez les principales différences, les applications et la mise en œuvre de la normalisation et de la standardisation dans le prétraitement des données pour l’apprentissage automatique.
Samuel Shaibu's photo

Samuel Shaibu

9 min

Voir PlusVoir Plus