Cours
Qu'il s'agisse d'estimer des paramètres de population ou de prédire des variables dépendantes, toute étude statistique comporte une part d'incertitude. Cette incertitude provient du processus d'échantillonnage. Il est irréaliste de considérer l’ensemble de la population lors d’une analyse statistique. Il faut donc choisir un échantillon représentatif — que ce soit pour estimer un paramètre de population, comme la moyenne, ou pour construire un modèle de régression.
Pour apprendre ou réviser ces bases, consultez le cours d'introduction aux statistiques de DataCamp.
La vraie valeur du paramètre de population n’est généralement pas exactement égale à la valeur estimée à partir de l’échantillon — cet écart correspond à l’erreur standard. Pour en tenir compte, on estime une valeur attendue puis on précise un intervalle dans lequel la valeur réelle a des chances de se trouver.
De même, les études de régression reposent sur des échantillons aléatoires plutôt que sur l’ensemble de la population. La relation entre variables dépendante et indépendantes, estimée par la régression sur l’échantillon, n’est pas exactement égale à la relation vraie au niveau de la population. Par conséquent, la valeur prédite pour une observation n’est pas strictement égale à sa vraie valeur. On s’attend à ce que la vraie valeur se situe dans un certain intervalle autour de la prédiction.
Cet article explique la signification de ces deux types d’intervalles et les méthodes mathématiques sous-jacentes pour les calculer. Il présente des exemples concrets d’utilisation de chaque intervalle. Enfin, il illustre, pas à pas, le calcul des intervalles de confiance et de prédiction dans le langage R.
Qu’est-ce qu’un intervalle de confiance ?
Un intervalle de confiance est une plage de valeurs qui devrait — avec un certain niveau de confiance — contenir la vraie valeur d’un paramètre de population, tel que la moyenne de population.
Intervalles de confiance en inférence statistique
Un paramètre de population est une propriété numérique de l’ensemble de la population. La moyenne (de l’ensemble de la population) en est un exemple. La vraie valeur des coefficients de régression entre deux variables en est un autre. Les statistiques inférentielles consistent à étudier un échantillon aléatoire afin d’estimer un paramètre de population.
Supposons, par hypothèse, que vous soyez horticulteur ou producteur d’oranges et que vous vouliez savoir quelle épaisseur atteignent les orangers à 100 jours. Il est impossible d’étudier chaque oranger de 100 jours. Vous sélectionnez donc aléatoirement quelques arbres de 100 jours et mesurez leur circonférence (épaisseur). La moyenne de ces mesures vous donne la moyenne d’échantillon. Vous souhaitez utiliser cette moyenne d’échantillon pour estimer la moyenne de population.

Une population d’orangers. Créée avec DALL-E.
La moyenne d’échantillon est une estimation ponctuelle du paramètre de population (ici, la moyenne). Ce cours sur l’inférence statistique de DataCamp développe ces notions en détail.
La moyenne d’échantillon est représentative de la moyenne de population, sans lui être exactement égale. On s’attend à ce que la moyenne de population se situe dans un certain intervalle autour de la moyenne d’échantillon, appelé intervalle de confiance.
- Plus l’échantillon est grand, plus il est représentatif de la population ; ainsi, des tailles d’échantillon plus élevées conduisent à des intervalles de confiance plus étroits.
- Par ailleurs, plus la variance des données est faible, plus l’estimation ponctuelle est proche du vrai paramètre. Ainsi, plus l’écart-type est faible, plus l’intervalle est étroit.
Intervalles de confiance en régression
La section précédente a expliqué les intervalles de confiance en inférence statistique. La régression fait également appel à des intervalles de confiance.
Par exemple, reprenons une variante des orangers :
- Vous ne souhaitez pas mesurer un échantillon d’orangers âgés de 100 jours.
- Vous disposez déjà de mesures de circonférence d’un échantillon d’orangers à 30, 60, 90, 120 jours, etc.
- Vous voulez utiliser ces informations pour estimer la circonférence moyenne des arbres de 100 jours.
Vous procédez par analyse de régression. Le jeu de données utilisé pour la régression provient d’un échantillon d’orangers. Ainsi, la moyenne estimée sur l’échantillon (circonférence moyenne des orangers de 100 jours) ne coïncidera pas exactement avec la moyenne de population. La vraie valeur de la moyenne de population se situe dans un intervalle de confiance autour de la moyenne estimée.
Les sections suivantes présentent et expliquent les expressions mathématiques de l’intervalle de confiance.
Qu’est-ce qu’un intervalle de prédiction ?
Un intervalle de prédiction est une plage de valeurs qui devrait — avec un certain niveau de confiance — contenir la vraie valeur d’une observation individuelle, à partir d’une prédiction issue d’une analyse de régression.
Considérons une autre variante de l’exemple de régression :
- Vous ne cherchez pas à estimer la circonférence moyenne des arbres de 100 jours (comme dans l’exemple précédent).
- Vous avez plutôt un oranger précis, âgé de 100 jours, dont vous souhaitez prédire la circonférence (sans la mesurer).
Vous utilisez la même formule de régression que précédemment. La valeur estimée (c’est-à-dire la valeur attendue) de la circonférence individuelle est la même que la moyenne estimée. Toutefois, vous devez tenir compte de la variabilité accrue des observations individuelles, puisque vous prédisez une valeur individuelle (et non une moyenne). L’intervalle de prédiction est donc plus large que l’intervalle de confiance.
Plus loin dans l’article, vous verrez les formules correspondantes et apprendrez à les calculer avec R.
Devenez un scientifique ML
Différences entre intervalles de prédiction et intervalles de confiance
Les deux notions — intervalle de prédiction et intervalle de confiance — sont étroitement liées. Une même analyse peut mobiliser les deux. Il est donc utile de les comparer directement.
Objectif et interprétation
Lorsque vous avez besoin d’un paramètre de population, comme une moyenne, vous utilisez un échantillon pour l’estimer. Comme la taille de l’échantillon est en général bien inférieure à celle de la population, l’estimation d’échantillon est imparfaite. L’intervalle de confiance est la plage (autour de l’estimation d’échantillon) censée contenir le paramètre de population.
Les coefficients de régression sont aussi des paramètres de population. Parce qu’ils sont estimés à partir d’un échantillon (et non de la population entière), une erreur leur est associée. Ils peuvent donc être fournis avec un intervalle de confiance.
Par ailleurs, la régression permet de prédire soit :
- La valeur moyenne d’une variable dépendante (par exemple, le poids moyen de chiens de 2 ans), ou
- La valeur d’une observation individuelle (par exemple, un chien de 2 ans en particulier).
Dans le premier cas, on utilise un intervalle de confiance ; dans le second, un intervalle de prédiction. La section suivante détaille davantage cette différence.
Calcul et largeur de l’intervalle
Calculer l’intervalle de confiance en inférence statistique
Comme expliqué plus haut, la largeur de l’intervalle de confiance est proportionnelle à l’écart-type et inversement proportionnelle à la taille d’échantillon. L’intervalle de confiance de la moyenne de population, 𝛍, s’écrit :
Dans cette expression :
- x est la moyenne d’échantillon, l’estimation que vous mesurez
- 𝛍 est la moyenne de population, le paramètre que vous souhaitez estimer.
- n est la taille d’échantillon
- s est l’écart-type d’échantillon
- t est la valeur critique de la loi de Student au
- Niveau de confiance 1 - α
- n-1 degrés de liberté
- Vous trouverez les valeurs de t dans des tables standard — cherchez « table de Student ».
Ainsi, la plage de 𝛍 est :
Niveaux de confiance et niveaux de signification
Notez aussi que la largeur de l’intervalle est proportionnelle à la valeur t. Si vous voulez un degré de confiance (certitude) très élevé que la valeur réelle se situe dans la plage donnée, cette plage doit être très large. Plus le degré de confiance est faible, plus l’intervalle est étroit. Mais un degré de confiance trop faible est peu utile. En pratique, on choisit généralement des niveaux de confiance de 90 %, 95 %, 99 %, etc.
Un niveau de confiance de 95 % correspond à un niveau de signification de 5 %. En supposant un intervalle bilatéral, vous devez trouver la valeur critique de t à 2,5 % (0,025).
Conceptuellement, tous les intervalles s’expriment ainsi :
Dans tous les cas, plus l’erreur est grande, plus l’intervalle est large. Cette erreur se calcule différemment selon le cas d’usage. En inférence, l’erreur est l’écart-type. En régression, l’erreur est présentée dans les sections suivantes.
Calculer l’intervalle de confiance en régression
Quand vous prédisez la valeur moyenne de la variable dépendante, vous estimez sa plage via l’intervalle de confiance. Par exemple, vous voulez prédire une plage pour le poids moyen de chiens de 2 ans en fonction de leur âge. C’est l’intervalle de confiance de la réponse moyenne. Il s’agit aussi d’un paramètre de population car il concerne toute la population. L’intervalle s’écrit :
Dans cette expression :
- y0 est la vraie valeur du paramètre prédit.
- y0 est la valeur prédite par la relation de régression.
- La valeur critique t est expliquée dans la section précédente
- n est la taille d’échantillon
- (x0 - x) est l’écart entre la valeur moyenne de x et x0, pour laquelle vous prédisez y0. Plus cet écart est grand, plus l’intervalle s’élargit. Vous obtenez donc des intervalles étroits (et des prédictions plus précises) pour des valeurs de x proches de la moyenne d’échantillon.
- SSx est la somme des carrés des écarts des x d’échantillon. Elle s’écrit :
- SE est l’erreur standard de l’estimation. Elle est la racine carrée de l’erreur quadratique moyenne (MSE). La MSE est la variance de l’erreur. Ainsi, SE est analogue à l’écart-type de l’erreur. La MSE est basée sur l’erreur résiduelle. Elle s’écrit :
![]()
Dans cette expression, le terme de somme est aussi appelé somme des carrés des résidus. Le résidu est la différence entre la vraie valeur de y et la valeur prédite de y.
En utilisant la MSE à la place de SE, l’intervalle de confiance de la réponse moyenne peut aussi s’écrire :

Comparez cette expression à la relation conceptuelle présentée plus haut.
![]()
Observez que l’erreur prend en compte :
- L’écart entre les valeurs réelle et prédite de y.
- La différence entre la valeur moyenne de x et la valeur de xo, pour laquelle vous générez la prédiction
- La dispersion globale des valeurs de x (autour de leur moyenne)
Calculer l’intervalle de prédiction en régression
Pour prédire la valeur d’une observation individuelle (et non la moyenne), vous estimez sa plage via l’intervalle de prédiction. Par exemple, vous voulez prédire la plage du poids réel d’un chien de 2 ans en particulier en fonction de l’âge. C’est l’intervalle de prédiction, exprimé comme suit :

Comparez-le à l’intervalle de confiance présenté plus haut :

Remarquez que les deux expressions sont très proches. La seule différence réside dans le terme d’erreur supplémentaire de l’intervalle de prédiction. L’intervalle de prédiction ajoute un terme de MSE sous la racine carrée par rapport à l’intervalle de confiance. Il tient compte de la variabilité des valeurs de y que vous souhaitez prédire. Cela rend l’intervalle de prédiction plus large que l’intervalle de confiance.
Le schéma ci-dessous illustre les intervalles de confiance et de prédiction par rapport à l’estimation ponctuelle (valeur prédite).

Comparaison des intervalles de confiance et de prédiction autour d’une estimation ponctuelle. Image de l’auteur.
Le croquis schématique ci-dessous montre les intervalles de confiance et de prédiction autour de la régression — remarquez également que les intervalles sont les plus étroits à proximité de la moyenne.

Illustration des intervalles de confiance et de prédiction en régression. Image de l’auteur.
Quand utiliser un intervalle de confiance
Les sections précédentes ont rappelé les bases des intervalles de confiance et de prédiction, leurs usages et les formules de calcul. Voici des exemples concrets d’application.
On utilise un intervalle de confiance pour estimer un paramètre de population. Pour estimer ce paramètre, vous pouvez :
- Utiliser des mesures directes à partir d’un échantillon aléatoire
- Utiliser un modèle de régression basé sur un échantillon aléatoire
Quelques cas d’usage typiques des intervalles de confiance :
- Estimer un paramètre de population à partir d’un échantillon aléatoire mesuré. Par exemple, pour estimer la taille et le poids moyens des nouveau-nés, vous mesurez un échantillon aléatoire de nourrissons.
- Estimer le comportement d’une population en étudiant un échantillon aléatoire. Cas fréquent en essais cliniques, où l’on cherche à estimer les effets d’un médicament sur la population en observant ses effets sur un échantillon aléatoire.
- Prédire la réponse moyenne d’une variable dépendante à partir d’une régression réalisée sur un échantillon aléatoire. Par exemple, prédire le poids moyen de chiots de 55 jours à partir d’un échantillon de poids mesurés tous les 15 jours.
- Définir des tolérances en production. Si une machine fabrique des pièces d’un poids spécifié, chaque pièce n’a pas exactement le même poids. Le poids de chaque pièce se situe dans un intervalle de confiance autour de la spécification. Cet intervalle constitue la tolérance. Les pièces en dehors des tolérances sont rejetées. La machine est censée produire majoritairement des pièces dans la tolérance.
- Contrôle qualité. Pour vérifier que les pièces produites respectent les tolérances, il est impossible de tout mesurer. On prélève des échantillons aléatoires, on les mesure, puis on utilise les estimations d’échantillon pour évaluer les paramètres de population.
- Tester des hypothèses. Niveaux de confiance et de signification sont les deux faces d’une même pièce. Niveau de signification = 1 - niveau de confiance. Un intervalle de confiance, à un niveau donné, inclut les valeurs pour lesquelles l’hypothèse nulle est vraie à un niveau de signification de (1 - niveau de confiance).
Quand utiliser un intervalle de prédiction
Les intervalles de prédiction s’emploient lorsque vous prédisez la valeur attendue d’une observation individuelle à partir d’observations (et d’une régression) sur un échantillon aléatoire.
Exemples pratiques :
- Prédire la plage d’une observation individuelle à partir d’une régression. Comme les observations individuelles peuvent être plus variables (que la moyenne d’échantillon), l’intervalle de prédiction doit être plus large. Par exemple, prédire le poids d’un chiot de 55 jours en particulier à partir d’un échantillon de poids mesurés tous les 15 jours.
- Utiliser des simulations de Monte-Carlo pour prédire la valeur d’une variable inconnue. Les méthodes de Monte-Carlo étant probabilistes, chaque exécution produit un résultat légèrement différent. Ces écarts sont capturés dans un intervalle d’incertitude de Monte-Carlo, conceptuellement proche d’un intervalle de prédiction.
- En régression « standard », on prédit la valeur moyenne d’un paramètre. En régression quantile, on entraîne des modèles pour différentes quantiles de la cible, ce qui permet de construire des intervalles de prédiction plus granulaires.
- Les modèles de machine learning visent à prédire la valeur d’un paramètre inconnu. Souvent fondés sur des méthodes statistiques, ils prédisent la valeur moyenne de la quantité inconnue. Ainsi, la sortie du modèle inclut la valeur attendue (moyenne) et l’intervalle de prédiction.
- Les modèles de deep learning utilisent des réseaux de neurones pour effectuer des prédictions. Pour évaluer l’incertitude, on « droppe » aléatoirement des neurones afin d’étudier la variabilité des sorties. La variance de ces prédictions sert à construire l’intervalle de prédiction.
- En prévision de séries temporelles, l’objectif est de prédire la valeur d’un indicateur à un pas de temps futur. Les prédictions s’appuient sur des modèles statistiques comme ARIMA, qui effectuent une auto-régression sur moyenne mobile. Ils prédisent donc une valeur attendue. Les valeurs réellement observées se situent dans un intervalle de prédiction autour de cette valeur attendue. Cet intervalle est fonction de l’écart-type. Par exemple, pour un niveau de confiance de 95 %, l’intervalle se trouve à ±1,96 écart-type de la valeur attendue. En outre, les prévisions multi-pas, avec un horizon plus long, impliquent des intervalles de prédiction plus larges. Pour en savoir plus sur les séries temporelles, consultez le cours de DataCamp sur l’analyse de séries temporelles.
Intervalle de confiance vs intervalle de prédiction : récapitulatif
Les intervalles de confiance et de prédiction sont souvent utilisés dans des contextes similaires, d’où l’importance de comprendre leurs différences.
Ce tableau récapitule les distinctions abordées ci-dessus :
|
Intervalle de confiance |
Intervalle de prédiction |
|
Utilisé pour déterminer des paramètres de population à partir de statistiques d’échantillon |
Non utilisé pour déterminer des paramètres de population à partir d’échantillons |
|
Permet de prédire la réponse moyenne (valeur moyenne de la variable dépendante pour une variable indépendante donnée) via des régressions |
Permet de prédire la valeur future (d’une observation individuelle pour une variable indépendante donnée) via des régressions |
|
Généralement plus étroit pour une analyse donnée |
Généralement plus large pour une analyse donnée |
Implémenter les intervalles de confiance et de prédiction en R
Cette section propose des exemples pratiques en R pour estimer des intervalles de confiance et de prédiction. R est un langage conçu pour les applications statistiques, livré avec des jeux de données et des fonctions dédiées.
Pour approfondir la régression en R, suivez le tutoriel de DataCamp sur la régression linéaire en R.
Les exemples ci-dessous utilisent le jeu de données intégré Orange. Il suit la circonférence (en millimètres) et l’âge (en jours) d’orangers. Naturellement, plus l’arbre est âgé, plus sa circonférence est grande.
Implémenter des intervalles de confiance en R
Les exemples suivants montrent comment estimer des intervalles de confiance pour des statistiques descriptives et des analyses de régression.
Intervalle de confiance en statistiques descriptives
Pour obtenir l’intervalle de confiance de la moyenne, exécutez le test t standard avec la fonction t.test() sur le jeu de données :
t.test(Orange$circumference)
La sortie ressemble à l’exemple suivant :
t = 11.923, df = 34, p-value = 1.076e-13
alternative hypothesis: true mean is not equal to 0
95 percent confidence interval:
96.10926 135.60502
sample estimates:
mean of x
115.8571
Vous obtenez l’estimation de la moyenne et l’intervalle de confiance à 95 %. Par défaut, la fonction t.test utilise un niveau de confiance de 95 %. Utilisez le paramètre conf.level pour spécifier un autre niveau, par exemple 99 %.
> t.test(Orange$circumference, conf.level = 0.99)
Cette commande produit la sortie suivante :
t = 11.923, df = 34, p-value = 1.076e-13
alternative hypothesis: true mean is not equal to 0
99 percent confidence interval:
89.34458 142.36970
sample estimates:
mean of x
115.8571
Notez que la moyenne estimée est identique dans les deux cas. En revanche, l’intervalle doit s’élargir pour atteindre un niveau de confiance plus élevé. D’après les données, nous sommes confiants à 99 % que la moyenne se situe entre 89,3 et 142,4, mais seulement à 95 % qu’elle se situe entre 96,1 et 135,6. Pour un paramètre estimé sur un échantillon donné, plus l’intervalle est étroit, plus le niveau de confiance est faible.
Intervalle de confiance en régression
En régression, vous avez besoin d’intervalles de confiance pour les coefficients et pour les valeurs prédites.
Pour une compréhension approfondie des régressions en R, suivez le cours DataCamp sur l’inférence pour la régression linéaire en R.
Intervalle de confiance des coefficients de régression
Les coefficients de régression sont estimés à partir d’un échantillon aléatoire. Ils ne sont donc pas les « vrais » coefficients de la population. Les estimations comportent une incertitude. En plus de leurs valeurs estimées, il est utile de fournir un intervalle de confiance pour ces paramètres.
Utilisez la fonction lm() pour construire un modèle linéaire sur le jeu de données Orange afin de prédire la circonférence (en mm) des orangers à partir de l’âge (en jours) :
model_orange <- lm(circumference ~ age, data = Orange)
Affichez les coefficients de ce modèle linéaire :
model_orange
Cette commande affiche les paramètres du modèle (interception et pente) comme ci-dessous :
Coefficients: (Intercept) age
17.3997 0.1068
Utilisez la fonction confint() pour calculer les intervalles de confiance à 95 % :
confint(model_orange, level = 0.95)
Vous voyez maintenant les intervalles de confiance à 95 % de la pente et de l’interception estimées par le modèle :
2.5 % 97.5 %
(Intercept) -0.14328303 34.9425835
age 0.08993141 0.1236092
Intervalle de confiance d’une prédiction de réponse moyenne
Utilisez le modèle de régression ci-dessus pour prédire la circonférence moyenne attendue d’arbres de 900 jours. Utilisez le paramètre interval pour demander un intervalle de confiance.
predict(model_orange, data.frame(age = 900), interval = "confidence", level = 0.95)
La sortie inclut la prédiction (fit) et l’intervalle de confiance (lwr et upr pour bornes inférieure et supérieure), comme ci-dessous :
fit lwr upr
1 113.4929 105.3211 121.6647
Implémenter des intervalles de prédiction en R
Reprenez le même modèle pour prédire la circonférence d’un oranger individuel âgé de 900 jours. Utilisez le paramètre interval pour demander l’intervalle de prédiction.
> predict(model, data.frame(age = 900), interval = "prediction", level = 0.95)
La sortie ressemble à l’exemple suivant :
fit lwr upr
1 113.4929 64.5118 162.4741
Notez que, dans les deux cas, la valeur prédite de la circonférence est la même — 113,49. Toutefois, l’intervalle de prédiction est bien plus large que l’intervalle de confiance. L’intervalle de confiance de la prédiction est la plage censée contenir la circonférence moyenne des arbres de 900 jours. L’intervalle de prédiction est la plage attendue pour la circonférence d’un arbre individuel de 900 jours. Les variations entre individus sont en effet plus importantes et se lissent lorsqu’on considère une moyenne.
Idées reçues et écueils fréquents
Les intervalles statistiques sont courants dans les domaines appliqués comme l’analyse de données, la pharmaceutique, l’économétrie, etc. Sans formation académique en statistiques, il est facile de confondre intervalles de confiance et de prédiction.
Voici quelques idées reçues fréquentes :
- Prédire sans considérer l’intervalle de prédiction.
- Avec un modèle de régression, pour une valeur donnée de la variable indépendante, l’équation fournit la valeur attendue de la variable dépendante. La valeur réelle coïncide rarement avec cette valeur attendue, mais se situe dans une plage définie par l’intervalle de prédiction.
- Penser qu’une analyse de régression n’implique que des intervalles de prédiction.
- Avec un modèle de régression, vous faites deux types de prédictions : 1) une valeur future individuelle, et 2) la réponse moyenne. Dans l’exemple des orangers, vous pouvez prédire 1) la circonférence d’un oranger précis de 900 jours, ou 2) la circonférence moyenne de tous les arbres de 900 jours. Dans les deux cas, la valeur attendue est la même. Cependant, le premier cas requiert l’intervalle de prédiction, le second l’intervalle de confiance.
- Croire que l’intervalle le plus étroit est le « meilleur ».
- Il peut être tentant de ne retenir que l’intervalle le plus étroit dans une étude de régression. L’intervalle de confiance n’est pas « meilleur » parce qu’il est plus étroit. Il est plus étroit car il encadre autre chose que l’intervalle de prédiction. Demandez-vous si vous cherchez à prédire une moyenne ou une valeur individuelle.
- Confondre intervalle de confiance et intervalle de prédiction.
- Si votre prédiction consiste à déterminer la valeur d’un paramètre de population à partir d’un échantillon, ou à prédire la réponse moyenne via une régression, utilisez l’intervalle de confiance. Si vous prédisez une propriété d’une observation individuelle à partir d’une régression, utilisez l’intervalle de prédiction.
Conclusion
Cet article a présenté un aperçu des intervalles de confiance et de prédiction. Il explique la différence entre ces notions proches et propose des exemples concrets pour savoir quand utiliser chaque type d’intervalle. Il montre aussi comment calculer ces intervalles en R.
Pour apprendre à appliquer des formules statistiques en Python, consultez le cours DataCamp sur les statistiques en Python. Enfin, si vous préparez des entretiens incluant des questions de statistiques, découvrez le cours DataCamp sur les questions d’entretien en statistiques en Python.
Devenez un scientifique ML
FAQs
Pourquoi a-t-on besoin d’intervalles ? Pourquoi la valeur vraie n’est-elle pas égale à la valeur attendue ?
Nous avons besoin d’intervalles car, en pratique, nous étudions de petits échantillons plutôt que l’ensemble de la population. Les propriétés d’échantillon, que nous pouvons mesurer et prédire, sont indicatives mais pas exactement égales aux propriétés de population que nous visons. La vraie valeur se situe toutefois dans un certain intervalle autour de la valeur attendue.
Les intervalles de confiance et de prédiction sont-ils interchangeables ?
Non, ce sont des concepts très différents. Les intervalles de confiance expriment la plage d’un paramètre de population, comme la moyenne. Les intervalles de prédiction portent sur la plage de la vraie valeur d’une observation individuelle.
Les intervalles de confiance et de prédiction sont-ils jamais utilisés dans le même contexte ?
Oui, ils sont tous deux utilisés en régression. Vous pouvez vouloir prédire soit la valeur moyenne d’un ensemble (par exemple le poids moyen de chiens de 2 ans), soit la valeur d’un individu précis. Dans le premier cas, on utilise l’intervalle de confiance ; dans le second, l’intervalle de prédiction.
Les intervalles de confiance et de prédiction dépendent-ils de la taille d’échantillon ?
Oui. Plus la taille d’échantillon est grande, meilleures sont les estimations des paramètres de population. Les estimations issues d’un grand échantillon ont donc des intervalles plus étroits.
Puis-je utiliser une estimation d’échantillon sans l’intervalle ?
En principe oui. En pratique, c’est peu utile. L’estimation d’échantillon est la valeur « attendue ». La valeur réelle coïncide rarement avec elle, mais se situe probablement dans une plage autour de cette valeur. Fournir l’intervalle avec l’estimation est donc la norme. On peut se passer de la valeur attendue si l’on dispose du bon intervalle.
Quand on prédit y à partir de x, l’intervalle de prédiction est-il le même pour toutes les valeurs de x et y ? Et l’intervalle de confiance ?
Excellente question. La réponse est non. Plus la valeur de x s’éloigne de la moyenne de x, plus les intervalles de prédiction et de confiance s’élargissent. Les intervalles sont les plus étroits lorsque x est proche de sa moyenne.
Arun est un ancien fondateur de startup qui aime construire de nouvelles choses. Il étudie actuellement les fondements techniques et mathématiques de l'intelligence artificielle. Il aime partager ce qu'il a appris, alors il écrit à ce sujet.
En plus de DataCamp, vous pouvez lire ses publications sur Medium, Airbyte et Vultr.



