Ir al contenido principal

Pruebas de hipótesis en machine learning

En este tutorial, aprenderás los fundamentos de las pruebas de hipótesis y su relevancia en machine learning.
Actualizado 17 sept 2026  · 4 min leer

Explorar con IA

ChatGPTClaudePerplexity

El proceso de las pruebas de hipótesis consiste en extraer inferencias o conclusiones sobre toda una población o conjunto de datos realizando pruebas estadísticas sobre una muestra. Estas mismas inferencias se aplican a distintos modelos de machine learning mediante la prueba t (t-test), que comentaré en este tutorial.

Para poder extraer conclusiones, partimos de ciertas suposiciones que dan lugar a dos conceptos clave en las pruebas de hipótesis.

  • Hipótesis nula: supone que no existe un patrón anómalo o, dicho de otro modo, que la observación concuerda con la suposición hecha.

  • Hipótesis alternativa: contraria a la hipótesis nula, sostiene que la observación es el resultado de un efecto real.

Valor p

También puede entenderse como la evidencia o el nivel de significación frente a la hipótesis nula, o en algoritmos de machine learning. Refleja la relevancia de los predictores respecto al objetivo.

Por lo general, se fija el nivel de significación en el 5 %, aunque en algunos casos es debatible. Si tienes un conocimiento sólido previo sobre el comportamiento de tus datos, puedes decidir el nivel de significación.

Por el contrario, si el valor p es inferior a 0,05 en un modelo de machine learning para una variable independiente, entonces se considera esa variable: indica que muestra un comportamiento heterogéneo respecto al objetivo, lo cual es útil y puede ser aprendido por los algoritmos de machine learning.

Los pasos del contraste de hipótesis son los siguientes:

  • Plantear una hipótesis nula; en algoritmos de machine learning suele asumirse que no hay relación anómala entre el objetivo y la variable independiente.

  • Recoger una muestra

  • Calcular el estadístico de la prueba

  • Decidir si se acepta o se rechaza la hipótesis nula

Cálculo del estadístico de prueba o t

Para calcular el estadístico t, planteamos un escenario.

Imagina una empresa que fabrica contenedores de transporte y afirma que cada contenedor pesa 1000 kg, ni más ni menos. Como la afirmación suena dudosa, recopilamos datos y creamos una muestra.

Tras reunir una muestra de 30 contenedores, encontramos que el peso medio es de 990 kg y la desviación estándar es de 12,5 kg.

Así, el estadístico de prueba se calcula como:

T = (Media - Afirmación) / (Desviación estándar / Tamaño de la muestra^(1/2))

Que da -4,3818 al sustituir los valores.

Ahora calculamos el valor t para una significación de 0,05 y sus grados de libertad.

Nota: Grados de libertad = Tamaño de la muestra - 1

En la tabla t el valor será -1,699.

Tras comparar, vemos que el estadístico obtenido es menor que el correspondiente al nivel de significación elegido. Por tanto, podemos rechazar la afirmación.

Puedes calcular el valor t con la función stats.t.ppf() de la clase stats de la librería scipy.

Errores

Como las pruebas de hipótesis se realizan sobre una muestra de datos y no sobre toda la población por falta de recursos o datos, las inferencias basadas en muestras pueden dar lugar a errores. Estos se clasifican en dos tipos:

  • Error de tipo I: rechazamos la hipótesis nula cuando en realidad es verdadera.

  • Error de tipo II: aceptamos la hipótesis nula cuando en realidad es falsa.

Otros enfoques

Existen varios enfoques para contrastar hipótesis entre dos modelos. Por ejemplo, entrenar dos modelos con las mismas variables: uno con todas las características y otro con una menos. Así podemos contrastar la significación de variables individuales. No obstante, la interdependencia entre variables puede afectar a métodos tan simples.

En problemas de regresión, solemos guiarnos por el valor p: se eliminan las variables que no cumplen el nivel de significación, mejorando el modelo de forma iterativa.

Hay enfoques específicos para cada algoritmo a la hora de contrastar la hipótesis sobre distintas características.

Si quieres profundizar en los fundamentos de las inferencias bayesianas, haz el curso de DataCamp Fundamentals of Bayesian Data Analysis in R.

Echa un vistazo a nuestro tutorial de Machine Learning Basics.

Temas
Aprendizaje automático
Ciencia de datos

Más sobre machine learning

Curso

Comprender el machine learning

2 h
308K
Introducción al machine learning, ¡y no hay que programar!
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Clasificación en machine learning: Introducción

Aprende sobre la clasificación en machine learning viendo qué es, cómo se utiliza y algunos ejemplos de algoritmos de clasificación.
Zoumana Keita 's photo

Zoumana Keita

14 min

Tutorial

Tutorial de DeepChecks: Automatizar las pruebas de aprendizaje automático

Aprende a realizar la validación de datos y modelos para garantizar un sólido rendimiento del aprendizaje automático utilizando nuestra guía paso a paso para automatizar las pruebas con DeepChecks.
Abid Ali Awan's photo

Abid Ali Awan

12 min

Tutorial

Pruebas de hipótesis fáciles

La comprobación de hipótesis es un método estadístico utilizado para evaluar afirmaciones sobre poblaciones basadas en datos muestrales.

Tutorial

Aprendizaje automático de datos categóricos con el tutorial de Python

Aprenda los trucos más comunes para manejar datos categóricos y preprocesarlos para construir modelos de aprendizaje automático.
Moez Ali's photo

Moez Ali

14 min

Tutorial

Prueba Chi-cuadrado en hojas de cálculo

En este tutorial, aprenderás a realizar la prueba chi-cuadrado en hojas de cálculo.
Avinash Navlani's photo

Avinash Navlani

10 min

Python

Tutorial

Comprender la regresión logística en el tutorial de Python

Aprende sobre la regresión logística, sus propiedades básicas, y construye un modelo de machine learning sobre una aplicación del mundo real en Python.
Avinash Navlani's photo

Avinash Navlani

10 min

Ver MásVer Más