Ir al contenido principal

Más de 40 recursos de estadística en Python para ciencia de datos

Una lista de recursos en Python sobre los ocho temas de estadística que necesitas dominar para destacar en ciencia de datos.
Actualizado 17 sept 2026  · 13 min leer

Explorar con IA

ChatGPTClaudePerplexity

Ciencia de datos frente a estadística

Según nuestra infografía “Aprende ciencia de datos en 8 (fáciles) pasos”, uno de los primeros pasos para aprender ciencia de datos es comprender bien la estadística, las matemáticas y el machine learning.

Si lo recuerdas, el siguiente paso es aprender a programar.

Pero una vez que dominas el Python necesario para hacer ciencia de datos, toca consolidar lo aprendido.

Los temas de estadística para ciencia de datos a los que hace referencia este blog e incluye recursos son:

Esta lista no cubre toda la estadística usada en ciencia de datos, pero te servirá para empezar. :) 

Por cierto, si todavía quieres empezar a aprender Python para ciencia de datos, deberías considerar nuestro curso Intro to Python For Data Science. Te ayudará a aplicar estadística con Python. 

Aprender estadística para ciencia de datos es muy práctico, por eso no olvides centrarte también en practicar los conceptos teóricos que quizá estudiaste al inicio de tu camino en ciencia de datos.

Pero, ¿cuál es exactamente la diferencia entre estadística y ciencia de datos?

A menudo se confunden, y hay quien dice que no hay diferencia y que la persona de data science es, en realidad, estadística.

Al margen de opiniones, la mayoría coincide en que la estadística es uno de los componentes esenciales de la ciencia de datos.

Estadística con Python

La entrada de hoy se centra en cómo puedes aprender estadística con Python. Incluye los temas de análisis estadístico que necesitarás explorar en tu recorrido de ciencia de datos usando Python.

¿Por qué Python?

R es un buen punto de partida para estadística. Se creó para computación y gráficos estadísticos, así que ofrece un montón de paquetes. Python, por su parte, es un lenguaje de propósito general con muchas aplicaciones.

Aun así, también puedes hacer estadística con Python.

Algunas personas lo eligen por rendimiento o porque permite hacer muchas de las cosas que haces en R. 

En esencia, este lenguaje gana popularidad y el número de paquetes para ciencia de datos ha crecido mucho en los últimos años. 

En resumen, hay buenas razones para usar Python en análisis estadístico.

La herramienta que elijas dependerá del tipo de análisis que quieras hacer.

Entonces, ¿listo para empezar con estadística en Python?

PD: Si buscas recursos para aprender estadística con R o sobre R, echa un vistazo a los open courses de DataCamp o al curso Intro to Statistics With R.


Aprende estadística en Python para ciencia de datos


Estadística y teoría de la probabilidad en Python

El primer tema que probablemente deberías abordar es estadística y teoría de la probabilidad. No solo hay muchos vídeos y cursos que pueden ayudarte, también hay muchísimos libros (en papel) para empezar con estadística en Python.

Introducción a la estadística con Python 

Para una introducción, este tutorial con ejemplos reales es una gran opción. Sus notebooks te presentan conceptos como media, mediana, desviación estándar y las bases de temas como pruebas de hipótesis y distribuciones de probabilidad.

Es una forma estupenda de empezar, ya que se inspira en los libros "Think Bayes" y "Think Stats", dos recomendaciones estrella que volverán a salir más abajo.

Si buscas libros, prueba este libro gratuito sobre estadística computacional en Python, que no solo incluye una introducción a la programación con Python, sino que también trata temas como Markov Chain Monte Carlo, el algoritmo de Expectation-Maximization (EM), métodos de remuestreo y mucho más.

O puedes comprar este libro de Thomas Haslwanter para una introducción general a pruebas estadísticas comunes, análisis de regresión lineal y temas de análisis de supervivencia y estadística bayesiana. Ten en cuenta que toma como área de aplicación las ciencias de la vida y médicas.

Como ves, ambos libros también te introducen en temas de estadística avanzada con Python.

Si te gustan los vídeos, considera este tutorial de análisis estadístico con SciPy de Christopher Fonnesbeck, profesor adjunto en el Departamento de Bioestadística de la Escuela de Medicina de la Universidad Vanderbilt. También está este vídeo sobre estadística inferencial y exploratoria con Python de Gaël Varoquaux. Este último usa los paquetes de Python Pandas y StatsModels. 

Verás que estos recursos son bastante generales para empezar con estadística en Python.

Si quieres ponerte al día rápido con lo básico, echa un vistazo al curso de DataCamp Statistical Thinking in Python, impartido por Justin Bois. Te introducirás en conceptos como análisis exploratorio de datos (EDA), varianza y covarianza, medias y medianas, distribuciones de probabilidad y mucho más.

Teoría de la probabilidad con Python

La teoría de la probabilidad también es clave cuando aprendes estadística con Python. Analiza fenómenos aleatorios. Es decir, el resultado de un evento aleatorio no es determinista: puede ser cualquiera de varios posibles, y el resultado final lo determina el azar.

La teoría de la probabilidad es el origen conceptual de la estadística.

Los recursos mencionados arriba ofrecen una introducción general a la estadística y, en algunos casos, también cubren probabilidad (lo cual tiene todo el sentido), pero hay recursos que se centran exclusivamente en este tema.

También puedes consultar los siguientes:

Una de las recomendaciones principales es el curso Computational Probability and Inference de EdX. Este curso práctico, impartido por profesorado del MIT, te hará sentirte cómodo con los principios de probabilidad e inferencia.

Tampoco te pierdas este libro gratuito, escrito por el profesor Brian Blais, que es un manual introductorio de inferencia estadística motivado por la probabilidad como lógica.

Distribuciones de probabilidad en Python

Para aprender de verdad estadística con Python para ciencia de datos, debes desarrollar una buena intuición sobre cuándo usar cada distribución. Una distribución es un listado o función que muestra todos los valores o intervalos posibles de los datos y con qué frecuencia ocurren.

Y, si miras esta lista, verás que hay unas cuantas a considerar.

Para una introducción a las distribuciones uniforme, normal, binomial y de Poisson con SciPy, revisa esta entrada.

Muy recomendable es el capítulo cuatro del libro “Think Stats: Probability and Statistics for Programmers”, que te introduce en las distribuciones continuas. No obstante, el quinto capítulo también ofrece una sólida introducción a las distribuciones.

Para visualizar distribuciones, puedes usar histogramas, entre otros. Si quieres un vistazo rápido, consulta este notebook de IPython, que te dará una breve introducción a la estadística descriptiva con medias, cuantiles e histogramas y sus relaciones. Para profundizar en la visualización de distribuciones, mira este tutorial de Seaborn.

También tienes este tutorial de plotly sobre estadística básica en Python.

Si prefieres un curso que cubra algunas distribuciones (como binomial y Poisson) y funciones de distribución como la función de distribución acumulada empírica, o que te enseñe a visualizarlas, echa un vistazo al curso de DataCamp Statistical Thinking in Python.


Distribuciones de probabilidad en Python


Pruebas de hipótesis en Python

Las pruebas de hipótesis son tests estadísticos que se usan para determinar si hay evidencia suficiente en una muestra de datos para inferir que una condición es cierta para toda la población.

Los dos conceptos centrales son la hipótesis nula y la alternativa, y también el valor p es fundamental. Estos conceptos cuestan cuando empiezas y requieren esfuerzo para entender el valor alfa o nivel de significación de tu valor p y qué diferencia hay entre rechazar o no rechazar la hipótesis nula.

Encontrarás un tutorial en la web de SciPy que trata brevemente valores p y estimación.

Estas lecciones de SciPy te introducirán en la prueba t, que puedes usar para contrastar tu hipótesis analizando las medias de dos poblaciones. También puedes recurrir a esta entrada si quieres explorar las pruebas t.

Si prefieres leer un libro, la recomendación estrella “Think Stats: Probability and Statistics for Programmers” también es válida aquí. El capítulo siete te enseñará todo sobre pruebas de hipótesis si aún no has pasado por los capítulos de distribuciones.

Para quienes busquen cursos, Statistical Thinking in Python (Part 2) de DataCamp ofrece una introducción y ejemplos de tests para adquirir los conocimientos y la práctica necesarios en pruebas de hipótesis y mucho más. 

Modelado y ajuste estadístico en Python

Ahora que ya manejas pruebas de hipótesis y distribuciones, puedes repasar o profundizar en cómo construir modelos estadísticos y ajustar distribuciones a los datos.

Los modelos estadísticos aproximan aquello que genera tus datos y se usan para resumir, predecir y simular. En otras palabras, representan fenómenos complejos que generaron los datos y pueden emplearse para resúmenes, predicciones o simulaciones.

Esto implica que también debes poder comprobar si tus datos se ajustan al modelo.

Para lograr el mejor ajuste entre modelo y datos, se recurre a la estimación. La estimación se ocupa de inferir sobre una población a partir de información obtenida de una muestra. Junto con las pruebas de hipótesis, es una forma de aprender sobre la población desde la muestra.

Este tutorial te introduce en el ajuste con la biblioteca SciPy de Python.

El modelado y ajuste estadístico de datos también es un capítulo de este tutorial de análisis estadístico, desarrollado en notebooks por Christopher Fonnesbeck. ¡El nombre ya te sonará! 

Si te van más los vídeos, este tutorial también está en YouTube en cuatro partes y trata temas como estimación (máxima verosimilitud y método de los momentos).

Puedes ver los vídeos de este tutorial aquí.

Por cierto, si quieres saber más sobre la estimación de máxima verosimilitud para clasificación de patrones estadística, no te pierdas este notebook de IPython o este otro que explica cómo calcularla para distintas distribuciones. Estos notebooks forman parte del repositorio de clasificación de patrones de Sebastian Raschka, que también tiene otro repositorio para su Python Machine Learning book

Machine learning con Python

Y con esta última sugerencia del libro de machine learning quizá te preguntes: ¿no iba esto de estadística?

Exacto.

Y no es que machine learning y estadística sean lo mismo, pero sí se hacen la misma pregunta: ¿cómo aprendemos de los datos?

Además, las técnicas de machine learning y de estadística se usan con frecuencia, por ejemplo, en reconocimiento de patrones o minería de datos. 

El machine learning es una herramienta muy útil en tu caja de ciencia de datos. Es un tema amplio y puedes dedicarle mucho tiempo a entender sus conceptos y algoritmos.

¡Por eso, mejor empieza ya!

No es sencillo saber por dónde arrancar porque es muy amplio y hay muchísimos recursos para dominar machine learning en Python.

El curso general de machine learning de Andrew Ng es bastante teórico, pero sigue siendo recomendable si quieres acercarte primero a los conceptos y algoritmos principales desde la teoría.

Aun así, hay muchos recursos prácticos que pueden ayudarte a empezar.

Estos son solo algunos:

Esta introducción suave a machine learning con SciPy te pondrá en la dirección correcta. Es ideal para quien quiera refrescar estadística básica y construir sobre ella. Kyle Kastner te guía por estimación de parámetros, regresión, estimación de modelos y clasificación básica.

Si prefieres un libro, echa un ojo al IPython Interactive Computing and Visualization Cookbook. El capítulo ocho introduce conceptos fundamentales de machine learning e ilustra algoritmos como regresión logística, Naive Bayes, k-vecinos más cercanos, máquinas de soporte vectorial, random forests y otros. El libro usa Scikit-learn para los ejemplos.

Si quieres un tutorial introductorio de Scikit-learn, ve aquí

Y no te pierdas este tutorial sobre el clasificador Naive Bayes.

Análisis de regresión con Python

La regresión es algo que no te puedes saltar cuando hablamos de estadística para ciencia de datos. Es un proceso estadístico para estimar la relación entre variables.

Para entender cómo hacer regresión con Python, comienza por material sobre regresión lineal.

Pero antes, revisa este tutorial: cubre el análisis de regresión usando el paquete StatsModels con Quandl. Primero explica los tipos de regresión que existen y luego te ofrece un ejemplo práctico.

Después, pasa por este tutorial de regresión lineal para practicar más.

Luego puedes avanzar a regresión no lineal. Para un tutorial sobre regresión ridge y lasso en Python, consulta este artículo de Analytics Vidhya. Utiliza las librerías NumPy, Pandas, Matplotlib y Scikit-learn para explicar claramente cómo abordar el tema. 

También hay un gran notebook sobre regresión logística que puedes encontrar aquí.

Y no te pierdas esta entrada de Yhat sobre regresión logística con Rodeo.


Pensamiento y modelado bayesiano en Python


Pensamiento y modelado bayesiano en Python

La estadística bayesiana es una teoría que expresa la evidencia sobre el verdadero estado del mundo en términos de grados de creencia, conocidos como probabilidades bayesianas. En ocasiones querrás adoptar un enfoque bayesiano para problemas de ciencia de datos.

Qué significa exactamente esto quedará claro en esta excelente serie de cinco partes que te introduce en el frecuentismo y el bayesianismo.

Si eres más de libros, revisa “Think Bayes: Bayesian Statistics in Python”. "Bayesian Methods For Hackers" es otro gran recurso para iniciarte en la inferencia bayesiana. ¡Dos lecturas imprescindibles para quien quiera empezar con pensamiento y modelado bayesiano! 

O, si prefieres una introducción en notebook, puedes seguir este tutorial, que presenta el teorema de Bayes.

Tampoco te pierdas este tutorial sobre análisis estadístico bayesiano en Python y los vídeos de YouTube asociados, que te introducirán en estadística bayesiana, Markov chain Monte Carlo, PyMC, modelado jerárquico y verificación y validación de modelos.

Para un tutorial sobre ajuste de modelos bayesianos en Python, consulta estos notebooks de IPython y el vídeo de YouTube correspondiente, una clase de Jake VanderPlas en el ESAC Data Analysis and Statistics Workshop 2014.  

Si quieres reutilizar recursos, revisa el IPython Interactive Computing and Visualization Cookbook, que quizá ya usaste para machine learning. El capítulo siete trata el análisis estadístico de datos y se centra en métodos frecuentistas y bayesianos para pruebas de hipótesis, estimación paramétrica y no paramétrica e inferencia de modelos.

Aquí tienes un tutorial sobre PyMC, un módulo de Python que implementa modelos estadísticos bayesianos y algoritmos de ajuste, incluido Markov Chain Monte Carlo (MCMC). Además, este tutorial, en el que aprenderás a implementar modelos de regresión lineal bayesiana con PyMC3, merece la pena. 

Cadenas de Markov

En pocas palabras, las cadenas de Markov son sistemas matemáticos que saltan de un "estado" a otro. Estos estados pueden ser una situación o un conjunto de valores. Esto significa que tienes una lista de estados disponible y, además, una cadena de Markov te indica la probabilidad de saltar, o "transicionar", de un estado a otro.

Algunos de los recursos anteriores ya te introducen en este tema.

Además de ellos, quizá quieras ver este vídeo: es un tutorial que usa, entre otros, simulación Monte Carlo y remuestreo para explorar pruebas de hipótesis y modelado estadístico. Puede ser una buena forma de afianzar conocimientos antes de entrar en cadenas de Markov.

Asimismo, el libro Computational Statistics in Python te dará una visión sobre cadenas de Markov. Es una introducción fantástica a Markov Chain Monte Carlo.

Cómo empezar con estadística en Python

Esta lista es solo para arrancar. Verás que muchos recursos se solapan o encontrarás otros por tu cuenta. ¡Cuéntanoslo en Twitter!

En cualquier caso, no hay motivo para esperar más para empezar a aprender estadística con Python.

Empieza ahora

Temas
Python

Python y otros cursos relacionados

Curso

Introducción a la ciencia de datos con Python

4 h
502.4K
Sumérgete en la ciencia de datos con Python y aprende a analizar y visualizar los datos con eficacia. No necesitas saber de programación.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Las 15 habilidades más importantes para los científicos de datos en 2026

Una lista de las habilidades imprescindibles que todo científico de datos debería tener en su caja de herramientas, incluidos recursos para desarrollar tus habilidades.
Javier Canales Luna's photo

Javier Canales Luna

8 min

blog

Las 36 preguntas y respuestas más importantes sobre Python para entrevistas de trabajo en 2026

Preguntas esenciales sobre Python para entrevistas de trabajo con ejemplos para personas en busca de empleo, estudiantes de último año y profesionales de datos.
Abid Ali Awan's photo

Abid Ali Awan

15 min

Tutorial

21 herramientas esenciales de Python

Conozca las herramientas esenciales de Python para el desarrollo de software, raspado y desarrollo web, análisis y visualización de datos y aprendizaje automático.
Abid Ali Awan's photo

Abid Ali Awan

6 min

Tutorial

30 trucos de Python para escribir mejor código con ejemplos

Hemos seleccionado 30 trucos de Python que puedes usar para mejorar tu código y desarrollar tus habilidades en Python.
Kurtis Pykes 's photo

Kurtis Pykes

15 min

Tutorial

Los 6 mejores IDE de Python para la ciencia de datos en 2026

Encuentra el IDE de Python perfecto para tus necesidades de ciencia de datos en 2026. Compara las características, ventajas y rendimiento para tomar una decisión informada y segura.
Adel Nehme's photo

Adel Nehme

9 min

Tutorial

Histogramas en Matplotlib

Aprende sobre histogramas y cómo puedes utilizarlos para obtener información de los datos con la ayuda de matplotlib.
Aditya Sharma's photo

Aditya Sharma

8 min

Ver MásVer Más