Ir al contenido principal

Datos sin misterio: panorama de la estadística descriptiva

En la quinta entrega de Datos sin misterio, ofrecemos una visión general de los conceptos básicos de la estadística descriptiva, una de las áreas fundamentales de la ciencia de datos.
Actualizado 17 sept 2026  · 6 min leer

Explorar con IA

ChatGPTClaudePerplexity

Bienvenido a la quinta parte de nuestra serie mensual Datos sin misterio. Como parte del Mes de la competencia en datos, esta serie aclara conceptos clave del mundo de los datos, responde a esas preguntas que quizá no te atreves a hacer y, de paso, nos divertimos. Si quieres empezar por el principio, lee la primera entrega: ¿Qué es un conjunto de datos?

Panorama de la estadística descriptiva

En esta entrega, profundizamos en la estadística descriptiva, una de las áreas básicas de la ciencia de datos. 

¿Qué es la estadística descriptiva?

La estadística descriptiva es la herramienta principal de la analítica descriptiva, una de las cuatro tipologías de analítica. Para entender la estadística descriptiva, primero ayuda comprender el concepto de variable. 

Una variable es una magnitud que puede medirse o contarse. Por ejemplo, dado un grupo de personas, podrías medir la altura de cada una. Eso sería una variable. Del mismo modo, podrías contar cuántas personas tienen cada color de pelo; el color de pelo también se consideraría una variable.

Las estadísticas descriptivas son valores numéricos que resumen variables. Calcular estadísticas descriptivas es tan común que han surgido varios nombres para lo mismo. "Estadísticos resumen" y "agregaciones" se usan como sinónimos de estadísticas descriptivas.

En las siguientes secciones, repasaremos las técnicas principales de estadística descriptiva, todas extraídas de nuestro curso de introducción a la estadística

Recuentos y proporciones

Cuando tienes variables categóricas —es decir, datos que consisten en grupos discretos como el color de pelo—, las formas más naturales de resumirlas son contando sus casos o hablando de proporciones. 

Por ejemplo, cuatro personas tenían el pelo negro, dos castaño, dos rubio, una pelirrojo y una cano. Alternativamente, puedes decir que el 40% tenía el pelo negro, el 20% castaño, el 20% rubio, el 10% pelirrojo y el 10% cano. 

Color de pelo

Recuento

Proporción

Negro

4

40%

Castaño

2

20%

Rubio

2

20%

Pelirrojo

1

10%

Cano

1

10%

Medidas de centralización

Las medidas de centralización, conocidas popularmente como promedios, resumen tus datos capturando un único valor que describe el centro de su distribución. Estas son las más habituales. 

Moda

La moda es el tipo de promedio más sencillo de calcular: es el valor más frecuente. En el ejemplo de colores de pelo, el negro es el más común, así que la moda es "negro".

Media aritmética

Quizá el promedio más conocido es la media aritmética. Si alguien habla de la media de algo sin especificar, normalmente se refiere a la media aritmética. 

La fórmula consiste en sumar todos los valores y dividir entre la cantidad de valores. Por ejemplo, si tienes una variable con la altura de 10 personas, para calcular la media sumas todas las alturas y divides entre 10. 

Una fortaleza (y también una debilidad, como veremos enseguida) de la media es que utiliza todos los puntos de datos en el cálculo. Es decir, aprovecha la máxima información posible.

Existen otros tipos de medias, como la media geométrica y la media armónica, con usos más específicos.

Mediana

La mediana se calcula ordenando los valores de menor a mayor y tomando el valor central. 

Siguiendo con el ejemplo de alturas, debes ordenar de menor a mayor y escoger el punto medio de tu variable; en este caso, sería el quinto valor. La mediana se considera una estadística descriptiva "robusta" porque no cambia mucho si uno de los valores varía. 

Para ilustrarlo, supongamos que recibimos otro dato de alguien extraordinariamente alto o bajo. La media aritmética cambiaría bastante, ya que los valores atípicos influyen en el resultado. La mediana, en cambio, variaría muy poco porque la posición central apenas se altera.  

Otras medidas de posición

A veces, un valor central no resume bien tu variable. Puede que te interesen el mínimo (valor más pequeño) o el máximo (valor más grande). Estas otras medidas sobre el tamaño de los valores se llaman medidas de posición.

Otra medida clave de posición es el percentil. Usa puntos de corte que dividen los datos en 100 intervalos con la misma cantidad de observaciones en cada uno. El percentil 100 coincide con el máximo y el percentil 50 con la mediana. Los percentiles no son tan relevantes cuando solo tienes 10 datos, como en el ejemplo de alturas, pero resultan muy útiles con conjuntos de datos más grandes. 

Una variante de los percentiles son los cuartiles, donde divides los datos en cuatro intervalos en lugar de 100.

Medidas de dispersión

En ocasiones, más que el tamaño de los valores, te interesa cuánto difieren entre sí. Las estadísticas descriptivas que cuantifican esas diferencias se llaman medidas de dispersión o de variabilidad.

Rango

La medida de dispersión más simple es el rango, que es el valor máximo menos el valor mínimo. En el ejemplo de alturas, el rango sería la altura máxima menos la mínima. 

Varianza

La varianza es una medida más técnica de dispersión que suele usarse junto con la media aritmética. Se calcula como la suma de los cuadrados de las diferencias entre cada valor y la media, dividida entre uno menos que el número de observaciones.

Para ilustrarlo, veamos un ejemplo aún más sencillo con la variable altura. Supón que tenemos las alturas de cuatro personas, como en la tabla siguiente.

Nombre

Altura

Isabella Leslie-Miller

158

Valeria Kogan-Higgs

172

Hadrien Lacroix

177

Sara Billen

183

La media aritmética de estas alturas es 172,5 cm (sumando todas y dividiendo entre 4). 

En este ejemplo, la varianza sería 

((158 - 172,5) ^ 2 + (172 - 172,5) ^ 2 + (177 - 172,5) ^ 2 + (183 - 172,5) ^ 2) / (4 - 1) = 113 cm2.

Como con la media, el hecho de usar todos los puntos de datos la hace muy potente y, potencialmente, más sensible a cambios cuando varían los datos.

Correlación

La correlación mide la relación lineal entre dos variables. Es decir, cuando una variable sube, ¿la otra sube o baja? Existen varios algoritmos para calcularla, pero siempre da una puntuación entre menos uno y uno. 

Para dos variables, X e Y, la correlación se interpreta así.

Valor de correlación

Interpretación

-1

Cuando X aumenta, Y disminuye. Cuanto más cerca de -1, más fuerte es la relación. 

Entre -1 y 0

Cuando X aumenta, Y disminuye. Cuanto más cerca de 0, más débil es la relación. 

0

No hay relación lineal entre X e Y, por lo que no existe correlación.

Entre 0 y 1

Cuando X aumenta, Y aumenta. Cuanto más cerca de 0, más débil es la relación. 

1

Cuando X aumenta, Y aumenta. Cuanto más cerca de 1, más fuerte es la relación. 

Ten en cuenta que la correlación no capta efectos no lineales; si X e Y no tienen una relación aproximadamente lineal, el valor de correlación puede no ser representativo.

¿Quieres saber más?

Esperamos que te haya gustado esta breve introducción a la estadística descriptiva. En la próxima entrega, profundizaremos en la correlación. En concreto, veremos de dónde viene el dicho correlación no implica causalidad y cómo evitar este error.

Temas
Alfabetización informática

Cursos de competencia en datos

Curso

Introducción a la estadística

4 h
159.8K
Estadística básica sin programar: medidas de tendencia central y dispersión, distribuciones de probabilidad, pruebas de hipótesis y más.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

La importancia de los datos: 5 razones principales

¿Por qué son importantes los datos? Conoce la importancia de los datos en el mundo actual y descubre algunos cursos que te ayudarán a mejorar tus propias habilidades con los datos.
Kurtis Pykes 's photo

Kurtis Pykes

6 min

blog

Cómo analizar datos para tu empresa en 5 pasos

Descubre los distintos pasos para analizar los datos y extraer valor de ellos, así como los métodos y técnicas que intervienen en el proceso.
Javier Canales Luna's photo

Javier Canales Luna

14 min

blog

¿Qué es la alfabetización de datos? Guía para 2026 dirigida a los responsables de datos y análisis

Descubre la importancia de la alfabetización en datos en el mundo actual, impulsado por los datos.
Matt Crabtree's photo

Matt Crabtree

15 min

blog

11 técnicas de visualización de datos para cada caso de uso con ejemplos

Descubra los análisis, técnicas y herramientas más populares para dominar el arte de la visualización de datos.
Javier Canales Luna's photo

Javier Canales Luna

12 min

blog

28 proyectos de análisis de datos para todos los niveles en 2026

Explora nuestra lista de proyectos de análisis de datos para principiantes, estudiantes de último curso y profesionales. La lista consta de proyectos guiados/no guiados y tutoriales con código fuente.
Abid Ali Awan's photo

Abid Ali Awan

13 min

Tutorial

Introducción al aprendizaje automático estadístico

Descubra la potente fusión de estadística y aprendizaje automático. Explore cómo las técnicas estadísticas sustentan los modelos de aprendizaje automático, permitiendo la toma de decisiones basada en datos.
Joanne Xiong's photo

Joanne Xiong

11 min

Ver MásVer Más