Curso
Bienvenido a la quinta parte de nuestra serie mensual Datos sin misterio. Como parte del Mes de la competencia en datos, esta serie aclara conceptos clave del mundo de los datos, responde a esas preguntas que quizá no te atreves a hacer y, de paso, nos divertimos. Si quieres empezar por el principio, lee la primera entrega: ¿Qué es un conjunto de datos?

En esta entrega, profundizamos en la estadística descriptiva, una de las áreas básicas de la ciencia de datos.
¿Qué es la estadística descriptiva?
La estadística descriptiva es la herramienta principal de la analítica descriptiva, una de las cuatro tipologías de analítica. Para entender la estadística descriptiva, primero ayuda comprender el concepto de variable.
Una variable es una magnitud que puede medirse o contarse. Por ejemplo, dado un grupo de personas, podrías medir la altura de cada una. Eso sería una variable. Del mismo modo, podrías contar cuántas personas tienen cada color de pelo; el color de pelo también se consideraría una variable.
Las estadísticas descriptivas son valores numéricos que resumen variables. Calcular estadísticas descriptivas es tan común que han surgido varios nombres para lo mismo. "Estadísticos resumen" y "agregaciones" se usan como sinónimos de estadísticas descriptivas.
En las siguientes secciones, repasaremos las técnicas principales de estadística descriptiva, todas extraídas de nuestro curso de introducción a la estadística.
Recuentos y proporciones
Cuando tienes variables categóricas —es decir, datos que consisten en grupos discretos como el color de pelo—, las formas más naturales de resumirlas son contando sus casos o hablando de proporciones.
Por ejemplo, cuatro personas tenían el pelo negro, dos castaño, dos rubio, una pelirrojo y una cano. Alternativamente, puedes decir que el 40% tenía el pelo negro, el 20% castaño, el 20% rubio, el 10% pelirrojo y el 10% cano.
|
Color de pelo |
Recuento |
Proporción |
|
Negro |
4 |
40% |
|
Castaño |
2 |
20% |
|
Rubio |
2 |
20% |
|
Pelirrojo |
1 |
10% |
|
Cano |
1 |
10% |
Medidas de centralización
Las medidas de centralización, conocidas popularmente como promedios, resumen tus datos capturando un único valor que describe el centro de su distribución. Estas son las más habituales.
Moda
La moda es el tipo de promedio más sencillo de calcular: es el valor más frecuente. En el ejemplo de colores de pelo, el negro es el más común, así que la moda es "negro".
Media aritmética
Quizá el promedio más conocido es la media aritmética. Si alguien habla de la media de algo sin especificar, normalmente se refiere a la media aritmética.
La fórmula consiste en sumar todos los valores y dividir entre la cantidad de valores. Por ejemplo, si tienes una variable con la altura de 10 personas, para calcular la media sumas todas las alturas y divides entre 10.
Una fortaleza (y también una debilidad, como veremos enseguida) de la media es que utiliza todos los puntos de datos en el cálculo. Es decir, aprovecha la máxima información posible.
Existen otros tipos de medias, como la media geométrica y la media armónica, con usos más específicos.
Mediana
La mediana se calcula ordenando los valores de menor a mayor y tomando el valor central.
Siguiendo con el ejemplo de alturas, debes ordenar de menor a mayor y escoger el punto medio de tu variable; en este caso, sería el quinto valor. La mediana se considera una estadística descriptiva "robusta" porque no cambia mucho si uno de los valores varía.
Para ilustrarlo, supongamos que recibimos otro dato de alguien extraordinariamente alto o bajo. La media aritmética cambiaría bastante, ya que los valores atípicos influyen en el resultado. La mediana, en cambio, variaría muy poco porque la posición central apenas se altera.
Otras medidas de posición
A veces, un valor central no resume bien tu variable. Puede que te interesen el mínimo (valor más pequeño) o el máximo (valor más grande). Estas otras medidas sobre el tamaño de los valores se llaman medidas de posición.
Otra medida clave de posición es el percentil. Usa puntos de corte que dividen los datos en 100 intervalos con la misma cantidad de observaciones en cada uno. El percentil 100 coincide con el máximo y el percentil 50 con la mediana. Los percentiles no son tan relevantes cuando solo tienes 10 datos, como en el ejemplo de alturas, pero resultan muy útiles con conjuntos de datos más grandes.
Una variante de los percentiles son los cuartiles, donde divides los datos en cuatro intervalos en lugar de 100.
Medidas de dispersión
En ocasiones, más que el tamaño de los valores, te interesa cuánto difieren entre sí. Las estadísticas descriptivas que cuantifican esas diferencias se llaman medidas de dispersión o de variabilidad.
Rango
La medida de dispersión más simple es el rango, que es el valor máximo menos el valor mínimo. En el ejemplo de alturas, el rango sería la altura máxima menos la mínima.
Varianza
La varianza es una medida más técnica de dispersión que suele usarse junto con la media aritmética. Se calcula como la suma de los cuadrados de las diferencias entre cada valor y la media, dividida entre uno menos que el número de observaciones.
Para ilustrarlo, veamos un ejemplo aún más sencillo con la variable altura. Supón que tenemos las alturas de cuatro personas, como en la tabla siguiente.
|
Nombre |
Altura |
|
Isabella Leslie-Miller |
158 |
|
Valeria Kogan-Higgs |
172 |
|
Hadrien Lacroix |
177 |
|
Sara Billen |
183 |
La media aritmética de estas alturas es 172,5 cm (sumando todas y dividiendo entre 4).
En este ejemplo, la varianza sería
((158 - 172,5) ^ 2 + (172 - 172,5) ^ 2 + (177 - 172,5) ^ 2 + (183 - 172,5) ^ 2) / (4 - 1) = 113 cm2.
Como con la media, el hecho de usar todos los puntos de datos la hace muy potente y, potencialmente, más sensible a cambios cuando varían los datos.
Correlación
La correlación mide la relación lineal entre dos variables. Es decir, cuando una variable sube, ¿la otra sube o baja? Existen varios algoritmos para calcularla, pero siempre da una puntuación entre menos uno y uno.
Para dos variables, X e Y, la correlación se interpreta así.
|
Valor de correlación |
Interpretación |
|
-1 |
Cuando X aumenta, Y disminuye. Cuanto más cerca de -1, más fuerte es la relación. |
|
Entre -1 y 0 |
Cuando X aumenta, Y disminuye. Cuanto más cerca de 0, más débil es la relación. |
|
0 |
No hay relación lineal entre X e Y, por lo que no existe correlación. |
|
Entre 0 y 1 |
Cuando X aumenta, Y aumenta. Cuanto más cerca de 0, más débil es la relación. |
|
1 |
Cuando X aumenta, Y aumenta. Cuanto más cerca de 1, más fuerte es la relación. |
Ten en cuenta que la correlación no capta efectos no lineales; si X e Y no tienen una relación aproximadamente lineal, el valor de correlación puede no ser representativo.
¿Quieres saber más?
Esperamos que te haya gustado esta breve introducción a la estadística descriptiva. En la próxima entrega, profundizaremos en la correlación. En concreto, veremos de dónde viene el dicho correlación no implica causalidad y cómo evitar este error.
- Descubre lo que tenemos preparado para el Mes de la competencia en datos
- Empieza con nuestro itinerario de aprendizaje Understanding Data Topics
- Suscríbete al pódcast DataFramed
- Echa un vistazo a nuestros próximos eventos
- Lee la siguiente entrega de la serie Datos sin misterio: correlación vs. causalidad

