Ir al contenido principal

Distribución de Bernoulli: guía completa con ejemplos

Descubre cómo la distribución de Bernoulli capta resultados binarios y se aplica en todo, desde lanzar una moneda hasta predecir compras de clientes.
Actualizado 17 sept 2026  · 11 min leer

Explorar con IA

ChatGPTClaudePerplexity

La distribución de Bernoulli es un concepto fundamental en estadística y ciencia de datos. Recibe su nombre del matemático suizo Jacob Bernoulli, y es clave en teoría de la probabilidad. Además, sirve como base para modelos estadísticos más complejos, desde predecir el comportamiento de clientes hasta desarrollar algoritmos de aprendizaje automático.

Para empezar, echa un vistazo a nuestro curso Introduction to Statistics para refrescar distribuciones de probabilidad. También te recomendamos Foundations of Probability in Python para trabajar problemas con dos posibles resultados y practicar con la librería scipy. Nuestro curso Statistical Thinking in Python (Part 1) es otra gran opción, porque te enseña a escribir tus propias funciones en Python para realizar ensayos de Bernoulli.  

¿Qué es una distribución de Bernoulli?

Una distribución de Bernoulli es una distribución de probabilidad discreta que modela una variable aleatoria con solo dos posibles resultados. Normalmente se etiquetan como "éxito" y "fracaso", o bien se representan numéricamente como 1 y 0.

Ensayos de Bernoulli

Empecemos con los ensayos de Bernoulli. Un ensayo de Bernoulli es un experimento aleatorio con exactamente dos posibles resultados. Ejemplos clásicos:

  • Lanzar una moneda (cara o cruz)
  • Responder una pregunta de verdadero/falso
  • Determinar si un cliente hará una compra (compra o no compra)

Cada ensayo de Bernoulli es independiente, es decir, el resultado de un ensayo no afecta a la probabilidad de éxito de los siguientes.

Distribuciones de Bernoulli

Una distribución de Bernoulli describe la probabilidad de éxito en un único ensayo de Bernoulli. Se caracteriza por un único parámetro, p, que representa la probabilidad de éxito. La probabilidad de fracaso es, por tanto, 1 - p. Matemáticamente, podemos expresar una distribución de Bernoulli como sigue, donde X es la variable aleatoria que representa el resultado del ensayo de Bernoulli.

Para ilustrar cómo cambia la distribución de Bernoulli con distintas probabilidades de éxito, comparemos tres ejemplos.

Comparison of Bernoulli distributions for different values of p

Comparación de distribuciones de Bernoulli para distintos valores de p. Imagen del autor. 

Aquí, cada gráfico muestra una distribución de Bernoulli distinta. 

  • Izquierda: p = 0,3 (30% de probabilidad de éxito)
  • Centro: p = 0,5 (50% de probabilidad de éxito)
  • Derecha: p = 0,7 (70% de probabilidad de éxito)

Como se ve, la función de masa de probabilidad de una distribución de Bernoulli siempre tiene dos barras: una para la probabilidad de fracaso (X = 0) y otra para la probabilidad de éxito (X = 1). La altura de estas barras cambia según el valor de p, pero siempre suman 1.

Propiedades de las distribuciones de Bernoulli

Veamos las características clave que definen la distribución de Bernoulli.

Resultados binarios

La característica más distintiva de una distribución de Bernoulli es su naturaleza binaria. Cada ensayo solo puede dar uno de dos posibles resultados:

  1. Éxito (normalmente representado como 1)
  2. Fracaso (normalmente representado como 0)

Esta propiedad binaria hace que las distribuciones de Bernoulli sean especialmente útiles cuando nos interesan resultados sí/no, verdadero/falso o éxito/fracaso. Algunas ventajas clave de usar distribuciones de Bernoulli en ciencia de datos y aprendizaje automático:

  • Simplicidad de modelado: Los resultados binarios permiten modelar probabilidades y odds de forma directa.
  • Fácil interpretación: Los resultados suelen interpretarse fácilmente como probabilidades o proporciones.
  • Versatilidad: Muchos escenarios complejos pueden descomponerse en una serie de decisiones o resultados binarios.
  • Base para distribuciones más complejas: Los ensayos de Bernoulli son la base de otras distribuciones importantes, como la binomial, que cuenta éxitos a lo largo de múltiples ensayos de Bernoulli, y la geométrica, que mide el número de ensayos hasta el primer éxito.

Media y varianza

La media (μ) y la varianza ²) de una distribución de Bernoulli están directamente relacionadas con la probabilidad de éxito, p.

Media

La media es igual a la probabilidad de éxito. Esto implica que, si repites un ensayo de Bernoulli muchas veces, el resultado medio tenderá a p.

Varianza

La varianza viene dada por: σ² = p(1 - p). La varianza alcanza su máximo cuando p = 0,5 y disminuye a medida que p se acerca a 0 o 1. Esta relación aporta información sobre la dispersión de los datos y la incertidumbre asociada a los resultados. En términos de dispersión, la varianza en una distribución de Bernoulli indica:

  • Predictibilidad: Una varianza baja (cuando p está cerca de 0 o 1) indica resultados más previsibles, mientras que una varianza alta (cuando p está cerca de 0,5) sugiere mayor incertidumbre.
  • Contenido informativo: Cuanto más cerca está p de 0,5, más información aporta cada ensayo, ya que los resultados son menos previsibles.
  • Tamaño muestral: La varianza orienta decisiones de tamaño de muestra en el diseño experimental. Una varianza alta suele requerir muestras mayores para lograr el mismo nivel de precisión en las estimaciones.
  • Evaluación del riesgo: En finanzas o seguros, la varianza puede interpretarse como una medida de riesgo o volatilidad.

Simetría y asimetría

La forma de una distribución de Bernoulli depende del valor de p:

  • Cuando p = 0,5, la distribución es simétrica. Un ejemplo es una moneda justa, donde las probabilidades de éxito y fracaso son iguales.
  • Cuando p ≠ 0,5, la distribución se vuelve asimétrica. A medida que p se acerca a 0 o 1, la asimetría aumenta.

La simetría o asimetría de la distribución afecta a la interpretación de varias maneras:

  • Fijación de expectativas: En una distribución simétrica, ningún resultado es más probable, lo que puede informar decisiones cuando no hay sesgo hacia un resultado, como en un juego justo.
  • Detección de sesgos: La asimetría en resultados observados cuando se espera simetría puede indicar sesgo en el proceso o en la medición.
  • Determinación de umbrales: En tareas de clasificación, la simetría o asimetría puede orientar la elección de umbrales de clasificación.
  • Selección de modelos: El grado de asimetría puede influir en la elección de modelos estadísticos o algoritmos de aprendizaje automático.
  • Estrategias de muestreo: En casos muy asimétricos (p muy cercano a 0 o 1), pueden requerirse técnicas de muestreo específicas para representar adecuadamente eventos raros.

Aplicaciones prácticas de las distribuciones de Bernoulli

Las distribuciones de Bernoulli se usan ampliamente en múltiples campos, especialmente en ciencia de datos y estadística. Veamos algunas aplicaciones comunes:

Clasificación binaria en aprendizaje automático

En aprendizaje automático, las distribuciones de Bernoulli desempeñan un papel central en problemas de clasificación binaria: escenarios donde hay que asignar cada dato a una de dos clases. Ejemplos:

  • Detección de spam en emails (spam o no spam)
  • Detección de fraude en transacciones financieras (fraudulenta o legítima)
  • Diagnóstico de enfermedades a partir de síntomas (presente o ausente)

Algoritmos que aprovechan distribuciones de Bernoulli para clasificación binaria:

  1. Regresión logística: La regresión logística asume que el resultado binario sigue una distribución de Bernoulli. Modela la probabilidad del resultado con la función logit, inversa de la logística. La salida resultante puede interpretarse como una probabilidad de Bernoulli. Lee nuestros tutoriales Understanding Logistic Regression in Python y Logistic Regression in R para aprender los detalles.
  2. Bernoulli Naive Bayes: Este clasificador se basa en el algoritmo Naive Bayes y es especialmente adecuado para clasificación de documentos cuando las características son binarias (presencia o ausencia de palabras).

Conviértete en un Científico ML

Mejora tus conocimientos de Python para convertirte en un científico del aprendizaje automático.
Empieza a Aprender Gratis

Pruebas de hipótesis

Las distribuciones de Bernoulli son fundamentales en las pruebas de hipótesis, especialmente cuando se analizan proporciones o tasas de éxito. Aplicaciones comunes:

  • A/B testing en marketing: Comparar las tasas de éxito de dos estrategias de marketing distintas. Aprende más sobre A/B testing con nuestro curso Customer Analytics and A/B Testing in Python y nuestro code-along A/B Testing in R.
  • Control de calidad: Comprobar si la tasa de defectos en un proceso de fabricación supera un umbral determinado.
  • Ensayos médicos: Evaluar la eficacia de un tratamiento nuevo frente a un placebo.

En estos escenarios, la hipótesis nula suele suponer un valor específico para la probabilidad de éxito p, y la alternativa cuestiona esta suposición a la luz de los datos observados.

Simulación y modelización

Las distribuciones de Bernoulli son muy útiles en simulaciones y modelización probabilística, especialmente en escenarios con resultados binarios. Se emplean en:

  • Simulaciones de Monte Carlo: Modelar sistemas complejos con muchos puntos de decisión binarios. Aprende más con nuestro tutorial Introduction to Monte Carlo Methods.
  • Análisis de riesgos: Evaluar la probabilidad de éxito o fracaso en escenarios de negocio.
  • Genética de poblaciones: Modelar la herencia de rasgos en estudios genéticos.

Generando muestras aleatorias de una distribución de Bernoulli, investigadores y data scientists pueden crear simulaciones realistas de sistemas y procesos complejos.

Aspectos de rendimiento

Al trabajar con distribuciones de Bernoulli en análisis de datos y aprendizaje automático, conviene tener en cuenta varios aspectos de rendimiento:

Gestión de datos desbalanceados

En muchos casos reales, la probabilidad de éxito p no es 0,5, lo que da lugar a conjuntos de datos desbalanceados. Este desbalance puede generar sesgos hacia la clase mayoritaria en los algoritmos. Algunas estrategias para abordarlo:

  1. Oversampling de la clase minoritaria: Técnicas como SMOTE (Synthetic Minority Oversampling Technique) generan muestras sintéticas de la clase minoritaria.
  2. Undersampling de la clase mayoritaria: Eliminar aleatoriamente instancias de la clase mayoritaria para equilibrar el conjunto.
  3. Ajuste de pesos de clase: Dar más importancia a la clase minoritaria durante el entrenamiento.
  4. Uso de métodos de conjunto: Técnicas como Random Forests o Gradient Boosting suelen manejar mejor el desbalance que modelos individuales. Lee nuestro tutorial What is Boosting para conocer el boosting y los métodos de conjunto en general.
  5. Elegir métricas de evaluación adecuadas: La exactitud por sí sola puede ser engañosa en conjuntos desbalanceados. Considera F1-score, precisión, recall o el área bajo la curva ROC.

Eficiencia computacional

Las distribuciones de Bernoulli son eficientes computacionalmente, sobre todo en tareas de clasificación binaria con grandes volúmenes de datos. Aun así, conviene considerar:

  1. Vectorización: Al implementar algoritmos basados en Bernoulli, usa operaciones vectorizadas (p. ej., NumPy en Python) para mejorar el rendimiento.
  2. Dispersidad (sparsity): En clasificación de texto con el clasificador Bernoulli Naive Bayes, aprovechar matrices dispersas reduce notablemente memoria y tiempo de cómputo.
  3. Equilibrios en la complejidad del modelo: Aunque modelos más complejos puedan rendir algo mejor, su coste computacional no siempre compensa la mejora marginal. Valora el equilibrio entre precisión y tiempo de proceso.

Ideas erróneas habituales

Para comprender bien las distribuciones de Bernoulli, conviene despejar algunos malentendidos comunes:

Interpretación incorrecta de la probabilidad de éxito

Un error frecuente es asumir que la probabilidad de éxito p en una distribución de Bernoulli siempre es 0,5. En realidad, p puede tomar cualquier valor entre 0 y 1, ambos incluidos. El valor de p depende del escenario o proceso que se esté modelando.

Por ejemplo:

  • En una moneda justa, p = 0,5.
  • En un dado cargado donde sacar un 6 se considera éxito, p podría ser 1/4.
  • En un control de calidad con tasa de defectos del 1%, p sería 0,01 para el resultado "defecto".

Estimar p con precisión a partir de datos es crucial para una inferencia y un modelado adecuados. A menudo implica recopilar una muestra representativa y calcular la proporción de éxitos.

Bernoulli vs. distribución binomial

A veces se confunden las distribuciones de Bernoulli con las binomiales. Están relacionadas, pero son distintas:

  • Una distribución de Bernoulli modela un único ensayo con dos posibles resultados.
  • Una distribución binomial modela el número de éxitos en un número fijo de ensayos de Bernoulli independientes.

En otras palabras, una distribución binomial es la suma de múltiples distribuciones de Bernoulli. Por ejemplo, si lanzas una moneda 10 veces y cuentas las caras, eso es una distribución binomial. Cada lanzamiento individual, sin embargo, sigue una distribución de Bernoulli. Veámoslo visualmente:

Bernoulli distribution versus binomial distribution

Distribución de Bernoulli frente a distribución binomial. Imagen del autor.

Esta comparación muestra claramente la diferencia fundamental entre ambas:

  • La distribución de Bernoulli (izquierda) representa un único ensayo con solo dos posibles resultados: 0 (fracaso) o 1 (éxito). En este ejemplo, con p = 0,3, vemos un 70% de probabilidad de fracaso y un 30% de éxito.
  • La distribución binomial (derecha) representa el número de éxitos en múltiples ensayos (en este caso, 10). Muestra la probabilidad de obtener cada posible número de éxitos, de 0 a 10. La forma de esta distribución viene determinada tanto por n (número de ensayos) como por p (probabilidad de éxito en cada ensayo).

Mientras que una distribución de Bernoulli siempre tiene exactamente dos posibles resultados, una distribución binomial puede tener n+1 resultados posibles, donde n es el número de ensayos.

Alternativas a las distribuciones de Bernoulli

Aunque las distribuciones de Bernoulli se usan ampliamente, hay escenarios donde otras distribuciones pueden ser más adecuadas. Dos alternativas comunes:

Distribución binomial

La distribución binomial es útil cuando trabajas con múltiples ensayos en lugar de un único evento. Se considera cuando te interesa el número de éxitos a lo largo de varios intentos, no solo un resultado.

Distribución geométrica

La distribución geométrica entra en juego cuando te interesa cuántos intentos harán falta hasta lograr el primer éxito. Se aplica a menudo cuando el foco está en el tiempo de espera o el número de intentos antes del éxito.

Conclusión

Las distribuciones de Bernoulli son la base de muchos conceptos estadísticos y componentes esenciales en ciencia de datos. Su naturaleza binaria, unida a sus amplias aplicaciones en aprendizaje automático, pruebas de hipótesis y simulación, las convierte en un marco clave para analizar y modelar resultados binarios.

Ideas clave:

  1. Las distribuciones de Bernoulli modelan ensayos individuales con dos posibles resultados.
  2. La probabilidad de éxito p es el parámetro clave que define la distribución.
  3. Tienen múltiples aplicaciones en clasificación binaria, pruebas de hipótesis y simulaciones.
  4. Comprender sus propiedades y los malentendidos frecuentes ayuda a aplicarlas con eficacia.
  5. Aunque potentes, en ciertos casos pueden ser más apropiadas la binomial o la geométrica.

Si te interesa aplicar estos conceptos en entornos de programación concretos, nuestros cursos Introduction to Statistics in Python e Introduction to Statistics in R ofrecen aprendizaje práctico. Y si quieres ir un paso más allá, el curso Mixture Models in R amplía estos fundamentos para explorar técnicas de modelización estadística más complejas. Por último, consulta el itinerario de habilidades Machine Learning in Production in Python para llevar tus habilidades de machine learning a producción y empezar a desplegar modelos avanzados. 

Desarrolla habilidades de aprendizaje automático

Eleva tus habilidades de aprendizaje automático al nivel de producción.

Vinod Chugani's photo
Author
Vinod Chugani
LinkedIn

Vinod Chugani comenzó su carrera en Tokio como el jefe más joven del equipo de ventas para hedge funds de JPMorgan y más tarde batió un récord individual de ventas en Lehman Brothers, para después crear un negocio de distribución de electrónica en 30 países que superó los 100 millones de SG$ en ingresos antes de dar el salto a los datos. Graduado en Economía por Duke y antiguo alumno de NYC Data Science Academy, fue uno de los tres becados entre más de 100 solicitantes para el curso Building AI Applications de Hugo Bowne-Anderson en Maven. Hoy escribe en DataCamp, KDnuggets, Machine Learning Mastery y Statology sobre temas que van desde estadística hasta IA agentiva, y mentoriza a profesionales de datos en NYC Data Science Academy con más de 1.000 sesiones uno a uno a sus espaldas.

 

Preguntas frecuentes

¿Qué es una distribución de Bernoulli?

Una distribución de Bernoulli es una distribución de probabilidad discreta para una variable aleatoria que solo tiene dos posibles resultados: éxito (normalmente 1) o fracaso (normalmente 0). Se caracteriza por un único parámetro p, que representa la probabilidad de éxito.

¿Cuál es la diferencia entre una distribución de Bernoulli y una binomial?

Una distribución de Bernoulli modela un único ensayo con dos posibles resultados, mientras que una distribución binomial modela el número de éxitos en un número fijo de ensayos de Bernoulli independientes. Puedes pensar en la binomial como la suma de múltiples distribuciones de Bernoulli.

¿Se pueden usar las distribuciones de Bernoulli en pruebas de hipótesis?

Sí, las distribuciones de Bernoulli se utilizan habitualmente en pruebas de hipótesis, especialmente en escenarios con proporciones o tasas de éxito. Son especialmente útiles en A/B testing, donde comparas las tasas de éxito de dos estrategias o tratamientos distintos.

¿Cómo se relacionan las distribuciones de Bernoulli con odds y log-odds?

Las odds (cuotas) de éxito en un ensayo de Bernoulli son p/(1-p), donde p es la probabilidad de éxito. El log-odds, también llamado función logit, es el logaritmo natural de las odds. Estos conceptos se usan comúnmente en regresión logística y otros análisis estadísticos.

¿Cómo puedo estimar el parámetro p de una distribución de Bernoulli a partir de datos?

El método más común para estimar p es la estimación de máxima verosimilitud (MLE). En una distribución de Bernoulli, el MLE de p es simplemente la proporción de éxitos en tu muestra. Por ejemplo, si observas 7 éxitos de 10 ensayos, tu estimación de p sería 0,7.

Temas
Ciencia de datos
Análisis de datos

Aprende con DataCamp

Curso

Modelos de mezcla en R

4 h
5.2K
Aprende los modelos mixtos: un marco estadístico formal y práctico para la agrupación y la clasificación probabilísticas.
Ver detallesRight Arrow
Iniciar Curso
Ver másRight Arrow
Relacionado

blog

Clasificación en machine learning: Introducción

Aprende sobre la clasificación en machine learning viendo qué es, cómo se utiliza y algunos ejemplos de algoritmos de clasificación.
Zoumana Keita 's photo

Zoumana Keita

14 min

blog

¿Qué es el análisis de datos? Una guía experta con ejemplos

Explora el mundo del análisis de datos con nuestra completa guía. Conoce su importancia, proceso, tipos, técnicas, herramientas y principales carreras en 2023
Matt Crabtree's photo

Matt Crabtree

10 min

Tutorial

Comprender la asimetría y la curtosis y cómo trazarlas

Una completa guía visual sobre la asimetría/curtosis y cómo afectan a las distribuciones y, en última instancia, a tu proyecto de ciencia de datos.

Tutorial

Prueba Chi-cuadrado en hojas de cálculo

En este tutorial, aprenderás a realizar la prueba chi-cuadrado en hojas de cálculo.
Avinash Navlani's photo

Avinash Navlani

10 min

Tutorial

Matriz de correlaciones en Excel: Guía completa para crear e interpretar

Aprende el concepto estadístico de correlación, y sigue el cálculo e interpretación de correlaciones para un conjunto de datos de muestra, en un tutorial paso a paso.
Arunn Thevapalan's photo

Arunn Thevapalan

9 min

Tutorial

Tutorial de cálculo de Power BI

Aprenda a utilizar la función CALCULAR de Power BI con ejemplos de uso.
Joleen Bothma's photo

Joleen Bothma

6 min

Ver MásVer Más