distribución bivariada – bivariate distribution
- Distribución Bivariada
- 1. Definición Central y Contexto
- 2. Formalismo Matemático y Componentes
- 3. Medidas Clave de Asociación: Covarianza y Correlación
- 4. Tipos Fundamentales de Distribuciones Bivariadas
- 5. La Distribución Normal Bivariada (DNB)
- 6. Aplicaciones a Través de Diversas Disciplinas
- 7. Estimación, Inferencia y Desafíos
- 8. Extensiones y el Paso a lo Multivariado
- Further Reading
Distribución Bivariada
Primary Disciplinary Field(s): Estadística, Teoría de la Probabilidad, Econometría, Ciencia de Datos
1. Definición Central y Contexto
La distribución bivariada es un concepto fundamental dentro de la Teoría de la Probabilidad y la Estadística, y se utiliza para describir el comportamiento probabilístico de dos variables aleatorias conjuntamente. A diferencia de una distribución univariada, que se centra en una sola variable $X$, la distribución bivariada se ocupa de un par ordenado de variables $(X, Y)$, permitiendo a los analistas modelar no solo la probabilidad de ocurrencia de cada variable individualmente, sino también cómo estas variables interactúan o se relacionan entre sí. Esta perspectiva conjunta es indispensable cuando el resultado de un fenómeno depende intrínsecamente de la observación simultánea de dos factores interdependientes, como la altura y el peso de una población, o el precio y la demanda de un producto.
El estudio de la distribución bivariada es esencialmente el estudio de la probabilidad conjunta. Si $X$ y $Y$ son variables aleatorias, su distribución conjunta especifica la probabilidad de que $X$ tome un valor específico $x$ y $Y$ tome un valor específico $y$ simultáneamente, o, en el caso continuo, la probabilidad de que el par $(X, Y)$ caiga dentro de una región particular del plano cartesiano. La capacidad de capturar esta interacción es lo que distingue a la estadística bivariada de la simple suma de dos análisis univariados. Si las variables fueran completamente independientes, el análisis univariado sería suficiente; sin embargo, en la realidad, la mayoría de los fenómenos de interés científico y económico presentan algún grado de dependencia.
La representación formal de esta distribución se realiza a través de la Función de Distribución Acumulada Conjunta (FDA conjunta), denotada como $F(x, y)$, que define la probabilidad de que $X leq x$ y $Y leq y$ al mismo tiempo. Esta función es la base para derivar todas las demás propiedades de la distribución, incluyendo las funciones de masa o densidad de probabilidad. Comprender el contexto de la distribución bivariada requiere reconocer que el espacio muestral se expande a dos dimensiones, lo que obliga a utilizar herramientas geométricas y de cálculo multivariado para su análisis y manipulación.
El objetivo principal al trabajar con una distribución bivariada es caracterizar la naturaleza de la dependencia entre $X$ e $Y$. Esto implica determinar si existe una relación, cuál es la dirección de esa relación (positiva o negativa) y cuál es su fuerza. La correcta identificación de la distribución subyacente permite realizar inferencias más precisas, predecir valores futuros y, crucialmente, desarrollar modelos causales o predictivos robustos en campos tan variados como la meteorología, la genética y las finanzas cuantitativas.
2. Formalismo Matemático y Componentes
El formalismo matemático de la distribución bivariada se diferencia según si las variables $X$ y $Y$ son discretas o continuas. Para el caso de variables aleatorias discretas, la distribución se define mediante la Función de Masa de Probabilidad Conjunta (FMP conjunta), $p(x, y) = P(X=x, Y=y)$. Esta función debe satisfacer dos condiciones esenciales: que $p(x, y) geq 0$ para todos los pares $(x, y)$, y que la suma de todas las probabilidades posibles sea igual a la unidad: $sum_x sum_y p(x, y) = 1$.
En el caso de variables aleatorias continuas, la distribución se especifica a través de la Función de Densidad de Probabilidad Conjunta (FDP conjunta), $f(x, y)$. En este contexto, la probabilidad de que $(X, Y)$ caiga en una región $A$ del plano se calcula integrando la FDP sobre esa región: $P((X, Y) in A) = iint_A f(x, y) , dx , dy$. Al igual que en el caso discreto, la FDP debe ser no negativa y la integral doble sobre todo el espacio de soporte debe ser igual a uno. La FDP conjunta no representa directamente una probabilidad, sino la densidad de probabilidad en un punto dado.
Dos conceptos derivados cruciales son las distribuciones marginales y condicionales. La distribución marginal de $X$, $f_X(x)$, se obtiene “sumando” o “integrando” la distribución conjunta sobre todos los posibles valores de $Y$. Para el caso continuo, esto es $f_X(x) = int_{-infty}^{infty} f(x, y) , dy$. La distribución marginal permite analizar el comportamiento de una variable ignorando la información sobre la otra, proporcionando el perfil univariado de cada componente.
Por otro lado, la distribución condicional, $f_{Y|X}(y|x)$, describe la distribución de una variable (por ejemplo, $Y$) dado que la otra variable ($X$) ha tomado un valor específico $x$. Se calcula como el cociente entre la distribución conjunta y la distribución marginal de la variable condicionante: $f_{Y|X}(y|x) = frac{f(x, y)}{f_X(x)}$, siempre que $f_X(x) > 0$. Las distribuciones condicionales son de vital importancia, ya que permiten la inferencia predictiva, es decir, predecir el valor de $Y$ si se conoce el valor de $X$. La independencia estadística entre $X$ e $Y$ se establece formalmente si la distribución condicional es idéntica a la distribución marginal, es decir, $f_{Y|X}(y|x) = f_Y(y)$, o equivalentemente, si $f(x, y) = f_X(x) f_Y(y)$.
3. Medidas Clave de Asociación: Covarianza y Correlación
Para cuantificar la relación lineal entre las dos variables que componen la distribución bivariada, se utilizan dos métricas fundamentales: la covarianza y el coeficiente de correlación. La covarianza, denotada como $Cov(X, Y)$ o $sigma_{XY}$, mide el grado en que $X$ y $Y$ varían conjuntamente. Se define como el valor esperado del producto de las desviaciones de cada variable respecto a sus respectivas medias: $Cov(X, Y) = E[(X – mu_X)(Y – mu_Y)]$. Un valor positivo de la covarianza indica que, en promedio, cuando $X$ es mayor que su media, $Y$ también lo es, sugiriendo una relación directa. Un valor negativo indica una relación inversa, y un valor cercano a cero sugiere una ausencia de relación lineal.
Sin embargo, la covarianza tiene una limitación significativa: su valor depende de la escala de las unidades de medida de $X$ e $Y$. Si se cambian las unidades (por ejemplo, de metros a centímetros), el valor numérico de la covarianza cambia, haciendo difícil la comparación de la fuerza de la relación entre diferentes pares de variables. Para superar esta limitación y obtener una medida estandarizada de la asociación lineal, se utiliza el coeficiente de correlación de Pearson, $rho_{XY}$.
El coeficiente de correlación se define como la covarianza normalizada por el producto de las desviaciones estándar de $X$ y $Y$: $rho_{XY} = frac{Cov(X, Y)}{sigma_X sigma_Y}$. Esta estandarización asegura que el valor de $rho_{XY}$ siempre se encuentre en el rango cerrado de $[-1, 1]$. Un valor de $+1$ indica una relación lineal positiva perfecta; $-1$ indica una relación lineal negativa perfecta; y $0$ indica ausencia de relación lineal. Es crucial destacar que la correlación solo mide la fuerza de la relación lineal; una correlación de cero no implica necesariamente independencia, ya que puede existir una fuerte relación no lineal.
La relación entre covarianza, correlación e independencia es un pilar de la estadística bivariada. Si dos variables $X$ e $Y$ son estadísticamente independientes, su covarianza y, por lo tanto, su correlación deben ser cero. Esto se debe a que la independencia implica que el valor de una variable no proporciona información sobre el valor de la otra. Sin embargo, el recíproco no es generalmente cierto: si $Cov(X, Y) = 0$, las variables son incorrelacionadas, pero no necesariamente independientes. La única excepción notable a esta regla es el caso de la Distribución Normal Bivariada, donde la incorrelación sí implica independencia.
4. Tipos Fundamentales de Distribuciones Bivariadas
Las distribuciones bivariadas se clasifican ampliamente en discretas y continuas, cada una con modelos específicos adaptados a diferentes tipos de datos y fenómenos. Entre las distribuciones discretas, la Distribución Multinomial es una extensión directa de la binomial que permite modelar la probabilidad de resultados de un experimento con más de dos categorías, donde dos de estas categorías pueden ser vistas como las variables $X$ y $Y$. Otro ejemplo es la Distribución de Poisson Bivariada, utilizada para modelar el número de ocurrencias conjuntas de dos eventos raros en un intervalo de tiempo o espacio determinado.
En el ámbito continuo, el modelo más común y estudiado es la Distribución Normal Bivariada, que se abordará en detalle más adelante. Otros modelos continuos incluyen la Distribución Uniforme Bivariada, donde la probabilidad se distribuye uniformemente sobre una región bidimensional específica (a menudo rectangular o triangular), y la Distribución Exponencial Bivariada, utilizada a menudo en teoría de la fiabilidad y modelado de tiempos de espera de dos componentes interrelacionados.
La elección del tipo de distribución es crucial para la modelización precisa. Por ejemplo, si se están analizando datos de conteo (como el número de llamadas recibidas por dos centrales telefónicas), una distribución bivariada de Poisson podría ser apropiada. Si se están analizando variables físicas que resultan de la acumulación de muchos factores aleatorios (como la estatura y la presión arterial), la distribución normal bivariada suele ser el punto de partida. La adecuación del modelo se evalúa a menudo mediante pruebas de bondad de ajuste que comparan los datos observados con las propiedades teóricas de la distribución propuesta.
Más allá de las distribuciones paramétricas clásicas, la estadística moderna hace uso extensivo de las cópulas. Las cópulas son funciones que permiten separar la estructura de dependencia entre $X$ e $Y$ de sus distribuciones marginales. Esto es extremadamente útil porque permite al modelador elegir una forma arbitraria para las distribuciones marginales (por ejemplo, una marginal t de Student y otra log-normal) y luego modelar la dependencia entre ellas utilizando una cópula (por ejemplo, Gaussiana o de Clayton), ofreciendo una flexibilidad mucho mayor que los modelos tradicionales.
5. La Distribución Normal Bivariada (DNB)
La Distribución Normal Bivariada (DNB) es, con diferencia, el modelo de distribución conjunta más importante y más utilizado en la estadística aplicada. Esto se debe no solo a que muchas variables naturales y sociales se aproximan a la normalidad, sino también a sus propiedades matemáticas únicas y manejables. La DNB está completamente definida por cinco parámetros: las medias de cada variable ($mu_X, mu_Y$), las varianzas ($sigma_X^2, sigma_Y^2$) y el coeficiente de correlación ($rho$).
La función de densidad de la DNB es una extensión de la campana de Gauss a dos dimensiones, creando una forma de campana tridimensional. Sus curvas de nivel, es decir, los conjuntos de puntos $(x, y)$ que tienen la misma densidad de probabilidad, son elipses concéntricas. La orientación y excentricidad de estas elipses están determinadas directamente por el valor del coeficiente de correlación $rho$. Si $rho$ es cero, las elipses se alinean con los ejes, y la distribución se convierte en un círculo (si las varianzas son iguales), indicando independencia. A medida que $|rho|$ se acerca a 1, las elipses se vuelven más alargadas y delgadas.
Una propiedad fundamental de la DNB es que sus distribuciones marginales son, a su vez, distribuciones normales univariadas. Además, y de manera excepcional, sus distribuciones condicionales también son normales. Por ejemplo, la distribución de $Y$ dado $X=x$ es una distribución normal con una media que es una función lineal de $x$ y una varianza que es menor que la varianza marginal de $Y$, reflejando la reducción de incertidumbre que se obtiene al conocer el valor de $X$.
La propiedad más distintiva de la DNB, que la hace tan valiosa en la inferencia estadística, es que la incorrelación implica independencia. Si el coeficiente de correlación $rho$ es igual a cero, la FDP conjunta se factoriza en el producto de las dos FDP marginales, cumpliendo la definición estricta de independencia estadística. Esta simplificación matemática es una de las razones por las que la DNB se utiliza como modelo predeterminado en muchas áreas de la ingeniería, la física y la econometría.
6. Aplicaciones a Través de Diversas Disciplinas
La distribución bivariada es una herramienta analítica indispensable con amplias aplicaciones en prácticamente todas las ciencias cuantitativas. En Econometría, se utiliza frecuentemente para modelar la relación entre variables económicas clave. Por ejemplo, un economista podría modelar conjuntamente la tasa de desempleo y la tasa de inflación (relación conocida como la Curva de Phillips) para entender cómo los cambios en una afectan a la probabilidad de ocurrencia de la otra. También es crucial en el análisis de regresión, donde la distribución de los errores residuales se analiza en conjunto con las variables explicativas.
En el campo de las Finanzas Cuantitativas y la Gestión de Riesgos, la distribución bivariada es vital para la construcción de carteras. Al modelar conjuntamente los rendimientos de dos activos financieros (acciones, bonos o divisas), los analistas utilizan la covarianza y la correlación para determinar cómo se moverán juntos. Una correlación baja o negativa entre dos activos es deseable, ya que reduce el riesgo total de la cartera a través de la diversificación. La DNB y, más recientemente, las cópulas, se utilizan para calcular métricas de riesgo como el Valor en Riesgo (VaR) bivariado.
En Biología y Medicina, las distribuciones bivariadas se aplican para estudiar la co-ocurrencia de características o síntomas. Por ejemplo, se puede modelar conjuntamente la respuesta de un paciente a dos fármacos diferentes, o la relación entre dos biomarcadores (como el colesterol y la presión arterial) para evaluar el riesgo de enfermedad. En la investigación genética, se utilizan para analizar la vinculación genética, estudiando la distribución conjunta de dos loci genéticos en una población.
Finalmente, en Ciencias Ambientales y Meteorología, la distribución bivariada se emplea para modelar fenómenos naturales interrelacionados. Un ejemplo podría ser la distribución conjunta de la precipitación y la temperatura en una región específica, lo cual es fundamental para la gestión de recursos hídricos y la predicción de eventos climáticos extremos. La correcta modelización de estas interdependencias permite a los planificadores tomar decisiones más informadas sobre infraestructura y preparación ante desastres.
7. Estimación, Inferencia y Desafíos
El proceso de inferencia estadística en distribuciones bivariadas comienza con la estimación de los parámetros de la distribución subyacente a partir de una muestra de datos. Para la DNB, esto implica estimar las cinco constantes (dos medias, dos varianzas y la correlación). Los métodos más comunes para la estimación son el Método de Máxima Verosimilitud (MLE) y el Método de Momentos. MLE es generalmente preferido por sus propiedades asintóticas deseables (consistencia y eficiencia), y proporciona estimaciones que son funciones directas de las medias muestrales, varianzas muestrales y la covarianza muestral.
Una vez que se han estimado los parámetros, el siguiente paso es la inferencia, que a menudo implica la realización de pruebas de hipótesis. La prueba de hipótesis más común en el contexto bivariado es si existe o no una relación lineal, es decir, probar la hipótesis nula $H_0: rho = 0$. Si se rechaza $H_0$, se concluye que existe evidencia estadística de una relación lineal significativa entre $X$ e $Y$. La construcción de intervalos de confianza para los parámetros estimados (como el intervalo de confianza para la media condicional o para el coeficiente de correlación) también es una tarea clave.
Uno de los principales desafíos en la aplicación de modelos bivariados es la suposición de la forma de la distribución. Si se asume incorrectamente que los datos siguen una DNB cuando en realidad tienen colas pesadas o asimetría, las inferencias sobre la dependencia (especialmente en los extremos de la distribución) pueden ser gravemente erróneas. Este problema es particularmente relevante en finanzas, donde los eventos extremos son críticos. La solidez de los modelos debe ser evaluada rigurosamente.
Otro desafío importante es la distinción entre correlación y causalidad. Aunque una distribución bivariada puede mostrar una fuerte correlación entre $X$ e $Y$, esto no implica que $X$ cause $Y$ o viceversa. La correlación simplemente mide la asociación estadística. Para establecer la causalidad, se requieren métodos estadísticos más avanzados, como el análisis de regresión, el diseño experimental o el uso de modelos estructurales, que trascienden el análisis puramente descriptivo de la distribución bivariada.
8. Extensiones y el Paso a lo Multivariado
Aunque la distribución bivariada es poderosa para analizar dos variables, muchos problemas reales involucran la interacción simultánea de tres o más variables. La extensión natural de la distribución bivariada es la distribución multivariada. En una distribución $k$-variada, se considera un vector aleatorio $mathbf{X} = (X_1, X_2, ldots, X_k)$, y la distribución conjunta describe la probabilidad de que todas las variables tomen valores específicos simultáneamente.
La distribución multivariada más importante es la Distribución Normal Multivariada, que generaliza la DNB a $k$ dimensiones. Esta distribución se define por un vector de medias ($boldsymbol{mu}$) y una matriz de covarianza ($boldsymbol{Sigma}$). La matriz de covarianza captura todas las varianzas individuales y todas las covarianzas bivariadas posibles entre cada par de variables $(sigma_{ij})$, convirtiéndose en el corazón del análisis de dependencia multivariada.
El desafío principal de las distribuciones multivariadas, especialmente en alta dimensionalidad, es la complejidad en el modelado de la estructura de dependencia. A medida que el número de variables $k$ aumenta, el número de parámetros de covarianza a estimar crece cuadráticamente, lo que puede requerir muestras de datos muy grandes para obtener estimaciones fiables. Además, visualizar y manipular distribuciones de más de tres dimensiones es matemáticamente complejo.
Por esta razón, la teoría de cópulas, ya mencionada en el contexto bivariado, se vuelve aún más crucial en el análisis multivariado. Las cópulas permiten construir modelos multivariados complejos al acoplar distribuciones marginales (posiblemente no normales) a una estructura de dependencia específica, lo que facilita el modelado de fenómenos con dependencias asimétricas o de cola, que no pueden ser capturadas adecuadamente por la distribución normal multivariada estándar.