– cumulative distribution function (CDF)
- Función de Distribución Acumulada (FDA)
- 1. Definición Central
- 2. Etimología y Desarrollo Histórico
- 3. Propiedades Fundamentales
- 4. Relación con Otras Funciones de Probabilidad
- 5. El CDF para Variables Discretas
- 6. El CDF para Variables Continuas
- 7. Aplicaciones Prácticas y Significado
- 8. Generalizaciones y Extensiones
- Lecturas Adicionales
Función de Distribución Acumulada (FDA)
Primary Disciplinary Field(s): Teoría de la Probabilidad, Estadística Matemática, Análisis Real.
1. Definición Central
La Función de Distribución Acumulada (FDA), conocida internacionalmente como Cumulative Distribution Function (CDF), es una herramienta fundamental dentro del marco de la Teoría de la Probabilidad y la Inferencia Estadística. Su propósito esencial es describir la distribución de una variable aleatoria real, ya sea discreta, continua o mixta. Formalmente, si $X$ es una variable aleatoria, su FDA, denotada por $F(x)$ o $F_X(x)$, se define para todo número real $x$ como la probabilidad de que $X$ tome un valor menor o igual a $x$. Matemáticamente, esto se expresa como $F(x) = P(X le x)$. Esta función proporciona una descripción completa y no ambigua de la distribución de probabilidad de la variable, siendo el pilar sobre el cual se construyen la mayoría de los análisis estadísticos avanzados.
A diferencia de la función de masa de probabilidad (FMP) o la función de densidad de probabilidad (FDP), que describen la probabilidad en puntos específicos o infinitesimales, la FDA ofrece una perspectiva acumulativa. Esta acumulación es crucial porque permite calcular directamente la probabilidad de que la variable aleatoria se encuentre dentro de cualquier intervalo $(a, b]$. Específicamente, la probabilidad de que $X$ caiga entre $a$ y $b$ (incluyendo $b$ pero no $a$) se calcula simplemente como la diferencia $P(a < X le b) = F(b) – F(a)$. Esta característica convierte a la FDA en el método más conveniente para determinar probabilidades de eventos complejos basados en rangos.
La naturaleza de la FDA asegura que su rango de valores esté siempre contenido en el intervalo cerrado $[0, 1]$, reflejando que la probabilidad de cualquier evento debe ser no negativa y no puede exceder la certeza total. La interpretación intuitiva de $F(x)$ es la proporción de la población o el espacio muestral que posee un valor de la variable aleatoria menor o igual al umbral $x$. Esta concepción la hace indispensable no solo en la estadística teórica, sino también en campos aplicados como la ingeniería, las finanzas cuantitativas y la física estadística, donde la modelización de la incertidumbre es primordial.
2. Etimología y Desarrollo Histórico
El concepto de la función de distribución acumulada, aunque no siempre denominado formalmente así, tiene raíces profundas en el desarrollo de la teoría de la probabilidad moderna, especialmente a partir del siglo XIX. Si bien figuras como Pierre-Simon Laplace y Carl Friedrich Gauss sentaron las bases para el estudio de distribuciones continuas y la ley de los grandes números, la formalización rigurosa de la FDA como un concepto central se consolidó en el siglo XX, coincidiendo con la axiomatización de la probabilidad. La necesidad de un marco unificado que pudiera tratar tanto con variables discretas (como el número de resultados en lanzamientos de dados) como con variables continuas (como la altura o el tiempo de vida) impulsó la adopción de la FDA.
El trabajo seminal de matemáticos como Andrei Kolmogorov en la década de 1930, que estableció la base axiomática moderna de la probabilidad utilizando la teoría de la medida, fue fundamental para cimentar el estatus de la FDA. En este marco, la FDA se convierte en la forma canónica de especificar una medida de probabilidad en la línea real. La FDA permite definir la probabilidad de cualquier conjunto Borel en la línea real, lo que otorga a la teoría de la probabilidad una solidez matemática inigualable. Esta formalización permitió a los estadísticos pasar de descripciones ad-hoc de distribuciones a un tratamiento universal y riguroso.
Antes de esta formalización, muchas distribuciones específicas (como la distribución Normal o Gaussiana) ya se utilizaban, pero la FDA proporcionó el lenguaje común para compararlas y manipularlas. El desarrollo de la inferencia no paramétrica, que a menudo depende de la función empírica de distribución (una estimación de la FDA basada en datos muestrales), destacó aún más su importancia práctica. Hoy en día, la FDA es considerada la representación más fundamental y completa de la información de probabilidad contenida en una variable aleatoria.
3. Propiedades Fundamentales
La Función de Distribución Acumulada debe satisfacer un conjunto estricto de propiedades matemáticas que garantizan su validez como medida de probabilidad. Estas propiedades son inherentes a su definición y son cruciales para su manipulación analítica. La primera propiedad esencial es que la FDA es una función monótona no decreciente. Esto significa que si $a < b$, entonces $F(a) le F(b)$. Esta propiedad es lógicamente necesaria, ya que al aumentar el valor umbral $x$, el conjunto de eventos ${X le x}$ se agranda o permanece igual, por lo que la probabilidad acumulada nunca puede disminuir.
La segunda propiedad fundamental se relaciona con sus límites en los extremos del dominio. Dado que la FDA acumula probabilidad desde $-infty$ hasta $+infty$, debe cumplir que el límite de $F(x)$ cuando $x$ tiende a $-infty$ es cero (es decir, $lim_{x to -infty} F(x) = 0$), y el límite de $F(x)$ cuando $x$ tiende a $+infty$ es uno (es decir, $lim_{x to +infty} F(x) = 1$). El primer límite refleja que la probabilidad acumulada antes de cualquier evento posible es nula, y el segundo refleja que la probabilidad total de todo el espacio muestral es la unidad, o certeza.
Finalmente, la FDA debe ser continua por la derecha. Esto se expresa como $lim_{h to 0^+} F(x+h) = F(x)$. Esta propiedad técnica es vital para la coherencia matemática, especialmente en el tratamiento de variables aleatorias discretas donde la FDA presenta saltos (discontinuidades). Si la variable es continua, la FDA será continua en todos los puntos; sin embargo, la continuidad por la derecha es la propiedad general que engloba ambos casos. Estos saltos en la FDA corresponden precisamente a los valores que la variable aleatoria discreta puede tomar con una probabilidad no nula.
4. Relación con Otras Funciones de Probabilidad
La FDA sirve como el puente conceptual y matemático entre las dos representaciones primarias de la distribución de probabilidad: la función de masa de probabilidad (FMP) para variables discretas y la función de densidad de probabilidad (FDP) para variables continuas. La FDA puede derivarse de estas funciones y, recíprocamente, puede utilizarse para obtenerlas, demostrando su papel central en la teoría.
Para una variable aleatoria discreta $X$, la FDA se construye como la suma de las probabilidades de todos los valores que son menores o iguales a $x$. Si $p(k)$ es la FMP, entonces $F(x) = sum_{k le x} p(k)$. La FMP, a su vez, puede recuperarse de la FDA al notar que la probabilidad de que $X$ tome un valor específico $k$ es el tamaño del salto de la FDA en ese punto: $p(k) = F(k) – F(k^-)$, donde $F(k^-)$ es el límite de $F(x)$ cuando $x$ se aproxima a $k$ por la izquierda.
Para una variable aleatoria continua $X$, la FDA está intrínsecamente ligada a la FDP, $f(x)$, a través de las herramientas del cálculo integral y diferencial. La FDA se define como la integral de la FDP desde menos infinito hasta $x$: $F(x) = int_{-infty}^{x} f(t) dt$. Recíprocamente, si la FDA es diferenciable, la FDP puede obtenerse derivando la FDA: $f(x) = F'(x)$. Esta relación fundamental subraya que la FDP representa la tasa de acumulación de probabilidad, mientras que la FDA representa la acumulación total hasta un punto dado.
5. El CDF para Variables Discretas
En el contexto de variables aleatorias discretas, la FDA exhibe una forma característica de función escalonada. Dado que la variable aleatoria solo puede tomar un conjunto contable de valores (por ejemplo, $x_1, x_2, x_3, dots$), la probabilidad solo se incrementa en estos puntos específicos. Entre dos valores consecutivos que la variable puede tomar, la FDA permanece constante, formando escalones horizontales. La altura de cada escalón es exactamente la probabilidad de que la variable aleatoria tome ese valor particular.
Consideremos, por ejemplo, la distribución de Poisson o la distribución Binomial. En estos casos, la FDA acumula la probabilidad en pasos discretos. Esta representación visual de la FDA escalonada es muy informativa, ya que permite identificar rápidamente los valores más probables y los saltos de probabilidad. La discontinuidad inherente a esta función escalonada es la razón por la que se requiere la propiedad de continuidad por la derecha, asegurando que la probabilidad $P(X le x)$ incluya el valor $x$ en el punto de salto.
El uso de la FDA para variables discretas es crucial en aplicaciones de conteo, como la modelización del número de fallos en un sistema, el número de clientes que llegan a una cola, o el resultado de ensayos repetidos. Permite calcular, por ejemplo, la probabilidad de observar “a lo sumo” un cierto número de eventos, lo cual es a menudo más relevante en la práctica que la probabilidad de observar un número exacto.
6. El CDF para Variables Continuas
Para las variables aleatorias continuas, la FDA es una función suave y continua en todo su dominio. Esto se debe a que la probabilidad de que una variable continua tome un valor exacto es cero ($P(X=x)=0$). La acumulación de probabilidad ocurre de manera gradual e ininterrumpida. Ejemplos clásicos incluyen la distribución Normal (Gaussiana), la distribución Exponencial o la distribución Uniforme.
La continuidad de la FDA en el caso continuo tiene una implicación práctica importante: para estas variables, $P(a < X le b)$ es idéntico a $P(a le X le b)$, $P(a < X < b)$, y $P(a le X < b)$. Es decir, la inclusión o exclusión de los puntos finales del intervalo no altera la probabilidad calculada. Esto simplifica enormemente los cálculos y la interpretación, ya que la integración de la FDP no se ve afectada por los límites de integración.
Un aspecto crucial de la FDA continua es que facilita la generación de números aleatorios a partir de una distribución específica. Si $U$ es una variable aleatoria distribuida uniformemente en $(0, 1)$, entonces la variable $X = F^{-1}(U)$ tendrá la distribución cuya FDA es $F$. Este método, conocido como el método de la transformada inversa, es la base de muchos algoritmos de simulación de Monte Carlo, demostrando la profunda utilidad algorítmica de la FDA inversa.
7. Aplicaciones Prácticas y Significado
La FDA posee un significado estadístico profundo que trasciende la mera descripción matemática. Es la base para la definición de cuantiles y percentiles. El cuantil $q$ (donde $0 < q < 1$) de una distribución es el valor $x_q$ tal que $F(x_q) = q$. Es decir, el cuantil $q$ es el valor por debajo del cual cae el $100q$ por ciento de la probabilidad. El cuantil 0.5 es la mediana de la distribución, una medida robusta de tendencia central.
En la estadística aplicada, la FDA es central en las pruebas de hipótesis no paramétricas. Por ejemplo, la prueba de Kolmogorov-Smirnov (KS) utiliza la distancia máxima entre la Función de Distribución Empírica (FDE), que es la FDA calculada a partir de una muestra de datos, y la FDA teórica para determinar si la muestra proviene de una distribución específica. Esta capacidad de comparar distribuciones de manera rigurosa hace que la FDA sea indispensable en la validación de modelos.
Más allá de la estadística, la FDA es vital en la gestión de riesgos y la ingeniería. En finanzas, por ejemplo, la FDA de los rendimientos de los activos ayuda a calcular métricas de riesgo como el VaR (Value at Risk), que requiere encontrar el cuantil correspondiente a una probabilidad de cola específica (e.g., el percentil 5). En la teoría de la fiabilidad, la FDA de la vida útil de un componente permite calcular la probabilidad de fallo antes de un tiempo determinado. Su naturaleza acumulativa proporciona la información de riesgo necesaria para la toma de decisiones críticas.
8. Generalizaciones y Extensiones
Aunque la FDA se define tradicionalmente para variables aleatorias unidimensionales (escalares), el concepto se extiende a variables aleatorias multidimensionales o vectores aleatorios. Para un vector aleatorio bidimensional $(X, Y)$, la FDA conjunta $F(x, y)$ se define como la probabilidad de que $X$ sea menor o igual a $x$ y $Y$ sea menor o igual a $y$: $F(x, y) = P(X le x, Y le y)$. Esta generalización es fundamental para estudiar la dependencia y la covarianza entre múltiples variables.
En el ámbito de la teoría de la medida, la FDA está íntimamente ligada a la medida de Lebesgue-Stieltjes. Cualquier FDA corresponde a una medida de probabilidad única en los conjuntos de Borel de $mathbb{R}$. Esto permite que la integración respecto a una FDA (la integral de Stieltjes) unifique el tratamiento de esperanza matemática para variables discretas (sumatorias) y continuas (integrales de Lebesgue).
Una función relacionada importante es la función de supervivencia (o función de cola), $S(x)$, definida como $S(x) = P(X > x) = 1 – F(x)$. Esta función es particularmente relevante en el análisis de supervivencia y la fiabilidad, ya que mide la probabilidad de que un evento (como la muerte o el fallo) ocurra después del tiempo $x$. La FDA y la función de supervivencia son representaciones equivalentes y complementarias de la distribución de probabilidad.