distribución chi-cuadrado (distribución χ2) – chi-square distribution (χ2 distribution)


Distribución Chi-cuadrado (χ² Distribución)

Primary Disciplinary Field(s): Estadística Matemática, Teoría de la Probabilidad, Inferencia Estadística.

1. Definición Central

La distribución chi-cuadrado, denotada formalmente como $X^2$ o $chi^2$, constituye una de las distribuciones de probabilidad continuas más fundamentales y ampliamente utilizadas en la inferencia estadística. Su definición matemática se fundamenta en la suma de los cuadrados de $k$ variables aleatorias normales estándar independientes. Si $Z_1, Z_2, ldots, Z_k$ son variables aleatorias independientes, cada una con una distribución normal estándar (media cero y varianza uno), entonces la variable aleatoria $Y = Z_1^2 + Z_2^2 + cdots + Z_k^2$ sigue una distribución chi-cuadrado con $k$ grados de libertad. Esta estructura define intrínsecamente la naturaleza de la distribución, asegurando que sus valores sean siempre no negativos, dado que es la suma de términos al cuadrado. La importancia de esta distribución radica en que surge naturalmente como la distribución de muestreo de la varianza de una muestra normal, y es esencial en la construcción de pruebas de hipótesis y en la formación de intervalos de confianza relacionados con varianzas y proporciones.

A diferencia de la distribución normal, que es simétrica, la distribución chi-cuadrado es inherentemente asimétrica y está sesgada hacia la derecha. La forma exacta de la distribución está determinada por un único parámetro crucial: los grados de libertad ($nu$ o $k$). Este parámetro no solo dicta la media y la varianza de la distribución, sino que también controla la magnitud de su asimetría. A medida que el número de grados de libertad aumenta, la distribución se vuelve menos sesgada y se aproxima gradualmente a una distribución normal. Este fenómeno es una manifestación del teorema del límite central, ya que la suma de un gran número de variables aleatorias independientes (incluso las cuadradas) tiende a normalizarse. La distribución chi-cuadrado, por lo tanto, no es una familia de distribuciones única, sino un conjunto de distribuciones paramétricas, cada una correspondiente a un valor específico de los grados de libertad.

El uso primario de la distribución chi-cuadrado en la práctica estadística se centra en la evaluación de la discrepancia entre las frecuencias observadas en un conjunto de datos y las frecuencias esperadas bajo una hipótesis nula específica. Es la base de la famosa Prueba de Pearson chi-cuadrado, que permite a los investigadores determinar si existe una relación estadísticamente significativa entre dos variables categóricas o si una distribución observada se ajusta a una distribución teórica. El estadístico de prueba resultante, que mide la magnitud de esta discrepancia, sigue la distribución chi-cuadrado bajo la suposición de que la hipótesis nula es verdadera. Si el valor calculado del estadístico chi-cuadrado es excepcionalmente grande, esto proporciona evidencia suficiente para rechazar la hipótesis nula, concluyendo que las diferencias observadas son probablemente reales y no debidas al azar del muestreo.

2. Etimología y Desarrollo Histórico

Aunque la distribución chi-cuadrado está intrínsecamente ligada al nombre de Karl Pearson, sus orígenes matemáticos se remontan a trabajos anteriores sobre la teoría de errores y la distribución de varianzas. El primer desarrollo formal de la distribución, aunque sin la nomenclatura moderna, fue realizado por el matemático y geodesta alemán Friedrich Robert Helmert. En 1876, Helmert investigó la distribución de la suma de cuadrados de los residuos de una muestra normal, sentando las bases teóricas de lo que hoy conocemos como la distribución chi-cuadrado. Su trabajo se centró en la determinación de la distribución de la varianza muestral, un problema estadístico crucial para la época, demostrando que esta distribución seguía una forma específica relacionada con la suma de cuadrados de normales estandarizadas. Sin embargo, el impacto de su trabajo permaneció limitado dentro de la comunidad estadística más amplia.

El reconocimiento y la aplicación práctica de la distribución se consolidaron definitivamente gracias al trabajo seminal del estadístico británico Karl Pearson a principios del siglo XX. En 1900, Pearson publicó su influyente artículo, “On the Criterion that a given System of Deviations from the Probable in the Case of Correlated Variables is such that it can reasonably be supposed to have arisen from Random Sampling”. En este trabajo, Pearson introdujo el estadístico de prueba chi-cuadrado como una medida general de la bondad de ajuste entre datos observados y predichos. El avance de Pearson radicó en proporcionar un método accesible y riguroso para probar hipótesis sobre distribuciones de frecuencias, superando las limitaciones de los métodos previos que a menudo requerían suposiciones más restrictivas sobre la normalidad o grandes tamaños de muestra. Pearson, además, estableció que, bajo la hipótesis nula, su estadístico seguía aproximadamente la distribución descubierta por Helmert.

Es importante destacar que, aunque Pearson popularizó la prueba y le dio su nombre característico (utilizando la letra griega chi, $chi$), la comprensión completa de los grados de libertad y su correcta aplicación en tablas de contingencia fue refinada por otros pioneros. Ronald Fisher, en particular, hizo contribuciones esenciales al diferenciar entre los grados de libertad utilizados para estimar parámetros y los utilizados en la prueba misma. Fisher clarificó que cada parámetro estimado a partir de los datos reduce el número de grados de libertad disponibles para la prueba de ajuste. Esta distinción fue crucial para la aplicación precisa de la prueba chi-cuadrado en la estadística moderna, asegurando que la distribución muestral del estadístico se utilizara correctamente para calcular los valores $P$ y tomar decisiones de inferencia. La distribución chi-cuadrado se convirtió así en la piedra angular de la estadística no paramétrica y de las pruebas categóricas.

3. Características Matemáticas Clave

La función de densidad de probabilidad (FDP) de la distribución chi-cuadrado es una forma específica de la distribución Gamma. Si $X sim chi^2(nu)$, donde $nu$ son los grados de libertad, su FDP es definida por la función Gamma ($Gamma$):
$$f(x; nu) = frac{1}{2^{nu/2} Gamma(nu/2)} x^{nu/2 – 1} e^{-x/2}, quad text{para } x > 0$$
Esta formulación matemática revela por qué la distribución está restringida al dominio positivo ($x > 0$) y cómo el parámetro $nu$ influye directamente en la forma de la curva. Cuando $nu=2$, la distribución chi-cuadrado se simplifica a la distribución exponencial con un parámetro de tasa $lambda = 1/2$. Para $nu=1$, la distribución es la de la variable aleatoria normal estándar al cuadrado, mostrando un sesgo infinito en el origen.

Las propiedades estadísticas fundamentales de la distribución chi-cuadrado son sencillas y están directamente relacionadas con los grados de libertad. La media (o valor esperado) de una variable aleatoria chi-cuadrado es exactamente igual a sus grados de libertad, $E[X] = nu$. Esto tiene sentido intuitivo, ya que la media de un cuadrado de una variable normal estándar es 1, y la distribución es la suma de $nu$ de tales cuadrados. La varianza de la distribución es $Var[X] = 2nu$. Estas relaciones directas simplifican enormemente el trabajo teórico y práctico con esta distribución, permitiendo a los estadísticos caracterizar rápidamente su dispersión y tendencia central basándose únicamente en el número de grados de libertad.

En cuanto a su forma, la distribución chi-cuadrado exhibe una asimetría positiva significativa (sesgo a la derecha) para valores pequeños de $nu$. El modo (el pico de la distribución) se encuentra en $nu – 2$ (para $nu > 2$). A medida que $nu$ crece, la asimetría disminuye rápidamente. Cuando $nu$ se aproxima a 30 o más, la distribución se vuelve notablemente más simétrica y su forma se asemeja tanto a la distribución normal que, en muchos contextos aplicados, una aproximación normal con la media y varianza correctas puede ser utilizada con alta precisión. Esta convergencia a la normal es una característica poderosa que facilita el cálculo en situaciones donde el número de grados de libertad es grande, aunque el uso de tablas o software estadístico sigue siendo el estándar para la precisión.

4. Parámetro Fundamental: Grados de Libertad ($nu$)

El concepto de grados de libertad ($nu$) es el eje central de la distribución chi-cuadrado y de toda la inferencia estadística. En términos generales, los grados de libertad representan el número de valores en el cálculo final de un estadístico que son libres de variar. En el contexto de la definición matemática de la distribución chi-cuadrado, $nu$ es simplemente el número de variables normales estándar independientes que se están sumando al cuadrado. Sin embargo, en aplicaciones prácticas, su determinación requiere considerar las restricciones impuestas por la estimación de parámetros a partir de la muestra. Cada vez que se utiliza un parámetro estimado (como la media muestral) para calcular el estadístico, se pierde un grado de libertad.

En la aplicación más común, la prueba de independencia chi-cuadrado en una tabla de contingencia $R times C$ (filas por columnas), los grados de libertad se calculan como $nu = (R-1)(C-1)$. Esta fórmula refleja que, una vez que se han fijado los totales marginales de las filas y las columnas, solo $(R-1)(C-1)$ celdas son libres de variar; los valores de las celdas restantes quedan determinados automáticamente para que la tabla sume los totales marginales fijos. Por ejemplo, en una tabla de $2 times 2$, solo una celda es libre de variar, por lo que $nu = (2-1)(2-1) = 1$. Esta metodología asegura que el estadístico chi-cuadrado calculado refleje correctamente la variabilidad inherente a los datos bajo la hipótesis nula de independencia.

La correcta identificación de los grados de libertad es crucial para evitar errores de tipo I y tipo II en la toma de decisiones estadísticas. Si se subestiman los grados de libertad, la distribución crítica utilizada será incorrectamente estrecha, lo que puede llevar a rechazar la hipótesis nula con demasiada frecuencia (aumentando el riesgo de un falso positivo). Si se sobreestiman, la distribución crítica será demasiado amplia, lo que dificulta la detección de efectos reales (aumentando el riesgo de un falso negativo). Por lo tanto, el parámetro $nu$ actúa como un puente vital entre el estadístico calculado a partir de la muestra y la distribución teórica que permite la inferencia probabilística.

5. Relación con Otras Distribuciones

La distribución chi-cuadrado no existe en aislamiento; es un miembro central de una familia interconectada de distribuciones de probabilidad que son fundamentales para la inferencia estadística, especialmente aquellas derivadas de la distribución normal. Como ya se mencionó, la distribución chi-cuadrado es un caso especial de la Distribución Gamma. Específicamente, si una variable aleatoria sigue una distribución Gamma con parámetro de forma $alpha = nu/2$ y parámetro de escala $beta = 2$, entonces esa variable es equivalente a una variable chi-cuadrado con $nu$ grados de libertad. Esta relación permite la derivación de muchas de sus propiedades matemáticas directamente a partir de la teoría de la distribución Gamma.

Además, la distribución chi-cuadrado es un componente esencial en la definición de otras dos distribuciones de muestreo clave: la Distribución t de Student y la Distribución F de Snedecor. La distribución t de Student se define como el cociente entre una variable normal estándar y la raíz cuadrada de una variable chi-cuadrado dividida por sus grados de libertad. Esto es fundamental para la inferencia sobre la media cuando la varianza poblacional es desconocida. Más directamente, la Distribución F (utilizada en el Análisis de Varianza o ANOVA y en la regresión) se define como el cociente de dos variables chi-cuadrado independientes, cada una dividida por sus respectivos grados de libertad.

Esta interconexión subraya la posición central de la distribución chi-cuadrado en la estadística paramétrica. Es un eslabón clave que conecta la distribución normal con las distribuciones utilizadas para probar hipótesis sobre medias (t de Student) y varianzas (F de Snedecor). La capacidad de la chi-cuadrado para modelar la suma de varianzas cuadradas permite a los estadísticos construir modelos robustos para probar la significancia de los efectos en modelos lineales complejos, demostrando su versatilidad más allá de las simples pruebas de independencia categórica.

6. Aplicaciones Principales en la Inferencia Estadística

Las aplicaciones de la distribución chi-cuadrado son vastas y cubren gran parte del espectro de la inferencia estadística, particularmente en el análisis de datos categóricos y en la estimación de la varianza. La aplicación más conocida es la Prueba de Bondad de Ajuste (Goodness of Fit). Esta prueba se utiliza para determinar si una distribución de frecuencia observada de una variable categórica difiere significativamente de una distribución teórica o esperada. Por ejemplo, puede usarse para verificar si los resultados de un dado de seis caras se ajustan a la distribución uniforme esperada (donde cada cara tiene una probabilidad de 1/6). El estadístico chi-cuadrado cuantifica la magnitud de la desviación de las frecuencias observadas respecto a las esperadas, proporcionando una base probabilística para rechazar o no la hipótesis de que el modelo teórico es válido.

Una segunda aplicación fundamental es la Prueba de Independencia, utilizada para analizar datos dispuestos en tablas de contingencia. El objetivo aquí es determinar si existe una asociación estadística entre dos variables categóricas. La hipótesis nula postula que las dos variables son estadísticamente independientes, lo que implica que la proporción de una categoría dentro de una variable es la misma en todas las categorías de la otra variable. El estadístico chi-cuadrado calcula qué tan lejos están las frecuencias observadas de las frecuencias que se esperarían si la independencia fuera cierta. Esta prueba es indispensable en campos como la sociología, la bioestadística y el marketing para evaluar relaciones entre características (por ejemplo, género y preferencia de producto).

Finalmente, la distribución chi-cuadrado juega un papel crucial en la inferencia sobre la Varianza Poblacional. Debido a su definición como la distribución de la varianza muestral (escalada), se utiliza para construir intervalos de confianza para la varianza ($sigma^2$) de una población normalmente distribuida. También es la base para la Prueba de Hipótesis sobre la varianza poblacional. En este contexto, el estadístico de prueba es $frac{(n-1)s^2}{sigma_0^2}$, donde $s^2$ es la varianza muestral, $n$ es el tamaño de la muestra, y $sigma_0^2$ es el valor hipotético de la varianza poblacional. Este estadístico sigue una distribución chi-cuadrado con $n-1$ grados de libertad, permitiendo realizar pruebas de una o dos colas sobre la dispersión de la población.

7. Limitaciones y Supuestos Críticos

A pesar de su versatilidad, la prueba chi-cuadrado de Pearson depende de varios supuestos críticos y presenta limitaciones que deben ser consideradas para garantizar la validez de los resultados. La limitación más importante se refiere al tamaño de la muestra y las frecuencias esperadas. La distribución chi-cuadrado es una aproximación asintótica de la distribución exacta del estadístico de prueba. Para que esta aproximación sea válida, las frecuencias esperadas en cada categoría o celda de la tabla de contingencia no deben ser demasiado pequeñas. La regla práctica comúnmente aceptada, aunque sujeta a debate, es que al menos el 80% de las frecuencias esperadas deben ser mayores o iguales a 5, y ninguna frecuencia esperada debe ser menor que 1. Si este supuesto se viola, la distribución muestral del estadístico se desvía significativamente de la distribución chi-cuadrado teórica, lo que lleva a valores $P$ incorrectos.

Otra limitación fundamental es que la prueba chi-cuadrado solo es aplicable a datos de frecuencia (recuentos) y a variables categóricas o discretas. No es apropiada para datos continuos sin una previa categorización, y no mide la magnitud de la asociación, sino únicamente si la asociación es estadísticamente significativa. Además, la prueba chi-cuadrado es sensible al tamaño de la muestra total. Con muestras muy grandes, incluso desviaciones pequeñas e insignificantes de la hipótesis nula pueden resultar en un valor chi-cuadrado grande y, por lo tanto, en el rechazo de la hipótesis nula. Esto requiere que el investigador complemente la prueba de significancia con medidas de tamaño del efecto (como el coeficiente Phi o V de Cramer) para evaluar la importancia práctica de la asociación.

Finalmente, las observaciones utilizadas para la prueba deben ser independientes. Si las observaciones están relacionadas o si se realizan múltiples mediciones sobre las mismas unidades (datos pareados o repetidos), la prueba chi-cuadrado estándar no es adecuada, ya que la dependencia viola el supuesto de que el estadístico es la suma de variables independientes. En tales casos, se requieren pruebas alternativas diseñadas para datos dependientes, como la prueba de McNemar o modelos log-lineales más complejos. Ignorar el supuesto de independencia puede llevar a una inflación del estadístico chi-cuadrado y a conclusiones erróneas sobre la significancia.

8. Lecturas Adicionales

Cite This Article

memjavad (2025, November 15). distribución chi-cuadrado (distribución χ2) – chi-square distribution (χ2 distribution). Spanish Psychological Databases. https://spanish.arabpsychology.com/trm/distribucion-chi-cuadrado-distribucion-%cf%872-chi-square-distribution-%cf%872-distribution/
memjavad. “distribución chi-cuadrado (distribución χ2) – chi-square distribution (χ2 distribution).” Spanish Psychological Databases, 15 November 2025, https://spanish.arabpsychology.com/trm/distribucion-chi-cuadrado-distribucion-%cf%872-chi-square-distribution-%cf%872-distribution/.
memjavad. “distribución chi-cuadrado (distribución χ2) – chi-square distribution (χ2 distribution).” Spanish Psychological Databases. November 15, 2025. https://spanish.arabpsychology.com/trm/distribucion-chi-cuadrado-distribucion-%cf%872-chi-square-distribution-%cf%872-distribution/.