tabla de contingencia – contingency table


Tabla de Contingencia

Primary Disciplinary Field(s): Estadística, Bioestadística, Ciencias Sociales, Investigación Cuantitativa

1. Core Definition

La tabla de contingencia, conocida también como tabla cruzada o matriz de clasificación cruzada, constituye una herramienta fundamental en la estadística descriptiva y el análisis inferencial, especialmente diseñada para examinar la relación o asociación entre dos o más variables de naturaleza categórica. Formalmente, se trata de una matriz bidimensional (o multidimensional en casos más complejos) donde las filas representan las categorías de una variable y las columnas representan las categorías de otra variable. Las celdas internas de la tabla contienen las frecuencias observadas, es decir, el número de casos que simultáneamente poseen una categoría específica de la variable de fila y una categoría específica de la variable de columna. Este formato matricial permite visualizar de manera concisa la distribución conjunta de las variables, facilitando la identificación de patrones de dependencia o independencia entre ellas.

La estructura básica de una tabla de contingencia requiere que las variables sean discretas y mutuamente excluyentes, asegurando que cada observación caiga en una y solo una de las celdas definidas. Además de las frecuencias internas (frecuencias conjuntas), la tabla incluye los totales marginales, que son las sumas de las frecuencias a lo largo de las filas y las columnas. Los totales marginales de las filas representan la distribución univariada de la variable de fila, mientras que los totales marginales de las columnas reflejan la distribución univariada de la variable de columna. El valor total de la muestra (N) se encuentra en la intersección de los totales marginales, sirviendo como el denominador para el cálculo de proporciones y porcentajes condicionales, los cuales son esenciales para determinar la fuerza y la dirección de cualquier asociación potencial.

El propósito central de construir una tabla de contingencia es someter a prueba la hipótesis nula de independencia. Si las variables son estadísticamente independientes, la distribución de la variable de fila no debería variar significativamente a través de las categorías de la variable de columna, y viceversa. Por el contrario, si existe una asociación, la distribución de una variable dependerá o estará condicionada por los niveles de la otra variable. La simplicidad visual de la tabla la convierte en un punto de partida indispensable para cualquier análisis bivariado que involucre datos nominales u ordinales, sirviendo de base para pruebas estadísticas avanzadas como la prueba de Ji-cuadrada.

2. Etymology and Historical Development

Si bien la idea de tabular datos categóricos existe desde los inicios de la estadística moderna, el concepto formal de la tabla de contingencia y su uso sistemático para probar la asociación se consolidó a principios del siglo XX. El desarrollo de métodos rigurosos para el análisis de atributos categóricos fue una respuesta directa a las necesidades de la biometría y la genética. Antes de este periodo, la mayoría de las herramientas estadísticas se centraban en variables continuas (como la correlación de Pearson), dejando un vacío metodológico para el estudio de cualidades o características no numéricas.

El término y la metodología asociada están estrechamente vinculados a los trabajos pioneros de Karl Pearson y George Udny Yule. Fue Pearson quien, en 1900, introdujo la prueba de Ji-cuadrada ($chi^2$), proporcionando el marco matemático necesario para evaluar si las frecuencias observadas en las celdas de una tabla de contingencia diferían significativamente de las frecuencias esperadas bajo la suposición de independencia. Este avance fue crucial, ya que transformó la tabla de una mera herramienta descriptiva en un instrumento de inferencia estadística.

Posteriormente, George Udny Yule desarrolló y popularizó el uso de las tablas de contingencia, particularmente en el contexto de las ciencias sociales y la epidemiología, centrándose en el análisis de la asociación entre atributos. Yule contribuyó significativamente a la comprensión de cómo calcular coeficientes de asociación apropiados para datos categóricos, lo que consolidó la tabla de contingencia como el estándar de facto para el análisis de variables discretas. El desarrollo histórico de la tabla de contingencia, por lo tanto, no solo es una cuestión de formato, sino que está intrínsecamente ligado a la evolución de la estadística inferencial aplicada a datos cualitativos, permitiendo que campos como la sociología y la medicina pudieran aplicar el rigor cuantitativo a sus datos.

3. Estructura Matemática

La estructura matemática de una tabla de contingencia está definida por sus dimensiones, denotadas generalmente como $R times C$, donde $R$ es el número de filas (categorías de la primera variable) y $C$ es el número de columnas (categorías de la segunda variable). La celda ubicada en la fila $i$ y columna $j$ contiene la frecuencia conjunta $n_{ij}$, que es el número de observaciones que caen simultáneamente en la categoría $i$ de la primera variable y la categoría $j$ de la segunda. La suma de todas estas frecuencias conjuntas es el tamaño total de la muestra, $N$.

La clave para el análisis inferencial reside en la comparación entre las frecuencias observadas ($n_{ij}$) y las frecuencias esperadas ($E_{ij}$). La frecuencia esperada representa el número de observaciones que se esperarían encontrar en esa celda específica si las dos variables fueran completamente independientes. Matemáticamente, la frecuencia esperada para la celda $(i, j)$ se calcula utilizando los totales marginales: $E_{ij} = (R_i times C_j) / N$, donde $R_i$ es el total marginal de la fila $i$ y $C_j$ es el total marginal de la columna $j$. Esta formulación se deriva del principio de probabilidad elemental de que, si dos eventos son independientes, la probabilidad de su ocurrencia conjunta es el producto de sus probabilidades individuales ($P(A cap B) = P(A)P(B)$).

El análisis de la asociación se reduce a cuantificar la discrepancia entre $n_{ij}$ y $E_{ij}$. Si estas frecuencias son muy similares, sugiere que la hipótesis de independencia es plausible. Si, por el contrario, la diferencia es grande, indica una asociación significativa. La magnitud de esta discrepancia es el núcleo de la estadística de prueba de Ji-cuadrada, que suma las contribuciones de todas las celdas: $chi^2 = sum_{i=1}^{R} sum_{j=1}^{C} frac{(n_{ij} – E_{ij})^2}{E_{ij}}$. Este estadístico sigue una distribución Ji-cuadrada con $(R-1)(C-1)$ grados de libertad, permitiendo la determinación del valor p y, consecuentemente, la decisión sobre el rechazo o no rechazo de la hipótesis nula.

4. Tipos de Tablas de Contingencia

Aunque el principio subyacente de la tabla de contingencia es siempre el mismo (clasificación cruzada de variables categóricas), las tablas se clasifican comúnmente según sus dimensiones, lo que a su vez dicta el tipo de análisis estadístico apropiado.

La tabla más simple y fundamental es la tabla de $2 times 2$. Esta matriz se utiliza cuando ambas variables son dicotómicas (es decir, solo tienen dos categorías, como “Sí/No”, “Hombre/Mujer”, o “Enfermo/Sano”). Esta estructura es omnipresente en la investigación biomédica y epidemiológica, ya que permite el cálculo directo de medidas de asociación cruciales como la razón de momios (Odds Ratio) y el riesgo relativo. Estas medidas cuantifican la fuerza de la asociación entre la exposición (variable de fila) y el resultado (variable de columna), proporcionando una estimación directa de la magnitud del efecto.

Existen también las tablas de $R times C$ generales, donde $R > 2$ o $C > 2$. Estas tablas se emplean cuando al menos una de las variables posee múltiples categorías (por ejemplo, Nivel Educativo: Primaria, Secundaria, Universitaria; o Nivel Socioeconómico: Bajo, Medio, Alto). El análisis de estas tablas sigue el mismo principio de Ji-cuadrada, pero la interpretación de la asociación se vuelve más compleja, ya que la significancia global solo indica que existe alguna asociación en la tabla, sin especificar dónde reside esa dependencia. En estos casos, a menudo se requieren análisis post-hoc (como el análisis de residuos estandarizados) para identificar qué pares de categorías son responsables de la asociación significativa.

Finalmente, se encuentran las tablas de contingencia multidimensionales o multi-vía, que involucran tres o más variables categóricas simultáneamente. Por ejemplo, se podría analizar la relación entre el Nivel Educativo y el Voto, pero controlando por la variable Edad (Joven, Adulto, Mayor). Estas tablas son esenciales para el análisis de datos complejos, ya que permiten investigar si la asociación entre dos variables es consistente a través de los niveles de una tercera variable (análisis de interacción o estratificación). Para estas tablas, se utilizan técnicas más avanzadas como el Análisis Loglineal o los modelos logísticos, que extienden el concepto de la prueba de Ji-cuadrada al permitir modelar la estructura de dependencia compleja entre múltiples factores.

5. Análisis Estadístico

El análisis estadístico de las tablas de contingencia se centra primordialmente en determinar si la asociación observada es estadísticamente significativa, lo que implica rechazar la hipótesis nula de independencia. El método más utilizado para este fin es la prueba de Ji-cuadrada de Pearson. Esta prueba es no paramétrica y se basa en la comparación de las frecuencias observadas con las frecuencias esperadas, siendo robusta y aplicable a la mayoría de las tablas $R times C$ siempre que el tamaño de la muestra sea suficientemente grande para garantizar que las frecuencias esperadas no sean demasiado pequeñas (generalmente, se requiere que menos del 20% de las celdas tengan una frecuencia esperada menor a 5, y ninguna celda tenga una frecuencia esperada de cero).

Cuando las frecuencias esperadas son bajas, especialmente en tablas $2 times 2$ con tamaños muestrales reducidos, la aproximación de la distribución Ji-cuadrada puede ser inexacta. En estos escenarios, se utiliza la Prueba Exacta de Fisher. A diferencia de Ji-cuadrada, la prueba de Fisher calcula la probabilidad exacta de obtener la tabla observada (o una más extrema) bajo la hipótesis nula de independencia, utilizando la distribución hipergeométrica. Aunque computacionalmente más intensiva, ofrece resultados precisos independientemente del tamaño de la muestra, siendo el estándar para muestras pequeñas en $2 times 2$ o incluso tablas $R times C$ pequeñas mediante simulaciones de Monte Carlo.

Además de las pruebas de significancia, el análisis requiere la cuantificación de la fuerza de la asociación. La estadística de Ji-cuadrada solo indica la existencia de una relación, pero no su intensidad. Para medir la fuerza, se emplean diversos coeficientes, cuya elección depende de la naturaleza de las variables. Para variables nominales, se usan el coeficiente Phi ($phi$) (para tablas $2 times 2$), el Coeficiente de Contingencia de Pearson ($C$) o la V de Cramer ($V$). La V de Cramer es particularmente popular ya que ajusta el valor de Ji-cuadrada por el tamaño de la muestra y el número de filas/columnas, variando entre 0 (independencia total) y 1 (asociación perfecta). Si las variables son ordinales, se prefieren medidas basadas en pares concordantes y discordantes, como el Gamma de Goodman y Kruskal o el Tau de Kendall, que también permiten evaluar la dirección de la relación.

6. Interpretación de Resultados

La interpretación de una tabla de contingencia se lleva a cabo en dos niveles interconectados: descriptivo e inferencial. A nivel descriptivo, el análisis se centra en las frecuencias relativas condicionales. Es crucial calcular los porcentajes dentro de las filas (o dentro de las columnas, dependiendo de qué variable se considere la variable independiente o de exposición) para visualizar cómo se distribuye una variable a través de las categorías de la otra. Por ejemplo, si se estudia la relación entre el Sexo (filas) y la Preferencia de Voto (columnas), se examinaría el porcentaje de hombres que votan por el Partido A, comparado con el porcentaje de mujeres que votan por el mismo partido. Una diferencia sustancial en estos porcentajes sugiere una asociación.

A nivel inferencial, la interpretación se basa en el valor p obtenido de la prueba estadística aplicada (generalmente Ji-cuadrada). Si el valor p es menor que el nivel de significancia preestablecido (típicamente $alpha = 0.05$), se rechaza la hipótesis nula de independencia. Esto significa que la asociación observada en la muestra es lo suficientemente fuerte como para concluir que existe una relación estadísticamente significativa entre las variables en la población. Sin embargo, un valor p significativo solo indica la existencia de la relación, no su magnitud ni su relevancia práctica.

Por lo tanto, una interpretación completa debe integrar la significancia estadística con la magnitud de la asociación, medida por coeficientes como la V de Cramer o la razón de momios. Una V de Cramer cercana a cero indica una asociación débil, incluso si el valor p es significativo (lo que puede ocurrir en muestras muy grandes). Por el contrario, una razón de momios de 4.0 en una tabla $2 times 2$ indica que la probabilidad de un resultado particular es cuatro veces mayor en el grupo expuesto que en el grupo no expuesto, lo que sugiere una fuerte relevancia práctica, independientemente del valor p. La interpretación final debe siempre contextualizar estos hallazgos dentro del marco teórico de la investigación.

7. Significado e Impacto

La tabla de contingencia posee un significado metodológico profundo y un impacto extenso en casi todas las disciplinas que manejan datos categóricos. Su principal contribución es proporcionar una estructura rigurosa para el análisis de datos cualitativos, un tipo de información que a menudo es difícil de cuantificar mediante métodos diseñados para variables continuas. Al formalizar la clasificación cruzada, la tabla permite que los investigadores pasen de la descripción simple a la inferencia estadística sobre la interdependencia de atributos.

En la epidemiología y la salud pública, las tablas de contingencia son esenciales para el análisis de estudios de casos y controles y estudios de cohorte. La tabla $2 times 2$ es la herramienta estándar para evaluar la asociación entre factores de riesgo (exposición) y enfermedades (resultado), permitiendo el cálculo de medidas de impacto cruciales para la toma de decisiones clínicas y políticas de salud, como el riesgo relativo y la razón de momios. Su impacto es directo en la identificación de patrones de riesgo y la evaluación de la eficacia de las intervenciones.

En las ciencias sociales (sociología, ciencia política, marketing), la tabla de contingencia es la base del análisis de encuestas y sondeos de opinión. Permite a los investigadores examinar cómo variables demográficas (edad, género, ingreso) se relacionan con actitudes, comportamientos o preferencias. Dado que gran parte de los datos recolectados en estas áreas son categóricos o pueden ser discretizados, la tabla de contingencia sigue siendo la primera herramienta de diagnóstico utilizada para identificar relaciones potenciales antes de pasar a modelos multivariados más complejos. Su universalidad y claridad la han mantenido como un pilar de la investigación cuantitativa.

8. Debates y Limitaciones

A pesar de su utilidad generalizada, la tabla de contingencia y sus pruebas asociadas (particularmente Ji-cuadrada) están sujetas a ciertas limitaciones y debates metodológicos que deben ser considerados por el analista. La limitación más frecuentemente citada es la sensibilidad de la prueba de Ji-cuadrada al tamaño de la muestra. En muestras muy grandes, incluso desviaciones triviales de las frecuencias esperadas (asociaciones que carecen de relevancia práctica) pueden resultar en un valor de Ji-cuadrada significativo, llevando al rechazo de la hipótesis nula. Esto subraya la necesidad de complementar la prueba de significancia con medidas de fuerza de asociación (como la V de Cramer) para evaluar la relevancia práctica del hallazgo.

Otra limitación crítica se relaciona con el supuesto de las frecuencias esperadas mínimas. Cuando las celdas contienen frecuencias esperadas muy bajas, la distribución muestral del estadístico Ji-cuadrada no se ajusta adecuadamente a la distribución teórica Ji-cuadrada, lo que infla la tasa de error Tipo I. Aunque el uso de la corrección de Yates para la continuidad o la Prueba Exacta de Fisher mitigan este problema en tablas $2 times 2$, las tablas $R times C$ grandes con datos dispersos siguen siendo un desafío, a menudo requiriendo la combinación lógica de categorías (colapsar filas o columnas) para cumplir con los supuestos.

Finalmente, el debate más fundamental es que las tablas de contingencia, al igual que todos los análisis de asociación bivariados, solo pueden establecer la existencia de una relación estadística, pero no la causalidad. La relación observada podría ser espuria o confundida por una tercera variable no incluida en la tabla. Para abordar la causalidad y el control de variables extrañas, los investigadores deben recurrir a extensiones de la tabla de contingencia, como el análisis loglineal o la regresión logística, que permiten modelar y ajustar la influencia de múltiples predictores simultáneamente, moviéndose más allá de la simple visualización bivariada.

Further Reading

Cite This Article

memjavad (2025, November 22). tabla de contingencia – contingency table. Spanish Psychological Databases. https://spanish.arabpsychology.com/trm/tabla-de-contingencia-contingency-table/
memjavad. “tabla de contingencia – contingency table.” Spanish Psychological Databases, 22 November 2025, https://spanish.arabpsychology.com/trm/tabla-de-contingencia-contingency-table/.
memjavad. “tabla de contingencia – contingency table.” Spanish Psychological Databases. November 22, 2025. https://spanish.arabpsychology.com/trm/tabla-de-contingencia-contingency-table/.