análisis de varianza entre sujetos – between-subjects analysis of variance
- Análisis de Varianza Entre Sujetos (ANOVA Between-Subjects)
- 1. Definición y Propósito Central
- 2. Etimología y Contexto Histórico
- 3. Supuestos Subyacentes
- 4. Diseño y Estructura
- 5. La Lógica de la Partición de la Varianza
- 6. Cálculo y Razón F
- 7. Pruebas Post Hoc y Tamaño del Efecto
- 8. Ventajas y Desventajas
- 9. Further Reading
Análisis de Varianza Entre Sujetos (ANOVA Between-Subjects)
Primary Disciplinary Field(s): Estadística Inferencial, Psicología Experimental, Bioestadística, Ciencias Sociales
1. Definición y Propósito Central
El Análisis de Varianza Entre Sujetos (ANOVA, por sus siglas en inglés: Analysis of Variance) es una potente herramienta estadística paramétrica diseñada para determinar si existen diferencias estadísticamente significativas entre las medias de tres o más grupos independientes. A diferencia de las pruebas t de Student, que solo permiten la comparación de dos medias a la vez, el ANOVA permite examinar múltiples niveles de un factor (variable independiente categórica) simultáneamente, manteniendo la tasa de error Tipo I (falso positivo) bajo control. Este método es fundamental en el diseño experimental, donde los investigadores asignan aleatoriamente a los participantes a diferentes condiciones o niveles de tratamiento, asegurando que los grupos sean independientes entre sí. La característica definitoria de un diseño entre sujetos es que cada unidad de observación (sujeto) solo experimenta una única condición experimental o pertenece a un solo grupo, lo que garantiza la independencia de las observaciones entre los diferentes grupos comparados.
El propósito primordial del ANOVA no es meramente comparar medias, sino descomponer la varianza total observada en un conjunto de datos en dos componentes principales: la varianza atribuible a las diferencias entre los grupos (el ‘efecto’ del tratamiento o factor) y la varianza atribuible al error dentro de los grupos (varianza residual o no explicada). La lógica subyacente sostiene que, si el tratamiento tiene un efecto real, la varianza entre grupos debería ser sustancialmente mayor que la varianza dentro de los grupos. Si la hipótesis nula, que postula la igualdad de todas las medias poblacionales, es cierta, la variación observada entre los grupos debería ser aproximadamente igual a la variación que se esperaría solo por el azar o el error muestral.
El ANOVA entre sujetos es la técnica de elección cuando se manejan diseños de investigación donde la manipulación experimental requiere la exposición única de los participantes a un nivel específico del factor. Por ejemplo, si un investigador desea comparar la efectividad de tres métodos de enseñanza diferentes, cada estudiante solo puede ser asignado a uno de los tres grupos (Método A, B o C). Esta estructura garantiza la ausencia de efectos de arrastre o fatiga que podrían contaminar los resultados en diseños de medidas repetidas. La interpretación de los resultados se centra en la obtención de la razón F, un estadístico que resume la relación entre la varianza explicada y la varianza no explicada, permitiendo así tomar una decisión informada sobre la hipótesis nula.
2. Etimología y Contexto Histórico
El desarrollo del Análisis de Varianza se atribuye principalmente al estadístico y biólogo británico Sir Ronald Fisher a principios del siglo XX. Fisher introdujo el concepto formal de ANOVA en la década de 1920, inicialmente en el contexto de la investigación agrícola. Su trabajo revolucionario permitió a los científicos dividir las fuentes de variación en experimentos complejos, mejorando drásticamente la capacidad de inferencia causal. La técnica se basó en el principio de que la varianza total de un conjunto de datos puede descomponerse aditivamente en componentes atribuibles a diferentes fuentes de variación, un concepto que él formalizó a través de la Suma de Cuadrados.
Antes del desarrollo del ANOVA, los investigadores que deseaban comparar múltiples grupos se veían obligados a realizar múltiples comparaciones por pares utilizando pruebas t de Student. Este enfoque, conocido como la ‘multiplicidad’, inflaba drásticamente la probabilidad de cometer un error Tipo I (rechazar la hipótesis nula cuando es verdadera). Fisher proporcionó una solución elegante al crear un único test omnibus (el test F) que evaluaba simultáneamente la hipótesis de igualdad de medias, manteniendo el error Tipo I en el nivel alfa preestablecido (típicamente 0.05).
Aunque el concepto fundamental del ANOVA se aplica tanto a diseños entre sujetos como a diseños de medidas repetidas (dentro de sujetos), la formulación inicial y la aplicación más directa se centró en los diseños completamente aleatorizados, que son intrínsecamente entre sujetos. Con el tiempo, el ANOVA se expandió para incluir diseños factoriales (donde múltiples variables independientes se cruzan) y se convirtió en la base de la regresión lineal y los Modelos Lineales Generales (GLM), consolidando su posición como la piedra angular de la estadística inferencial moderna en la investigación experimental y cuasi-experimental.
3. Supuestos Subyacentes
El ANOVA entre sujetos, al ser una prueba paramétrica, depende de la satisfacción de varios supuestos estadísticos para que sus resultados sean válidos y las inferencias sean precisas. La violación severa de estos supuestos puede llevar a conclusiones erróneas, ya sea aumentando la probabilidad de error Tipo I o reduciendo el poder estadístico. El cumplimiento de estos supuestos debe verificarse rigurosamente antes de interpretar la razón F.
El primer supuesto crucial es la Normalidad de la distribución de los residuos (los errores) dentro de cada grupo. Se asume que las puntuaciones de la variable dependiente para cada nivel del factor se distribuyen normalmente en la población. Aunque el ANOVA es relativamente robusto a violaciones leves de la normalidad, especialmente con tamaños de muestra grandes (debido al Teorema del Límite Central), las desviaciones extremas, como distribuciones muy asimétricas o platicúrticas, pueden distorsionar los valores p. Los investigadores suelen utilizar pruebas como Shapiro-Wilk o gráficos Q-Q para evaluar este supuesto.
El segundo supuesto fundamental es la Homogeneidad de Varianzas (también conocida como homocedasticidad). Este postulado requiere que la varianza de la variable dependiente sea aproximadamente igual en todos los grupos o niveles del factor. Si las varianzas son muy dispares (heterocedasticidad), el cálculo del error estándar se vuelve impreciso, afectando la razón F. Para evaluar la homogeneidad de varianzas, se utiliza comúnmente la Prueba de Levene. Si este supuesto se viola significativamente, se deben emplear correcciones, como el ajuste de Welch (un ANOVA robusto), o recurrir a pruebas no paramétricas alternativas como la prueba de Kruskal-Wallis.
Finalmente, el supuesto más crítico en el ANOVA entre sujetos es la Independencia de las Observaciones. Este supuesto implica que la puntuación de un sujeto no debe estar influenciada por la puntuación de ningún otro sujeto. En diseños entre sujetos, esto se asegura mediante la asignación aleatoria de los participantes a los grupos y la recolección de datos de manera que cada sujeto contribuya con una sola observación. La violación de la independencia, por ejemplo, si los sujetos interactúan o son muestreados en conglomerados no reconocidos, invalida fundamentalmente la prueba F, ya que el error residual se subestimaría o sobreestimaría.
4. Diseño y Estructura
El diseño de un ANOVA entre sujetos requiere la definición clara de las variables y su estructura. La variable independiente (o factor) debe ser categórica, con al menos tres niveles o grupos. La variable dependiente debe ser continua (intervalo o razón). El diseño más simple es el ANOVA de un factor (One-Way ANOVA), donde se examina el efecto de una única variable independiente sobre la variable dependiente.
En un diseño de un factor con $k$ niveles, el modelo estadístico busca explicar la variabilidad de la respuesta $Y_{ij}$ (la puntuación del sujeto $i$ en el grupo $j$) como la suma de la media general $mu$, el efecto específico del tratamiento $tau_j$ y un término de error $epsilon_{ij}$. La estructura de los datos se organiza típicamente en $k$ columnas, donde cada columna representa un grupo y las filas representan a los sujetos, con la restricción de que cada fila solo tiene datos en una columna. Esta disposición es lo que subraya la naturaleza ‘entre sujetos’.
Los diseños pueden volverse más complejos mediante el uso de ANOVA Factorial Entre Sujetos (Two-Way, Three-Way, etc.). En estos diseños, se introducen dos o más factores independientes. Por ejemplo, un investigador podría examinar el efecto del Método de Enseñanza (Factor A) y el Género (Factor B) en el rendimiento. La ventaja clave del ANOVA factorial es que no solo permite evaluar los efectos principales de cada factor por separado, sino también la interacción entre ellos. Una interacción ocurre cuando el efecto de un factor depende del nivel del otro factor, proporcionando una comprensión mucho más matizada de la relación entre las variables.
5. La Lógica de la Partición de la Varianza
El núcleo conceptual del ANOVA reside en la partición de la Suma de Cuadrados Total ($SS_{Total}$). La $SS_{Total}$ representa la dispersión total de todas las puntuaciones alrededor de la media general. Esta variabilidad total se divide en dos componentes ortogonales (independientes): la Suma de Cuadrados Entre Grupos ($SS_{Entre}$) y la Suma de Cuadrados Dentro de Grupos ($SS_{Dentro}$).
La $SS_{Entre}$ (también conocida como $SS_{Modelo}$ o $SS_{Tratamiento}$) cuantifica la variabilidad de las medias grupales alrededor de la media general. Esta varianza es la ‘señal’ que el investigador espera encontrar: las diferencias sistemáticas atribuibles al tratamiento experimental. Si el tratamiento tiene un efecto significativo, la $SS_{Entre}$ será grande. Matemáticamente, se calcula sumando las diferencias cuadradas entre cada media grupal y la media total, ponderadas por el tamaño de la muestra de cada grupo.
La $SS_{Dentro}$ (también conocida como $SS_{Error}$ o $SS_{Residual}$) cuantifica la variabilidad de las puntuaciones individuales alrededor de sus respectivas medias grupales. Esta varianza representa el ‘ruido’ o el error no sistemático: las diferencias individuales, los errores de medición y otros factores incontrolados. En un diseño entre sujetos, esta varianza es crucial porque actúa como el denominador en la razón F, sirviendo como el mejor estimador de la varianza poblacional cuando la hipótesis nula es verdadera. El ANOVA asume que esta varianza de error es aleatoria e independiente de los niveles de tratamiento.
6. Cálculo y Razón F
Para pasar de la Suma de Cuadrados (SS) a un valor interpretable, es necesario calcular los Grados de Libertad ($df$) y las Medias Cuadráticas ($MS$). Los $df$ representan el número de piezas de información independientes que se utilizaron para calcular el estadístico. Para $SS_{Entre}$, $df_{Entre} = k – 1$ (donde $k$ es el número de grupos); para $SS_{Dentro}$, $df_{Dentro} = N – k$ (donde $N$ es el tamaño total de la muestra).
Las Medias Cuadráticas se calculan dividiendo las Sumas de Cuadrados por sus respectivos Grados de Libertad ($MS = SS / df$). La $MS_{Entre}$ representa la varianza promedio explicada por el modelo (el efecto del tratamiento), y la $MS_{Dentro}$ representa la varianza promedio no explicada (el error residual). Ambas MS son estimadores de la varianza poblacional, pero bajo diferentes condiciones. Si la hipótesis nula es verdadera, ambas deberían ser aproximadamente iguales.
La Razón F (o estadístico F) es el cociente de estas dos medias cuadráticas: $F = MS_{Entre} / MS_{Dentro}$. Si la hipótesis nula es verdadera (es decir, las medias poblacionales son iguales), se espera que la razón F sea cercana a 1.0. Sin embargo, si el tratamiento tiene un efecto real, la $MS_{Entre}$ será significativamente mayor que la $MS_{Dentro}$, resultando en una razón F considerablemente mayor que 1.0. El valor F obtenido se compara luego con la distribución F teórica (determinada por los grados de libertad) para obtener un valor p, que indica la probabilidad de observar un resultado tan extremo si la hipótesis nula fuera cierta.
7. Pruebas Post Hoc y Tamaño del Efecto
Si el ANOVA de un factor resulta en una razón F significativa (es decir, se rechaza la hipótesis nula), la conclusión es que “al menos dos medias son diferentes”. Sin embargo, el test F no especifica qué pares de grupos difieren entre sí. Para identificar estas diferencias específicas, se requieren Pruebas Post Hoc (comparaciones múltiples). Estas pruebas están diseñadas para controlar el error Tipo I acumulado que resultaría de realizar múltiples pruebas t por separado.
Existen diversas pruebas post hoc, cada una con diferentes niveles de conservadurismo. El HSD de Tukey (Diferencia Significativa Honestamente) es una de las más utilizadas, especialmente cuando los tamaños de muestra son iguales (diseños balanceados), ya que ofrece un buen equilibrio entre el control del error Tipo I y el poder estadístico. Otras opciones incluyen la corrección de Bonferroni (muy conservadora) o la prueba de Scheffé (más robusta para diseños complejos o cuando se realizan comparaciones no planificadas).
Además de la significancia estadística (valor p), es crucial reportar el Tamaño del Efecto. El tamaño del efecto mide la magnitud de la diferencia o la proporción de la varianza total explicada por el factor. Las medidas comunes incluyen eta-cuadrado ($eta^2$) y eta-cuadrado parcial ($eta_p^2$). $eta^2$ representa la proporción de la varianza total en la variable dependiente que es atribuible al factor. Un tamaño del efecto grande indica que las diferencias observadas son sustancialmente importantes, independientemente de si el resultado es estadísticamente significativo.
8. Ventajas y Desventajas
El ANOVA entre sujetos ofrece ventajas significativas en el diseño experimental. La principal es su capacidad para manejar múltiples grupos y niveles de tratamiento simultáneamente con un único test omnibus, controlando así el error Tipo I global. Además, su estructura es conceptualmente simple y robusta, especialmente cuando los supuestos se cumplen, permitiendo a los investigadores aislar el efecto del tratamiento del error residual con claridad. Los diseños entre sujetos también eliminan los problemas de contaminación de datos derivados de los efectos de orden, práctica o fatiga, que son inherentes a los diseños de medidas repetidas, ya que cada sujeto participa solo una vez.
No obstante, el ANOVA entre sujetos presenta limitaciones importantes, principalmente relacionadas con la eficiencia y el control del error. La principal desventaja es la necesidad de un mayor número de participantes en comparación con los diseños dentro de sujetos, lo que aumenta los costos y la dificultad de la recolección de datos. Si se tienen $k$ grupos y se necesita un tamaño de muestra $n$ por grupo, el tamaño total de la muestra será $N = k times n$.
Además, debido a que diferentes sujetos pueblan cada grupo, la varianza dentro de los grupos ($MS_{Dentro}$) tiende a ser mayor, ya que incluye todas las diferencias individuales entre los participantes (por ejemplo, diferencias en inteligencia, motivación, experiencia previa, etc.). Esta varianza individual no puede ser separada del error en un diseño entre sujetos simple, lo que resulta en un denominador de error más grande. Un denominador de error grande reduce la razón F y, consecuentemente, disminuye el poder estadístico para detectar un efecto real del tratamiento. Si bien los diseños de bloques o el ANCOVA pueden mitigar este problema, el ANOVA entre sujetos puro sacrifica el control de la varianza individual en aras de la independencia de las observaciones.