Prueba de rango múltiple de Duncan (MRT de Duncan) – Duncan’s multiple range test (Duncan’s MRT)


Prueba de Rangos Múltiples de Duncan (Duncan’s MRT)

Primary Disciplinary Field(s): Estadística, Bioestadística, Diseño Experimental, Agronomía

1. Definición Central y Propósito

La Prueba de Rangos Múltiples de Duncan (Duncan’s MRT), introducida por David B. Duncan en la década de 1950, es un procedimiento estadístico diseñado para realizar comparaciones múltiples por pares entre medias de grupos, específicamente después de que un análisis de varianza (ANOVA) haya determinado que existe una diferencia significativa general entre al menos algunas de esas medias. Se clasifica dentro del grupo de pruebas post-hoc o de comparaciones múltiples. Su función primordial es identificar qué pares específicos de medias difieren significativamente entre sí, manteniendo un control sobre la tasa de error experimental.

A diferencia de las pruebas a priori, que se planifican antes de la recopilación de datos, las pruebas post-hoc como la MRT de Duncan se aplican cuando la hipótesis nula global del ANOVA (que establece que todas las medias son iguales) ha sido rechazada. Si bien el ANOVA nos dice que hay diferencias, no especifica dónde se encuentran esas diferencias. Duncan’s MRT aborda esta ambigüedad al realizar comparaciones secuenciales. Es crucial entender que la MRT de Duncan es fundamentalmente una extensión del concepto de la prueba t de Student, ajustada para manejar el problema de la inflación del error Tipo I que surge al realizar múltiples comparaciones simultáneamente.

El principal atractivo de la MRT de Duncan, históricamente, residía en su capacidad para ofrecer una potencia estadística relativamente alta en comparación con métodos más conservadores, como la Prueba de Rango Sinceramente Significativo de Tukey (HSD). Esta mayor potencia, sin embargo, se logra a expensas de un control menos estricto del error Tipo I a nivel familiar (Family-Wise Error Rate, FWER), un punto que ha sido la fuente principal de debate y crítica metodológica a lo largo de los años. Por lo tanto, su elección depende a menudo del equilibrio que el investigador desee establecer entre el riesgo de cometer un error Tipo I (falso positivo, declarar una diferencia inexistente) y el riesgo de cometer un error Tipo II (falso negativo, no detectar una diferencia real).

2. Origen Histórico y Proponente

La Prueba de Rangos Múltiples fue desarrollada por el influyente estadístico estadounidense David B. Duncan (1916–2006). Duncan publicó por primera vez su metodología en una serie de artículos seminales, siendo el más influyente el de 1955, titulado “Multiple Range and Multiple F Tests”. En ese momento, la necesidad de métodos robustos para la comparación de medias en campos como la agricultura y la biología experimental era apremiante, especialmente tras el auge del diseño experimental promovido por Ronald Fisher. La estadística experimental requería una herramienta que pudiera manejar el creciente número de tratamientos en los estudios agronómicos.

El contexto histórico era uno de intensa competencia metodológica. Anteriormente, los investigadores dependían a menudo de la prueba de la Mínima Diferencia Significativa (LSD) de Fisher, que carecía de un control adecuado del error cuando el número de grupos aumentaba, llevando a una alta tasa de falsos positivos. Duncan buscó una solución intermedia que ofreciera un equilibrio entre la potencia de la LSD y el estricto control de la tasa de error por experimento ofrecido por otros métodos, como la prueba de Scheffé o la propia HSD de Tukey. Duncan argumentó que la tasa de error no debería ser constante para todas las comparaciones, sino que debería depender del número de pasos intermedios entre las medias que se comparan, lo que llevó al concepto de niveles de significación secuenciales.

La rápida adopción de la MRT de Duncan, especialmente en las décadas de 1960 y 1970, se debió a su facilidad de cálculo (en la era pre-computacional, donde los cálculos manuales eran la norma) y a su promesa de detectar diferencias genuinas que otros métodos más conservadores podrían haber pasado por alto. Aunque su uso ha disminuido en algunas disciplinas debido a la evolución de las directrices estadísticas hacia un control más riguroso del FWER, sigue siendo una herramienta histórica y conceptualmente relevante en el ámbito de las comparaciones múltiples, demostrando un enfoque alternativo en la gestión del riesgo de error.

3. Principios Fundamentales y Metodología

El principio central de la MRT de Duncan es el concepto de rango y el uso de valores críticos que varían en función del número de medias que abarca el rango que se está probando. A diferencia de la prueba HSD de Tukey, que utiliza un único valor crítico (el rango sinceramente significativo) para todas las comparaciones de pares, la MRT de Duncan emplea una serie de Rangos Significativos Protegidos ($R_p$) que se ajustan según la distancia entre las medias ordenadas. Esta variación en el valor crítico es la fuente de la potencia diferencial de la prueba.

La metodología comienza, como es estándar en las pruebas post-hoc de rango, con la ordenación de las medias muestrales de menor a mayor. Posteriormente, la prueba calcula una serie de valores críticos, $R_p$, donde $p$ representa el número de medias incluidas en el rango de la comparación (desde $p=2$ para medias adyacentes hasta $p=k$ para la diferencia entre la media más grande y la más pequeña, siendo $k$ el número total de grupos). La clave es que, para un rango dado $p$, el valor crítico utilizado por Duncan es calculado de tal manera que permite una mayor probabilidad de rechazo de la hipótesis nula, en comparación con Tukey, si la diferencia observada es real.

Específicamente, la prueba utiliza una tasa de error por comparación que aumenta con el número de pasos intermedios, basándose en la justificación de que si un subconjunto de medias ya ha sido declarado homogéneo (no significativamente diferente), la tasa de error para las comparaciones dentro de ese subconjunto puede ser menor. Este enfoque de protección secuencial es lo que distingue a Duncan de otros procedimientos. La significación de una diferencia entre dos medias no solo depende del tamaño de la diferencia, sino también de si las comparaciones intermedias ya han sido declaradas significativas, lo cual es la base de la regla de parada que previene la realización de pruebas innecesarias dentro de grupos ya considerados equivalentes.

4. Relación con Otras Pruebas Post-Hoc

La Prueba de Rangos Múltiples de Duncan se sitúa en un espectro de pruebas post-hoc que varían en cuanto a su rigor en el control del error Tipo I y su potencia estadística. Este espectro va desde los métodos más conservadores (como Scheffé, que rara vez comete un error Tipo I pero puede pasar por alto diferencias reales) hasta los menos conservadores (como la LSD de Fisher no protegida, con alta potencia pero alta tasa de error familiar).

La MRT de Duncan se clasifica como una prueba de rango, compartiendo similitudes con la prueba de Newman-Keuls. Ambos métodos utilizan rangos críticos que dependen del número de medias que se comparan. Sin embargo, Duncan introdujo una modificación fundamental en la aproximación de Newman-Keuls al permitir que el nivel de significación aumentara gradualmente a medida que el número de medias en el rango ($p$) aumentaba. Mientras que Newman-Keuls mantiene el nivel de significación ($alpha$) fijo, Duncan utiliza un nivel de significación ajustado $alpha_p = 1 – (1 – alpha)^{p-1}$. Este ajuste es la razón fundamental por la que Duncan es más poderoso que Newman-Keuls, pero al mismo tiempo, es más propenso a errores Tipo I a nivel familiar.

La comparación más relevante es con la Prueba de Rango Sinceramente Significativo (HSD) de Tukey. HSD controla rigurosamente el error Tipo I a nivel familiar (FWER), asegurando que la probabilidad de cometer al menos un falso positivo en todas las comparaciones sea igual o menor que $alpha$. La MRT de Duncan, en contraste, solo controla el error por comparación individual de manera secuencial, lo que resulta en una tasa FWER que excede el nivel $alpha$ nominal. Los investigadores suelen preferir Tukey cuando el control estricto del error Tipo I es primordial (como en estudios confirmatorios), mientras que Duncan se ha favorecido históricamente en investigación exploratoria donde la detección de cualquier diferencia real es prioritaria, a pesar del riesgo incrementado de falsos positivos.

5. Procedimiento Detallado (Pasos Clave)

La aplicación práctica de la Prueba de Rangos Múltiples de Duncan requiere un conjunto de pasos sistemáticos que se inician tras la finalización de un ANOVA y la confirmación de un efecto significativo del tratamiento. Este proceso garantiza la correcta aplicación de los rangos críticos secuenciales.

  1. Cálculo de la Varianza y el Error Estándar: El primer paso es obtener la Media Cuadrática del Error (MCE) del ANOVA, que sirve como estimación de la varianza poblacional dentro de los grupos. Luego, se calcula el error estándar de la media ($text{S}_{bar{x}}$) dividiendo la raíz cuadrada de la MCE por el tamaño de la muestra ($n$) en cada grupo, asumiendo tamaños de muestra iguales (diseño balanceado).
  2. Ordenación de las Medias: Las $k$ medias de los tratamientos se ordenan de menor a mayor. Esta ordenación es esencial, ya que las comparaciones se realizan en función del rango (distancia en la lista ordenada) entre las medias.
  3. Determinación de los Rangos Significativos Protegidos ($R_p$): Para cada rango $p$ (desde 2 hasta $k$), se consulta una tabla de rangos múltiples de Duncan (basada en la distribución del rango studentizado, pero ajustada por Duncan). Este valor tabular ($q_p$) se multiplica por el error estándar $text{S}_{bar{x}}$ para obtener el valor crítico $R_p$. Estos valores $R_p$ son los umbrales de diferencia que deben superarse para declarar la significación para cada rango específico $p$.
  4. Comparación Secuencial: Se comienza comparando la diferencia absoluta entre la media más grande y la media más pequeña (rango $k$). Si esta diferencia es mayor que $R_k$, se declara significativa. Posteriormente, se comparan las diferencias de rango $k-1$ (por ejemplo, la media más grande vs. la segunda más pequeña, y la segunda más grande vs. la más pequeña), y así sucesivamente, hasta llegar a las comparaciones de rango 2 (medias adyacentes).
  5. Aplicación de la Regla de Parada: La regla fundamental de Duncan establece que, si la diferencia entre dos medias cualesquiera separadas por $p-2$ medias intermedias resulta ser no significativa, entonces todas las comparaciones entre las medias intermedias de ese subconjunto también deben considerarse no significativas, y se detienen las pruebas dentro de ese subconjunto. Esta “protección” evita la realización de comparaciones redundantes que, si se hicieran, inflarían aún más la tasa de error.

El resultado final es un conjunto de subgrupos de medias homogéneas. Las medias que no difieren significativamente entre sí se agrupan, y estos subgrupos se suelen denotar con letras (por ejemplo, A, B, C), donde las medias que comparten una letra no son estadísticamente diferentes al nivel de significación elegido ($alpha$).

6. Aplicaciones Típicas en Investigación

A lo largo de su historia, la Prueba de Rangos Múltiples de Duncan ha encontrado un uso extensivo en disciplinas que manejan diseños experimentales con múltiples niveles de tratamiento y donde la identificación de los tratamientos más efectivos es un objetivo primordial. Su popularidad inicial y continua se centra fuertemente en la investigación agrícola y biológica.

En la Agronomía, la MRT de Duncan es una herramienta estándar para comparar el rendimiento de múltiples variedades de cultivos, la eficacia de diferentes dosis de fertilizantes o pesticidas, o el impacto de distintos regímenes de riego. Si un experimento evalúa el crecimiento de quince cepas de maíz y el ANOVA general es significativo, Duncan’s MRT permite al investigador agrupar las cepas de alto rendimiento que no difieren entre sí (Grupo A), separándolas de las de rendimiento medio (Grupo B) y bajo (Grupo C). Esta claridad en la agrupación es vital para las recomendaciones prácticas a los agricultores.

En la Ciencia Animal y Veterinaria, se utiliza para comparar la ganancia de peso, la eficiencia alimenticia o los parámetros de salud en animales sometidos a diferentes dietas o tratamientos. En la Ecología, puede aplicarse para comparar la biomasa o la diversidad de especies en múltiples sitios o bajo diferentes condiciones ambientales. Aunque su presencia en la literatura de Psicología Experimental y Sociología ha disminuido, sigue siendo un método enseñado y aplicado en ciertas tradiciones de investigación aplicada donde la potencia estadística es altamente valorada.

La persistencia de Duncan en estos campos se debe a menudo a dos factores: la tradición metodológica en ciertas revistas y la preferencia por una prueba que tenga una alta probabilidad de detectar diferencias reales cuando existen, incluso si esto conlleva un mayor riesgo de error Tipo I que otros métodos. Esto es especialmente cierto en la investigación de laboratorio o de campo donde la variabilidad puede ser alta y la detección de cualquier efecto es crucial para el desarrollo de productos o protocolos.

7. Críticas y Limitaciones Metodológicas

A pesar de su utilidad práctica, la Prueba de Rangos Múltiples de Duncan ha sido objeto de críticas sustanciales por parte de la comunidad estadística, principalmente relacionadas con su manejo de la Tasa de Error Tipo I a nivel familiar (FWER). Los críticos argumentan que el método de Duncan no controla la FWER de manera adecuada, permitiendo que esta tasa se infle significativamente por encima del nivel de significación nominal ($alpha$).

La principal limitación radica en la justificación del ajuste secuencial del nivel de significación. Al utilizar $alpha_p = 1 – (1 – alpha)^{p-1}$, la probabilidad de cometer un error Tipo I en cualquier comparación particular aumenta a medida que aumenta el rango. Aunque Duncan argumentó que esto era apropiado porque las comparaciones de rangos más amplios son “menos protegidas” por las comparaciones intermedias, el consenso moderno es que este enfoque compromete la integridad de la inferencia global. El resultado es que la probabilidad real de declarar al menos una diferencia significativa por error en todo el conjunto de comparaciones es considerablemente mayor que el $alpha$ declarado por el investigador (típicamente 0.05), llevando a una alta tasa de falsos positivos.

Además, la dependencia de la regla de parada secuencial puede ser metodológicamente restrictiva. Si una comparación inicial de rango grande falla en alcanzar la significación, la prueba detiene las comparaciones dentro de ese subconjunto. Esto puede llevar a la situación paradójica de que dos medias que están más separadas se declaren no significativas, mientras que dos medias intermedias (con una diferencia similar) podrían haber sido significativas si la prueba hubiera continuado. Esta falta de consistencia en las decisiones (no monotonía) es otra crítica importante que llevó a muchos estadísticos a favorecer métodos como la HSD de Tukey, que garantizan un control uniforme del FWER independientemente del número de grupos o del rango de la comparación.

8. Legado y Uso Actual

El legado de Duncan’s MRT es innegable. Fue un desarrollo crucial en la evolución de las técnicas de comparación múltiple, impulsando la discusión fundamental sobre el equilibrio necesario entre la potencia estadística (la capacidad de detectar efectos reales) y el control del error Tipo I (la prevención de falsos descubrimientos). Su existencia obligó a los estadísticos a formalizar y clarificar la definición de la tasa de error que debía controlarse en los diseños experimentales complejos.

Hoy en día, el uso de Duncan’s MRT ha disminuido en la mayoría de las disciplinas de alta inferencia. En campos como la investigación biomédica, la salud pública y la psicología experimental, donde la replicabilidad y el control estricto de los errores Tipo I son cruciales para evitar tratamientos ineficaces o conclusiones erróneas, ha sido ampliamente reemplazado por procedimientos más conservadores como la Prueba de Tukey, el control de la Tasa de Descubrimiento Falso (FDR) o ajustes de Bonferroni/Holm. Sin embargo, sigue siendo una opción común en algunas áreas de las Ciencias Agrícolas, la Zootecnia y la Ecología, donde la tradición metodológica es fuerte y donde la alta potencia es a menudo considerada una prioridad para el cribado de tratamientos.

En el software estadístico moderno, la MRT de Duncan está disponible, aunque a menudo se incluye con advertencias sobre su conservadurismo estadístico. Su estudio sigue siendo fundamental en los cursos de diseño experimental, no solo para su aplicación, sino para ilustrar vívidamente los principios de las pruebas de rangos múltiples y la importancia crítica de definir y controlar la tasa de error experimental. Su metodología representa un punto de inflexión en la historia de la estadística aplicada, marcando el debate continuo sobre cómo optimizar la detección de efectos sin comprometer indebidamente la fiabilidad de los resultados.

Lecturas Adicionales

Cite This Article

memjavad (2025, December 29). Prueba de rango múltiple de Duncan (MRT de Duncan) – Duncan’s multiple range test (Duncan’s MRT). Spanish Psychological Databases. https://spanish.arabpsychology.com/trm/prueba-de-rango-multiple-de-duncan-mrt-de-duncan-duncans-multiple-range-test-duncans-mrt/
memjavad. “Prueba de rango múltiple de Duncan (MRT de Duncan) – Duncan’s multiple range test (Duncan’s MRT).” Spanish Psychological Databases, 29 December 2025, https://spanish.arabpsychology.com/trm/prueba-de-rango-multiple-de-duncan-mrt-de-duncan-duncans-multiple-range-test-duncans-mrt/.
memjavad. “Prueba de rango múltiple de Duncan (MRT de Duncan) – Duncan’s multiple range test (Duncan’s MRT).” Spanish Psychological Databases. December 29, 2025. https://spanish.arabpsychology.com/trm/prueba-de-rango-multiple-de-duncan-mrt-de-duncan-duncans-multiple-range-test-duncans-mrt/.