método de intervalos de apariencia igual – equal-appearing-intervals method
- Método de Intervalos Aparentemente Iguales (Thurstone)
- 1. Definición Conceptual y Propósito
- 2. Fundamentos Teóricos: La Ley del Juicio Comparativo
- 3. Proceso Detallado de Construcción de la Escala: Generación y Clasificación
- 4. El Proceso de Escalamiento y Asignación de Valores
- 5. Selección Final de los Ítems
- 6. Características Clave de la Escala Resultante
- 7. Aplicaciones Prácticas en Investigación Social
- 8. Limitaciones Metodológicas y Críticas
- 9. Legado e Influencia
- Further Reading
Método de Intervalos Aparentemente Iguales (Thurstone)
Primary Disciplinary Field(s): Psicometría, Psicología Social, Estadística.
1. Definición Conceptual y Propósito
El Método de Intervalos Aparentemente Iguales, frecuentemente conocido como la técnica de Thurstone, es una metodología clásica dentro de la psicometría diseñada para la construcción de escalas de actitud. Su objetivo fundamental es transformar juicios ordinales y subjetivos de un grupo de jueces sobre una serie de afirmaciones en una escala de medición con propiedades de intervalo. Esto significa que la técnica busca asignar valores numéricos a los ítems de tal manera que las distancias entre estos valores sean interpretables como diferencias iguales en la intensidad de la actitud subyacente que se está midiendo. Desarrollado por Louis Leon Thurstone en 1929, este método marcó un hito crucial en la historia de la medición social, ya que permitió a los investigadores cuantificar actitudes complejas, como el racismo, la religiosidad o la opinión política, con una precisión matemática que se creía inalcanzable hasta ese momento.
A diferencia de métodos posteriores que simplemente suman respuestas (como la escala de Likert), el método de Thurstone pone el énfasis en la etapa inicial de calibración de los ítems, que es realizada por un panel de expertos o jueces. Estos jueces no expresan su propia actitud, sino que evalúan la intensidad o favorabilidad de cada afirmación respecto al constructo. El supuesto central radica en que, si se pide a los jueces que clasifiquen las afirmaciones en categorías que perciben como intervalos de igual apariencia (por ejemplo, 11 montones que van de “extremadamente desfavorable” a “extremadamente favorable”), las distribuciones resultantes de estas clasificaciones pueden ser analizadas estadísticamente para determinar el valor escalar objetivo de cada ítem.
La importancia de obtener una escala de intervalo reside en que permite la aplicación de operaciones estadísticas paramétricas más robustas. Si bien la respuesta final del sujeto encuestado es binaria (acuerdo o desacuerdo), la escala subyacente que se construye mediante este método garantiza que un cambio de, por ejemplo, dos unidades en la puntuación de la actitud del encuestado representa la misma magnitud de cambio en la actitud medida, independientemente de dónde se sitúe ese cambio en el continuo. Así, el método de Intervalos Aparentemente Iguales busca superar las limitaciones inherentes a las escalas puramente ordinales, proporcionando una base más rigurosa para la medición psicológica y social.
2. Fundamentos Teóricos: La Ley del Juicio Comparativo
El sustento teórico del Método de Intervalos Aparentemente Iguales se encuentra en la Ley del Juicio Comparativo (Law of Comparative Judgment), también formulada por Thurstone. Esta ley postula que, cuando un individuo es confrontado repetidamente con un estímulo (en este caso, una afirmación de actitud), el juicio que emite sobre ese estímulo no es constante, sino que varía ligeramente debido a fluctuaciones psicológicas inherentes. Esta variabilidad se modela asumiendo que el valor psicológico de cada estímulo en el continuo subyacente sigue una distribución normal.
Thurstone argumentó que la percepción de un estímulo genera un “proceso discriminatorio” que se distribuye normalmente en torno a un valor modal o “verdadero” en el continuo psicológico. La distancia entre dos estímulos en la escala se determina por la proporción de veces que un estímulo es juzgado como “mayor” o más favorable que otro. Aunque el método de Intervalos Aparentemente Iguales es una simplificación práctica de la Ley del Juicio Comparativo, utiliza la lógica de la distribución normal acumulada para calcular los valores escalares. Específicamente, asume que la distribución de los juicios de los jueces sobre la posición de un ítem en las categorías de clasificación puede ser tratada como una distribución normal, permitiendo así transformar las proporciones de juicios en unidades de desviación estándar (unidades Z) que definen el punto del ítem en la escala de intervalo.
Esta aproximación teórica es esencial porque permite a los investigadores inferir una métrica de intervalo a partir de datos que son inicialmente categóricos u ordinales. Al utilizar la función de distribución acumulada de la curva normal estándar, se puede determinar la posición del ítem que divide a los jueces en la proporción deseada. Por ejemplo, si el 50% de los jueces clasificó un ítem por debajo de la categoría 5, y el 50% por encima, ese ítem se situaría en el punto central de la escala. Esta dependencia de la distribución normal es la razón por la cual el método requiere un número considerable de jueces y una clasificación exhaustiva, asegurando que los datos de juicio sean lo suficientemente estables para la aplicación de la inferencia estadística.
3. Proceso Detallado de Construcción de la Escala: Generación y Clasificación
La construcción de una escala Thurstone es un procedimiento laborioso que consta de varias fases rigurosas. La primera fase es la generación de ítems. El investigador debe recopilar un gran número de afirmaciones (típicamente entre 80 y 150) relacionadas con el objeto de actitud, asegurándose de que cubran todo el espectro del continuo, desde las posiciones más extremas y favorables hasta las más extremas y desfavorables, pasando por posiciones neutrales. Es crucial que estas afirmaciones sean claras, concisas, y que solo expresen una única idea.
La segunda fase es la selección de jueces y la clasificación de los ítems. Se recluta un grupo grande de jueces (idealmente 100 o más), cuyo papel es estrictamente evaluativo, no actitudinal. A estos jueces se les pide que clasifiquen cada una de las afirmaciones en un número predefinido de categorías (usualmente 7, 9 u 11) que representan un continuo de favorabilidad. Se instruye a los jueces para que consideren que las categorías representan intervalos de igual tamaño o apariencia en la escala de actitud subyacente. Por ejemplo, en una escala de 11 categorías, la categoría 1 representa la actitud más desfavorable posible y la 11 la más favorable, y se asume que la distancia psicológica entre 1 y 2 es la misma que entre 10 y 11.
El tercer paso implica la tabulación de los juicios. Para cada ítem, el investigador registra la frecuencia con la que fue colocado en cada una de las categorías de clasificación por el conjunto de jueces. Estos datos brutos de frecuencia son esenciales, ya que reflejan el consenso o la dispersión de los juicios sobre la posición de la afirmación en el continuo. Un ítem que es clasificado consistentemente en una sola categoría por la mayoría de los jueces será considerado menos ambiguo y más preciso en su posición escalar que un ítem cuyos juicios están dispersos a lo largo de varias categorías.
4. El Proceso de Escalamiento y Asignación de Valores
Una vez tabulados los juicios, el proceso de escalamiento comienza con el cálculo de la distribución de las clasificaciones para cada ítem. Los datos de frecuencia se convierten en proporciones acumuladas. Para cada ítem, se calcula la proporción de jueces que colocaron el ítem en una categoría determinada o en una categoría menos favorable. Estas proporciones acumuladas son cruciales porque, bajo el supuesto de normalidad, pueden transformarse en valores Z mediante el uso de la tabla de la curva normal estándar.
El valor escalar (S) de un ítem se define como la mediana de la distribución de los juicios. En términos prácticos, el valor S es el punto en la escala de actitud (expresado en unidades Z o una transformación lineal de estas) donde el 50% de los jueces clasificó el ítem por debajo y el 50% por encima. Este valor S representa la ubicación objetiva del ítem en el continuo de actitud y es el valor que se utilizará en la escala final. El cálculo de la mediana asegura que la posición del ítem refleje el juicio central del grupo de evaluadores, minimizando la influencia de clasificaciones extremas o atípicas.
Adicionalmente, se calcula una medida de la ambigüedad o dispersión del ítem, conocida como el valor Q (o rango intercuartílico). Este valor Q se calcula como la diferencia entre los valores escalares que corresponden al percentil 75 y el percentil 25 de la distribución de juicios. Un valor Q pequeño indica que los jueces estuvieron altamente de acuerdo sobre la posición del ítem, lo que significa que el ítem es claro y poco ambiguo. Por el contrario, un valor Q grande sugiere una alta dispersión en los juicios, indicando que el ítem es ambiguo o que los jueces lo interpretaron de manera inconsistente, haciéndolo menos útil para una escala de intervalo precisa.
5. Selección Final de los Ítems
La fase de selección final es crítica para garantizar que la escala resultante cumpla con las propiedades de intervalo deseadas. El investigador utiliza los valores S (ubicación) y Q (ambigüedad) calculados para cada ítem para tomar decisiones informadas sobre cuáles afirmaciones incluir en la escala final. El objetivo es seleccionar un subconjunto manejable de ítems (generalmente entre 15 y 25) que cumplan dos criterios principales.
El primer criterio es la cobertura uniforme del continuo. Los ítems seleccionados deben estar distribuidos de manera equitativa a lo largo de todo el rango de valores S, desde el extremo menos favorable hasta el más favorable. Idealmente, los valores S de los ítems seleccionados deberían formar una progresión casi aritmética, asegurando que se cubran los “intervalos aparentemente iguales” prometidos por el método. Esta distribución uniforme es lo que otorga a la escala sus propiedades de intervalo, ya que garantiza que las distancias entre los ítems sean consistentes y representativas de las diferencias reales en la actitud.
El segundo criterio es la baja ambigüedad. Solo se seleccionan aquellos ítems que poseen los valores Q más bajos. Los ítems con alta dispersión (alto Q) son descartados porque su significado no es consistente entre los jueces, lo que comprometería la validez de la medición. Al seleccionar ítems con bajo Q y valores S uniformemente espaciados, el investigador produce una escala final que es tanto precisa en la ubicación de sus ítems como consistente en la interpretación de los mismos. Una vez seleccionados, los ítems se presentan al encuestado final sin sus valores S, y el encuestado simplemente marca aquellos con los que está de acuerdo.
6. Características Clave de la Escala Resultante
La principal característica diferenciadora de una escala construida mediante el método de Intervalos Aparentemente Iguales es que el valor de la actitud de un encuestado final se calcula como la mediana de los valores escalares (S) de los ítems con los que estuvo de acuerdo. Esta es una diferencia fundamental con las escalas aditivas (como Likert), donde la puntuación es simplemente la suma o el promedio de las respuestas categóricas. En una escala Thurstone, el valor escalar de cada ítem ya está pre-calibrado con propiedades de intervalo, lo que confiere a la puntuación final del encuestado una naturaleza métrica superior.
Otra característica vital es la unidimensionalidad implícita. El proceso de selección de ítems, particularmente el descarte de aquellos con alta ambigüedad, tiende a forzar la escala hacia la medición de un único constructo subyacente. Los ítems que son interpretados de manera muy diferente por los jueces a menudo están midiendo dimensiones secundarias o son simplemente mal formulados, y son eliminados. Aunque el método no incluye análisis factorial explícito (como hacen las técnicas modernas), la rigurosa calibración y selección por consenso de los jueces funciona como un filtro para la coherencia conceptual.
Finalmente, la escala resultante es notablemente eficiente para el encuestado. Una vez construida y validada, la aplicación de la escala es muy sencilla: el encuestado solo tiene que marcar “sí” o “no” a las afirmaciones con las que está de acuerdo. Esto reduce la fatiga del encuestado y el sesgo de deseabilidad social que a veces se asocia con las escalas Likert de múltiples categorías de respuesta. La complejidad se traslada por completo a la fase de diseño y calibración, garantizando que el instrumento final sea rápido de administrar y altamente interpretable.
7. Aplicaciones Prácticas en Investigación Social
Históricamente, el método de Intervalos Aparentemente Iguales fue revolucionario en la medición de actitudes. Su aplicación inicial se centró en temas de alta sensibilidad social, como la medición de actitudes hacia la guerra, la religión, las razas y las instituciones políticas. Por ejemplo, Thurstone y Chave (1929) crearon una de las primeras escalas clásicas de actitud utilizando este método para medir las actitudes hacia la iglesia, demostrando la viabilidad de cuantificar fenómenos psicológicos complejos.
En el campo de la psicología social, la metodología permitió establecer de manera empírica si las actitudes se distribuían de forma continua o si existían agrupaciones discretas. Al obtener valores de intervalo, los investigadores podían comparar grupos con mayor precisión (por ejemplo, hombres vs. mujeres, o grupos etarios) utilizando pruebas t o ANOVA, asumiendo que la variable de actitud medida cumplía con los requisitos métricos para tales análisis. Esto fue fundamental para el desarrollo de la investigación de opinión pública y el estudio de prejuicios.
Aunque su uso ha disminuido en favor de métodos más sencillos y robustos computacionalmente (como los modelos de Rasch o la escala de Likert), la lógica de Thurstone aún influye en la investigación de mercado y la evaluación de servicios. La idea de que los expertos deben calibrar la intensidad de los estímulos antes de que los consumidores los evalúen se utiliza, por ejemplo, en la creación de escalas de satisfacción donde la importancia de diferentes atributos del producto se pondera previamente mediante un proceso de juicio similar a la clasificación de Thurstone.
8. Limitaciones Metodológicas y Críticas
A pesar de su sofisticación estadística y su importancia histórica, el método de Intervalos Aparentemente Iguales enfrenta varias limitaciones y ha sido objeto de críticas significativas. La crítica más importante se centra en la dependencia de los jueces. El método asume que los jueces son capaces de ignorar su propia actitud hacia el tema y clasificar las afirmaciones basándose únicamente en la favorabilidad inherente de la declaración. Sin embargo, la evidencia sugiere que las actitudes personales de los jueces pueden influir sutilmente en su clasificación, lo que introduce un sesgo potencial en los valores escalares (S) asignados a los ítems.
Otra limitación práctica es la alta demanda de recursos. El método requiere un número muy grande de ítems iniciales, un gran panel de jueces y un proceso estadístico intensivo para la calibración. Esto contrasta fuertemente con la escala de Likert, que requiere solo un grupo piloto pequeño y un cálculo mucho más directo de las correlaciones ítem-total, haciendo que el método de Likert sea significativamente más económico y rápido de implementar en la investigación aplicada.
Finalmente, existe un debate sobre si el método realmente logra una escala de intervalo “verdadera”. Aunque el proceso estadístico transforma las proporciones en unidades Z (que son de intervalo), la validez de esta transformación depende críticamente del supuesto de que las categorías de juicio realmente representan intervalos de igual apariencia para los jueces y de que la distribución de los juicios es estrictamente normal. Si estos supuestos se violan, la escala resultante puede acercarse más a una escala ordinal sofisticada que a una verdadera escala de intervalo, lo que ha llevado a muchos psicómetras modernos a preferir modelos de respuesta al ítem que abordan directamente la probabilidad de respuesta en lugar de depender de juicios de clasificación externos.
9. Legado e Influencia
El legado de Thurstone y su Método de Intervalos Aparentemente Iguales es innegable. Junto con la obra de Rensis Likert, estableció las bases de la moderna teoría de la medición de actitudes. Thurstone fue el primero en demostrar de manera convincente que las actitudes, un concepto intrínsecamente subjetivo, podían ser cuantificadas de manera rigurosa y métrica, abriendo el camino para la psicometría como disciplina científica. Su trabajo forzó a la comunidad científica a considerar la necesidad de validar la métrica subyacente de las escalas antes de utilizarlas para la inferencia estadística.
Si bien la escala de Likert (desarrollada en 1932) se convirtió en el método dominante debido a su sencillez y robustez empírica, la contribución de Thurstone radica en la introducción del concepto de calibración de estímulos. La idea de que los estímulos (ítems) deben ser evaluados y escalados independientemente de las respuestas del sujeto final es una metodología que sigue siendo central en diversas áreas de la psicología experimental y la percepción. Además, la Ley del Juicio Comparativo continúa siendo un marco fundamental para comprender cómo los seres humanos perciben y comparan estímulos a lo largo de un continuo psicológico.
En esencia, el Método de Intervalos Aparentemente Iguales no solo proporcionó una técnica específica, sino que también estableció un estándar de rigor. Demostró que, para obtener una medición de intervalo a partir de datos ordinales, se requiere un esfuerzo considerable en la etapa de diseño del instrumento. Su existencia y sus complejidades metodológicas impulsaron el desarrollo de modelos psicométricos más avanzados que buscan lograr la métrica de intervalo con mayor eficiencia y menor dependencia de los supuestos de juicio, garantizando que la medición psicológica continúe evolucionando hacia una mayor precisión científica.