procedimiento de cadenas concurrentes – concurrent-chains procedure
- Procedimiento de Cadenas Concurrentes
- 1. Definición Central
- 2. Etimología y Desarrollo Histórico
- 3. Metodología: Estructura del Procedimiento
- 4. Conceptos Clave y Componentes
- 5. Análisis de la Elección y la Preferencia
- 6. Aplicaciones: Investigación de la Impulsividad y el Autocontrol
- 7. Variaciones y Diseños Complejos
- 8. Debates y Críticas
- Lecturas Adicionales
Procedimiento de Cadenas Concurrentes
Primary Disciplinary Field(s): Análisis Experimental de la Conducta; Psicología del Aprendizaje
1. Definición Central
El procedimiento de cadenas concurrentes es una metodología experimental sofisticada, fundamental dentro del campo del análisis experimental de la conducta, diseñada específicamente para estudiar la elección y la preferencia entre diferentes opciones de reforzamiento que varían en sus demoras o magnitudes asociadas. A diferencia de los programas concurrentes simples, donde la elección produce un reforzador inmediato, el procedimiento de cadenas concurrentes introduce una estructura temporal de dos fases, lo que permite a los investigadores analizar no solo la elección inicial (la preferencia), sino también el valor que el organismo asigna a las consecuencias futuras prometidas por esa elección. Esta técnica es esencialmente una combinación de dos o más programas de reforzamiento que operan de forma simultánea e independiente en la primera fase (la fase de elección o eslabón inicial) y que conducen a programas de reforzamiento únicos y exclusivos en la segunda fase (la fase terminal o eslabón final).
La estructura distintiva de este procedimiento radica en que la respuesta inicial del sujeto experimental (típicamente un animal, como una paloma o una rata) en uno de los programas concurrentes no produce el reforzador directamente, sino que introduce al sujeto en la segunda fase, la cual está “encadenada” a la elección inicial. Esta segunda fase opera bajo un programa de reforzamiento simple (como un Intervalo Fijo o Razón Fija) que finalmente entregará el reforzador primario. Por lo tanto, la elección que se mide en la primera fase no es una elección entre reforzadores inmediatos, sino una elección entre diferentes ambientes de reforzamiento futuros. El valor de la preferencia observada en la fase inicial se convierte en un índice directo del valor subjetivo que el organismo otorga a la contingencia de reforzamiento específica disponible en el eslabón terminal.
La importancia metodológica del procedimiento de cadenas concurrentes reside en su capacidad para modelar situaciones de la vida real donde las decisiones tomadas en el presente tienen implicaciones demoradas. Permite a los analistas de la conducta aislar y manipular variables críticas, como la demora del reforzamiento, la tasa de reforzamiento, la magnitud del reforzador y el esfuerzo requerido, para entender cómo estos factores influyen en la toma de decisiones a largo plazo. Es la herramienta primordial para la investigación de conceptos complejos como el autocontrol, la impulsividad y la evaluación de reforzadores condicionados, proporcionando una base empírica sólida para las teorías del valor de la recompensa y el descuento temporal.
2. Etimología y Desarrollo Histórico
El desarrollo del procedimiento de cadenas concurrentes está íntimamente ligado a la evolución del análisis experimental de la conducta y a la necesidad de estudiar la elección bajo condiciones más realistas que las ofrecidas por los procedimientos de programas concurrentes simples. Aunque B. F. Skinner sentó las bases para el estudio de los programas encadenados (chain schedules) en la década de 1930, el diseño específico de “cadenas concurrentes” surgió más tarde, a mediados del siglo XX, como una respuesta directa a los desafíos de medir la preferencia por reforzadores demorados. Los primeros experimentos sistemáticos utilizando esta metodología fueron cruciales para expandir el alcance de la teoría del reforzamiento, particularmente al permitir la cuantificación del valor de los estímulos que predicen la disponibilidad de reforzamiento.
Un hito fundamental en la formalización de este procedimiento ocurrió con el trabajo de Murray Sidman y, posteriormente, con investigaciones seminales realizadas por George S. Reynolds y Richard J. Herrnstein en las décadas de 1960 y 1970. Herrnstein, conocido por su formulación de la Ley de Igualación (Matching Law), reconoció la limitación de los programas concurrentes simples para evaluar el valor de reforzadores que no eran inmediatamente accesibles. El procedimiento de cadenas concurrentes permitió a Herrnstein y otros colegas manipular las contingencias futuras y medir cómo estas manipulaciones afectaban la distribución de las respuestas en la fase de elección inicial. Este enfoque marcó un cambio paradigmático, pasando de centrarse únicamente en la tasa de respuesta como una función del reforzamiento inmediato a considerar la elección como una función del valor descontado de las consecuencias futuras.
El desarrollo histórico no solo se centró en la metodología, sino también en la interpretación teórica de los resultados. El procedimiento de cadenas concurrentes proporcionó el andamiaje empírico necesario para desarrollar y probar teorías de la elección intertemporal, como la teoría del descuento hiperbólico propuesta por George Ainslie. Al crear una situación donde el organismo debe “comprometerse” con una opción que solo ofrece sus beneficios después de una demora, los investigadores pudieron modelar y cuantificar la devaluación temporal de los reforzadores, solidificando así el estatus del procedimiento como la herramienta estándar para la investigación de la toma de decisiones económicas y conductuales.
3. Metodología: Estructura del Procedimiento
El procedimiento de cadenas concurrentes se caracteriza por su rigurosa estructura bifásica, que asegura que la preferencia medida en la primera fase refleje el valor de las contingencias futuras. La primera fase, denominada eslabón de elección (o eslabón inicial), presenta al organismo dos o más opciones de respuesta simultáneas, cada una asociada a un estímulo discriminativo distinto (por ejemplo, dos teclas iluminadas con colores diferentes para una paloma). Las respuestas en esta fase no producen el reforzador primario, sino que actúan como “respuestas de compromiso” o “respuestas de elección”. Generalmente, esta fase opera bajo programas de intervalo variable concurrente (Concurrent VI VI) para asegurar una distribución estable de la respuesta sin patrones estereotipados. Una vez que el organismo emite la respuesta requerida en una de las opciones, la fase de elección termina y se inicia la segunda fase.
La segunda fase, conocida como eslabón terminal (o eslabón final), es una fase de reforzamiento simple que opera bajo un programa predefinido y que es exclusivo de la opción elegida. Si el organismo eligió la Opción A en el eslabón inicial, solo tendrá acceso al programa de reforzamiento asociado a A en el eslabón terminal. Durante el eslabón terminal, el organismo debe seguir respondiendo según el programa especificado (por ejemplo, FI 30s o VR 10) hasta obtener el reforzador primario (ej., comida o agua). Es crucial que el acceso al eslabón terminal sea irreversible; una vez que se ha hecho la elección, el organismo no puede volver atrás ni cambiar al otro eslabón terminal hasta que se complete el ensayo y se inicie un nuevo ensayo de elección. El estímulo presente en esta fase actúa como un poderoso reforzador condicionado, señalando la disponibilidad inminente del reforzador primario.
La variable fundamental que se manipula en este diseño suele ser la naturaleza de los programas de reforzamiento en los eslabones terminales. Por ejemplo, los investigadores pueden comparar la preferencia por una cadena que conduce a un reforzamiento de alta tasa (ej., VI 30s) versus una cadena que conduce a un reforzamiento de baja tasa (ej., VI 120s), manteniendo la duración del eslabón terminal constante. Alternativamente, se puede manipular la demora misma, comparando un eslabón terminal que tiene una duración corta con uno que tiene una duración larga, lo que efectivamente manipula la demora antes de la obtención del reforzador primario. La medida principal de interés es la proporción de respuestas o la proporción de tiempo que el organismo dedica a cada opción en el eslabón de elección, lo que refleja directamente la preferencia relativa por las contingencias de reforzamiento futuras. Es importante señalar que la duración del eslabón terminal actúa como la demora efectiva del reforzador.
4. Conceptos Clave y Componentes
El procedimiento de cadenas concurrentes se basa en la interacción de varios conceptos conductuales esenciales que permiten la medición precisa de la preferencia por consecuencias demoradas. La distinción entre las dos fases, mediada por diferentes tipos de reforzadores, es fundamental para su funcionamiento. Los componentes clave del procedimiento permiten el estudio de la transferencia de valor entre reforzadores primarios y estímulos predictivos.
- Eslabón de Elección (Choice Link): Es la fase inicial y concurrente. Las respuestas aquí están bajo el control de los reforzadores condicionados que se obtienen al acceder a la siguiente fase. La distribución de respuestas en este eslabón es la variable dependiente primaria utilizada para cuantificar la preferencia.
- Eslabón Terminal (Terminal Link): Es la fase secundaria y no concurrente. En este eslabón, el organismo trabaja bajo un programa de reforzamiento simple hasta obtener el reforzador primario. La duración y el programa de esta fase determinan el valor final del reforzador condicionado asociado al eslabón de elección.
- Reforzadores Condicionados (Conditioned Reinforcers): Los estímulos discriminativos presentes al inicio del eslabón terminal (ej., un color específico de luz) que adquieren propiedades de reforzamiento debido a su asociación constante con el reforzador primario final. El procedimiento de cadenas concurrentes es el método más fiable para evaluar la fuerza relativa y la eficacia de estos reforzadores secundarios, ya que la elección en el eslabón inicial es una elección entre ellos.
- Compromiso Conductual (Behavioral Commitment): La irreversibilidad de la elección una vez que se accede al eslabón terminal. Esta característica obliga al organismo a experimentar las consecuencias demoradas de su elección, lo que es esencial para el estudio del autocontrol y la impulsividad, al impedir que el sujeto regrese a la opción alternativa una vez que se ha iniciado la demora.
El éxito del procedimiento depende de la capacidad de los estímulos en el eslabón terminal para funcionar como potentes reforzadores condicionados. Los analistas de la conducta han demostrado que el valor de estos estímulos condicionados se ve afectado directamente por factores como la tasa, la magnitud y la demora del reforzador primario que se obtiene al final de la cadena. Un eslabón terminal que promete un reforzador grande e inmediato genera un reforzador condicionado más fuerte que uno que promete un reforzador pequeño y demorado, lo que se refleja en una mayor proporción de respuestas en el eslabón de elección inicial.
5. Análisis de la Elección y la Preferencia
El análisis de los datos generados por el procedimiento de cadenas concurrentes va más allá de la simple observación de qué opción se elige con mayor frecuencia. Se busca establecer una relación cuantitativa entre las propiedades del reforzamiento terminal y la preferencia inicial. La elección se cuantifica como la proporción de respuestas o el tiempo dedicado a una opción, y esta proporción se utiliza para mapear el valor subjetivo de las consecuencias futuras.
Una de las principales ventajas analíticas de este procedimiento es que permite a los investigadores separar el proceso de elección (lo que sucede en el eslabón inicial) de la experiencia del reforzamiento (lo que sucede en el eslabón terminal). Esto es crucial porque la elección en el eslabón inicial está determinada por el valor descontado de los reforzadores terminales. El valor descontado se refiere a la reducción en la efectividad de un reforzador a medida que aumenta la demora entre la respuesta de elección y la entrega del reforzador primario. Al manipular la duración del eslabón terminal o los programas dentro de él, se puede trazar una curva de descuento temporal que ilustre cómo la preferencia disminuye a medida que el reforzador se aleja en el tiempo.
El análisis más riguroso de la preferencia en las cadenas concurrentes se realiza mediante el uso de la Ley de Igualación y los modelos de descuento hiperbólico. La Ley de Igualación, en este contexto, predice que la proporción relativa de respuestas en el eslabón inicial se igualará a la proporción relativa del valor descontado de los reforzadores terminales. El valor descontado de cada reforzador terminal es inversamente proporcional a la demora total impuesta por el eslabón terminal. Este análisis permite la identificación de la tasa de descuento de un organismo (el parámetro $k$), un índice crucial para entender cómo los individuos ponderan las recompensas futuras frente a las inmediatas, proporcionando una base empírica para la comprensión de la economía conductual.
6. Aplicaciones: Investigación de la Impulsividad y el Autocontrol
La aplicación más significativa y de mayor impacto del procedimiento de cadenas concurrentes se centra en la investigación de la impulsividad y el autocontrol, que son conceptos operacionales definidos por la elección intertemporal. En el laboratorio, la impulsividad se define como la preferencia por un reforzador pequeño e inmediato sobre un reforzador grande y demorado, mientras que el autocontrol es la preferencia por el reforzador grande y demorado. El procedimiento de cadenas concurrentes es ideal para estudiar estos fenómenos porque separa la decisión de la consecuencia, permitiendo la observación de un verdadero compromiso.
Para estudiar esto, los investigadores configuran el procedimiento con dos cadenas: una que ofrece un reforzador pequeño (S) después de una demora corta (Ds) y otra que ofrece un reforzador grande (L) después de una demora larga (Dl). La clave metodológica es que el organismo debe elegir y comprometerse con una de las opciones en el eslabón de elección, mucho antes de que se produzca la diferencia de valor entre S y L. Si el organismo elige consistentemente la cadena L/Dl sobre la cadena S/Ds, demuestra autocontrol. Si elige S/Ds, demuestra impulsividad, lo que indica una alta tasa de descuento temporal.
Este diseño experimental ha sido crucial para identificar los factores que influyen en la impulsividad, como la magnitud absoluta del reforzador, la diferencia entre las demoras y el estado motivacional del organismo. Además, el procedimiento de cadenas concurrentes ha sido fundamental en la investigación farmacológica y neurobiológica. Se utiliza rutinariamente para evaluar cómo diferentes fármacos, lesiones cerebrales o manipulaciones genéticas afectan el parámetro de descuento temporal de un organismo. Las alteraciones en la preferencia por el reforzador demorado (cambios en la impulsividad) son marcadores bioconductuales importantes en modelos animales de trastornos como la adicción, el trastorno por déficit de atención con hiperactividad (TDAH) y diversas condiciones psiquiátricas, donde la toma de decisiones subóptima es una característica central.
7. Variaciones y Diseños Complejos
El diseño básico de cadenas concurrentes ha generado varias variaciones que permiten abordar preguntas de investigación más específicas o mitigar ciertas limitaciones metodológicas. Una variación común es el procedimiento de cadenas de igualación a la muestra (matching-to-sample chains), donde la elección en el eslabón inicial depende de un estímulo presentado previamente, permitiendo el estudio de la memoria y la elección bajo control de estímulos complejos.
Otra variación importante es el uso de procedimientos de cadenas concurrentes con opción de escape. En estos diseños, el organismo tiene la posibilidad de volver a la fase de elección inicial antes de que termine el eslabón terminal, aunque este retorno suele implicar una penalización (ej., pérdida de tiempo o un pequeño castigo). Esto se utiliza para estudiar la persistencia y la resistencia a la frustración, y para modelar situaciones donde el compromiso conductual no es absoluto. Estos diseños complejos han enriquecido la comprensión de la elección al introducir elementos de flexibilidad y reversibilidad en la toma de decisiones.
Además, el procedimiento se ha adaptado para estudiar la elección social, donde las consecuencias terminales de una cadena no solo afectan al sujeto experimental, sino también a un compañero. Al manipular las tasas de reforzamiento para el compañero a través de una de las cadenas, los investigadores pueden medir la preferencia por opciones que benefician a otros, sentando las bases para el estudio experimental del altruismo y la cooperación en modelos animales, demostrando la versatilidad del diseño para explorar fenómenos conductuales complejos que van más allá de la simple maximización de la recompensa individual.
8. Debates y Críticas
A pesar de su aceptación generalizada, el procedimiento de cadenas concurrentes es objeto de debates, principalmente en torno a la interpretación de los datos de elección y la naturaleza precisa del control del estímulo. Una crítica fundamental se relaciona con el valor del reforzador condicionado. Algunos teóricos argumentan que la elección en el eslabón inicial está bajo el control inmediato del reforzador condicionado (la transición al eslabón terminal) y no directamente bajo el control del reforzador primario demorado. Si bien la fuerza del reforzador condicionado depende del reforzador primario, esta distinción puede complicar la interpretación directa de la impulsividad, sugiriendo que el organismo está igualando las tasas de reforzamiento condicionado en lugar de descontar el valor del reforzador primario.
Otro debate importante se centra en el papel de la información proporcionada por los estímulos discriminativos del eslabón terminal. Se ha sugerido que los organismos pueden estar eligiendo la opción que proporciona la mayor reducción de incertidumbre o la información más valiosa sobre la contingencia futura, en lugar de simplemente basar la elección en el valor hedonista descontado de la recompensa. Esta perspectiva, aunque no invalida los resultados, propone que la elección en cadenas concurrentes es multifacética, involucrando procesos cognitivos de búsqueda de información además de la simple maximización del reforzamiento.
Finalmente, existen preocupaciones metodológicas sobre la necesidad de mantener programas de reforzamiento idénticos y simétricos en el eslabón de elección (Concurrent VI VI). Cualquier desviación de la simetría en estos programas puede introducir sesgos en la preferencia que no son atribuibles a las contingencias terminales. Los analistas de la conducta han respondido a estas críticas refinando los diseños experimentales y utilizando modelos matemáticos más complejos que incorporan parámetros de sesgo y sensibilidad para aislar la influencia de las variables terminales con mayor precisión. El procedimiento, en esencia, sigue siendo la herramienta más robusta para el estudio de la elección intertemporal en el laboratorio.
Lecturas Adicionales
- Herrnstein, R. J. (1961). Relative response frequency as a function of relative reinforcement frequency.
- Skinner, B. F. (1938). The behavior of organisms: An experimental analysis.
- Ainslie, G. (1975). Specious reward: A behavioral theory of impulsiveness and impulse control.
- Rachlin, H., & Green, L. (1972). Commitment, choice and the matching law.
- Mazur, J. E. (2001). Concurrent-chains procedure.