regresión censurada – censored regression
- Regresión Censurada
- 1. Definición Central
- 2. Contexto del Problema de Censura
- 3. Modelos Clave de Regresión Censurada
- 4. Fundamentos Matemáticos y Estimación
- 5. Tipos de Censura y sus Implicaciones
- 6. Aplicaciones Empíricas
- 7. Desafíos y Limitaciones Metodológicas
- 8. Extensiones y Desarrollos Recientes
- Further Reading
Regresión Censurada
Primary Disciplinary Field(s): Econometría, Estadística Aplicada, Bioestadística
1. Definición Central
La regresión censurada es una clase fundamental de modelos estadísticos y econométricos diseñados para abordar situaciones donde la variable dependiente (o variable de respuesta) no se observa completamente para todas las unidades muestrales, sino que está “censurada” en uno o ambos extremos de su distribución. Este fenómeno ocurre cuando el valor verdadero de la variable subyacente (la variable latente) cae fuera de un rango observable predefinido. Es crucial distinguir la censura del simple problema de datos perdidos (missing data) o del problema de truncamiento muestral. Mientras que en los datos perdidos la observación se desconoce por completo, y en el truncamiento la unidad muestral ni siquiera es observada si la variable cae fuera del rango, en la regresión censurada, la unidad muestral siempre está presente, pero su valor exacto solo se conoce hasta cierto límite.
El objetivo principal de utilizar modelos de regresión censurada, como el Modelo Tobit, es obtener estimaciones consistentes y eficientes de los parámetros de regresión. Si se aplicara el método de Mínimos Cuadrados Ordinarios (MCO) a datos censurados, se producirían estimadores sesgados e inconsistentes. Este sesgo surge porque MCO utiliza los valores límite observados (por ejemplo, cero) como si fueran los valores reales para todas las observaciones censuradas, ignorando que estas observaciones representan en realidad valores latentes que podrían ser mucho menores o mayores que el límite registrado. Por lo tanto, el uso de técnicas especializadas que incorporen la información de la distribución de la variable latente es indispensable para realizar inferencias válidas.
La metodología de regresión censurada se basa en la suposición de que existe una variable latente, $y^*$, que sigue un modelo de regresión estándar lineal. La variable observada, $y$, es una función de $y^*$. Por ejemplo, en el caso de la censura inferior en cero (la forma más común), si $y^* > 0$, entonces $y = y^*$; pero si $y^* le 0$, entonces $y = 0$. El modelo debe estimar simultáneamente la probabilidad de que una observación sea censurada y la magnitud de la relación entre las covariables y la variable latente cuando esta no está censurada, utilizando métodos de máxima verosimilitud que integran la densidad de probabilidad para las observaciones no censuradas y la probabilidad acumulada para las observaciones censuradas.
2. Contexto del Problema de Censura
El problema de la censura es endémico en muchas disciplinas cuantitativas, especialmente en la economía y la salud, y surge por restricciones físicas, institucionales o de medición. Una restricción física común es la imposibilidad de observar valores negativos para variables inherentemente no negativas, como el gasto, la duración de una estancia hospitalaria o las horas de trabajo. Si un modelo predice un gasto negativo para un individuo, el valor observado en la realidad será cero. Este límite impuesto artificialmente es lo que define la censura.
Es fundamental establecer una clara distinción terminológica entre censura y truncamiento, ya que ambos implican información incompleta, pero requieren diferentes tratamientos estadísticos. En el truncamiento, la muestra de datos observados es incompleta porque las unidades muestrales cuyos valores latentes caen fuera del rango observable simplemente no son registradas. Un ejemplo clásico es un estudio de ingresos donde solo se encuestan a personas con ingresos superiores a un umbral determinado; las personas con ingresos inferiores no forman parte del conjunto de datos. En contraste, en la censura, la muestra es completa; todas las unidades muestrales están presentes, pero el valor exacto de la variable dependiente solo se registra hasta el punto límite para una porción de la muestra.
La comprensión precisa de cómo se genera la censura es vital, ya que el modelo de regresión debe reflejar fielmente este proceso de generación de datos. Si se confunde un problema de censura con uno de truncamiento o viceversa, el modelo estadístico aplicado será incorrecto, llevando a estimaciones de parámetros sesgadas y, por lo tanto, a conclusiones económicas o científicas erróneas. Por ejemplo, el sesgo de MCO en datos censurados tiende a subestimar la magnitud de los coeficientes (atenuación), ya que las observaciones censuradas “tiran” de la línea de regresión hacia el punto de censura, reduciendo la pendiente estimada.
3. Modelos Clave de Regresión Censurada
El modelo más representativo y fundacional en la regresión censurada es el Modelo Tobit, introducido por James Tobin en 1958 para analizar la demanda de bienes duraderos. Este modelo es formalmente conocido como el modelo de regresión con censura Tipo I (o punto límite fijo). El Modelo Tobit asume que la variable latente sigue una distribución normal y que la censura ocurre en un punto conocido (típicamente cero).
Además del Tobit estándar, existen varias extensiones y alternativas desarrolladas para manejar supuestos más flexibles o tipos específicos de datos. Una variación importante es el Modelo Tobit Tipo II, aunque este técnicamente aborda un problema de selección muestral (truncamiento con resultados observados), a menudo se agrupa contextualmente. Más relevantes para la censura pura son los modelos que relajan el supuesto de normalidad, como el Modelo Cragg (también conocido como Tobit de dos partes), que modela por separado la probabilidad de ser censurado (usando un Probit) y la magnitud de la variable no censurada (usando una regresión truncada), permitiendo que los efectos marginales de las covariables difieran entre estas dos etapas.
Otro desarrollo significativo es la Regresión de Intervalo (o Regresión Agrupada), que se aplica cuando la variable dependiente no está censurada en un punto fijo, sino que solo se conoce que cae dentro de un intervalo específico. Este enfoque es común en encuestas donde las respuestas de ingresos o edad se proporcionan en rangos (ej., “entre 20,000 y 30,000”). Aunque conceptualmente similar a la censura, requiere una formulación de máxima verosimilitud ligeramente diferente que evalúa la probabilidad de que la variable latente se encuentre dentro del intervalo observado, en lugar de ser exactamente igual al punto límite.
4. Fundamentos Matemáticos y Estimación
La estimación de los modelos de regresión censurada se realiza casi exclusivamente mediante el método de Máxima Verosimilitud (MV), ya que MCO es inconsistente. El método MV requiere especificar la función de verosimilitud conjunta para toda la muestra, que debe reflejar el proceso de generación de los datos censurados.
Para el caso del Modelo Tobit con censura inferior en cero, la función de verosimilitud ($L$) se construye en dos partes. Para las observaciones no censuradas ($y_i > 0$), la contribución a la verosimilitud es la función de densidad de probabilidad (pdf) de la variable latente (asumiendo normalidad). Para las observaciones censuradas ($y_i = 0$), la contribución es la probabilidad acumulada (cdf) de que la variable latente sea menor o igual al punto de censura (cero). Matemáticamente, esto implica que se maximiza el logaritmo de la función de verosimilitud, que es una suma de dos términos: un logaritmo de densidad (para los no censurados) y un logaritmo de probabilidad acumulada (para los censurados).
La complejidad del Modelo Tobit reside en la interpretación de los coeficientes estimados. El coeficiente $beta$ en el modelo Tobit no representa el efecto marginal de un cambio en la covariable sobre la variable observada ($y$), sino sobre la variable latente ($y^*$). Es necesario calcular los efectos marginales específicos, que son de tres tipos: 1) el efecto sobre la variable latente, 2) el efecto sobre la variable observada (que es una función de la probabilidad de no ser censurado y el valor esperado no censurado), y 3) el efecto sobre la probabilidad de no ser censurado. El cálculo de estos efectos marginales implica la evaluación de la función de densidad y la función de distribución normal en el punto de censura, lo cual requiere un manejo cuidadoso de las derivadas y las propiedades de la distribución asumida.
5. Tipos de Censura y sus Implicaciones
La manera en que se aplica el límite de observación define el tipo de censura y, por ende, el modelo estadístico apropiado. La censura puede ser clasificada según la ubicación del límite o según la naturaleza del límite mismo. La clasificación más común se refiere a la ubicación: censura izquierda (cuando la variable está limitada por abajo, como el cero), censura derecha (cuando la variable está limitada por arriba, como un límite máximo de prueba), y censura doble (cuando la variable está limitada tanto por arriba como por abajo).
En el ámbito de la bioestadística y el análisis de supervivencia, se utilizan términos ligeramente diferentes pero relacionados, como la censura Tipo I y Tipo II. La censura Tipo I ocurre cuando el experimento o período de observación termina en un tiempo predeterminado fijo, y cualquier evento (como la falla de un componente o la muerte de un paciente) que no haya ocurrido hasta ese momento se registra como censurado en ese tiempo fijo. Este tipo de censura es análogo al Tobit estándar donde el punto límite es fijo y exógeno.
Por otro lado, la censura Tipo II se da en experimentos donde la observación se detiene una vez que un número predefinido de eventos ha ocurrido. Por ejemplo, en una prueba de vida útil, el experimento puede detenerse tan pronto como 10 de 50 componentes fallen. En este caso, el tiempo de censura no es fijo, sino que es una variable aleatoria determinada por el orden de los eventos. Aunque la regresión censurada en econometría se centra principalmente en la censura Tipo I (límites fijos), la comprensión de estos diferentes mecanismos es esencial, ya que el modelo de máxima verosimilitud debe ser ajustado para reflejar con precisión el proceso subyacente que genera la censura.
6. Aplicaciones Empíricas
La regresión censurada tiene una vastísima aplicación en la investigación empírica donde las variables de resultado tienen límites naturales. En Economía Laboral, se utiliza frecuentemente para modelar las horas trabajadas o la participación laboral, donde las horas pueden estar censuradas en cero (no participación) o en límites máximos impuestos por la legislación laboral o las restricciones contractuales. También se aplica al estudio de salarios mínimos, donde los salarios observados no pueden caer por debajo del umbral legal.
En Economía de la Salud, el uso de la regresión censurada es casi obligatorio para el análisis de gastos médicos. El gasto de muchos individuos es cero, lo que implica una censura izquierda. Además, en ensayos clínicos o estudios de duración de enfermedades, la censura derecha es común cuando los pacientes abandonan el estudio o el estudio finaliza antes de que se observe el evento de interés. El modelo Tobit permite estimar el impacto de factores socioeconómicos en el gasto potencial (latente) de salud de una población, incluso si una parte significativa de la muestra no incurre en gastos.
Otras áreas de aplicación incluyen las Finanzas, donde se pueden modelar las decisiones de inversión (censuradas en cero si el inversor decide no invertir), y la Investigación de Mercados, al analizar la demanda de productos donde el consumo de muchos hogares puede ser cero. En todos estos casos, la aplicación de MCO sería incorrecta, produciendo inferencias sesgadas sobre la verdadera relación entre las características de los agentes y sus resultados latentes. La capacidad de la regresión censurada para manejar la masa de probabilidad en el punto de censura es lo que la convierte en la herramienta estadística correcta para estos datos.
7. Desafíos y Limitaciones Metodológicas
A pesar de su utilidad, el Modelo Tobit y sus variantes enfrentan importantes desafíos metodológicos, siendo el más crítico la estricta dependencia de los supuestos distribucionales, particularmente la Normalidad de los errores y la Homoscedasticidad. El Tobit estándar no solo asume que los errores son normales, sino que también asume que el proceso que determina la censura es el mismo proceso que determina la magnitud de la variable latente, lo que se conoce como el supuesto de ‘identidad de parámetros’.
Si el supuesto de normalidad se viola, los estimadores de Máxima Verosimilitud del Tobit dejan de ser consistentes. El sesgo resultante puede ser considerable, a diferencia de MCO, que es relativamente robusto a desviaciones leves de la normalidad. La heteroscedasticidad (varianza no constante de los errores) también invalida las propiedades de consistencia del Tobit. En la práctica empírica, las pruebas de especificación (como las pruebas de White o la prueba de especificación de Pagan y Vella) son esenciales para diagnosticar problemas de heteroscedasticidad o no normalidad en los residuos.
Para abordar estas limitaciones, se han desarrollado métodos alternativos. Si la heteroscedasticidad es el problema, se pueden utilizar extensiones del Tobit que modelan la varianza de los errores como una función de las covariables. Si la normalidad es violada severamente, los investigadores recurren a modelos semiparamétricos o no paramétricos de regresión censurada, que requieren supuestos distribucionales más débiles. Un ejemplo es el estimador de Powell de Mínimos Cuadrados Menores Absolutos Censurados (CLAD), que proporciona estimaciones consistentes bajo censura sin asumir normalidad, aunque con menor eficiencia que el Tobit si la normalidad se cumple.
8. Extensiones y Desarrollos Recientes
Los desarrollos recientes en el campo de la regresión censurada han buscado aumentar la robustez y la flexibilidad de los modelos. Una extensión importante es la integración de la regresión censurada con métodos de datos de panel, dando lugar a los Modelos Tobit de Efectos Fijos y Efectos Aleatorios. Estos modelos permiten controlar la heterogeneidad no observada entre individuos a lo largo del tiempo, lo cual es crucial en muchos contextos económicos. Sin embargo, la estimación del modelo Tobit con efectos fijos es particularmente compleja, ya que la presencia de efectos fijos generalmente introduce el problema del sesgo incidental de parámetros cuando el número de períodos de tiempo es pequeño.
Otra área de desarrollo es la aplicación de Métodos Bayesianos a la regresión censurada. Los enfoques bayesianos permiten incorporar información previa sobre los parámetros y son especialmente útiles cuando los datos son escasos o cuando los supuestos de máxima verosimilitud son difíciles de justificar. Estos métodos a menudo utilizan técnicas de Muestreo de Gibbs para simular las distribuciones posteriores de los parámetros, ofreciendo una visión más completa de la incertidumbre en las estimaciones.
Finalmente, la distinción entre censura y selección muestral ha llevado al desarrollo de modelos que manejan ambos fenómenos simultáneamente. Aunque el Modelo de Selección de Heckman aborda primariamente el truncamiento, los modelos generalizados de regresión censurada permiten la coexistencia de diferentes tipos de censura o la combinación de censura con otros procesos de generación de datos, proporcionando herramientas sofisticadas para el análisis empírico en situaciones complejas.