Modelo de Regresión Lineal Simple: Teoría, Supuestos, Estimación por MCO y Predicción
Introducción al Modelo de Regresión Lineal Simple
Origen econométrico del modelo: Un modelo econométrico se construye a partir de un modelo económico al cual se le añade un componente aleatorio, transformándolo en un modelo estadístico.
Parámetros poblacionales: Los parámetros del modelo son desconocidos, por lo que resulta indispensable estimarlos a través de datos empíricos.
Obtención de información primaria: Una forma de recolectar datos es mediante fuentes primarias, aplicando encuestas de manera directa a los individuos de la población objetivo para consultar las variables de interés.
Ejemplo clásico de aplicación (Hill et al., 2018): Estudio de una función de gasto en comida semanal. La teoría económica establece que el gasto en comida es explicado por el nivel de ingreso familiar.
Estructura del modelo económico:
Función genérica:
* Especificación lineal específica:
* : Gasto en comida semanal (variable dependiente).
* : Ingreso familiar semanal (variable independiente o explicativa).
* *Aclaración sobre la terminología de variables: * Las variables ubicadas al lado derecho de la ecuación se denominan explicativas. No todas las variables explicativas son estrictamente independientes, pero en el Modelo de Regresión Lineal Simple se asume que las explicativas son variables independientes (no correlacionadas con el término de error).
Función de densidad condicional:
Si se fija un nivel de ingreso específico (por ejemplo, semanales) y se selecciona aleatoriamente una familia de la población objetivo, su gasto en comida semanal es una variable aleatoria continua cuyo valor preciso se conoce únicamente tras realizar y responder la encuesta.
Aunque el nivel de ingreso se fije en , los valores de gasto reportados varían entre las distintas familias. Existe una función de densidad de la variable alrededor de su media condicional.
Gráficamente, se genera una función de densidad condicional de dado ( ), con media condicional .
El mismo procedimiento se aplica para otros niveles de ingreso, como , obteniendo la función de densidad condicional y su media condicional .
Conforme el ingreso se incrementa, también aumenta el Valor Esperado Condicional del gasto en comida, lo que confirma gráficamente una relación positiva entre las variables.
La función de regresión es en realidad una función de esperanza condicional .
Factores omisos y aleatoriedad: El gasto en comida de las familias no varía únicamente debido a cambios en el ingreso. Existen otros factores relevantes que inciden sobre el gasto:
Número de integrantes de la familia.
Preferencias alimenticias de la familia.
Edad de los integrantes.
Ubicación geográfica (zona urbana vs. zona rural).
Aleatoriedad intrínseca en el comportamiento humano.
Estructura del modelo econométrico: Para incorporar los factores no observados, se introduce el término residual o término aleatorio en la ecuación:
* y representan los parámetros poblacionales desconocidos que deben estimarse.
* El análisis de regresión es un método estadístico que utiliza datos empíricos para explorar las relaciones existentes entre variables. El modelo simple evalúa la relación entre una variable dependiente () y una explicativa ().
Supuestos del Modelo de Regresión Lineal Simple
1) Modelo lineal en los parámetros: Todos los pares de observaciones extraídos aleatoriamente de la población satisfacen la relación:
¿que es ei?
2) Exogeneidad Estricta: El valor esperado condicional del término de error dado es igual a cero:
* Implicación directa: No es posible utilizar la información de la variable explicativa para pronosticar el error
* Este supuesto implica que la media condicional de dado está determinada por la Función de Esperanza Condicional lineal (Función de Regresión Poblacional):
* Esto permite descomponer la variable dependiente como:
3) Homoscedasticidad: La varianza condicional del término de error es constante para todas las observaciones:
* Dado que es la componente aleatoria de , las propiedades estadísticas de una determinan las de la otra. Por lo tanto, el supuesto expresado en términos de es:
4) No correlación en los errores (Ausencia de Autocorrelación): La covarianza condicional entre dos términos de error distintos y es igual a cero:
* Donde 5) Variabilidad en la variable explicativa: Las observaciones de la variable explicativa deben tomar al menos dos valores distintos dentro de la muestra. La variable explicativa no puede ser una constante:
6) Normalidad de los errores: La distribución condicional de los errores se distribuye normalmente con media cero y varianza constante :
* Expresado en términos de la variable aleatoria :
Interpretación geométrica de los parámetros de la función de regresión poblacional:
es el intercepto de la función: representa el valor esperado condicional de cuando (). En el contexto del gasto en comida, representa el gasto esperado cuando el ingreso familiar es nulo.
es la pendiente de la función de regresión poblacional:
* representa el cambio en el valor esperado condicional de ante un incremento unitario en la variable explicativa .
Estimación del MRLS mediante Mínimos Cuadrados Ordinarios (MCO)
Levantamiento de información de campo (Puebla, 2015):
Población objetivo: Familias pertenecientes al municipio de Puebla.
Levantamiento de datos: Realizado en el año 2015 por estudiantes del curso de Econometría I de la Licenciatura en Economía de la BUAP.
Muestra obtenida: Un total de observaciones (pares de ingreso y gasto en comida semanal por familia).
Matriz de datos muestrales (pesos de 2015):
Observación 1: ,
Observación 2: ,
Observación 3: ,
Observación 4: ,
Observación 5: ,
Observación 6: ,
Observación 7: ,
Observación 8: ,
Observación 9: ,
Observación 10: ,
Observación 11: ,
Observación 12: ,
Observación 13: ,
Observación 14: ,
Observación 15: ,
Observación 16: ,
Observación 17: ,
Observación 18: ,
Observación 19: ,
Observación 20: ,
Observación 21: ,
Observación 22: ,
Observación 23: ,
Observación 24: ,
Observación 25: ,
Observación 26: ,
Observación 27: ,
Observación 28: ,
Observación 29: ,
Observación 30: ,
Resumen descriptivo de los datos ():
Gasto en comida (): Media , Desviación Estándar = , Mínimo = , Máximo = .
Ingreso familiar (): Media , Desviación Estándar = , Mínimo = , Máximo = .
Suma de diferencias al cuadrado del ingreso:
Suma de productos cruzados:
El Principio de Mínimos Cuadrados:
El método consiste en ajustar una línea recta que pase a través de los datos muestrales de forma que la suma del cuadrado de las distancias verticales de cada punto observado hacia la línea sea mínima.
Se utilizan los cuadrados de las distancias para impedir que las desviaciones positivas cancelen a las desviaciones negativas al sumar.
Línea ajustada estimadora:
* Residuales de Mínimos Cuadrados:
* Función objetivo a minimizar:
Condiciones de Primer Orden (CPO):
Derivada parcial respecto a (CPO-1):
* Derivada parcial respecto a (CPO-2):
Deducción matemática del estimador del intercepto ():
A partir de la CPO-1:
Deducción matemática del estimador de la pendiente ():
A partir de la CPO-2:
* Sustituyendo :
Distinción conceptual entre Estimador y Estimación:
Los estimadores (, ) son funciones algebraicas de variables aleatorias (fórmulas).
Las estimaciones son los valores numéricos concretos obtenidos al insertar las observaciones de una muestra en las expresiones algebraicas de los estimadores.
Cálculo empírico de las estimaciones para la función de gasto en comida:
Cálculo de la pendiente estimada:
* Cálculo del intercepto estimado:
* Expresión de la línea de regresión estimada:
(o reportada simplificadamente como )
Interpretación económica de los coeficientes estimados:
Pendiente estimada (): Es la derivada de respecto a (efecto marginal de sobre ). Por cada peso de aumento en el ingreso familiar semanal, se espera en promedio que el gasto semanal en comida aumente en (). Equivalentemente, por cada de incremento en el ingreso semanal, el gasto en comida se incrementa en promedio .
Intercepto estimado (): Indica que cuando el ingreso familiar semanal es de cero pesos, el gasto semanal en comida esperado es de .
Nota cautelar sobre el intercepto: Es preciso tener cuidado en la interpretación económica del intercepto, ya que en ocasiones puede carecer de sentido práctico o económico real; sin embargo, su inclusión en la función es obligatoria para garantizar la completitud del modelo matemático.
Propiedad de la línea de regresión ajustada: La recta estimada siempre pasa por el punto de medias muestrales de las observaciones .
Resultados Computacionales de la Regresión en STATA
Sintaxis empleada:
reg y xSalida completa reportada por STATA:
Número de observaciones =
Prueba F:
Prob > F =
Coeficiente de determinación () =
Ajustado =
Raíz del error cuadrático medio (Root MSE) =
Suma de Cuadrados (SS):
Modelo: , grados de libertad () = ,
Residual: , grados de libertad () = ,
Total: , grados de libertad () = ,
Tabla de Coeficientes:
Variable explicativa : Coeficiente = , Error Estándar = , valor , P > |t| = 0.027, Intervalo de Confianza al 95%:
Constante
_cons(): Coeficiente = , Error Estándar = , valor , P > |t| = 0.001, Intervalo de Confianza al 95%:
Análisis de Elasticidades en el Modelo Lineal
Definición general de elasticidad:
* Indica el cambio porcentual en la variable dependiente ante un incremento de un punto porcentual en la variable explicativa x$.\n* **Derivación de la elasticidad en la Función de Esperanza Condicional:**\n * Dada la función de regresión E(y_i|x_i) = \beta_1 + \beta_2 x_i\beta_2 = \frac{\Delta E(y_i|x_i)}{\Delta x_i}.\n * Sustituyendo en la fórmula de elasticidad, se obtiene la elasticidad puntual:\n\n \varepsilon_i = \beta_2 \frac{x_i}{E(y_i|x_i)}\n\n * Dado que el modelo es lineal, la elasticidad varía para cada par individual (x_i, y_i) a lo largo de la recta de regresión.\n* **Estimación de la elasticidad en cada punto:**\n\n \hat{\varepsilon}_i = b_2 \frac{x_i}{\hat{y}_i} = b_2 \frac{x_i}{b_1 + b_2 x_i}\n\n* **Elasticidad evaluada en las medias muestrales (Elasticidad en el promedio):**\n * Consiste en evaluar la elasticidad en el punto promedio de los datos (x_i = \bar{x}\hat{y}_i = \bar{y}:\n\n \hat{\varepsilon}_{\bar{x}} = b_2 \frac{\bar{x}}{\bar{y}}\n\n * Cálculo numérico para el ejemplo de gasto en comida:\n\n \hat{\varepsilon}_{\bar{x}} = 0.1397492 \times \frac{3641.667}{1489.31} = 0.3417\n\n * *Interpretación:* Un incremento del 1\%0.34\% en el promedio de los datos.\n* **Elasticidad Promedio (Average Elasticity):**\n * Se calcula promediando la elasticidad estimada individual de cada una de las observaciones de la muestra:\n\n \bar{\varepsilon} = \frac{1}{N} \sum_{i=1}^N \hat{\varepsilon}_i = 0.3166\n\n * *Diferenciación importante:* No se debe confundir la "elasticidad en el promedio de los datos" (0.34170.3166).\n\n# Predicción y Pronóstico Puntual\n\n* **Uso del modelo estimado:** El modelo de regresión lineal estimado permite predecir y realizar pronósticos del comportamiento de la variable dependiente yx$.
Ejemplo de cálculo de un pronóstico puntual:
Objetivo: Pronosticar el gasto en comida promedio para una familia cuyo ingreso semanal es de (pesos de 2015).
Sustitución en la función de regresión ajustada:
* *Interpretación:* En promedio, una familia que percibe un ingreso semanal de asignará un gasto estimado en comida de semanales (o ).
Referencias Bibliográficas
Greene, William. (2003). Econometric Analysis. Prentice Hall, 5th Edition.
Hill, C., Griffiths, W. and Lim, G. (2018). Principles of Econometrics. Wiley, 5th Edition.
Wooldridge, Jeffrey. (2003). Introductory Econometrics, A modern approach. Thomson Learning, 2nd Edition.