Modelo de Regresión Lineal Simple: Teoría, Supuestos, Estimación por MCO y Predicción

Introducción al Modelo de Regresión Lineal Simple

  • Origen econométrico del modelo: Un modelo econométrico se construye a partir de un modelo económico al cual se le añade un componente aleatorio, transformándolo en un modelo estadístico.

  • Parámetros poblacionales: Los parámetros del modelo son desconocidos, por lo que resulta indispensable estimarlos a través de datos empíricos.

  • Obtención de información primaria: Una forma de recolectar datos es mediante fuentes primarias, aplicando encuestas de manera directa a los individuos de la población objetivo para consultar las variables de interés.

  • Ejemplo clásico de aplicación (Hill et al., 2018): Estudio de una función de gasto en comida semanal. La teoría económica establece que el gasto en comida es explicado por el nivel de ingreso familiar.

  • Estructura del modelo económico:

    • Función genérica:

        yi=f(xi)y_i = f(x_i)

* Especificación lineal específica:

        yi=β1+β2xiy_i = \beta_1 + \beta_2 x_i

* yiy_i: Gasto en comida semanal (variable dependiente).
* xix_i: Ingreso familiar semanal (variable independiente o explicativa).
* *Aclaración sobre la terminología de variables: * Las variables ubicadas al lado derecho de la ecuación se denominan explicativas. No todas las variables explicativas son estrictamente independientes, pero en el Modelo de Regresión Lineal Simple se asume que las explicativas son variables independientes (no correlacionadas con el término de error).

  • Función de densidad condicional:

    • Si se fija un nivel de ingreso específico (por ejemplo, x=1000pesosx = 1000\,\text{pesos} semanales) y se selecciona aleatoriamente una familia de la población objetivo, su gasto en comida semanal yiy_i es una variable aleatoria continua cuyo valor preciso se conoce únicamente tras realizar y responder la encuesta.

    • Aunque el nivel de ingreso se fije en 1000pesos1000\,\text{pesos}, los valores de gasto reportados varían entre las distintas familias. Existe una función de densidad de la variable yy alrededor de su media condicional.

    • Gráficamente, se genera una función de densidad condicional de yy dado x=1000x = 1000 (f(yx=1000)f(y|x = 1000) ), con media condicional E(yx=1000)E(y|x = 1000).

    • El mismo procedimiento se aplica para otros niveles de ingreso, como x=2000pesosx = 2000\,\text{pesos}, obteniendo la función de densidad condicional f(yx=2000)f(y|x = 2000) y su media condicional E(yx=2000)E(y|x = 2000).

    • Conforme el ingreso xx se incrementa, también aumenta el Valor Esperado Condicional E(yx)E(y|x) del gasto en comida, lo que confirma gráficamente una relación positiva entre las variables.

    • La función de regresión es en realidad una función de esperanza condicional E(yx)E(y|x).

  • Factores omisos y aleatoriedad: El gasto en comida de las familias no varía únicamente debido a cambios en el ingreso. Existen otros factores relevantes que inciden sobre el gasto:

    1. Número de integrantes de la familia.

    2. Preferencias alimenticias de la familia.

    3. Edad de los integrantes.

    4. Ubicación geográfica (zona urbana vs. zona rural).

    5. Aleatoriedad intrínseca en el comportamiento humano.

  • Estructura del modelo econométrico: Para incorporar los factores no observados, se introduce el término residual o término aleatorio eie_i en la ecuación:


    yi=β1+β2xi+eiy_i = \beta_1 + \beta_2 x_i + e_i

*   β1\beta_1 y β2\beta_2 representan los parámetros poblacionales desconocidos que deben estimarse.
*   El análisis de regresión es un método estadístico que utiliza datos empíricos para explorar las relaciones existentes entre variables. El modelo simple evalúa la relación entre una variable dependiente (yy) y una explicativa (xx).

Supuestos del Modelo de Regresión Lineal Simple

  • 1) Modelo lineal en los parámetros: Todos los pares de observaciones (yi,xi)(y_i, x_i) extraídos aleatoriamente de la población satisfacen la relación:

    yi=β1+β2xi+eipara i=1,2,3,,Ny_i = \beta_1 + \beta_2 x_i + e_i \quad \text{para } i = 1, 2, 3, \dots, N

¿que es ei?


  • 2) Exogeneidad Estricta: El valor esperado condicional del término de error eie_i dado xix_i es igual a cero:

    E(eixi)=0iE(e_i|x_i) = 0 \quad \forall i

*   Implicación directa: No es posible utilizar la información de la variable explicativa xix_i para pronosticar el error eie_i
*   Este supuesto implica que la media condicional de yiy_i dado xix_i está determinada por la Función de Esperanza Condicional lineal (Función de Regresión Poblacional):

        E(yixi)=β1+β2xipara i=1,2,3,,NE(y_i|x_i) = \beta_1 + \beta_2 x_i \quad \text{para } i = 1, 2, 3, \dots, N

*   Esto permite descomponer la variable dependiente como:

        yi=E(yixi)+eipara i=1,2,3,,Ny_i = E(y_i|x_i) + e_i \quad \text{para } i = 1, 2, 3, \dots, N

  • 3) Homoscedasticidad: La varianza condicional del término de error es constante para todas las observaciones:

    Var(eixi)=σ2i\text{Var}(e_i|x_i) = \sigma^2 \quad \forall i

*   Dado que eie_i es la componente aleatoria de yiy_i, las propiedades estadísticas de una determinan las de la otra. Por lo tanto, el supuesto expresado en términos de yiy_i es:

        Var(yixi)=σ2i\text{Var}(y_i|x_i) = \sigma^2 \quad \forall i

  • 4) No correlación en los errores (Ausencia de Autocorrelación): La covarianza condicional entre dos términos de error distintos eie_i y eje_j es igual a cero:

    Cov(ei,ejx)=0ij\text{Cov}(e_i, e_j|x) = 0 \quad \forall i \neq j

*   Donde x=x1,x2,,xNx = x_1, x_2, \dots, x_N
  • 5) Variabilidad en la variable explicativa: Las observaciones de la variable explicativa xix_i deben tomar al menos dos valores distintos dentro de la muestra. La variable explicativa no puede ser una constante:

    xicx_i \neq c

  • 6) Normalidad de los errores: La distribución condicional de los errores se distribuye normalmente con media cero y varianza constante σ2\sigma^2:

    eixN(0,σ2)e_i|x \sim N(0, \sigma^2)

*   Expresado en términos de la variable aleatoria yiy_i:

        yixN(β1+β2xi,σ2)y_i|x \sim N(\beta_1 + \beta_2 x_i, \sigma^2)

  • Interpretación geométrica de los parámetros de la función de regresión poblacional:

    • β1\beta_1 es el intercepto de la función: representa el valor esperado condicional de yy cuando x=0x = 0 (E(yx=0)E(y|x = 0)). En el contexto del gasto en comida, representa el gasto esperado cuando el ingreso familiar es nulo.

    • β2\beta_2 es la pendiente de la función de regresión poblacional:

        β2=ΔE(yx)Δx=dE(yx)dx\beta_2 = \frac{\Delta E(y|x)}{\Delta x} = \frac{d E(y|x)}{dx}

*   β2\beta_2 representa el cambio en el valor esperado condicional de yy ante un incremento unitario en la variable explicativa xx.

Estimación del MRLS mediante Mínimos Cuadrados Ordinarios (MCO)

  • Levantamiento de información de campo (Puebla, 2015):

    • Población objetivo: Familias pertenecientes al municipio de Puebla.

    • Levantamiento de datos: Realizado en el año 2015 por estudiantes del curso de Econometría I de la Licenciatura en Economía de la BUAP.

    • Muestra obtenida: Un total de N=30N = 30 observaciones (pares de ingreso y gasto en comida semanal por familia).

  • Matriz de datos muestrales (pesos de 2015):

    • Observación 1: y1=1850y_1 = 1850, x1=2500x_1 = 2500

    • Observación 2: y2=945y_2 = 945, x2=1760x_2 = 1760

    • Observación 3: y3=1000y_3 = 1000, x3=5000x_3 = 5000

    • Observación 4: y4=850y_4 = 850, x4=6500x_4 = 6500

    • Observación 5: y5=1000y_5 = 1000, x5=4100x_5 = 4100

    • Observación 6: y6=950y_6 = 950, x6=2200x_6 = 2200

    • Observación 7: y7=1260y_7 = 1260, x7=1750x_7 = 1750

    • Observación 8: y8=1400y_8 = 1400, x8=2100x_8 = 2100

    • Observación 9: y9=1250y_9 = 1250, x9=2300x_9 = 2300

    • Observación 10: y10=1200y_{10} = 1200, x10=2500x_{10} = 2500

    • Observación 11: y11=1900y_{11} = 1900, x11=4500x_{11} = 4500

    • Observación 12: y12=2075y_{12} = 2075, x12=5000x_{12} = 5000

    • Observación 13: y13=1500y_{13} = 1500, x13=3875x_{13} = 3875

    • Observación 14: y14=1125y_{14} = 1125, x14=3250x_{14} = 3250

    • Observación 15: y15=457.5y_{15} = 457.5, x15=915x_{15} = 915

    • Observación 16: y16=700y_{16} = 700, x16=1500x_{16} = 1500

    • Observación 17: y17=2500y_{17} = 2500, x17=6250x_{17} = 6250

    • Observación 18: y18=1200y_{18} = 1200, x18=3500x_{18} = 3500

    • Observación 19: y19=1300y_{19} = 1300, x19=8000x_{19} = 8000

    • Observación 20: y20=1560y_{20} = 1560, x20=10000x_{20} = 10000

    • Observación 21: y21=643.55y_{21} = 643.55, x21=750x_{21} = 750

    • Observación 22: y22=2500y_{22} = 2500, x22=7000x_{22} = 7000

    • Observación 23: y23=1800y_{23} = 1800, x23=4000x_{23} = 4000

    • Observación 24: y24=700y_{24} = 700, x24=1500x_{24} = 1500

    • Observación 25: y25=1250y_{25} = 1250, x25=2000x_{25} = 2000

    • Observación 26: y26=3200y_{26} = 3200, x26=3500x_{26} = 3500

    • Observación 27: y27=3750y_{27} = 3750, x27=4500x_{27} = 4500

    • Observación 28: y28=713.25y_{28} = 713.25, x28=1000x_{28} = 1000

    • Observación 29: y29=2125y_{29} = 2125, x29=4500x_{29} = 4500

    • Observación 30: y30=1975y_{30} = 1975, x30=3000x_{30} = 3000

  • Resumen descriptivo de los datos (N=30N = 30):

    • Gasto en comida (yy): Media yˉ=1489.31pesos\bar{y} = 1489.31\,\text{pesos}, Desviación Estándar = 767.3866pesos767.3866\,\text{pesos}, Mínimo = 457.5pesos457.5\,\text{pesos}, Máximo = 3750pesos3750\,\text{pesos}.

    • Ingreso familiar (xx): Media xˉ=3641.667pesos\bar{x} = 3641.667\,\text{pesos}, Desviación Estándar = 2222.133pesos2222.133\,\text{pesos}, Mínimo = 750pesos750\,\text{pesos}, Máximo = 10000pesos10000\,\text{pesos}.

    • Suma de diferencias al cuadrado del ingreso: i=130(xixˉ)2=143198366.67\sum_{i=1}^{30} (x_i - \bar{x})^2 = 143198366.67

    • Suma de productos cruzados: i=130(xixˉ)yi=20011857.50\sum_{i=1}^{30} (x_i - \bar{x}) y_i = 20011857.50

  • El Principio de Mínimos Cuadrados:

    • El método consiste en ajustar una línea recta que pase a través de los datos muestrales de forma que la suma del cuadrado de las distancias verticales de cada punto observado hacia la línea sea mínima.

    • Se utilizan los cuadrados de las distancias para impedir que las desviaciones positivas cancelen a las desviaciones negativas al sumar.

    • Línea ajustada estimadora:

        y^i=b1+b2xi\hat{y}_i = b_1 + b_2 x_i

* Residuales de Mínimos Cuadrados:

        e^i=yiy^i=yib1b2xi\hat{e}_i = y_i - \hat{y}_i = y_i - b_1 - b_2 x_i

* Función objetivo a minimizar:

        minβ1,β2S(β1,β2)=i=1N(yiβ1β2xi)2\min_{\beta_1, \beta_2} S(\beta_1, \beta_2) = \sum_{i=1}^N (y_i - \beta_1 - \beta_2 x_i)^2

  • Condiciones de Primer Orden (CPO):

    • Derivada parcial respecto a β1\beta_1 (CPO-1):

        S(β1,β2)β1=2i=1N(yiβ1β2xi)=0\frac{\partial S(\beta_1, \beta_2)}{\partial \beta_1} = -2 \sum_{i=1}^N (y_i - \beta_1 - \beta_2 x_i) = 0

* Derivada parcial respecto a β2\beta_2 (CPO-2):

        S(β1,β2)β2=2i=1N(yiβ1β2xi)xi=0\frac{\partial S(\beta_1, \beta_2)}{\partial \beta_2} = -2 \sum_{i=1}^N (y_i - \beta_1 - \beta_2 x_i) x_i = 0

  • Deducción matemática del estimador del intercepto (b1b_1):

    • A partir de la CPO-1:

        i=1N(yib1b2xi)=0\sum_{i=1}^N (y_i - b_1 - b_2 x_i) = 0

        i=1NyiNb1b2i=1Nxi=0\sum_{i=1}^N y_i - N b_1 - b_2 \sum_{i=1}^N x_i = 0

        Nb1=i=1Nyib2i=1NxiN b_1 = \sum_{i=1}^N y_i - b_2 \sum_{i=1}^N x_i

        b1=yˉb2xˉb_1 = \bar{y} - b_2 \bar{x}

  • Deducción matemática del estimador de la pendiente (b2b_2):

    • A partir de la CPO-2:

        i=1N(yib1b2xi)xi=0\sum_{i=1}^N (y_i - b_1 - b_2 x_i) x_i = 0

        i=1Nxiyib1i=1Nxib2i=1Nxi2=0\sum_{i=1}^N x_i y_i - b_1 \sum_{i=1}^N x_i - b_2 \sum_{i=1}^N x_i^2 = 0

* Sustituyendo b1=yˉb2xˉb_1 = \bar{y} - b_2 \bar{x}:

        xiyi(yˉb2xˉ)Nxˉb2xi2=0\sum x_i y_i - (\bar{y} - b_2 \bar{x}) N \bar{x} - b_2 \sum x_i^2 = 0

        xiyiNxˉyˉ+Nb2xˉ2b2xi2=0\sum x_i y_i - N \bar{x} \bar{y} + N b_2 \bar{x}^2 - b_2 \sum x_i^2 = 0

        b2(xi2Nxˉ2)=xiyiNxˉyˉb_2 \left( \sum x_i^2 - N \bar{x}^2 \right) = \sum x_i y_i - N \bar{x} \bar{y}

        b2=xiyiNxˉyˉxi2Nxˉ2=(xixˉ)(yiyˉ)(xixˉ)2=(xixˉ)yi(xixˉ)2b_2 = \frac{\sum x_i y_i - N \bar{x} \bar{y}}{\sum x_i^2 - N \bar{x}^2} = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sum (x_i - \bar{x})^2} = \frac{\sum (x_i - \bar{x}) y_i}{\sum (x_i - \bar{x})^2}

  • Distinción conceptual entre Estimador y Estimación:

    • Los estimadores (b1b_1, b2b_2) son funciones algebraicas de variables aleatorias (fórmulas).

    • Las estimaciones son los valores numéricos concretos obtenidos al insertar las observaciones de una muestra en las expresiones algebraicas de los estimadores.

  • Cálculo empírico de las estimaciones para la función de gasto en comida:

    • Cálculo de la pendiente estimada:

        b2=20011857.50143198366.67=0.1397492b_2 = \frac{20011857.50}{143198366.67} = 0.1397492

* Cálculo del intercepto estimado:

        b1=yˉb2xˉ=1489.3100(0.1397492×3641.6667)=980.389989980.39b_1 = \bar{y} - b_2 \bar{x} = 1489.3100 - (0.1397492 \times 3641.6667) = 980.389989 \approx 980.39

* Expresión de la línea de regresión estimada:

        y^i=980.39+0.1397492xi\hat{y}_i = 980.39 + 0.1397492 x_i

        (o reportada simplificadamente como y^=980.39+0.1397xi\hat{y} = 980.39 + 0.1397 x_i)

  • Interpretación económica de los coeficientes estimados:

    • Pendiente estimada (b2=0.1397492b_2 = 0.1397492): Es la derivada de yy respecto a xx (efecto marginal de xx sobre yy). Por cada peso de aumento en el ingreso familiar semanal, se espera en promedio que el gasto semanal en comida aumente en 0.1397pesos0.1397\,\text{pesos} (13.97centavos13.97\,\text{centavos}). Equivalentemente, por cada 100pesos100\,\text{pesos} de incremento en el ingreso semanal, el gasto en comida se incrementa en promedio 13.97pesos13.97\,\text{pesos}.

    • Intercepto estimado (b1=980.39b_1 = 980.39): Indica que cuando el ingreso familiar semanal es de cero pesos, el gasto semanal en comida esperado es de 980.39pesos980.39\,\text{pesos}.

    • Nota cautelar sobre el intercepto: Es preciso tener cuidado en la interpretación económica del intercepto, ya que en ocasiones puede carecer de sentido práctico o económico real; sin embargo, su inclusión en la función es obligatoria para garantizar la completitud del modelo matemático.

    • Propiedad de la línea de regresión ajustada: La recta estimada siempre pasa por el punto de medias muestrales de las observaciones (xˉ,yˉ)=(3641.67,1489.31)(\bar{x}, \bar{y}) = (3641.67, 1489.31).

Resultados Computacionales de la Regresión en STATA

  • Sintaxis empleada: reg y x

  • Salida completa reportada por STATA:

    • Número de observaciones = 3030

    • Prueba F: F(1,28)=5.48F(1, 28) = 5.48

    • Prob > F = 0.02650.0265

    • Coeficiente de determinación (R2R^2) = 0.16380.1638

    • R2R^2 Ajustado = 0.13390.1339

    • Raíz del error cuadrático medio (Root MSE) = 714.17714.17

    • Suma de Cuadrados (SS):

      • Modelo: SS=2796641.13SS = 2796641.13, grados de libertad (dfdf) = 11, MS=2796641.13MS = 2796641.13

      • Residual: SS=14280944SS = 14280944, grados de libertad (dfdf) = 2828, MS=510033.715MS = 510033.715

      • Total: SS=17077585.2SS = 17077585.2, grados de libertad (dfdf) = 2929, MS=588882.247MS = 588882.247

    • Tabla de Coeficientes:

      • Variable explicativa xx: Coeficiente = 0.13974920.1397492, Error Estándar = 0.05968020.0596802, valor t=2.34t = 2.34, P > |t| = 0.027, Intervalo de Confianza al 95%: [0.0174998,0.2619986][0.0174998, 0.2619986]

      • Constante _cons (b1b_1): Coeficiente = 980.39980.39, Error Estándar = 253.4479253.4479, valor t=3.87t = 3.87, P > |t| = 0.001, Intervalo de Confianza al 95%: [461.2255,1499.554][461.2255, 1499.554]

Análisis de Elasticidades en el Modelo Lineal

  • Definición general de elasticidad:

    ε=%Δy%Δx=Δy/yΔx/x=ΔyΔxxy\varepsilon = \frac{\%\Delta y}{\%\Delta x} = \frac{\Delta y / y}{\Delta x / x} = \frac{\Delta y}{\Delta x} \frac{x}{y}

*   Indica el cambio porcentual en la variable dependiente yy ante un incremento de un punto porcentual en la variable explicativa x$.\n*   **Derivación de la elasticidad en la Función de Esperanza Condicional:**\n    *   Dada la función de regresión E(y_i|x_i) = \beta_1 + \beta_2 x_i,latasadecambiomarginalesconstante:, la tasa de cambio marginal es constante:\beta_2 = \frac{\Delta E(y_i|x_i)}{\Delta x_i}.\n    *   Sustituyendo en la fórmula de elasticidad, se obtiene la elasticidad puntual:\n\n        \varepsilon_i = \beta_2 \frac{x_i}{E(y_i|x_i)}\n\n    *   Dado que el modelo es lineal, la elasticidad varía para cada par individual (x_i, y_i) a lo largo de la recta de regresión.\n*   **Estimación de la elasticidad en cada punto:**\n\n    \hat{\varepsilon}_i = b_2 \frac{x_i}{\hat{y}_i} = b_2 \frac{x_i}{b_1 + b_2 x_i}\n\n*   **Elasticidad evaluada en las medias muestrales (Elasticidad en el promedio):**\n    *   Consiste en evaluar la elasticidad en el punto promedio de los datos (x_i = \bar{x}),locualimplicaqueelvalorajustadoes), lo cual implica que el valor ajustado es\hat{y}_i = \bar{y}:\n\n        \hat{\varepsilon}_{\bar{x}} = b_2 \frac{\bar{x}}{\bar{y}}\n\n    *   Cálculo numérico para el ejemplo de gasto en comida:\n\n        \hat{\varepsilon}_{\bar{x}} = 0.1397492 \times \frac{3641.667}{1489.31} = 0.3417\n\n    *   *Interpretación:* Un incremento del 1\%enelingresofamiliarincrementaraˊelgastosemanalencomidaenunen el ingreso familiar incrementará el gasto semanal en comida en un0.34\% en el promedio de los datos.\n*   **Elasticidad Promedio (Average Elasticity):**\n    *   Se calcula promediando la elasticidad estimada individual de cada una de las observaciones de la muestra:\n\n        \bar{\varepsilon} = \frac{1}{N} \sum_{i=1}^N \hat{\varepsilon}_i = 0.3166\n\n    *   *Diferenciación importante:* No se debe confundir la "elasticidad en el promedio de los datos" (0.3417)conla"elasticidadpromedio"() con la "elasticidad promedio" (0.3166).\n\n# Predicción y Pronóstico Puntual\n\n*   **Uso del modelo estimado:** El modelo de regresión lineal estimado permite predecir y realizar pronósticos del comportamiento de la variable dependiente yparadeterminadosvaloreshipoteˊticosoespecıˊficosdelavariableexplicativapara determinados valores hipotéticos o específicos de la variable explicativax$.
  • Ejemplo de cálculo de un pronóstico puntual:

    • Objetivo: Pronosticar el gasto en comida promedio para una familia cuyo ingreso semanal es de 2500pesos2500\,\text{pesos} (pesos de 2015).

    • Sustitución en la función de regresión ajustada:

        y^i=980.39+0.1397492×2500=1329.763\hat{y}_i = 980.39 + 0.1397492 \times 2500 = 1329.763

*   *Interpretación:* En promedio, una familia que percibe un ingreso semanal de 2500pesos2500\,\text{pesos} asignará un gasto estimado en comida de 1330pesos1330\,\text{pesos} semanales (o 1329.763pesos1329.763\,\text{pesos}).

Referencias Bibliográficas

  • Greene, William. (2003). Econometric Analysis. Prentice Hall, 5th Edition.

  • Hill, C., Griffiths, W. and Lim, G. (2018). Principles of Econometrics. Wiley, 5th Edition.

  • Wooldridge, Jeffrey. (2003). Introductory Econometrics, A modern approach. Thomson Learning, 2nd Edition.