Introducción al modelamiento: Regresión Lineal

EST145-Estadística

Enver Gerald Tarazona Vargas

Pontificia Universidad Católica del Perú (PUCP), Perú

Motivación

  • En un estudio de automóviles, se desea estudiar la relación entre la eficiencia en consumo de combustible medida en millas por galón (mpg) y la potencia del motor en caballos de fuerza (hp).
  • Consideremos los datos disponibles en R en el objeto mtcars.
                   mpg cyl disp  hp drat    wt  qsec vs am gear carb
Mazda RX4         21.0   6  160 110 3.90 2.620 16.46  0  1    4    4
Mazda RX4 Wag     21.0   6  160 110 3.90 2.875 17.02  0  1    4    4
Datsun 710        22.8   4  108  93 3.85 2.320 18.61  1  1    4    1
Hornet 4 Drive    21.4   6  258 110 3.08 3.215 19.44  1  0    3    1
Hornet Sportabout 18.7   8  360 175 3.15 3.440 17.02  0  0    3    2
Valiant           18.1   6  225 105 2.76 3.460 20.22  1  0    3    1

Motivación

[1] -0.7761684
  • Observamos que existe evidencia de una asociación lineal negativa, es decir, que si la potencia del motor aumenta se observa que la eficiencia tiende a disminuir.
  • Podemos medir esta tendencia mediante el coeficiente de correlación muestral de Pearson (\(\hat{\rho}_{XY}=-0.776\)), que en este caso indica que se tiene una fuerte asociación negativa.

Motivación

  • Correlación lineal de Pearson (estimador):

\[ \hat{\rho}_{xy}=\frac{S_{xy}}{S_xS_y} \]

  • donde

\[ S_{xy}=\frac{\sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})}{n-1},\qquad S_x^2=\frac{\sum_{i=1}^{n}(x_i-\bar{x})^2}{n-1} \qquad\text{y}\qquad S_y^2=\frac{\sum_{i=1}^{n}(y_i-\bar{y})^2}{n-1} \]

  • son estimadores de la covarianza, varianza de \(X\) y varianza de \(Y\) respectivamente.

Modelo de regresión lineal simple

  • En el proceso de modelar se han definido dos tipos de variables
    • Variable respuesta: denotada por \(Y\)
    • Covariable: denotada por \(X\)
  • En nuestro ejemplo, deseamos ver si la potencia del motor explica la eficiencia en consumo de combustible de un automóvil, por lo tanto,
    • Variable respuesta: eficiencia (\(Y\))
    • Covariable: potencia del motor (\(X\))

Modelo de regresión lineal simple

  • El modelo de regresión lineal simple es dado por

\[ Y=\beta_0+\beta_1X+\epsilon \]

  • donde \(\epsilon\) es un error aleatorio que usualmente se asume satisface los siguientes supuestos clásicos:

\[ \begin{aligned} (i)\quad &E(\epsilon)=0\\ (ii)\quad &Var(\epsilon)=\sigma^2 \quad \text{(varianza constante)}\\ (iii)\quad &cor(\epsilon_i,\epsilon_j)=0,\ \forall i\neq j \quad \text{(errores no correlacionados)} \end{aligned} \]

  • El modelo anterior lo podríamos también escribir mediante la recta de regresión:

\[ y_x=E(Y\mid X=x)=\beta_0+\beta_1x \qquad\text{y}\qquad Var(Y\mid X=x)=\sigma^2 \]

Modelo de regresión lineal simple

  • Coeficientes de regresión: \(\beta_0,\beta_1\)
  • Intercepto: \(\beta_0\)

\[ y_0=E(Y\mid X=0)=\beta_0 \]

  • Interpretación: El valor esperado de \(Y\) cuando \(X=0\) (no siempre tiene una interpretación práctica).
  • Pendiente: \(\beta_1\)

\[ y_{x+1}-y_x=E(Y\mid X=x+1)-E(Y\mid X=x)=\beta_1 \]

  • Interpretación: Si \(X\) aumenta en una unidad se espera que \(Y\) aumente (o disminuya) en \(\beta_1\) unidades.
  • En adelante asumiremos, que \(X\) es fijo o no aleatorio, por lo cual lo denotaremos en minúsculas. En este caso la esperanza condicional arriba es un esperado simple.

Estimación

  • Dada una m.a. de \(Y\) para \(n\) valores dados de \(x\): \((x_1,Y_1),\ldots,(x_n,Y_n)\), el modelo anterior nos dice que:

\[ Y_i=\beta_0+\beta_1x_i+\epsilon_i,\qquad i=1,\ldots,n \]

  • Se define la suma de cuadrados de los errores como:

\[ SCE(\beta_0,\beta_1)=\sum_{i=1}^{n}\epsilon_i^2 =\sum_{i=1}^{n}(Y_i-\beta_0-\beta_1x_i)^2. \]

  • Estimador de mínimos cuadrados ordinarios: Hallar \(\beta_0\) y \(\beta_1\) que minimicen la suma de cuadrados de los errores. Solución:

\[ \hat{\beta}_1=\hat{\rho}_{xY}\frac{S_Y}{S_x} \qquad \hat{\beta}_0=\bar{Y}-\hat{\beta}_1\bar{x}, \]

donde \(S_x=\sqrt{S_x^2}\) y \(S_Y=\sqrt{S_Y^2}\).

Estimación


Call:
lm(formula = mpg ~ hp, data = mtcars)

Coefficients:
(Intercept)           hp  
   30.09886     -0.06823  
  • Recta estimada:

\[ \hat y_x=\hat\beta_0+\hat\beta_1x =30.09886-0.06823x \]

  • Intercepto (\(\hat\beta_0\)): no tiene interpretación practica en este caso.
  • Pendiente (\(\hat\beta_1\)): Si la potencia del motor aumenta en un caballo de fuerza se espera que la eficiencia en consumo de combustible disminuya en 0.06823 millas por galón.

Estimación

  • Valores observados: \(y_i\), \(i=1,2,\ldots,n\)
  • Valores ajustados

\[ \hat y_i=\hat\beta_0+\hat\beta_1x_i,\qquad i=1,2,\ldots,n \]

  • Residuales

\[ \hat\epsilon_i=y_i-\hat y_i,\qquad i=1,2,\ldots,n \]

  • Los residuales serán utilizados para verificar si se cumplen los supuestos del modelo.

Propiedades

  • La suma de los residuales es igual a cero.

\[ \sum_{i=1}^{n}\hat\epsilon_i=\sum_{i=1}^{n}(y_i-\hat y_i)=0 \]

  • La suma de los valores observados es igual a la suma de los valores ajustados.

\[ \sum_{i=1}^{n}y_i=\sum_{i=1}^{n}\hat y_i \]

  • La recta estimada pasa por el punto \((\bar{x},\bar{y})\), es decir,

\[ \bar y=\hat\beta_0+\hat\beta_1\bar x \]

El coeficiente de determinación

  • Se tiene la siguiente propiedad de descomposición de la variablidad de la variable respuesta:

\[ \underbrace{\sum_{i=1}^{n}(Y_i-\bar Y)^2}_{SCT} = \underbrace{\sum_{i=1}^{n}(\hat Y_i-\bar Y)^2}_{SCR} + \underbrace{\sum_{i=1}^{n}(Y_i-\hat Y_i)^2}_{SCE} \]

  • SCT: suma de cuadrados total, mide la variabilidad total de los valores observados.
  • SCR: suma de cuadrados de la regresión, mide la variabilidad de los valores ajustados.
  • SCR: suma de cuadrados de los residuales.

El coeficiente de determinación

  • A partir de la última propiedad, se propone como medida de bondad de ajuste, al coeficiente de determinación observado, denotado por \(R^2\),

\[ R^2=1-\frac{SCE}{SCT} =1-\frac{\sum_{i=1}^{n}(Y_i-\hat Y_i)^2} {\sum_{i=1}^{n}(Y_i-\bar Y)^2} \]

  • Interpretación: El \(100R^2\%\) de la variabilidad de \(Y\) es explicada por el modelo lineal con \(x\).

Ejemplo

[1] 0.6024373

El modelo con covariable la potencia del motor explica el 60.24% de la variabilidad de la eficiencia.

Ejemplo

Considerando los datos mtcars de R, estime un modelo para estimar la eficiencia en consumo de combustible (mpg) en función del peso del automóvil en miles libras (wt).

a) Interprete los coeficientes.

b) Estime la eficiencia en consumo de combustible de un automóvil con un peso de 3 mil libras.

c) Compare este modelo con el modelo anterior con covariable la potencia del motor ¿Qúe modelo es mejor para estimar la eficiencia?

Covariable categórica

  • Consideremos ahora como covariable al tipo de caja de cambio de cambio que posee un automóvil (am).
  • Esta variable es categórica, cuenta con dos niveles: automática o mecánica.
  • Para representar este tipo de variables se utiliza una variable indicadora,

\[ X=\begin{cases} 1, & \text{si la caja de cambio es mecánica}\\ 0, & \text{si la caja de cambio es automática} \end{cases} \]

Covariable categórica

  • Consideremos un modelo de regresión con esta covariable

\[ Y=\beta_0+\beta_1X \]

  • Intercepto: \(\beta_0\)

\[ y_0=E(Y\mid X=0)=\beta_0 \]

  • Interpretación: Es el valor esperado de eficiencia para un automóvil con caja de cambio automática.
  • Pendiente: \(\beta_1\)

\[ y_1-y_0=E(Y\mid X=1)-E(Y\mid X=0)=\beta_1 \]

  • Interpretación: Se espera que la eficiencia de un automóvil con caja de cambio mecánica tenga una eficiencia mayor (o menor) en \(\beta_1\) unidades a la de un automóvil con caja de cambio automática.

Covariable categórica


Call:
lm(formula = mpg ~ am, data = mtcars)

Coefficients:
(Intercept)           am  
     17.147        7.245  
[1] 0.3597989
  • Se espera que la eficiencia de un automóvil con caja de cambio automática sea de 17.1 millas por galón.
  • Se espera que un automóvil con caja de cambio mecánica tenga una eficiencia mayor en 7.2 millas por galón a la eficiencia de un automóvil con caja automática.
  • El modelo con covariable tipo de caja de cambio explica el 35.98% de la variabilidad de la eficiencia.

Estimación de \(\sigma^2\)

  • También podemos estimar la varianza de los errores, \(\sigma^2\), en este caso el estimador es dado por

\[ \hat\sigma^2=\frac{SCE}{n-2} =\frac{\sum_{i=1}^{n}(Y_i-\hat Y_i)^2}{n-2} \]

  • Este, que se obtiene por máxima verosimilitud, es un estimador insesgado de la varianza en caso de normalidad.

Modelo de regresión lineal múltiple

  • El modelo de regresión lineal múltiple es dado por

\[ Y=\beta_0+\beta_1X_1+\beta_2X_2+\ldots+\beta_kX_k+\epsilon \tag{1} \]

  • donde \(\epsilon\) es un error aleatorio que usualmente se asume los supuestos clásicos.
  • El modelo se puede tambien escribir como

\[ y_{x_1x_2,\ldots,x_k} =E(Y\mid X_1=x_1,\ldots,X_k=x_k) =\beta_0+\beta_1x_1+\ldots+\beta_kx_k \tag{2} \]

\[ Var(Y\mid X_1=x_1,\ldots,X_k=x_k)=\sigma^2. \]

  • donde podríamos omitir la condicional, si es que asumimos que las covariables son fijas (no aleatorias).

El modelo de regresión lineal múltiple

Consideremos, para ilustrar, un modelo con \(k=2\) covariables. Entonces

  • Intercepto: \(\beta_0\)

\[ y_{00}=E(Y\mid X_1=0,X_2=0)=\beta_0 \]

  • Interpretación: Es el valor esperado de \(Y\) cuando \(X_1=0\) y \(X_2=0\) (no siempre tiene una interpretación práctica).
  • Coeficiente \(\beta_1\)

\[ y_{x+1,z}-y_{x,z} =E(Y\mid X_1=x+1,X_2=z)-E(Y\mid X_1=x,X_2=z)=\beta_1 \]

  • Interpretación: Se espera que \(Y\) aumente (o disminuya) en \(\beta_1\) unidades cuando \(X_1\) aumenta en una unidad y \(X_2\) permanece constante.
  • Coeficiente \(\beta_2\)

\[ y_{x,z+1}-y_{x,z} =E(Y\mid X_1=x,X_2=z+1)-E(Y\mid X_1=x,X_2=z)=\beta_2 \]

  • Intrepretación: Se espera que \(Y\) aumente (o disminuya) en \(\beta_2\) unidades cuando \(X_2\) aumenta en una unidad y \(X_1\) permanece constante.

Estimación

  • En adelante asumiremos que las covariables o variable independientes serán fijas (no aleatorias). Así, dada una m.a de \(Y\) para valores de las variables independientes \((x_{11},\ldots,x_{1k},Y_1),\ldots,(x_{n1},\ldots,x_{nk},Y_n)\), estos deben seguir el modelo:

\[ Y_i=\beta_0+\beta_1x_{i1}+\beta_1x_{i2}+\ldots+\beta_kx_{ik}+\epsilon_i, \qquad i=1,\ldots,n \tag{3} \]

  • Suma de cuadrados de los errores:

\[ SCE(\beta_0,\beta_1,\ldots,\beta_p) =\sum_{i=1}^{n}\epsilon_i^2 =\sum_{i=1}^{n}(Y_i-\beta_0-\beta_1x_{i1}-\ldots-\beta_kx_{ik})^2. \]

  • Estimador de minimos cuadrados ordinarios: Hallar \(\beta_0,\beta_1,\ldots,\beta_k\) que minimicen la suma de cuadrados de los errores.

Estimación

Podemos reescribir el modelo (3) de manera matricial como:

\[ \mathbf{Y}=\mathbf{X}\boldsymbol{\beta}+\boldsymbol{\epsilon} \]

donde

\[ \mathbf{Y}= \begin{bmatrix} Y_1\\Y_2\\\vdots\\Y_n \end{bmatrix},\qquad \mathbf{X}= \begin{bmatrix} 1 & x_{11} & x_{12} & \cdots & x_{1k}\\ 1 & x_{21} & x_{22} & \cdots & x_{2k}\\ \vdots & \vdots & \vdots & \ddots & \vdots\\ 1 & x_{n1} & x_{n2} & \cdots & x_{nk} \end{bmatrix}, \]

\[ \boldsymbol{\beta}= \begin{bmatrix} \beta_0\\\beta_1\\\vdots\\\beta_k \end{bmatrix},\qquad \boldsymbol{\epsilon}= \begin{bmatrix} \epsilon_1\\\epsilon_2\\\vdots\\\epsilon_n \end{bmatrix}. \]

Estimación

  • Suma de cuadrados de los errores:

\[ SCE(\boldsymbol{\beta}) =\sum_{i=1}^{n}\epsilon_i^2 =\boldsymbol{\epsilon}^{\top}\boldsymbol{\epsilon} =(\mathbf{Y}-\mathbf{X}\boldsymbol{\beta})^{\top}(\mathbf{Y}-\mathbf{X}\boldsymbol{\beta}) \]

  • Estimador de mínimos cuadrados ordinarios

\[ \hat{\boldsymbol{\beta}}=(\mathbf{X}^{\top}\mathbf{X})^{-1}\mathbf{X}^{\top}\mathbf{Y} \]

Estimación


Call:
lm(formula = mpg ~ hp + wt, data = mtcars)

Coefficients:
(Intercept)           hp           wt  
   37.22727     -0.03177     -3.87783  
  • Modelo estimado:

\[ \hat y_{x_1x_2}=\hat\beta_0+\hat\beta_1x_1+\hat\beta_2x_2 =37.2-0.03x_1-3.9x_2 \]

  • Intercepto (\(\hat\beta_0\)): No tiene interpretación practica en este caso.
  • Coeficiente (\(\hat\beta_1\)): Se estima que la eficiencia media en consumo de combustible disminuya en 0.03 millas por galón cuando la potencia del motor aumenta en un caballo de fuerza y el peso se mantiene constante.
  • Coeficiente (\(\hat\beta_2\)): Se estima que la eficiencia media en consumo de combustible disminuya en 3.9 millas por galón cuando el peso aumenta en mil libras y la potencia del motor se mantiene constante.

Estimación

  • Valores observados: \(y_i\), \(i=1,2,\ldots,n\)
  • Valores ajustados

\[ \hat y_i=\hat\beta_0+\hat\beta_1x_{i1}+\ldots+\hat\beta_kx_{ik}, \qquad i=1,2,\ldots,n \]

  • Residuales

\[ \hat\epsilon_i=y_i-\hat y_i, \qquad i=1,2,\ldots,n \]

  • Los residuales serán utilizados para verificar si se cumplen los supuestos del modelo.

Medidas para comparación de modelos

  • Coeficiente de determinación: \(R^2\)
  • Coeficiente de determinación ajustado: \(R^2_{adj}\)
  • Criterio de información de Akaike: AIC

Coeficiente de determinación

  • Coeficiente de determinación, denotado por \(R^2\),

\[ R^2=1-\frac{SCE}{SCT} =1-\frac{\sum_{i=1}^{n}(Y_i-\hat Y_i)^2} {\sum_{i=1}^{n}(Y_i-\bar Y)^2} \]

  • Interpretación: El \(100R^2\%\) de la variabilidad de \(y\) es explicada por el modelo.
  • Esta medida observada siempre disminuye a medida que se aumentan variables al modelo, aunque estas sean irrelevantes. Por esta razón, no se suele usar para comparación de modelos y se prefieren otras como medidas como el \(R^2\) ajustado o el AIC.

Coeficiente de determinación ajustado

  • Coeficiente de determinación ajustado, denotado por \(R^2_{adj}\),

\[ R^2_{adj} =1-\frac{SCE/(n-p)}{SCT/(n-1)} =1-(1-R^2)\frac{n-1}{n-p} \]

donde \(p=k+1\), es el número de coeficientes de regresión del modelo, incluyendo el intercepto.

  • Interpretación: El \(100R^2_{adj}\%\) de la variabilidad de \(y\) es explicada por el modelo.
  • El \(R^2_{adj}\) solamente aumentará si se adiciona una covariable que explique la respuesta e incluso disminuirá en caso se adicione una variable irrelavante.

Criterio de información de Akaike

  • Criterio de información de Akaike: AIC

\[ AIC=-2\hat\ell+2r \]

donde \(\hat\ell\) es la log-verosimilitud estimada y \(r\) es el número de parámetros.

  • Considerando un modelo normal (\(\epsilon_i\sim N(0,\sigma^2)\)), tendríamos \(p+1\) parámetros y se obtiene

\[ AIC=n\log(2\pi)+n+n\log\left(\frac{SCE}{n-p}\right)+2(p+1) \]

  • A menor valor del AIC se obtiene un mejor ajuste.

Ejemplo

[1] 0.8267855
[1] 156.6523
  • El modelo con covariables la potencia del motor y el peso del vehículo explica el 82.7% de la variabilidad de la eficiencia.
  • El AIC no tiene una interpretación directa, se utiliza para comparar entre modelos.

Ejemplo

Considerando los datos mtcars de R, estime un modelo para estimar la eficiencia en consumo de combustible (mpg) en función del peso del automóvil en miles libras (wt) y del tipo de motor (am).

a) Interprete los coeficientes.

b) Estime la eficiencia en consumo de combustible de un automóvil con un peso de 3 mil libras y con motor mecánico.

c) Compare este modelo con el modelo anterior ¿Qúe modelo es mejor para estimar la eficiencia?

Covariable categórica con más de de dos niveles

  • Consideremos ahora como covariable al número de cilindros del motor (cyl).
  • Esta variable se considera como categórica, cuenta con tres niveles: motor con 4 cilindros (cyl=4), motor con 6 cilindros (cyl=6) y motor con 8 cilindros (cyl=8).
  • Para representar una variable cualitativa con dos categorías usamos una variable auxiliar. En el caso de tener \(s\) categorías requerimos de \(s-1\) variables auxiliares.
  • Una de las categorías será denominanada de referencia y se definiran las variables auxiliares como indicadores de las otras categorías.

Variable auxiliares

  • En el ejemplo, tenemos 3 categorías, por lo tanto, se requieren 2 variables auxiliares.
  • Consideremos como categoría de referencia tener un motor de 4 cilindros (cyl=4), por lo tanto, las variables auxiliares se definen como

\[ x_1=\begin{cases} 1, & \text{si el motor es de 6 cilindros}\\ 0, & \text{si de otro modo} \end{cases} \]

\[ x_2=\begin{cases} 1, & \text{si el motor es de 8 cilindros}\\ 0, & \text{si de otro modo} \end{cases} \]

Covariable categórica

  • Consideremos un modelo de regresión con esta covariable

\[ y_{x_1x_2}=\beta_0+\beta_1x_1+\beta_2x_2 \]

  • Notemos que
Categoría Modelo estimado
Motor de 4 cilindros \(\hat y_{00}=\hat\beta_0\)
Motor de 6 cilindros \(\hat y_{10}=\hat\beta_0+\hat\beta_1\)
Motor de 8 cilindros \(\hat y_{01}=\hat\beta_0+\hat\beta_2\)

Covariable categórica

Interpretación:

  • \(\hat\beta_0\), representa la eficiencia esperada estimada de un auto con un motor de 4 cilindros (categoría de referencia).
  • \(\hat\beta_1\), representa la diferencia esperada estimada entre la eficiencia de un auto con un motor de 6 cilindros contra uno que tenga un motor de 4 cilindros.
  • \(\hat\beta_2\), representa la diferencia esperada estimada entre la eficiencia de un auto con un motor de 8 cilindros contra uno que tenga un motor de 4 cilindros.

Covariable categórica


Call:
lm(formula = mpg ~ cyl, data = mtcars)

Coefficients:
(Intercept)         cyl6         cyl8  
     26.664       -6.921      -11.564  
[1] 0.714009
  • Se espera que la eficiencia de un automóvil con un motor de 4 cilindros sea de 26.7 millas por galón.
  • Se espera que un automóvil con un motor de 6 cilindros tenga una eficiencia menor en 6.9 millas por galón a la eficiencia de un automóvil con un motor de 4 cilindros.
  • Se espera que un automóvil con un motor de 8 cilindros tenga una eficiencia menor en 11.6 millas por galón a la eficiencia de un automóvil con un motor de 4 cilindros.
  • El modelo con covariable el número de cilindros del motor explica el 71.4% de la variabilidad de la eficiencia.

Estimación de \(\sigma^2\)

  • También podemos estimar la varianza de los errores, \(\sigma^2\), en este caso el estimador es dado por

\[ \hat\sigma^2=\frac{SCE}{n-p} =\frac{\sum_{i=1}^{n}(Y_i-\hat Y_i)^2}{n-p} \]

  • Este es un estimador insesgado de la varianza.

Ejemplo

Considerando los datos mtcars de R, estime un modelo para estimar la eficiencia en consumo de combustible (mpg) en función de la potencia del motor (hp), del peso del automóvil en miles libras (wt) y del tipo de caja de cambio (am).

a) Interprete los coeficientes.

c) Compare este modelo con los modelos anteriores ¿Qúe modelo es mejor para estimar la eficiencia?