El vector de valores ajustados \hat{y}_i que corresponden a los valores observados y_i es:
\hat{{y}}=\textbf{X}\hat{\beta}=\textbf{X}(\textbf{X} ^t\textbf{X} )^{-1}\textbf{X} ^t\textbf{y}= H\textbf{y}donde H=\textbf{X}(\textbf{X} ^t\textbf{X} )^{-1}\textbf{X}^t es una matriz de n \times n y se le llama matriz sombrero. Aplica el vector de valores observados en un vector de valores ajustados. La matriz de sombrero y sus propiedades desempeñan un papel central en el análisis de regresión.
de valores observados en un vector de valores ajustados. La matriz de sombrero y sus propiedades desempeñan un papel central en el análisis de regresión.
Ejemplo 1.
El objetivo principal de la investigación original no era únicamente predecir el valor de las viviendas, sino estimar la disposición a pagar de la sociedad por una mejora en la calidad del aire.
Los autores combinaron datos del Censo de Población y Vivienda de EE. UU. de 1970 con mediciones meteorológicas y de contaminación atmosférica en el área metropolitana de Boston, Massachusetts, para construir un modelo de precios hedónicos que aislara el impacto de la contaminación por óxidos de nitrógeno (\text{NO}_x) sobre el mercado inmobiliario.
Muestra: El dataset consta de 506 observaciones.
Unidad de Análisis: Cada fila representa una sección censal (census tract) o vecindario del área urbana de Boston, no una casa individual. Por esta razón, la mayoría de las variables representan promedios, tasas o porcentajes agregados a nivel vecindario:
medv: La mediana del valor de las casas habitadas por sus dueños en esa sección censal ( y )
rm: El promedio del número de habitaciones por vivienda en la zona ( x_1 )
lstat: El porcentaje de la población clasificada dentro del estrato socioeconómico bajo ( x_2 )
ptratio: La razón promedio de alumnos por profesor en las escuelas del distrito ( x_3 )
tax representa la tasa de impuesto a la propiedad sobre el valor total ( x_4 )
Código R : Preparación de los datos
# 1. Instalar y cargar los paquetes requeridosif (!require("ISLR2")) install.packages("ISLR2")if (!require("dplyr")) install.packages("dplyr")library(ISLR2)library(dplyr)library(ISLR)library(corrplot)library(car)# 2. Cargar y filtrar solo las variables cuantitativas continuas de interésdata("Boston")datos_cuant <- Boston %>%select(medv, rm, lstat, ptratio, tax) %>%na.omit()# Confirmar la estructura (todas deben ser numéricas: num o dbl)str(datos_cuant)
corrplot(correlations, method ="number", order ="hclust", type ="lower", tl.col ="black", tl.srt =45,title ="Matriz de Correlación - Datos Boston",mar =c(0, 0, 2, 0))
Con base en la matriz de correlación y el corrplot podemos sospechar, de manera exploratoria, una presencia de Multicolinealidad moderada. Sin embargo, realizamos el análisis del VIF para determinar las variables predictoras que propician un multicolinealidad moderada en el modelo de regresión.
Con base en el VIF, podemos concluir que existe presencia de Multicolinealidad moderada, por lo que no es de alarmarse. No es necesario eliminar alguna variable.
Por lo tanto, se inicia con un modelado con la siguiente estructura algebraica:
X <-model.matrix(modelo_cuant)#Calcular la matriz sombrero completaH <- X %*%solve(t(X) %*% X) %*%t(X)
Residuales
La diferencia entre el valor observado \hat{{y}_i} y el valor ajustado {y}_i correspondiente es el residual e_i = {y}_i-\hat{{y}_i}. Los n residuales se pueden escribir cómodamente con notación matricial como sigue:
\textbf{e}= \textbf{y}-\hat{\textbf{y}}
Hay otras maneras de expresar el vector de residuales \textbf{e}, que pueden ser útiles, como:
Para calcular el valor de SS_{Reg} se necesita sumar cada SS que aporta cada variable predictora x_j
SSREG<-sum(ANOVA1$`Sum Sq`[1:4]) #Suma los tres primeros valores SSRES<-ANOVA1$`Sum Sq`[5]SST<-SSREG+SSRES
Por lo tanto SS_{Reg}=2.903267\times 10^{4} , SS_{Reg}=1.3683625\times 10^{4} y SS_T = 4.2716295\times 10^{4}.
Propiedades
Matriz Sombrero:H = X(X^T X)^{-1}X^T, con propiedades de simetría (H^T = H) e idempotencia (H^2 = H).
Valores ajustados:\hat{y} = Hy = X\hat{\beta}.
Residuos:e = y - \hat{y} = (I - H)y.
Ortogonalidad de los residuos: Por las ecuaciones normales, X^T e = \vec{\mathbf{0}}. Esto implica que:
\hat{y}^T e = (X\hat{\beta})^T e =\vec{\mathbf{0}}
Suma de residuos nula:\mathbf{1}^T e = \vec0
Prueba de la significancia de la regresión
La prueba de la significancia de la regresión es para determinar si hay una relación lineal entre la respuesta y y cualquiera de las variables regresoras.
Contraste de hipótesisH_0: \beta_1=\beta_2=\cdots \beta_k=0 \hspace{1cm} vs. \hspace{1cm} H_1: \beta_j\neq 0 para alguna j=1,2,\dots, k.
Estadístico de PruebaF_0=\frac{MS_{Reg}}{MS_{Res}}
Región de Rechazo
F_0>F_{\alpha, p-1, n-p}
Retomando el Ejemplo 1.
summary(modelo_cuant)
Call:
lm(formula = medv ~ rm + lstat + ptratio + tax, data = datos_cuant)
Residuals:
Min 1Q Median 3Q Max
-13.9862 -3.0327 -0.9504 1.7846 30.4802
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 17.674476 3.972999 4.449 1.07e-05 ***
rm 4.586067 0.429202 10.685 < 2e-16 ***
lstat -0.545083 0.047126 -11.567 < 2e-16 ***
ptratio -0.875195 0.125394 -6.980 9.43e-12 ***
tax -0.002240 0.001757 -1.274 0.203
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 5.226 on 501 degrees of freedom
Multiple R-squared: 0.6797, Adjusted R-squared: 0.6771
F-statistic: 265.7 on 4 and 501 DF, p-value: < 2.2e-16
Contraste de hipótesisH_0: \beta_1=\beta_2=\cdots \beta_4=0 \hspace{1cm} vs. \hspace{1cm} H_1: \beta_j\neq 0 para alguna j=1,2,\dots, 4.
Estadístico de PruebaF_0=\frac{MS_{Reg}}{MS_{Res}}=265.7
Región de Rechazo
Con un \alpha=0.05 se obtiene que F_{\alpha,4,501}=0.1774. Como F_0=265.7>0.1774=F_{\alpha,4,501} entonces se rechaza H_0 con una significancia de \alpha=0.05. Esto quiere decir que, existe al menos una variable predictora entre rm, lstat, ptratio y tax que se relaciona de manera lineal con medv .
Important
En esta prueba de hipótesis, en caso de rechazar H_0, no nos dice realmente cuál o cuáles son las variables que se relacionan linealmente con y.