library(readxl)
datos <- read_excel("exceltrabajoregresion.xlsx")TALLER 3: Transformación Box-Cox
1 Introducción
El modelo de regresión lineal múltiple es una herramienta estadística que permite estudiar la relación existente entre una variable respuesta y dos o más variables regresoras.
Su expresión general está dada por:
\[ Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\cdots+\beta_kX_{ki}+\varepsilon_i \]
donde:
- \(Y_i\) representa la variable respuesta.
- \(X_{1i},X_{2i},\ldots,X_{ki}\) representan las variables regresoras.
- \(\beta_0\) representa el intercepto.
- \(\beta_1,\beta_2,\ldots,\beta_k\) representan los parámetros del modelo.
- \(\varepsilon_i\) representa el término de error aleatorio.
Para realizar inferencias estadísticas mediante el método de mínimos cuadrados ordinarios es necesario verificar determinados supuestos sobre los errores del modelo, entre ellos la normalidad, la homocedasticidad y la independencia.
Cuando uno o varios de estos supuestos no se cumplen, se pueden implementar diferentes medidas remediales con el propósito de mejorar las propiedades estadísticas del modelo.
En este trabajo se estudia la relación entre las ventas y los presupuestos destinados a publicidad en televisión, radio y periódico. Inicialmente se ajusta un modelo de regresión lineal múltiple con los datos originales, posteriormente se verifican sus supuestos y, finalmente, se aplica una transformación de Box-Cox como medida remedial.
2 Medidas remediales en modelos de regresión lineal
2.1 Definición
Las medidas remediales son procedimientos estadísticos empleados cuando los datos o los residuos obtenidos a partir de un modelo de regresión no satisfacen adecuadamente los supuestos necesarios para la aplicación del método de mínimos cuadrados ordinarios.
Estas medidas buscan reducir o corregir problemas asociados con:
- Falta de normalidad de los residuos.
- Heterocedasticidad.
- Dependencia o autocorrelación.
- Relaciones no lineales.
- Presencia de observaciones atípicas.
- Presencia de observaciones influyentes.
- Especificación incorrecta del modelo.
La medida remedial seleccionada depende del supuesto que se esté incumpliendo y de las características particulares de los datos analizados.
2.2 Transformaciones de la variable respuesta
Una de las medidas remediales más utilizadas consiste en transformar la variable respuesta \(Y\).
Estas transformaciones pueden ayudar a disminuir la asimetría, estabilizar la varianza y mejorar la relación existente entre la variable respuesta y las variables explicativas.
2.2.1 Transformación logarítmica
\[ Y^*=\ln(Y) \]
Esta transformación puede utilizarse cuando los datos presentan asimetría positiva o cuando la variabilidad aumenta conforme aumenta el valor de la variable respuesta.
2.2.2 Transformación raíz cuadrada
\[ Y^*=\sqrt{Y} \]
Puede utilizarse cuando la variabilidad aumenta moderadamente con la media.
2.2.3 Transformación inversa
\[ Y^*=\frac{1}{Y} \]
Es una transformación más fuerte y puede ser utilizada cuando existe una marcada asimetría en la variable respuesta.
2.2.4 Transformación Box-Cox
La transformación de Box-Cox corresponde a una familia de transformaciones definida mediante:
\[ Y^{(\lambda)} = \begin{cases} \dfrac{Y^\lambda-1}{\lambda}, & \lambda\neq0\\[6pt] \ln(Y), & \lambda=0 \end{cases} \]
El valor de \(\lambda\) determina el tipo de transformación aplicada.
| Valor de \(\lambda\) | Transformación aproximada |
|---|---|
| \(-1\) | \(1/Y\) |
| \(-0.5\) | \(1/\sqrt{Y}\) |
| \(0\) | \(\ln(Y)\) |
| \(0.5\) | \(\sqrt{Y}\) |
| \(1\) | Sin transformación |
El valor adecuado de \(\lambda\) puede seleccionarse utilizando el método de máxima verosimilitud.
2.3 Medidas remediales ante falta de normalidad
Cuando los residuos no presentan una distribución aproximadamente normal se pueden considerar las siguientes medidas:
- Aplicar una transformación a la variable respuesta.
- Aplicar la transformación Box-Cox.
- Examinar la presencia de valores atípicos.
- Revisar errores de digitación o medición.
- Incorporar variables explicativas importantes que hayan sido omitidas.
- Incorporar términos cuadráticos cuando exista una relación no lineal.
- Incorporar interacciones entre variables cuando sea estadísticamente justificable.
No es recomendable eliminar observaciones únicamente para conseguir normalidad. Una observación solamente debe eliminarse si existe una justificación estadística o un problema comprobado durante la recopilación de los datos.
2.4 Medidas remediales ante heterocedasticidad
El supuesto de homocedasticidad establece que:
\[ Var(\varepsilon_i)=\sigma^2 \]
para todas las observaciones.
Cuando la varianza cambia entre observaciones existe heterocedasticidad:
\[ Var(\varepsilon_i)=\sigma_i^2 \]
Entre las medidas remediales pueden utilizarse:
- Transformaciones de la variable respuesta.
- Transformación logarítmica.
- Transformación Box-Cox.
- Mínimos cuadrados ponderados.
- Errores estándar robustos.
- Revisión de la especificación del modelo.
En mínimos cuadrados ponderados se minimiza:
\[ \sum_{i=1}^{n}w_i(Y_i-\hat{Y}_i)^2 \]
donde los pesos pueden definirse como:
\[ w_i=\frac{1}{\sigma_i^2} \]
2.5 Medidas remediales ante dependencia
El supuesto de independencia establece que:
\[ Cov(\varepsilon_i,\varepsilon_j)=0 \qquad i\neq j \]
Cuando existe correlación entre errores consecutivos se puede presentar autocorrelación.
Un modelo de autocorrelación de primer orden puede escribirse como:
\[ \varepsilon_t=\rho\varepsilon_{t-1}+u_t \]
Entre las posibles medidas remediales se encuentran:
- Incorporar variables relacionadas con el tiempo.
- Incluir tendencias.
- Incluir componentes estacionales.
- Utilizar mínimos cuadrados generalizados.
- Utilizar modelos para series de tiempo cuando corresponda.
3 Descripción de los datos y modelo de regresión
3.1 Descripción de la base de datos
La base de datos contiene 200 observaciones relacionadas con inversiones en publicidad y ventas.
Cada observación contiene información sobre la inversión realizada en televisión, radio y periódico, junto con el valor de las ventas correspondiente.
Las variables utilizadas son:
| Variable | Descripción | Función |
|---|---|---|
Sales ($) |
Ventas obtenidas | Variable respuesta |
TV Ad Budget ($) |
Presupuesto en televisión | Variable regresora |
Radio Ad Budget ($) |
Presupuesto en radio | Variable regresora |
Newspaper Ad Budget ($) |
Presupuesto en periódico | Variable regresora |
El objetivo consiste en explicar el comportamiento de las ventas a partir de las inversiones realizadas en los tres medios de publicidad.
3.2 Importación de los datos
Se verifica la estructura de la base de datos:
dim(datos)[1] 200 5
names(datos)[1] "...1" "TV Ad Budget ($)"
[3] "Radio Ad Budget ($)" "Newspaper Ad Budget ($)"
[5] "Sales ($)"
summary(datos) ...1 TV Ad Budget ($) Radio Ad Budget ($) Newspaper Ad Budget ($)
Min. : 1.00 Min. : 0.70 Min. : 0.000 Min. : 0.30
1st Qu.: 50.75 1st Qu.: 74.38 1st Qu.: 9.975 1st Qu.: 12.75
Median :100.50 Median :149.75 Median :22.900 Median : 25.75
Mean :100.50 Mean :147.04 Mean :23.264 Mean : 30.55
3rd Qu.:150.25 3rd Qu.:218.82 3rd Qu.:36.525 3rd Qu.: 45.10
Max. :200.00 Max. :296.40 Max. :49.600 Max. :114.00
Sales ($)
Min. : 1.60
1st Qu.:10.38
Median :12.90
Mean :14.02
3rd Qu.:17.40
Max. :27.00
3.3 Creación de las variables
ventas <- datos$`Sales ($)`
tv <- datos$`TV Ad Budget ($)`
radio <- datos$`Radio Ad Budget ($)`
periódico <- datos$`Newspaper Ad Budget ($)`Se define:
\[ Y=\text{Ventas} \]
\[ X_1=\text{Presupuesto en televisión} \]
\[ X_2=\text{Presupuesto en radio} \]
\[ X_3=\text{Presupuesto en periódico} \]
3.4 Planteamiento del modelo
El modelo de regresión lineal múltiple es:
\[ Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\beta_3X_{3i}+\varepsilon_i \]
Para este problema:
\[ Ventas_i= \beta_0+ \beta_1TV_i+ \beta_2Radio_i+ \beta_3Periódico_i+ \varepsilon_i \]
Los parámetros se estiman mediante mínimos cuadrados ordinarios.
En forma matricial:
\[ \mathbf{Y}=\mathbf{X}\boldsymbol{\beta}+\boldsymbol{\varepsilon} \]
La estimación de mínimos cuadrados ordinarios está dada por:
\[ \hat{\boldsymbol{\beta}} = (\mathbf{X}^{T}\mathbf{X})^{-1} \mathbf{X}^{T}\mathbf{Y} \]
3.5 Estimación del modelo en R
modelo <- lm(ventas ~ tv + radio + periódico)
summary(modelo)
Call:
lm(formula = ventas ~ tv + radio + periódico)
Residuals:
Min 1Q Median 3Q Max
-8.8277 -0.8908 0.2418 1.1893 2.8292
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 2.938889 0.311908 9.422 <2e-16 ***
tv 0.045765 0.001395 32.809 <2e-16 ***
radio 0.188530 0.008611 21.893 <2e-16 ***
periódico -0.001037 0.005871 -0.177 0.86
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 1.686 on 196 degrees of freedom
Multiple R-squared: 0.8972, Adjusted R-squared: 0.8956
F-statistic: 570.3 on 3 and 196 DF, p-value: < 2.2e-16
Para observar los parámetros estimados:
coef(modelo) (Intercept) tv radio periódico
2.938889369 0.045764645 0.188530017 -0.001037493
La ecuación estimada es aproximadamente:
\[ \widehat{Ventas} = 2.9389 + 0.0458(TV) + 0.1885(Radio) - 0.0010(Periódico) \]
La interpretación de los coeficientes es la siguiente:
Manteniendo constantes las demás variables, por cada unidad adicional invertida en publicidad de televisión, las ventas aumentan aproximadamente \(0.0458\) unidades.
Manteniendo constantes las demás variables, por cada unidad adicional invertida en publicidad de radio, las ventas aumentan aproximadamente \(0.1885\) unidades.
El coeficiente correspondiente al periódico es aproximadamente \(-0.0010\), mostrando un efecto estimado prácticamente nulo sobre las ventas al controlar las demás variables.
El coeficiente de determinación obtenido es aproximadamente:
\[ R^2=0.8972 \]
Por lo tanto, aproximadamente el 89.72 % de la variabilidad de las ventas es explicada por las inversiones realizadas en televisión, radio y periódico.
4 Verificación de los supuestos con los datos originales
4.1 Supuesto de normalidad
El supuesto de normalidad establece que:
\[ \varepsilon_i\sim N(0,\sigma^2) \]
4.1.1 Obtención de los residuales
residuales <- modelo$residualsLos residuales se definen como:
\[ e_i=Y_i-\hat{Y}_i \]
4.1.2 Verificación gráfica de normalidad
qqnorm(residuales)
qqline(residuales)En un modelo cuyos residuos presentan una distribución normal, los puntos del gráfico Q-Q deberían ubicarse aproximadamente sobre la línea de referencia.
En este caso, se observan desviaciones importantes de los puntos respecto a la línea de referencia, especialmente en las colas. Por lo tanto, se sospecha una violación del supuesto de normalidad de los residuos.
4.1.3 Verificación formal de normalidad
Para verificar formalmente el supuesto de normalidad se utiliza la prueba de Kolmogorov-Smirnov con corrección de Lilliefors.
Las hipótesis son:
\[ \begin{cases} H_0: e_i \sim N(\mu, \sigma^2) \\ H_1: e_i \nsim N(\mu, \sigma^2) \end{cases} \]
El nivel de significancia utilizado es:
\[ \alpha=0.05 \]
library(nortest)
lillie.test(residuales)
Lilliefors (Kolmogorov-Smirnov) normality test
data: residuales
D = 0.13197, p-value = 4.887e-09
El estadístico obtenido es:
\[ D_0=0.13197 \]
Se calcula además el estadístico teórico:
KS <- 0.895/(sqrt(200)-0.01+(0.85/sqrt(200)))
KS[1] 0.06306263
El resultado es aproximadamente:
\[ KS=0.06306 \]
Al comparar:
\[ D_0=0.13197>KS=0.06306 \]
Además:
\[ p\text{-value}=4.887\times10^{-9}<0.05 \]
Por lo tanto, se rechaza \(H_0\).
Se concluye que los residuos del modelo original no presentan una distribución normal.
\[ \boxed{\text{No se cumple el supuesto de normalidad}} \]
4.2 Supuesto de homocedasticidad
El supuesto de homocedasticidad establece:
\[ Var(\varepsilon_i)=\sigma^2 \]
para todas las observaciones.
4.2.1 Verificación gráfica
Se obtienen los residuos y valores ajustados:
residuales <- modelo$residuals
ajustados <- modelo$fitted.valuesCódigo utilizado para el gráfico:
plot(x=ajustados,
y=residuales,
main="Verificación supuesto de homocedasticidad",
xlab="Valores ajustados",
ylab="Residuales",
ylim=c(-15,15))
abline(h=0, lty=3, col="purple")Los residuos presentan una dispersión relativamente similar a lo largo de los valores ajustados, sin observarse un patrón claro de aumento o disminución de la variabilidad. Por lo tanto, gráficamente no se sospecha una violación del supuesto de homocedasticidad, aunque se observan algunos valores atípicos.
4.2.2 Verificación formal mediante Breusch-Pagan
Las hipótesis son:
\[ \begin{cases} H_0: \gamma_{k} = 0 \; ; \; k=1,2,\dots,p-1 \\ H_1: \gamma_{k} \neq 0 \; ; \; \text{para al menos un } k, \; k=1,2,\dots,p-1 \end{cases} \]
library(lmtest)
bptest(modelo)
studentized Breusch-Pagan test
data: modelo
BP = 5.1329, df = 3, p-value = 0.1623
El estadístico observado es aproximadamente:
\[ BP_0=5.1329 \]
El estadístico teórico se obtiene mediante:
qchisq(0.05, 3, lower.tail = FALSE)[1] 7.814728
El resultado es:
\[ \chi^2_{0.05,3}=7.814728 \]
Como:
\[ BP_0=5.1329< \chi^2_{0.05,3}=7.814728 \]
y el p-value es superior a \(0.05\), no se rechaza \(H_0\).
Por lo tanto, no se encuentra evidencia estadística suficiente de heterocedasticidad.
\[ \boxed{\text{Se cumple el supuesto de homocedasticidad}} \]
4.3 Supuesto de independencia
La independencia establece que:
\[ \varepsilon_i \sim N(0, \sigma^2); \ \mathbf{ind.} \ \ \mathbf{i=1,\dots,n} \]
4.3.1 Verificación gráfica
residuales <- modelo$residuals
orden_temporal <- 1:200
plot(x=orden_temporal,
y=residuales,
xlab="Orden temporal",
ylab="Residuales",
main="Verificación supuesto de independencia",
ylim=c(-15,15),
type="o")
abline(h=0)Los residuos fluctúan alrededor de cero sin mostrar tendencias, ciclos o patrones sistemáticos evidentes. Por lo tanto, gráficamente no se sospecha una violación del supuesto de independencia de los residuos.
4.3.2 Verificación formal mediante Durbin-Watson
El estadístico de Durbin-Watson está dado por:
\[ d= \frac{\displaystyle\sum_{t=2}^{n}(e_t-e_{t-1})^2} {\displaystyle\sum_{t=1}^{n}e_t^2} \]
Las hipótesis son:
\[ H_0:\rho=0 \]
\[ H_1:\rho\neq0 \]
Se aplica la prueba:
library(car)
durbinWatsonTest(modelo, alternative="two.sided") lag Autocorrelation D-W Statistic p-value
1 -0.04687792 2.083648 0.566
Alternative hypothesis: rho != 0
Se obtiene aproximadamente:
\[ d_0=2.083648 \]
Para:
\[ n=200 \]
y tres variables regresoras:
\[ k=3 \]
se tienen aproximadamente:
\[ d_L=1.738 \]
\[ d_U=1.799 \]
Además:
\[ 4-d_L=2.262 \]
\[ 4-d_U=2.201 \]
Como:
\[ 1.799<2.083648<2.201 \]
se tiene:
\[ d_U<d_0<4-d_U \]
Por lo tanto, no se rechaza:
\[ H_0:\rho=0 \]
\[ \boxed{\text{No se encuentra evidencia de autocorrelación positiva ni negativa de primer orden.}} \]
No existe evidencia de autocorrelación de primer orden según Durbin-Watson. Sin embargo, como los residuos no cumplen el supuesto de normalidad, no se puede concluir completamente que sean independientes.
4.4 Resumen de los supuestos del modelo original
| Supuesto | Prueba | Conclusión |
|---|---|---|
| Normalidad | Kolmogorov-Smirnov con corrección de Lilliefors | No se cumple |
| Homocedasticidad | Breusch-Pagan | Se cumple |
| Independencia | Durbin-Watson | No existe evidencia de autocorrelación |
El principal problema identificado en el modelo original corresponde al incumplimiento del supuesto de normalidad.
5 Transformación de los datos mediante Box-Cox
Debido al incumplimiento del supuesto de normalidad se utiliza la transformación de Box-Cox como una medida remedial.
La transformación está definida por:
\[ Y^{(\lambda)} = \begin{cases} \dfrac{Y^\lambda-1}{\lambda}, & \lambda\neq0\\[6pt] \ln(Y), & \lambda=0 \end{cases} \]
5.1 Determinación del valor óptimo de lambda
Se utiliza el paquete MASS:
library(MASS)
resultado <- boxcox(modelo, plotit = FALSE)
lambda_optimo <- resultado$x[which.max(resultado$y)]
datos_bc <- data.frame(
lambda = resultado$x,
loglik = resultado$y
)
print(
paste(
"El valor óptimo de lambda es:",
round(lambda_optimo, 4)
)
)[1] "El valor óptimo de lambda es: 0.9"
El valor óptimo de \(\lambda\) obtenido es:
\[ \lambda\approx0.9 \]
Este valor se encuentra cercano a:
\[ \lambda=1 \]
Un valor de \(\lambda\) cercano a 1 indica que la transformación recomendada por Box-Cox es relativamente leve, ya que cuando \(\lambda=1\) la variable respuesta permanece prácticamente en su escala original.
5.2 Transformación de la variable ventas
Como:
\[ \lambda\neq0 \]
la transformación utilizada es:
\[ Ventas^{(\lambda)} = \frac{Ventas^\lambda-1}{\lambda} \]
En R:
ventas_bc <- ((ventas^lambda_optimo)-1)/lambda_optimo5.3 Ajuste del modelo transformado
Se ajusta nuevamente el modelo de regresión:
modelo_transf <- lm(
ventas_bc ~ tv + radio + periódico
)
summary(modelo_transf)
Call:
lm(formula = ventas_bc ~ tv + radio + periódico)
Residuals:
Min 1Q Median 3Q Max
-7.3712 -0.7005 0.2266 0.9040 2.1521
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 2.2812318 0.2405152 9.485 <2e-16 ***
tv 0.0353191 0.0010756 32.836 <2e-16 ***
radio 0.1428229 0.0066402 21.509 <2e-16 ***
periódico -0.0006268 0.0045272 -0.138 0.89
---
Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Residual standard error: 1.3 on 196 degrees of freedom
Multiple R-squared: 0.8962, Adjusted R-squared: 0.8947
F-statistic: 564.3 on 3 and 196 DF, p-value: < 2.2e-16
El modelo transformado tiene la forma:
\[ \widehat{Ventas^{(\lambda)}} = \hat{\beta}_0+ \hat{\beta}_1TV+ \hat{\beta}_2Radio+ \hat{\beta}_3Periódico \]
6 Verificación de los supuestos con los datos transformados
6.1 Supuesto de normalidad
6.1.1 Obtención de los residuales
residuales_transf <- modelo_transf$residuals6.1.2 Verificación gráfica
qqnorm(residuales_transf)
qqline(residuales_transf)Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos continúan presentando desviaciones importantes respecto a la línea de referencia, especialmente en las colas. Por lo tanto, gráficamente se sigue sospechando una violación del supuesto de normalidad y no se observa una mejora significativa respecto al modelo original.
6.1.3 Verificación formal
Las hipótesis son:
\[ \begin{cases} H_0: e_i \sim N(\mu, \sigma^2) \\ H_1: e_i \nsim N(\mu, \sigma^2) \end{cases} \] Se utiliza:
library(nortest)
lillie.test(residuales_transf)
Lilliefors (Kolmogorov-Smirnov) normality test
data: residuales_transf
D = 0.13804, p-value = 6.16e-10
El estadístico obtenido es:
\[ D_0=0.13804 \]
El estadístico teórico continúa siendo:
KS <- 0.895/(sqrt(200)-0.01+(0.85/sqrt(200)))
KS[1] 0.06306263
Al comparar:
\[ D_0=0.13804>KS=0.06306 \]
Además:
\[ p\text{-value}=6.16\times10^{-10}<\alpha=0.05 \] De acuerdo con los resultados obtenidos con estos datos, se rechaza \(H_0\) y se concluye que los residuos continúan sin presentar distribución normal. La transformación Box-Cox no consigue corregir completamente la falta de normalidad de los residuos.
\[ \boxed{\text{La transformación no corrige completamente el problema de normalidad}} \]
6.2 Supuesto de homocedasticidad
6.2.1 Verificación gráfica
residuales_transf <- modelo_transf$residuals
ajustados_transf <- modelo_transf$fitted.values
plot(x=ajustados_transf,
y=residuales_transf,
main="Verificación supuesto de homocedasticidad",
xlab="Valores ajustados",
ylab="Residuales", ylim=c(-15,15))
abline(h=0, lty=3, col="purple")Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos mantienen una dispersión relativamente constante alrededor de cero y no se observa un patrón claro de aumento o disminución de la variabilidad. Por lo tanto, gráficamente no se sospecha una violación importante del supuesto de homocedasticidad. Sin embargo, persiste cierto patrón curvo en los residuos, por lo que la transformación no produce una mejora evidente respecto al modelo original.
6.2.2 Verificación formal mediante Breusch-Pagan
Las hipótesis son:
\[ \begin{cases} H_0: \gamma_k = 0 \; ; \; k=1,2,\dots,p-1 \\ H_1: \gamma_k \neq 0 \; ; \; \text{para al menos un } k, \; k=1,2,\dots,p-1 \end{cases} \] Se aplica:
library(lmtest)
bptest(modelo_transf)
studentized Breusch-Pagan test
data: modelo_transf
BP = 6.0828, df = 3, p-value = 0.1077
Se obtiene: \[ BP_0=6.0828 \] con: \[ p\text{-value}=0.1077 \]
El valor crítico teórico se obtiene mediante:
qchisq(0.05, 3, lower.tail = FALSE)[1] 7.814728
Por lo tanto:
\[ \chi^2_{0.05,3}=7.814728 \]
Si:
\[ BP_0=6.0828<7.814728 \]
o:
\[ p\text{-value}=0.1077>0.05 \]
Por lo tanto, no se rechaza \(H_0\). No existe evidencia estadística suficiente para afirmar que la varianza de los errores cambia entre las observaciones. En consecuencia, después de aplicar la transformación Box-Cox, se mantiene el supuesto de homocedasticidad.
\[ \boxed{\text{Se cumple el supuesto de homocedasticidad}} \] Al comparar este resultado con el modelo original, se observa que la transformación Box-Cox no produce una mejora importante en este supuesto, debido a que la homocedasticidad ya se cumplía antes de realizar la transformación.
6.3 Supuesto de independencia
6.3.1 Verificación gráfica
residuales_transf <- modelo_transf$residuals
orden_temporal <- 1:200
plot(x=orden_temporal,
y=residuales_transf,
xlab="Orden temporal",
ylab="Residuales",
main="Verificación supuesto de independencia",
ylim=c(-15,15),
type="o")
abline(h=0)Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos continúan distribuyéndose alrededor de cero sin presentar tendencias, ciclos o patrones sistemáticos evidentes a lo largo del orden de las observaciones. Por lo tanto, gráficamente no se sospecha la presencia de autocorrelación entre los residuos. Además, no se observa una mejora importante respecto al modelo original, ya que ambas gráficas presentan un comportamiento muy similar.
6.3.2 Verificación formal mediante Durbin-Watson
Las hipótesis son:
\[ H_0:\rho=0 \]
\[ H_1:\rho\neq0 \]
Se utiliza:
library(car)
durbinWatsonTest(
modelo_transf,
alternative="two.sided"
) lag Autocorrelation D-W Statistic p-value
1 -0.04171427 2.074159 0.652
Alternative hypothesis: rho != 0
Un estadístico de Durbin-Watson cercano a:
\[ d=2 \]
indica ausencia de evidencia importante de autocorrelación de primer orden.
De acuerdo con los resultados obtenidos para el modelo transformado, el estadístico permanece próximo a dos.
Por lo tanto:
\[ \boxed{\text{No se encuentra evidencia significativa de autocorrelación de primer orden}} \]
6.4 Comparación entre el modelo original y el transformado
| Supuesto | Modelo original | Modelo transformado |
|---|---|---|
| Normalidad | No se cumple | No se corrige completamente |
| Homocedasticidad | Se cumple | Se cumple |
| Independencia | Sin evidencia de autocorrelación | Sin evidencia de autocorrelación |
7 Conclusiones
El análisis realizado permitió estudiar la relación entre las ventas y las inversiones en publicidad mediante televisión, radio y periódico, a partir de un modelo de regresión lineal múltiple estimado mediante mínimos cuadrados ordinarios. El modelo presentó una alta capacidad explicativa, ya que aproximadamente el 89.72 % de la variabilidad de las ventas fue explicada conjuntamente por las variables incluidas.
En la verificación de los supuestos del modelo original se encontró que el supuesto de normalidad no se cumple, debido a que tanto el gráfico Q-Q como la prueba de Kolmogorov-Smirnov con corrección de Lilliefors evidenciaron desviaciones importantes respecto a una distribución normal. Por otra parte, el supuesto de homocedasticidad sí se cumplió, ya que gráficamente no se observó un patrón claro de cambio en la dispersión de los residuos y la prueba de Breusch-Pagan no mostró evidencia de heterocedasticidad.
En cuanto al supuesto de independencia, la prueba de Durbin-Watson no evidenció autocorrelación de primer orden y gráficamente los residuos se distribuyeron alrededor de cero sin mostrar patrones sistemáticos. Sin embargo, como el supuesto de normalidad no se cumple, no se puede afirmar completamente que los residuos sean independientes.
Como medida remedial se aplicó la transformación Box-Cox, obteniéndose un valor óptimo de lambda igual a 0.9. Al ser un valor muy cercano a 1, la transformación aplicada fue relativamente leve, por lo que el comportamiento del modelo transformado resultó muy similar al del modelo original.
Después de la transformación, el supuesto de normalidad continuó sin cumplirse, ya que el gráfico Q-Q siguió mostrando desviaciones importantes en las colas. El supuesto de homocedasticidad se mantuvo, debido a que la prueba de Breusch-Pagan siguió indicando ausencia de heterocedasticidad. En relación con la independencia, tampoco se evidenció autocorrelación de primer orden, aunque nuevamente no puede afirmarse completamente la independencia debido al incumplimiento de la normalidad.
En términos generales, la transformación Box-Cox no produjo una mejora significativa en los supuestos del modelo. La normalidad continuó incumpliéndose, la homocedasticidad se mantuvo y no se encontró evidencia de autocorrelación antes ni después de la transformación. Esto demuestra que una medida remedial no garantiza automáticamente el cumplimiento de todos los supuestos y que, después de aplicarla, es necesario verificar nuevamente el comportamiento del modelo.