TALLER 3: Transformación Box-Cox

Author

María José Bula Arango, Jackeline González Cardenas, Alvaro Andrés Sánchez Mora, Dayana Paola Severiche Sánchez, María Isabel Torres, Miguel Andrés Turizo Barrios

1 Introducción

El modelo de regresión lineal múltiple es una herramienta estadística que permite estudiar la relación existente entre una variable respuesta y dos o más variables regresoras.

Su expresión general está dada por:

\[ Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\cdots+\beta_kX_{ki}+\varepsilon_i \]

donde:

  • \(Y_i\) representa la variable respuesta.
  • \(X_{1i},X_{2i},\ldots,X_{ki}\) representan las variables regresoras.
  • \(\beta_0\) representa el intercepto.
  • \(\beta_1,\beta_2,\ldots,\beta_k\) representan los parámetros del modelo.
  • \(\varepsilon_i\) representa el término de error aleatorio.

Para realizar inferencias estadísticas mediante el método de mínimos cuadrados ordinarios es necesario verificar determinados supuestos sobre los errores del modelo, entre ellos la normalidad, la homocedasticidad y la independencia.

Cuando uno o varios de estos supuestos no se cumplen, se pueden implementar diferentes medidas remediales con el propósito de mejorar las propiedades estadísticas del modelo.

En este trabajo se estudia la relación entre las ventas y los presupuestos destinados a publicidad en televisión, radio y periódico. Inicialmente se ajusta un modelo de regresión lineal múltiple con los datos originales, posteriormente se verifican sus supuestos y, finalmente, se aplica una transformación de Box-Cox como medida remedial.

2 Medidas remediales en modelos de regresión lineal

2.1 Definición

Las medidas remediales son procedimientos estadísticos empleados cuando los datos o los residuos obtenidos a partir de un modelo de regresión no satisfacen adecuadamente los supuestos necesarios para la aplicación del método de mínimos cuadrados ordinarios.

Estas medidas buscan reducir o corregir problemas asociados con:

  • Falta de normalidad de los residuos.
  • Heterocedasticidad.
  • Dependencia o autocorrelación.
  • Relaciones no lineales.
  • Presencia de observaciones atípicas.
  • Presencia de observaciones influyentes.
  • Especificación incorrecta del modelo.

La medida remedial seleccionada depende del supuesto que se esté incumpliendo y de las características particulares de los datos analizados.

2.2 Transformaciones de la variable respuesta

Una de las medidas remediales más utilizadas consiste en transformar la variable respuesta \(Y\).

Estas transformaciones pueden ayudar a disminuir la asimetría, estabilizar la varianza y mejorar la relación existente entre la variable respuesta y las variables explicativas.

2.2.1 Transformación logarítmica

\[ Y^*=\ln(Y) \]

Esta transformación puede utilizarse cuando los datos presentan asimetría positiva o cuando la variabilidad aumenta conforme aumenta el valor de la variable respuesta.

2.2.2 Transformación raíz cuadrada

\[ Y^*=\sqrt{Y} \]

Puede utilizarse cuando la variabilidad aumenta moderadamente con la media.

2.2.3 Transformación inversa

\[ Y^*=\frac{1}{Y} \]

Es una transformación más fuerte y puede ser utilizada cuando existe una marcada asimetría en la variable respuesta.

2.2.4 Transformación Box-Cox

La transformación de Box-Cox corresponde a una familia de transformaciones definida mediante:

\[ Y^{(\lambda)} = \begin{cases} \dfrac{Y^\lambda-1}{\lambda}, & \lambda\neq0\\[6pt] \ln(Y), & \lambda=0 \end{cases} \]

El valor de \(\lambda\) determina el tipo de transformación aplicada.

Valor de \(\lambda\) Transformación aproximada
\(-1\) \(1/Y\)
\(-0.5\) \(1/\sqrt{Y}\)
\(0\) \(\ln(Y)\)
\(0.5\) \(\sqrt{Y}\)
\(1\) Sin transformación

El valor adecuado de \(\lambda\) puede seleccionarse utilizando el método de máxima verosimilitud.

2.3 Medidas remediales ante falta de normalidad

Cuando los residuos no presentan una distribución aproximadamente normal se pueden considerar las siguientes medidas:

  • Aplicar una transformación a la variable respuesta.
  • Aplicar la transformación Box-Cox.
  • Examinar la presencia de valores atípicos.
  • Revisar errores de digitación o medición.
  • Incorporar variables explicativas importantes que hayan sido omitidas.
  • Incorporar términos cuadráticos cuando exista una relación no lineal.
  • Incorporar interacciones entre variables cuando sea estadísticamente justificable.

No es recomendable eliminar observaciones únicamente para conseguir normalidad. Una observación solamente debe eliminarse si existe una justificación estadística o un problema comprobado durante la recopilación de los datos.

2.4 Medidas remediales ante heterocedasticidad

El supuesto de homocedasticidad establece que:

\[ Var(\varepsilon_i)=\sigma^2 \]

para todas las observaciones.

Cuando la varianza cambia entre observaciones existe heterocedasticidad:

\[ Var(\varepsilon_i)=\sigma_i^2 \]

Entre las medidas remediales pueden utilizarse:

  • Transformaciones de la variable respuesta.
  • Transformación logarítmica.
  • Transformación Box-Cox.
  • Mínimos cuadrados ponderados.
  • Errores estándar robustos.
  • Revisión de la especificación del modelo.

En mínimos cuadrados ponderados se minimiza:

\[ \sum_{i=1}^{n}w_i(Y_i-\hat{Y}_i)^2 \]

donde los pesos pueden definirse como:

\[ w_i=\frac{1}{\sigma_i^2} \]

2.5 Medidas remediales ante dependencia

El supuesto de independencia establece que:

\[ Cov(\varepsilon_i,\varepsilon_j)=0 \qquad i\neq j \]

Cuando existe correlación entre errores consecutivos se puede presentar autocorrelación.

Un modelo de autocorrelación de primer orden puede escribirse como:

\[ \varepsilon_t=\rho\varepsilon_{t-1}+u_t \]

Entre las posibles medidas remediales se encuentran:

  • Incorporar variables relacionadas con el tiempo.
  • Incluir tendencias.
  • Incluir componentes estacionales.
  • Utilizar mínimos cuadrados generalizados.
  • Utilizar modelos para series de tiempo cuando corresponda.

3 Descripción de los datos y modelo de regresión

3.1 Descripción de la base de datos

La base de datos contiene 200 observaciones relacionadas con inversiones en publicidad y ventas.

Cada observación contiene información sobre la inversión realizada en televisión, radio y periódico, junto con el valor de las ventas correspondiente.

Las variables utilizadas son:

Variable Descripción Función
Sales ($) Ventas obtenidas Variable respuesta
TV Ad Budget ($) Presupuesto en televisión Variable regresora
Radio Ad Budget ($) Presupuesto en radio Variable regresora
Newspaper Ad Budget ($) Presupuesto en periódico Variable regresora

El objetivo consiste en explicar el comportamiento de las ventas a partir de las inversiones realizadas en los tres medios de publicidad.

3.2 Importación de los datos

library(readxl)

datos <- read_excel("exceltrabajoregresion.xlsx")

Se verifica la estructura de la base de datos:

dim(datos)
[1] 200   5
names(datos)
[1] "...1"                    "TV Ad Budget ($)"       
[3] "Radio Ad Budget ($)"     "Newspaper Ad Budget ($)"
[5] "Sales ($)"              
summary(datos)
      ...1        TV Ad Budget ($) Radio Ad Budget ($) Newspaper Ad Budget ($)
 Min.   :  1.00   Min.   :  0.70   Min.   : 0.000      Min.   :  0.30         
 1st Qu.: 50.75   1st Qu.: 74.38   1st Qu.: 9.975      1st Qu.: 12.75         
 Median :100.50   Median :149.75   Median :22.900      Median : 25.75         
 Mean   :100.50   Mean   :147.04   Mean   :23.264      Mean   : 30.55         
 3rd Qu.:150.25   3rd Qu.:218.82   3rd Qu.:36.525      3rd Qu.: 45.10         
 Max.   :200.00   Max.   :296.40   Max.   :49.600      Max.   :114.00         
   Sales ($)    
 Min.   : 1.60  
 1st Qu.:10.38  
 Median :12.90  
 Mean   :14.02  
 3rd Qu.:17.40  
 Max.   :27.00  

3.3 Creación de las variables

ventas <- datos$`Sales ($)`
tv <- datos$`TV Ad Budget ($)`
radio <- datos$`Radio Ad Budget ($)`
periódico <- datos$`Newspaper Ad Budget ($)`

Se define:

\[ Y=\text{Ventas} \]

\[ X_1=\text{Presupuesto en televisión} \]

\[ X_2=\text{Presupuesto en radio} \]

\[ X_3=\text{Presupuesto en periódico} \]

3.4 Planteamiento del modelo

El modelo de regresión lineal múltiple es:

\[ Y_i=\beta_0+\beta_1X_{1i}+\beta_2X_{2i}+\beta_3X_{3i}+\varepsilon_i \]

Para este problema:

\[ Ventas_i= \beta_0+ \beta_1TV_i+ \beta_2Radio_i+ \beta_3Periódico_i+ \varepsilon_i \]

Los parámetros se estiman mediante mínimos cuadrados ordinarios.

En forma matricial:

\[ \mathbf{Y}=\mathbf{X}\boldsymbol{\beta}+\boldsymbol{\varepsilon} \]

La estimación de mínimos cuadrados ordinarios está dada por:

\[ \hat{\boldsymbol{\beta}} = (\mathbf{X}^{T}\mathbf{X})^{-1} \mathbf{X}^{T}\mathbf{Y} \]

3.5 Estimación del modelo en R

modelo <- lm(ventas ~ tv + radio + periódico)

summary(modelo)

Call:
lm(formula = ventas ~ tv + radio + periódico)

Residuals:
    Min      1Q  Median      3Q     Max 
-8.8277 -0.8908  0.2418  1.1893  2.8292 

Coefficients:
             Estimate Std. Error t value Pr(>|t|)    
(Intercept)  2.938889   0.311908   9.422   <2e-16 ***
tv           0.045765   0.001395  32.809   <2e-16 ***
radio        0.188530   0.008611  21.893   <2e-16 ***
periódico   -0.001037   0.005871  -0.177     0.86    
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 1.686 on 196 degrees of freedom
Multiple R-squared:  0.8972,    Adjusted R-squared:  0.8956 
F-statistic: 570.3 on 3 and 196 DF,  p-value: < 2.2e-16

Para observar los parámetros estimados:

coef(modelo)
 (Intercept)           tv        radio    periódico 
 2.938889369  0.045764645  0.188530017 -0.001037493 

La ecuación estimada es aproximadamente:

\[ \widehat{Ventas} = 2.9389 + 0.0458(TV) + 0.1885(Radio) - 0.0010(Periódico) \]

La interpretación de los coeficientes es la siguiente:

Manteniendo constantes las demás variables, por cada unidad adicional invertida en publicidad de televisión, las ventas aumentan aproximadamente \(0.0458\) unidades.

Manteniendo constantes las demás variables, por cada unidad adicional invertida en publicidad de radio, las ventas aumentan aproximadamente \(0.1885\) unidades.

El coeficiente correspondiente al periódico es aproximadamente \(-0.0010\), mostrando un efecto estimado prácticamente nulo sobre las ventas al controlar las demás variables.

El coeficiente de determinación obtenido es aproximadamente:

\[ R^2=0.8972 \]

Por lo tanto, aproximadamente el 89.72 % de la variabilidad de las ventas es explicada por las inversiones realizadas en televisión, radio y periódico.

4 Verificación de los supuestos con los datos originales

4.1 Supuesto de normalidad

El supuesto de normalidad establece que:

\[ \varepsilon_i\sim N(0,\sigma^2) \]

4.1.1 Obtención de los residuales

residuales <- modelo$residuals

Los residuales se definen como:

\[ e_i=Y_i-\hat{Y}_i \]

4.1.2 Verificación gráfica de normalidad

qqnorm(residuales)
qqline(residuales)

En un modelo cuyos residuos presentan una distribución normal, los puntos del gráfico Q-Q deberían ubicarse aproximadamente sobre la línea de referencia.

En este caso, se observan desviaciones importantes de los puntos respecto a la línea de referencia, especialmente en las colas. Por lo tanto, se sospecha una violación del supuesto de normalidad de los residuos.

4.1.3 Verificación formal de normalidad

Para verificar formalmente el supuesto de normalidad se utiliza la prueba de Kolmogorov-Smirnov con corrección de Lilliefors.

Las hipótesis son:

\[ \begin{cases} H_0: e_i \sim N(\mu, \sigma^2) \\ H_1: e_i \nsim N(\mu, \sigma^2) \end{cases} \]

El nivel de significancia utilizado es:

\[ \alpha=0.05 \]

library(nortest)

lillie.test(residuales)

    Lilliefors (Kolmogorov-Smirnov) normality test

data:  residuales
D = 0.13197, p-value = 4.887e-09

El estadístico obtenido es:

\[ D_0=0.13197 \]

Se calcula además el estadístico teórico:

KS <- 0.895/(sqrt(200)-0.01+(0.85/sqrt(200)))

KS
[1] 0.06306263

El resultado es aproximadamente:

\[ KS=0.06306 \]

Al comparar:

\[ D_0=0.13197>KS=0.06306 \]

Además:

\[ p\text{-value}=4.887\times10^{-9}<0.05 \]

Por lo tanto, se rechaza \(H_0\).

Se concluye que los residuos del modelo original no presentan una distribución normal.

\[ \boxed{\text{No se cumple el supuesto de normalidad}} \]

4.2 Supuesto de homocedasticidad

El supuesto de homocedasticidad establece:

\[ Var(\varepsilon_i)=\sigma^2 \]

para todas las observaciones.

4.2.1 Verificación gráfica

Se obtienen los residuos y valores ajustados:

residuales <- modelo$residuals
ajustados <- modelo$fitted.values

Código utilizado para el gráfico:

plot(x=ajustados,
     y=residuales,
     main="Verificación supuesto de homocedasticidad",
     xlab="Valores ajustados",
     ylab="Residuales",
     ylim=c(-15,15))

abline(h=0, lty=3, col="purple")

Los residuos presentan una dispersión relativamente similar a lo largo de los valores ajustados, sin observarse un patrón claro de aumento o disminución de la variabilidad. Por lo tanto, gráficamente no se sospecha una violación del supuesto de homocedasticidad, aunque se observan algunos valores atípicos.

4.2.2 Verificación formal mediante Breusch-Pagan

Las hipótesis son:

\[ \begin{cases} H_0: \gamma_{k} = 0 \; ; \; k=1,2,\dots,p-1 \\ H_1: \gamma_{k} \neq 0 \; ; \; \text{para al menos un } k, \; k=1,2,\dots,p-1 \end{cases} \]

library(lmtest)

bptest(modelo)

    studentized Breusch-Pagan test

data:  modelo
BP = 5.1329, df = 3, p-value = 0.1623

El estadístico observado es aproximadamente:

\[ BP_0=5.1329 \]

El estadístico teórico se obtiene mediante:

qchisq(0.05, 3, lower.tail = FALSE)
[1] 7.814728

El resultado es:

\[ \chi^2_{0.05,3}=7.814728 \]

Como:

\[ BP_0=5.1329< \chi^2_{0.05,3}=7.814728 \]

y el p-value es superior a \(0.05\), no se rechaza \(H_0\).

Por lo tanto, no se encuentra evidencia estadística suficiente de heterocedasticidad.

\[ \boxed{\text{Se cumple el supuesto de homocedasticidad}} \]

4.3 Supuesto de independencia

La independencia establece que:

\[ \varepsilon_i \sim N(0, \sigma^2); \ \mathbf{ind.} \ \ \mathbf{i=1,\dots,n} \]

4.3.1 Verificación gráfica

residuales <- modelo$residuals

orden_temporal <- 1:200

plot(x=orden_temporal,
     y=residuales,
     xlab="Orden temporal",
     ylab="Residuales",
     main="Verificación supuesto de independencia",
     ylim=c(-15,15),
     type="o")

abline(h=0)

Los residuos fluctúan alrededor de cero sin mostrar tendencias, ciclos o patrones sistemáticos evidentes. Por lo tanto, gráficamente no se sospecha una violación del supuesto de independencia de los residuos.

4.3.2 Verificación formal mediante Durbin-Watson

El estadístico de Durbin-Watson está dado por:

\[ d= \frac{\displaystyle\sum_{t=2}^{n}(e_t-e_{t-1})^2} {\displaystyle\sum_{t=1}^{n}e_t^2} \]

Las hipótesis son:

\[ H_0:\rho=0 \]

\[ H_1:\rho\neq0 \]

Se aplica la prueba:

library(car)

durbinWatsonTest(modelo, alternative="two.sided")
 lag Autocorrelation D-W Statistic p-value
   1     -0.04687792      2.083648   0.566
 Alternative hypothesis: rho != 0

Se obtiene aproximadamente:

\[ d_0=2.083648 \]

Para:

\[ n=200 \]

y tres variables regresoras:

\[ k=3 \]

se tienen aproximadamente:

\[ d_L=1.738 \]

\[ d_U=1.799 \]

Además:

\[ 4-d_L=2.262 \]

\[ 4-d_U=2.201 \]

Como:

\[ 1.799<2.083648<2.201 \]

se tiene:

\[ d_U<d_0<4-d_U \]

Por lo tanto, no se rechaza:

\[ H_0:\rho=0 \]

\[ \boxed{\text{No se encuentra evidencia de autocorrelación positiva ni negativa de primer orden.}} \]

No existe evidencia de autocorrelación de primer orden según Durbin-Watson. Sin embargo, como los residuos no cumplen el supuesto de normalidad, no se puede concluir completamente que sean independientes.

4.4 Resumen de los supuestos del modelo original

Supuesto Prueba Conclusión
Normalidad Kolmogorov-Smirnov con corrección de Lilliefors No se cumple
Homocedasticidad Breusch-Pagan Se cumple
Independencia Durbin-Watson No existe evidencia de autocorrelación

El principal problema identificado en el modelo original corresponde al incumplimiento del supuesto de normalidad.

5 Transformación de los datos mediante Box-Cox

Debido al incumplimiento del supuesto de normalidad se utiliza la transformación de Box-Cox como una medida remedial.

La transformación está definida por:

\[ Y^{(\lambda)} = \begin{cases} \dfrac{Y^\lambda-1}{\lambda}, & \lambda\neq0\\[6pt] \ln(Y), & \lambda=0 \end{cases} \]

5.1 Determinación del valor óptimo de lambda

Se utiliza el paquete MASS:

library(MASS)

resultado <- boxcox(modelo, plotit = FALSE)

lambda_optimo <- resultado$x[which.max(resultado$y)]

datos_bc <- data.frame(
  lambda = resultado$x,
  loglik = resultado$y
)

print(
  paste(
    "El valor óptimo de lambda es:",
    round(lambda_optimo, 4)
  )
)
[1] "El valor óptimo de lambda es: 0.9"

El valor óptimo de \(\lambda\) obtenido es:

\[ \lambda\approx0.9 \]

Este valor se encuentra cercano a:

\[ \lambda=1 \]

Un valor de \(\lambda\) cercano a 1 indica que la transformación recomendada por Box-Cox es relativamente leve, ya que cuando \(\lambda=1\) la variable respuesta permanece prácticamente en su escala original.

5.2 Transformación de la variable ventas

Como:

\[ \lambda\neq0 \]

la transformación utilizada es:

\[ Ventas^{(\lambda)} = \frac{Ventas^\lambda-1}{\lambda} \]

En R:

ventas_bc <- ((ventas^lambda_optimo)-1)/lambda_optimo

5.3 Ajuste del modelo transformado

Se ajusta nuevamente el modelo de regresión:

modelo_transf <- lm(
  ventas_bc ~ tv + radio + periódico
)

summary(modelo_transf)

Call:
lm(formula = ventas_bc ~ tv + radio + periódico)

Residuals:
    Min      1Q  Median      3Q     Max 
-7.3712 -0.7005  0.2266  0.9040  2.1521 

Coefficients:
              Estimate Std. Error t value Pr(>|t|)    
(Intercept)  2.2812318  0.2405152   9.485   <2e-16 ***
tv           0.0353191  0.0010756  32.836   <2e-16 ***
radio        0.1428229  0.0066402  21.509   <2e-16 ***
periódico   -0.0006268  0.0045272  -0.138     0.89    
---
Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1

Residual standard error: 1.3 on 196 degrees of freedom
Multiple R-squared:  0.8962,    Adjusted R-squared:  0.8947 
F-statistic: 564.3 on 3 and 196 DF,  p-value: < 2.2e-16

El modelo transformado tiene la forma:

\[ \widehat{Ventas^{(\lambda)}} = \hat{\beta}_0+ \hat{\beta}_1TV+ \hat{\beta}_2Radio+ \hat{\beta}_3Periódico \]

6 Verificación de los supuestos con los datos transformados

6.1 Supuesto de normalidad

6.1.1 Obtención de los residuales

residuales_transf <- modelo_transf$residuals

6.1.2 Verificación gráfica

qqnorm(residuales_transf)
qqline(residuales_transf)

Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos continúan presentando desviaciones importantes respecto a la línea de referencia, especialmente en las colas. Por lo tanto, gráficamente se sigue sospechando una violación del supuesto de normalidad y no se observa una mejora significativa respecto al modelo original.

6.1.3 Verificación formal

Las hipótesis son:

\[ \begin{cases} H_0: e_i \sim N(\mu, \sigma^2) \\ H_1: e_i \nsim N(\mu, \sigma^2) \end{cases} \] Se utiliza:

library(nortest)

lillie.test(residuales_transf)

    Lilliefors (Kolmogorov-Smirnov) normality test

data:  residuales_transf
D = 0.13804, p-value = 6.16e-10

El estadístico obtenido es:

\[ D_0=0.13804 \]

El estadístico teórico continúa siendo:

KS <- 0.895/(sqrt(200)-0.01+(0.85/sqrt(200)))

KS
[1] 0.06306263

Al comparar:

\[ D_0=0.13804>KS=0.06306 \]

Además:

\[ p\text{-value}=6.16\times10^{-10}<\alpha=0.05 \] De acuerdo con los resultados obtenidos con estos datos, se rechaza \(H_0\) y se concluye que los residuos continúan sin presentar distribución normal. La transformación Box-Cox no consigue corregir completamente la falta de normalidad de los residuos.

\[ \boxed{\text{La transformación no corrige completamente el problema de normalidad}} \]

6.2 Supuesto de homocedasticidad

6.2.1 Verificación gráfica

residuales_transf <- modelo_transf$residuals
ajustados_transf <- modelo_transf$fitted.values

plot(x=ajustados_transf,
     y=residuales_transf,
     main="Verificación supuesto de homocedasticidad",
     xlab="Valores ajustados",
     ylab="Residuales", ylim=c(-15,15))

abline(h=0, lty=3, col="purple")

Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos mantienen una dispersión relativamente constante alrededor de cero y no se observa un patrón claro de aumento o disminución de la variabilidad. Por lo tanto, gráficamente no se sospecha una violación importante del supuesto de homocedasticidad. Sin embargo, persiste cierto patrón curvo en los residuos, por lo que la transformación no produce una mejora evidente respecto al modelo original.

6.2.2 Verificación formal mediante Breusch-Pagan

Las hipótesis son:

\[ \begin{cases} H_0: \gamma_k = 0 \; ; \; k=1,2,\dots,p-1 \\ H_1: \gamma_k \neq 0 \; ; \; \text{para al menos un } k, \; k=1,2,\dots,p-1 \end{cases} \] Se aplica:

library(lmtest)

bptest(modelo_transf)

    studentized Breusch-Pagan test

data:  modelo_transf
BP = 6.0828, df = 3, p-value = 0.1077

Se obtiene: \[ BP_0=6.0828 \] con: \[ p\text{-value}=0.1077 \]

El valor crítico teórico se obtiene mediante:

qchisq(0.05, 3, lower.tail = FALSE)
[1] 7.814728

Por lo tanto:

\[ \chi^2_{0.05,3}=7.814728 \]

Si:

\[ BP_0=6.0828<7.814728 \]

o:

\[ p\text{-value}=0.1077>0.05 \]

Por lo tanto, no se rechaza \(H_0\). No existe evidencia estadística suficiente para afirmar que la varianza de los errores cambia entre las observaciones. En consecuencia, después de aplicar la transformación Box-Cox, se mantiene el supuesto de homocedasticidad.

\[ \boxed{\text{Se cumple el supuesto de homocedasticidad}} \] Al comparar este resultado con el modelo original, se observa que la transformación Box-Cox no produce una mejora importante en este supuesto, debido a que la homocedasticidad ya se cumplía antes de realizar la transformación.

6.3 Supuesto de independencia

6.3.1 Verificación gráfica

residuales_transf <- modelo_transf$residuals

orden_temporal <- 1:200

plot(x=orden_temporal,
     y=residuales_transf,
     xlab="Orden temporal",
     ylab="Residuales",
     main="Verificación supuesto de independencia",
     ylim=c(-15,15),
     type="o")

abline(h=0)

Después de aplicar la transformación Box-Cox con \(\lambda=0.9\), los residuos continúan distribuyéndose alrededor de cero sin presentar tendencias, ciclos o patrones sistemáticos evidentes a lo largo del orden de las observaciones. Por lo tanto, gráficamente no se sospecha la presencia de autocorrelación entre los residuos. Además, no se observa una mejora importante respecto al modelo original, ya que ambas gráficas presentan un comportamiento muy similar.

6.3.2 Verificación formal mediante Durbin-Watson

Las hipótesis son:

\[ H_0:\rho=0 \]

\[ H_1:\rho\neq0 \]

Se utiliza:

library(car)

durbinWatsonTest(
  modelo_transf,
  alternative="two.sided"
)
 lag Autocorrelation D-W Statistic p-value
   1     -0.04171427      2.074159   0.652
 Alternative hypothesis: rho != 0

Un estadístico de Durbin-Watson cercano a:

\[ d=2 \]

indica ausencia de evidencia importante de autocorrelación de primer orden.

De acuerdo con los resultados obtenidos para el modelo transformado, el estadístico permanece próximo a dos.

Por lo tanto:

\[ \boxed{\text{No se encuentra evidencia significativa de autocorrelación de primer orden}} \]

6.4 Comparación entre el modelo original y el transformado

Supuesto Modelo original Modelo transformado
Normalidad No se cumple No se corrige completamente
Homocedasticidad Se cumple Se cumple
Independencia Sin evidencia de autocorrelación Sin evidencia de autocorrelación

7 Conclusiones

El análisis realizado permitió estudiar la relación entre las ventas y las inversiones en publicidad mediante televisión, radio y periódico, a partir de un modelo de regresión lineal múltiple estimado mediante mínimos cuadrados ordinarios. El modelo presentó una alta capacidad explicativa, ya que aproximadamente el 89.72 % de la variabilidad de las ventas fue explicada conjuntamente por las variables incluidas.

En la verificación de los supuestos del modelo original se encontró que el supuesto de normalidad no se cumple, debido a que tanto el gráfico Q-Q como la prueba de Kolmogorov-Smirnov con corrección de Lilliefors evidenciaron desviaciones importantes respecto a una distribución normal. Por otra parte, el supuesto de homocedasticidad sí se cumplió, ya que gráficamente no se observó un patrón claro de cambio en la dispersión de los residuos y la prueba de Breusch-Pagan no mostró evidencia de heterocedasticidad.

En cuanto al supuesto de independencia, la prueba de Durbin-Watson no evidenció autocorrelación de primer orden y gráficamente los residuos se distribuyeron alrededor de cero sin mostrar patrones sistemáticos. Sin embargo, como el supuesto de normalidad no se cumple, no se puede afirmar completamente que los residuos sean independientes.

Como medida remedial se aplicó la transformación Box-Cox, obteniéndose un valor óptimo de lambda igual a 0.9. Al ser un valor muy cercano a 1, la transformación aplicada fue relativamente leve, por lo que el comportamiento del modelo transformado resultó muy similar al del modelo original.

Después de la transformación, el supuesto de normalidad continuó sin cumplirse, ya que el gráfico Q-Q siguió mostrando desviaciones importantes en las colas. El supuesto de homocedasticidad se mantuvo, debido a que la prueba de Breusch-Pagan siguió indicando ausencia de heterocedasticidad. En relación con la independencia, tampoco se evidenció autocorrelación de primer orden, aunque nuevamente no puede afirmarse completamente la independencia debido al incumplimiento de la normalidad.

En términos generales, la transformación Box-Cox no produjo una mejora significativa en los supuestos del modelo. La normalidad continuó incumpliéndose, la homocedasticidad se mantuvo y no se encontró evidencia de autocorrelación antes ni después de la transformación. Esto demuestra que una medida remedial no garantiza automáticamente el cumplimiento de todos los supuestos y que, después de aplicarla, es necesario verificar nuevamente el comportamiento del modelo.