30/09/26
Abstract
La teoría mencionada puede revisarse en el TEXTO GUÍA o en la BIBLIOGRAFÍA COMPLEMENTARIA. En Rpubs:: toc se pueden ver otros documentos de posible interés.
Para el desarrollo de los ejemplos de este capítulo utilizaremos los siguientes paquetes de R, que nos permitirán construir gráficos y presentar tablas de manera clara y organizada.
library(ggplot2)
library(GGally)
library(knitr)
library(kableExtra)
Antes de estudiar la regresión lineal, recordemos brevemente algunos elementos de la ecuación de una recta.
Una de las formas más sencillas de representar la relación entre dos variables cuantitativas \(x\) y \(y\) es:
\[ y=\delta+\beta x \]
donde:
\(x\) representa la variable explicativa o predictora;
\(y\) representa la variable respuesta;
\(\delta\) es el intercepto o punto de partida de la recta;
\(\beta\) es la pendiente de la recta.
La pendiente es particularmente importante porque indica cuánto cambia \(y\) cuando \(x\) aumenta una unidad.
Suponga que un investigador desea relacionar el número de horas de sueño de los estudiantes con su puntaje de estrés académico.
En este caso podríamos definir:
\(x\): horas de sueño por noche;
\(y\): puntaje de estrés académico.
Suponga, a manera de ejemplo, que la relación pudiera representarse mediante:
\[ y=50-3x \]
La pendiente es
\[ \beta= -3. \]
De acuerdo con la recta, Esto significa que:
Por ejemplo, para un estudiante que duerme 6 horas:
\[ y=50-3(6)=32 \]
Por tanto, la recta asignaría un puntaje de estrés de 32 puntos.
La pendiente indica cuánto cambia la variable respuesta cuando la variable explicativa aumenta una unidad.
Además, su signo permite conocer la dirección de la relación.
Cuando la pendiente es positiva, al aumentar la variable explicativa, la variable respuesta también tiende a aumentar.
Por ejemplo, imagine una relación entre:
\(x\): horas semanales dedicadas al estudio;
\(y\): puntaje obtenido en una prueba.
Una pendiente positiva indicaría que un mayor número de horas de estudio está asociado con puntajes más altos.
Cuando la pendiente es negativa, al aumentar la variable explicativa, la variable respuesta tiende a disminuir.
Por ejemplo:
\(x\): horas de sueño;
\(y\): puntaje de estrés académico.
Una pendiente negativa indicaría que un mayor número de horas de sueño está asociado con menores puntajes de estrés.
Cuando la pendiente es igual a cero, al aumentar la variable explicativa, el valor representado por la recta permanece constante.
Por ejemplo, una pendiente igual o muy cercana a cero indicaría que no se observa un cambio lineal en el puntaje psicológico al aumentar la variable explicativa.
El intercepto representa el valor de \(y\) cuando \(x=0\).
Considere nuevamente:
\[ y=50-3x \]
El intercepto es \[ \delta=50. \]
Matemáticamente, esto significa que cuando:
\[ x=0, \]
entonces:
\[ y=50. \]
Sin embargo, en una aplicación real el intercepto no siempre tiene una interpretación práctica útil.
Por ejemplo, si \(x\) representa las horas de sueño, interpretar el puntaje de estrés de una persona que duerme cero horas podría no ser relevante para el estudio.
Por esta razón, en regresión no todos los valores de la ecuación deben interpretarse de manera automática.
Hasta ahora hemos considerado la relación entre dos variables mediante una recta.
Sin embargo, en Psicología los datos reales rara vez se encuentran exactamente sobre una línea.
Suponga que se registran las horas promedio de sueño, las horas diarias de estudio y el puntaje de estrés académico de 20 estudiantes universitarios.
Los siguientes datos son únicamente ilustrativos:
datos <- data.frame(
estudiante = 1:20,
sueno = c(5.0, 6.0, 7.0, 5.5, 6.5, 7.5, 4.5, 8.0, 6.0, 5.0,
7.0, 6.5, 5.5, 7.5, 4.0, 8.0, 6.0, 5.0, 7.0, 6.5),
estudio = c(4, 3, 2, 5, 4, 2, 6, 2, 4, 5,
6, 3, 2, 4, 5, 3, 2, 6, 3, 5),
estres = c(44, 39, 31, 46, 38, 28, 52, 26, 40, 47,
39, 33, 36, 34, 50, 29, 35, 45, 32, 41)
)
datos |>
kbl(
col.names = c(
"Estudiante",
"Horas de sueño",
"Horas de estudio",
"Puntaje de estrés"
),
align = "c",
booktabs = TRUE,
caption = "Datos ilustrativos de 20 estudiantes"
) |>
kable_styling(
bootstrap_options = c("striped", "hover", "condensed"),
full_width = FALSE,
position = "center"
)
| Estudiante | Horas de sueño | Horas de estudio | Puntaje de estrés |
|---|---|---|---|
| 1 | 5.0 | 4 | 44 |
| 2 | 6.0 | 3 | 39 |
| 3 | 7.0 | 2 | 31 |
| 4 | 5.5 | 5 | 46 |
| 5 | 6.5 | 4 | 38 |
| 6 | 7.5 | 2 | 28 |
| 7 | 4.5 | 6 | 52 |
| 8 | 8.0 | 2 | 26 |
| 9 | 6.0 | 4 | 40 |
| 10 | 5.0 | 5 | 47 |
| 11 | 7.0 | 6 | 39 |
| 12 | 6.5 | 3 | 33 |
| 13 | 5.5 | 2 | 36 |
| 14 | 7.5 | 4 | 34 |
| 15 | 4.0 | 5 | 50 |
| 16 | 8.0 | 3 | 29 |
| 17 | 6.0 | 2 | 35 |
| 18 | 5.0 | 6 | 45 |
| 19 | 7.0 | 3 | 32 |
| 20 | 6.5 | 5 | 41 |
Inicialmente nos concentraremos únicamente en la relación entre:
\(x\): horas de sueño por noche;
\(y\): puntaje de estrés académico.
Cada estudiante proporciona un par de valores, formado por sus horas de sueño y su puntaje de estrés:
\[ (\text{horas de sueño},\;\text{puntaje de estrés}) \]
Por ejemplo, para el primer estudiante tenemos:
\[ (5.0,\;44) \]
mientras que para el sexto estudiante tenemos:
\[ (7.5,\;28). \]
Observe que la base de datos contiene también las horas de estudio. Esta variable no será utilizada inicialmente, pero la incorporaremos más adelante cuando estudiemos modelos con más de una variable explicativa.
Un primer paso para estudiar la relación entre dos variables cuantitativas consiste en construir un diagrama de dispersión.
En este gráfico:
La variable explicativa se representa en el eje horizontal.
La variable respuesta se representa en el eje vertical.
Cada estudiante aparece representado mediante un punto.
En R podemos construirlo de la siguiente manera:
ggplot(datos, aes(x = sueno, y = estres)) +
geom_point(size = 2.5, color = "blue") +
labs(
title = "Relación entre horas de sueño y estrés académico",
x = "Horas de sueño",
y = "Puntaje de estrés académico"
) +
theme_minimal(base_size = 12)
Observe el gráfico y responda:
¿Parece existir alguna relación entre las horas de sueño y el estrés académico?
¿La relación parece creciente o decreciente?
¿Los puntos parecen seguir aproximadamente una línea recta?
¿Todos los estudiantes presentan exactamente el mismo patrón?
En el ejemplo anterior se observa una tendencia: los estudiantes que duermen más horas tienden a presentar menores puntajes de estrés académico.
Sin embargo, los puntos no se encuentran exactamente sobre una misma recta.
Esto plantea una nueva pregunta:
¿Podemos encontrar una recta que represente adecuadamente la tendencia general observada en los datos?
La regresión lineal proporciona una herramienta estadística para responder esta pregunta.
A partir de este momento ya no estudiaremos una recta únicamente como una expresión matemática, sino como un modelo que permite describir y cuantificar la relación entre variables observadas.
En la sección anterior vimos que un diagrama de dispersión permite visualizar la relación entre dos variables cuantitativas.
Continuaremos trabajando con los mismos datos de los 20 estudiantes y, en una primera etapa, estudiaremos la relación entre:
Variable explicativa (\(x\)): horas de sueño.
Variable respuesta (\(y\)): puntaje de estrés académico.
Ahora queremos ir más allá de la descripción gráfica y responder preguntas como:
¿Qué tan fuerte es la relación entre las variables?
¿La relación es positiva o negativa?
¿Cuánto cambia, en promedio, el estrés cuando cambian las horas de sueño?
¿Existe evidencia estadística de esa relación?
¿Podemos utilizar las horas de sueño para predecir el puntaje de estrés?
Para responder estas preguntas estudiaremos inicialmente la correlación y posteriormente la regresión lineal.
El énfasis estará en la interpretación de los resultados y no en el desarrollo matemático de las fórmulas.
Más adelante incorporaremos las horas de estudio como una segunda variable explicativa.
El coeficiente de correlación, representado por \(r\), permite resumir la dirección y la intensidad de la relación lineal entre dos variables cuantitativas.
El coeficiente de correlación toma valores entre -1 y 1:
Un valor positivo indica una relación lineal creciente;
Un valor negativo indica una relación lineal decreciente;
Cuanto más próximo se encuentre \(r\) a 1 o a -1, mayor será la intensidad de la relación lineal;
Cuanto más próximo se encuentre \(r\) a cero, menor será la intensidad de la relación lineal.
Es importante observar que un valor cercano a cero indica poca relación lineal, pero no necesariamente ausencia de cualquier tipo de relación entre las variables.
En R podemos calcularlo mediante:
cor(datos$sueno, datos$estres)
## [1] -0.9046659
Para nuestros datos se obtiene aproximadamente:
\[ r\;=\;-0.905 \]
El signo negativo indica que la relación es decreciente: los estudiantes que duermen más horas tienden a presentar menores puntajes de estrés académico.
Además, el valor se encuentra relativamente cerca de -1, lo que indica una relación lineal marcada en estos datos.
Es importante recordar que el coeficiente de correlación describe una asociación entre las variables.
Correlación no implica causalidad.
Por tanto, estos resultados no permiten afirmar, por sí solos, que dormir más horas sea la causa de una reducción del estrés académico.
La correlación permite conocer la dirección y la intensidad de una relación lineal, pero podemos ir un paso más allá y preguntarnos:
¿Cuánto cambia, en promedio, el puntaje de estrés académico cuando cambian las horas de sueño?
La regresión lineal simple permite responder esta pregunta mediante una recta que representa la tendencia general observada en los datos.
En términos generales, podemos pensar en la ecuación de regresión como:
\[ \text{Valor esperado de la respuesta} \;=\; \text{punto de partida} \;+\; \text{cambio asociado con la variable explicativa} \]
lm()En R, el modelo de regresión lineal simple se ajusta mediante la
función lm():
modelo1 <- lm(estres ~ sueno, data = datos)
modelo1
##
## Call:
## lm(formula = estres ~ sueno, data = datos)
##
## Coefficients:
## (Intercept) sueno
## 74.417 -5.833
La expresión
estres ~ sueno
se puede leer como:
estudiar el estrés en función de las horas de sueño.
summary()Para obtener información más detallada sobre el modelo utilizamos:
summary(modelo1)
##
## Call:
## lm(formula = estres ~ sueno, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -6.3333 -1.9583 -0.3333 2.1458 5.4167
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 74.4167 4.0806 18.237 4.71e-13 ***
## sueno -5.8333 0.6476 -9.007 4.35e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 3.251 on 18 degrees of freedom
## Multiple R-squared: 0.8184, Adjusted R-squared: 0.8083
## F-statistic: 81.13 on 1 and 18 DF, p-value: 4.352e-08
La función summary() proporciona diferentes resultados
relacionados con el modelo de regresión.
Por ahora, no es necesario interpretar toda la información que aparece en esta salida. En estas notas centraremos nuestra atención principalmente en dos elementos:
La tabla Coefficients, que contiene
información sobre el intercepto y la pendiente del modelo.
El Multiple R-squared, que
corresponde al coeficiente de determinación \(R^2\).
Los demás elementos de la salida se irán utilizando únicamente cuando sean necesarios.
Para facilitar su identificación, podemos resumir las partes que nos interesan:
| Coeficiente | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| Intercepto | 74.4167 | 4.0806 | 18.2368 | <0.001 |
| Horas de sueño | -5.8333 | 0.6476 | -9.0072 | <0.001 |
El segundo elemento que utilizaremos se encuentra hacia el final de la salida:
| Medida | Valor |
|---|---|
| Coeficiente de determinación (R²) | 0.8184 |
El valor de \(R^2\) será
interpretado más adelante, después de estudiar los coeficientes, las
predicciones y los residuos. En las siguientes secciones iremos
interpretando paso a paso la información seleccionada de la salida de
summary().
A partir de los datos de los 20 estudiantes, la recta estimada es:
\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(\text{Horas de sueño}) \]
El símbolo \(\widehat{\text{Estrés}}\) indica que se trata del puntaje de estrés estimado o predicho por el modelo.
Como vimos anteriormente, una recta está determinada principalmente por su pendiente y su intercepto. En regresión utilizaremos:
\(\hat{\beta}\) para representar la pendiente estimada;
\(\hat{\delta}\) para representar el intercepto estimado.
En nuestro ejemplo:
\[ \hat{\beta}\;=\;-5.8333, \qquad \hat{\delta}\;=\;74.4167 \]
La pendiente estimada es:
\[ \hat{\beta}=-5.8333. \]
Su signo negativo indica que la relación entre las horas de sueño y el estrés académico es decreciente.
En el contexto del estudio:
Por cada hora adicional de sueño, el puntaje promedio esperado de estrés académico disminuye aproximadamente 5.8333 puntos.
La palabra promedio es importante.
Esto no significa que todos los estudiantes que duerman una hora adicional presenten exactamente 5.8333 puntos menos de estrés. La regresión describe una tendencia promedio en el conjunto de estudiantes.
El intercepto estimado es:
\[ \hat{\delta}=74.4167. \]
Este valor representa el puntaje de estrés que el modelo estimaría cuando las horas de sueño son iguales a cero.
Sin embargo, como vimos anteriormente, el intercepto no siempre tiene una interpretación práctica relevante.
En este ejemplo, cero horas de sueño se encuentra fuera del rango habitual de los datos estudiados, por lo que no resulta conveniente atribuirle una interpretación sustantiva.
Podemos representar los datos mediante un diagrama de dispersión y agregar la recta estimada:
ggplot(datos, aes(x = sueno, y = estres)) +
geom_point(size = 3) +
geom_smooth(method = "lm", se = FALSE, linewidth = 1) +
labs(
title = "Relación entre horas de sueño y estrés académico",
x = "Horas de sueño",
y = "Puntaje de estrés académico"
) +
theme_minimal(base_size = 13)
Observe que los puntos no se encuentran exactamente sobre la recta.
La recta representa la tendencia general de la relación entre las horas de sueño y el estrés académico.
Además de estimar cuánto cambia el estrés cuando cambian las horas de sueño, podemos preguntarnos:
¿Existe evidencia estadística de una relación lineal entre las horas de sueño y el estrés académico?
Esta pregunta puede estudiarse utilizando la misma lógica de las pruebas de hipótesis vistas anteriormente.
En este caso, nos interesa determinar si existe evidencia de que la pendiente poblacional es diferente de cero.
Una pendiente igual a cero indicaría que, en promedio, no existe una relación lineal entre las horas de sueño y el puntaje de estrés académico.
Coefficients en la función summary()La salida de summary() proporciona un p-valor
asociado con el coeficiente de las horas de sueño:
| Coeficiente | Estimate | Std. Error | t value | Pr(>|t|) |
|---|---|---|---|---|
| (Intercept) | 74.4167 | 4.0806 | 18.2368 | <0.001 |
| sueno | -5.8333 | 0.6476 | -9.0072 | <0.001 |
El p-valor correspondiente a las horas de sueño es menor que 0.05.
Por tanto, los datos proporcionan evidencia de una relación lineal entre las horas de sueño y el puntaje de estrés académico.
Una conclusión apropiada sería:
Se encontró evidencia de una relación lineal entre las horas de sueño y el estrés académico (p < 0.001). En promedio, una hora adicional de sueño se asocia con una disminución aproximada de 5.8333 puntos en el puntaje de estrés académico.
Observe que esta conclusión proporciona dos tipos de información:
Evidencia estadística: proporcionada por el p-valor.
Magnitud y dirección de la asociación: proporcionadas por la pendiente.
El p-valor permite evaluar si existe evidencia de una relación, pero no informa por sí solo acerca de la precisión con la que hemos estimado la magnitud de dicha relación.
Para ello podemos construir un intervalo de confianza para la pendiente.
En R:
confint(modelo1)
## 2.5 % 97.5 %
## (Intercept) 65.84370 82.989631
## sueno -7.19395 -4.472717
Para las horas de sueño se obtiene el siguiente intervalo del 95% de confianza para la pendiente poblacional:
\[ -7.19 < \beta < -4.47 \]
Equivalentemente,
\[ IC_{95\%}(\beta)=(-7.19,\;-4.47). \]
Una interpretación apropiada sería:
Con un 95% de confianza, se estima que una hora adicional de sueño está asociada con una disminución promedio del puntaje de estrés académico comprendida aproximadamente entre 4.47 y 7.19 puntos.
Observe que todo el intervalo se encuentra por debajo de cero, lo cual es consistente con la existencia de una relación negativa entre las horas de sueño y el estrés académico.
La ecuación de regresión también puede utilizarse para obtener el puntaje de estrés que el modelo espera para determinadas horas de sueño.
Considere nuevamente:
\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(\text{Horas de sueño}) \]
Para un estudiante que duerme 6 horas:
\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(6) \]
por lo que:
\[ \widehat{\text{Estrés}} \;\approx\;39.41667. \]
Por tanto, el modelo predice un puntaje de estrés académico de aproximadamente 39.4 puntos para un estudiante que duerme 6 horas por noche.
En R también podemos obtener esta predicción mediante:
predicho6 <- predict(modelo1, newdata = data.frame(sueno = 6))
predicho6
## 1
## 39.41667
El valor predicho por el modelo no tiene que coincidir exactamente con el valor observado en cada estudiante.
Por ejemplo, consideremos al estudiante 2 de nuestra base de datos. Este estudiante duerme 6 horas y presenta un puntaje de estrés de 39 puntos.
Podemos obtener directamente este valor observado desde la base de datos:
observado6 <- datos$estres[datos$estudiante == 2]
observado6
## [1] 39
Por otra parte, para un estudiante que duerme 6 horas, sabemos que el modelo predice:
predicho6
## 1
## 39.41667
Por tanto, mientras el valor observado es 39, el valor predicho por el modelo es aproximadamente 39.4 puntos.
La diferencia entre el valor observado y el valor predicho se denomina residuo:
\[ \text{Residuo} \;=\; \text{valor observado} \;-\; \text{valor predicho}. \]
Para el estudiante considerado, el valor observado es 39 y el valor predicho es aproximadamente 39.41667.
Por tanto:
\[ \text{Residuo} \;=\; 39 \;-\; 39.41667 \;\approx \; -0.41667. \]
Residuo6 <- observado6 - predicho6
Residuo6
## 1
## -0.4166667
El residuo negativo indica que el valor observado de estrés es ligeramente menor que el valor predicho por el modelo.
Una medida que permite resumir qué tan bien el modelo explica la variabilidad observada en la variable respuesta es el coeficiente de determinación, representado por \(R^2\).
En nuestro ejemplo se obtiene aproximadamente:
\[ R^2=0.818. \]
Esto significa que:
Aproximadamente el 81.8% de la variabilidad observada en los puntajes de estrés académico es explicada por el modelo lineal que utiliza las horas de sueño como variable explicativa.
El porcentaje restante corresponde a variabilidad que este modelo no logra explicar.
Es importante interpretar correctamente este resultado.
Un valor de \(R^2=0.818\) no significa que el 81.8% del estrés de cada estudiante sea causado por las horas de sueño.
Es decir:
El coeficiente de determinación tampoco demuestra una relación causal.
Hasta este momento hemos estudiado la relación entre las horas de sueño y el estrés académico.
Sin embargo, nuestra base de datos contiene una tercera variable: las horas de estudio.
Es razonable pensar que el estrés académico podría estar relacionado simultáneamente con las horas de sueño y con el tiempo dedicado al estudio.
Por tanto, ahora estudiaremos conjuntamente:
Variable respuesta (\(y\)): puntaje de estrés académico.
Variable explicativa 1 (\(x_1\)): horas de sueño.
Variable explicativa 2 (\(x_2\)): horas de estudio.
Nuestro interés ya no se limita a preguntar si el sueño está relacionado con el estrés. Ahora podemos plantear una pregunta más completa:
¿Cómo se relacionan las horas de sueño con el estrés académico cuando también tenemos en cuenta las horas de estudio?
Antes de ajustar un modelo con dos variables explicativas, es conveniente examinar cómo se relacionan entre sí las tres variables consideradas en el estudio:
Para realizar esta exploración inicial utilizaremos dos herramientas que estudiaremos con mayor detalle más adelante:
La matriz de correlaciones.
La matriz de diagramas de dispersión.
Estas herramientas nos permitirán obtener una primera aproximación a la dirección y la intensidad de las relaciones entre las variables, así como identificar posibles patrones en los datos.
cor()Una forma sencilla de estudiar conjuntamente estas relaciones consiste en calcular las correlaciones entre cada par de variables.
En R:
correlaciones <- cor(
datos[, c("sueno", "estudio", "estres")]
)
rownames(correlaciones) <- c(
"Horas de sueño",
"Horas de estudio",
"Puntaje de estrés"
)
colnames(correlaciones) <- c(
"Horas de sueño",
"Horas de estudio",
"Puntaje de estrés"
)
round(correlaciones, 3) |>
kbl(
align = "c",
booktabs = TRUE,
caption = "Matriz de correlaciones entre las variables"
) |>
kable_styling(
bootstrap_options = c("striped", "hover", "condensed"),
full_width = FALSE,
position = "center"
)
| Horas de sueño | Horas de estudio | Puntaje de estrés | |
|---|---|---|---|
| Horas de sueño | 1.000 | -0.531 | -0.905 |
| Horas de estudio | -0.531 | 1.000 | 0.809 |
| Puntaje de estrés | -0.905 | 0.809 | 1.000 |
Cada valor de la matriz representa la correlación entre dos variables.
Observe que los valores de la diagonal son iguales a 1, porque corresponden a la correlación de cada variable consigo misma.
La misma información puede representarse gráficamente mediante un mapa de calor de correlaciones (heatmap).
Este gráfico permite identificar visualmente la dirección y la intensidad de las relaciones lineales entre las variables.
cor_long <- as.data.frame(as.table(correlaciones))
names(cor_long) <- c(
"Variable1",
"Variable2",
"Correlacion"
)
ggplot(
cor_long,
aes(
x = Variable1,
y = Variable2,
fill = Correlacion
)
) +
geom_tile() +
geom_text(
aes(label = sprintf("%.2f", Correlacion)),
size = 4
) +
scale_fill_gradient2(
low = "red",
mid = "white",
high = "blue",
midpoint = 0,
limits = c(-1, 1)
) +
coord_equal() +
labs(
title = "Mapa de calor de las correlaciones",
x = NULL,
y = NULL,
fill = "Correlación"
) +
theme_minimal(base_size = 13) +
theme(
panel.grid = element_blank(),
axis.text.x = element_text(
angle = 30,
hjust = 1
)
)
Los valores de correlación se encuentran entre -1 y 1. El signo indica la dirección de la relación, mientras que la cercanía a 1 o a -1 indica una relación lineal más intensa.
Como ahora estamos estudiando varias variables simultáneamente, necesitamos indicar con claridad a qué par de variables corresponde cada coeficiente de correlación.
En general, utilizaremos la notación
\[ r_{X,Y} \]
para representar el coeficiente de correlación entre las variables \(X\) y \(Y\).
Por ejemplo:
\(r_{\text{Sueño, Estrés}}\) representa la correlación entre las horas de sueño y el puntaje de estrés académico.
De manera similar, \(r_{\text{Estudio, Estrés}}\) representa la correlación entre las horas de estudio y el puntaje de estrés académico.
Mientras que \(r_{\text{Sueño, Estudio}}\) representa la correlación entre las horas de sueño y las horas de estudio.
Para nuestros datos se obtiene aproximadamente:
\[ r_{\text{Sueño, Estrés}} \;=\; -0.905 \]
\[ r_{\text{Estudio, Estrés}}\;=\;0.809 \]
\[ r_{\text{Sueño, Estudio}}\;=\;-0.531 \]
A partir de estos resultados se observa que:
Las horas de sueño y el estrés académico presentan una relación lineal negativa marcada (\(r=-0.905\)).
Las horas de estudio y el estrés académico presentan una relación lineal positiva (\(r=0.809\)).
Las horas de sueño y las horas de estudio presentan una relación lineal negativa (\(r=-0.531\)).
En conclusión:
Al considerar las variables por pares, tanto las horas de sueño como las horas de estudio presentan una relación lineal con el estrés académico.
Además, las dos variables explicativas también presentan cierta relación entre sí.
Esto motiva estudiar ambas variables simultáneamente mediante un modelo de regresión lineal múltiple, que permitirá analizar la relación de cada variable explicativa con el estrés académico teniendo en cuenta la presencia de la otra.
El mapa de calor permite resumir las correlaciones entre las variables. Sin embargo, también resulta útil observar directamente cómo se distribuyen los datos y qué forma presentan las relaciones entre cada par de variables.
Para ello podemos utilizar una matriz de gráficos,
construida mediante la función ggpairs() del paquete
GGally:
datos_graficos <- datos[, c("sueno", "estudio", "estres")]
names(datos_graficos) <- c(
"Horas de sueño",
"Horas de estudio",
"Puntaje de estrés"
)
GGally::ggpairs(
datos_graficos,
upper = list(
continuous = GGally::wrap(
"cor",
size = 4
)
),
lower = list(
continuous = GGally::wrap(
"smooth",
method = "lm",
se = FALSE,
color = "blue",
alpha = 0.75,
size = 2
)
),
diag = list(
continuous = GGally::wrap(
"densityDiag",
fill = "lightblue",
alpha = 0.7
)
)
) +
theme_minimal(base_size = 12) +
theme(
strip.text = element_text(face = "bold"),
panel.grid.minor = element_blank()
)
En esta representación:
La diagonal muestra la distribución de cada variable.
Los diagramas de dispersión permiten observar la relación entre cada par de variables.
Los coeficientes de correlación resumen la dirección y la intensidad de esas relaciones lineales.
Esta representación complementa la matriz de correlaciones y el mapa de calor, ya que permite observar directamente la forma de las relaciones antes de construir el modelo de regresión múltiple.
Cuando se utiliza una variable respuesta y más de una variable explicativa hablamos de regresión lineal múltiple.
En nuestro ejemplo queremos estudiar el estrés académico utilizando simultáneamente las horas de sueño y las horas de estudio.
En R podemos ajustar el modelo mediante:
modelo2 <- lm(estres ~ sueno + estudio, data = datos)
summary(modelo2)
##
## Call:
## lm(formula = estres ~ sueno + estudio, data = datos)
##
## Residuals:
## Min 1Q Median 3Q Max
## -3.5747 -0.5908 0.2395 0.7993 1.9245
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 55.6988 2.7017 20.616 1.82e-13 ***
## sueno -4.2649 0.3259 -13.085 2.65e-10 ***
## estudio 2.3667 0.2613 9.056 6.49e-08 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 1.386 on 17 degrees of freedom
## Multiple R-squared: 0.9688, Adjusted R-squared: 0.9652
## F-statistic: 264.1 on 2 and 17 DF, p-value: 1.576e-13
La expresión
estres ~ sueno + estudio
se puede leer como:
estudiar el estrés en función de las horas de sueño y las horas de estudio.
A partir de nuestros datos, la ecuación estimada es aproximadamente:
\[ \widehat{\text{Estrés}} \;=\; 55.70 \;-\; 4.26(\text{Horas de sueño}) \;+\; 2.37(\text{Horas de estudio}) \]
Ahora tenemos dos pendientes estimadas, una para cada variable explicativa.
La interpretación de las pendientes requiere una idea fundamental: cada coeficiente se interpreta teniendo en cuenta la presencia de la otra variable explicativa en el modelo.
El coeficiente estimado para las horas de sueño es:
\[ \hat{\beta}_{\text{Sueño}}\;=\;-4.26. \]
Su interpretación es:
Manteniendo constantes las horas de estudio, una hora adicional de sueño se asocia con una disminución promedio de aproximadamente 4.26 puntos en el puntaje de estrés académico.
El coeficiente estimado para las horas de estudio es:
\[ \hat{\beta}_{\text{Estudio}}=2.37. \]
Su interpretación es:
Manteniendo constantes las horas de sueño, una hora adicional de estudio se asocia con un aumento promedio de aproximadamente 2.37 puntos en el puntaje de estrés académico.
La expresión “manteniendo constante la otra variable” es fundamental para interpretar los coeficientes de una regresión múltiple.
Observe además que la pendiente correspondiente a las horas de sueño cambió:
\[ -5.8333 \quad\longrightarrow\quad -4.26. \]
En el primer modelo solo considerábamos las horas de sueño. En el segundo modelo también tenemos en cuenta las horas de estudio.
Por esta razón, los coeficientes de una regresión múltiple no tienen que coincidir con los obtenidos en una regresión simple.
Al igual que en la regresión lineal simple, podemos utilizar los p-valores para evaluar si existe evidencia de una relación lineal entre cada variable explicativa y la variable respuesta, teniendo en cuenta las demás variables incluidas en el modelo.
summary()Podemos presentar los principales resultados de
summary(modelo2) en una tabla:
tabla_modelo2 <- as.data.frame(coef(summary(modelo2)))
tabla_modelo2 <- data.frame(
Variable = c(
"Intercepto",
"Horas de sueño",
"Horas de estudio"
),
Estimación = round(tabla_modelo2[, 1], 2),
`Error estándar` = round(tabla_modelo2[, 2], 2),
`Valor t` = round(tabla_modelo2[, 3], 2),
`p-valor` = c("<0.001", "<0.001", "<0.001"),
check.names = FALSE
)
tabla_modelo2 |>
kbl(
align = "c",
booktabs = TRUE,
caption = "Resultados del modelo de regresión lineal múltiple"
) |>
kable_styling(
bootstrap_options = c("striped", "hover", "condensed"),
full_width = FALSE,
position = "center"
)
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| Intercepto | 55.70 | 2.70 | 20.62 | <0.001 |
| Horas de sueño | -4.26 | 0.33 | -13.08 | <0.001 |
| Horas de estudio | 2.37 | 0.26 | 9.06 | <0.001 |
Para las horas de sueño, el p-valor es menor de 0.001. Por tanto:
Manteniendo constantes las horas de estudio, existe evidencia de una relación lineal entre las horas de sueño y el estrés académico.
Para las horas de estudio, el p-valor también es menor de 0.001. Por tanto:
Manteniendo constantes las horas de sueño, existe evidencia de una relación lineal entre las horas de estudio y el estrés académico.
La interpretación completa debe considerar tanto la evidencia estadística, proporcionada por el p-valor, como la magnitud y dirección de la asociación, proporcionadas por cada coeficiente estimado.
Para el modelo que utiliza simultáneamente las horas de sueño y las horas de estudio se obtiene aproximadamente:
\[ R^2=0.969. \]
Esto significa que:
Aproximadamente el 96.9% de la variabilidad observada en los puntajes de estrés académico es explicada conjuntamente por el modelo lineal que incluye las horas de sueño y las horas de estudio.
Podemos comparar descriptivamente los dos modelos:
comparacion_modelos <- data.frame(
Modelo = c(
"Sueño",
"Sueño + estudio"
),
`Variables explicativas` = c(
"Horas de sueño",
"Horas de sueño y horas de estudio"
),
`R²` = c(
summary(modelo1)$r.squared,
summary(modelo2)$r.squared
),
check.names = FALSE
)
comparacion_modelos$`R²` <- round(
comparacion_modelos$`R²`,
3
)
comparacion_modelos |>
kbl(
align = "c",
booktabs = TRUE,
caption = "Comparación descriptiva de los modelos"
) |>
kable_styling(
bootstrap_options = c("striped", "hover", "condensed"),
full_width = FALSE,
position = "center"
)
| Modelo | Variables explicativas | R² |
|---|---|---|
| Sueño | Horas de sueño | 0.818 |
| Sueño + estudio | Horas de sueño y horas de estudio | 0.969 |
El modelo que incluye ambas variables explicativas presenta un \(R^2\) mayor.
En estos datos ilustrativos, incorporar las horas de estudio permite explicar una mayor proporción de la variabilidad observada en el estrés académico.
Sin embargo, un valor elevado de \(R^2\) no demuestra causalidad ni implica, por sí solo, que un modelo sea apropiado.
Además, estos datos fueron construidos con fines didácticos y presentan relaciones particularmente marcadas.
Una de las precauciones más importantes en la interpretación de los modelos de regresión consiste en distinguir entre asociación y causalidad.
Por ejemplo, nuestro modelo muestra que, manteniendo constantes las horas de estudio, un mayor número de horas de sueño está asociado con menores puntajes de estrés.
Sin embargo, esto no permite concluir automáticamente que aumentar las horas de sueño cause una reducción del estrés académico.
Pueden existir otras características de los estudiantes que no han sido incluidas en el modelo y que también estén relacionadas con el estrés.
Por esta razón, expresiones como:
“las horas de sueño están asociadas con el nivel de estrés”
son generalmente más apropiadas que:
“las horas de sueño causan una reducción del estrés”
a menos que el diseño de la investigación permita establecer relaciones causales.
Para utilizar adecuadamente un modelo de regresión lineal es conveniente examinar algunos aspectos de los datos y de los residuos del modelo.
| Aspecto | Pregunta orientadora |
|---|---|
| Linealidad | ¿Las relaciones estudiadas son aproximadamente lineales? |
| Independencia | ¿Las observaciones corresponden a unidades independientes? |
| Variabilidad de los residuos | ¿La dispersión de los residuos es aproximadamente similar? |
| Normalidad de los residuos | ¿Los residuos presentan una distribución aproximadamente normal? |
| Valores atípicos | ¿Existen observaciones extremadamente alejadas del patrón general? |
Es importante señalar que la normalidad se refiere principalmente a los residuos del modelo, no a que cada una de las variables tenga que presentar individualmente una distribución normal.
En este curso no realizaremos un diagnóstico avanzado. Nuestro objetivo será reconocer gráficamente situaciones claramente problemáticas.
Después de ajustar el modelo podemos estudiar sus residuos. Estos nos permiten analizar, de manera sencilla, qué tan diferentes son los valores observados de los valores predichos por el modelo.
Primero construiremos una base sencilla que reúna tres cantidades útiles para el diagnóstico del modelo:
ajustado: valor predicho por el
modelo para cada observación;
residuo: diferencia entre el valor
observado y el valor predicho;
residuo_estandarizado: versión
estandarizada del residuo, que facilita la comparación entre
observaciones.
diagnostico <- data.frame(
ajustado = fitted(modelo2),
residuo = residuals(modelo2),
residuo_estandarizado = rstandard(modelo2)
)
diagnostico
## ajustado residuo residuo_estandarizado
## 1 43.84123 0.1587735 0.1220837
## 2 37.20959 1.7904119 1.3484519
## 3 30.57795 0.4220502 0.3269405
## 4 44.07552 1.9244834 1.4543554
## 5 37.44388 0.5561217 0.4136307
## 6 28.44550 -0.4455004 -0.3482641
## 7 50.70715 1.2928451 1.0464615
## 8 26.31305 -0.3130510 -0.2511931
## 9 39.57633 0.4236723 0.3138733
## 10 46.20797 0.7920340 0.6066799
## 11 40.04491 -1.0449080 -0.9281227
## 12 35.07714 -2.0771387 -1.5508695
## 13 36.97530 -0.9752980 -0.8133223
## 14 33.17898 0.8210205 0.6451430
## 15 50.47286 -0.4728648 -0.3924506
## 16 28.67979 0.3202095 0.2557350
## 17 34.84285 0.1571514 0.1255306
## 18 48.57471 -3.5747056 -2.8431639
## 19 32.94469 -0.9446893 -0.7097508
## 20 39.81062 1.1893822 0.9163001
Cada fila de esta nueva base corresponde a una observación del conjunto de datos original.
Por ejemplo:
En la primera fila el modelo predice un valor aproximado de 43.84, mientras que el residuo es aproximadamente 0.16.
Un residuo positivo indica que el valor observado fue mayor que el valor predicho por el modelo.
Un residuo negativo indica que el valor observado fue menor que el predicho.
En las siguientes secciones utilizaremos estas cantidades para construir algunos gráficos básicos de diagnóstico.
ggplot(diagnostico, aes(x = ajustado, y = residuo)) +
geom_point(
size = 2.5,
color = "blue",
alpha = 0.8
) +
geom_hline(
yintercept = 0,
linetype = "dashed",
linewidth = 0.8,
color = "red"
) +
labs(
title = "Residuos frente a valores ajustados",
x = "Valor predicho de estrés",
y = "Residuo"
) +
theme_minimal(base_size = 12)
En términos generales, esperamos observar los puntos distribuidos alrededor de cero sin un patrón claramente definido.
Patrones curvos o cambios muy marcados en la dispersión pueden indicar que el modelo lineal no representa adecuadamente algunos aspectos de los datos.
ggplot(
diagnostico,
aes(sample = residuo_estandarizado)
) +
stat_qq(
size = 2.5,
color = "blue",
alpha = 0.8
) +
stat_qq_line(
linewidth = 0.8,
linetype = "dashed",
color = "red"
) +
labs(
title = "Gráfico Q-Q de los residuos",
x = "Cuantiles teóricos",
y = "Residuos estandarizados"
) +
theme_minimal(base_size = 12)
Si los puntos siguen aproximadamente la línea de referencia, la distribución de los residuos puede considerarse razonablemente compatible con una distribución normal.
No esperamos que todos los puntos se encuentren exactamente sobre la línea. El objetivo es identificar desviaciones claramente importantes.
Al finalizar esta unidad, usted debería ser capaz de:
Identificar la variable respuesta y las variables explicativas.
Reconocer visualmente la dirección y la forma general de una relación entre variables cuantitativas.
Interpretar el coeficiente de correlación en términos de dirección e intensidad de la relación lineal.
Interpretar la pendiente y el intercepto de un modelo de regresión lineal simple.
Obtener e interpretar una predicción a partir de una ecuación de regresión.
Comprender qué representa un residuo.
Interpretar el p-valor asociado con un coeficiente de regresión.
Interpretar un intervalo de confianza para un coeficiente de regresión.
Interpretar el coeficiente de determinación \(R^2\).
Interpretar los coeficientes de una regresión lineal múltiple utilizando la idea de mantener constantes las demás variables explicativas.
Distinguir entre asociación y causalidad.
Reconocer posibles problemas del modelo mediante gráficos básicos de residuos.
Correlación, regresión lineal simple y regresión lineal múltiple.
Aplicar los procedimientos estudiados para explorar, modelar e interpretar relaciones entre variables cuantitativas utilizando un conjunto de datos real. Asimismo, fortalecer las habilidades para seleccionar una muestra aleatoria reproducible, construir representaciones gráficas, interpretar coeficientes de regresión, evaluar evidencia estadística y documentar adecuadamente todo el proceso mediante R Markdown.
Para el desarrollo del proyecto se utilizará el conjunto de datos
sat.act del paquete
psych.
Esta base contiene información de 700 participantes recopilada como parte del proyecto Synthetic Aperture Personality Assessment (SAPA), un proyecto de evaluación psicológica realizado a través de Internet.
El conjunto de datos contiene seis variables:
gender: sexo registrado en la base;education: nivel educativo reportado;age: edad del participante;ACT: puntaje compuesto obtenido en la prueba ACT;SATV: puntaje correspondiente al componente verbal del
SAT;SATQ: puntaje correspondiente al componente
cuantitativo del SAT.En particular, los puntajes de las pruebas tienen las siguientes escalas:
ACT: puede tomar valores entre 1 y 36;SATV: puede tomar valores entre 200 y 800;SATQ: puede tomar valores entre 200 y 800.Los puntajes de ACT, SATV y
SATQ fueron reportados por los propios
participantes, por lo que deben interpretarse teniendo en cuenta
esta característica de la base.
Para cargar los datos en R, ejecute:
# Instalar una sola vez, si es necesario:
# install.packages("psych")
data("sat.act", package = "psych")
str(sat.act)
Puede consultar la documentación del conjunto de datos directamente desde R mediante:
?psych::sat.act
o mediante:
help("sat.act", package = "psych")
o en estos links:
En este proyecto trabajaremos únicamente con las siguientes cuatro variables cuantitativas:
age: edad del participante;ACT: puntaje compuesto en la prueba ACT;SATV: puntaje verbal en la prueba SAT;SATQ: puntaje cuantitativo en la prueba SAT.Las variables gender y education forman
parte de la base original, pero no serán utilizadas en los modelos
de regresión de este proyecto.
Nota:
Esta base fue incluida en el paquete con fines de demostración y análisis. Los autores señalan que los puntajes promedio son superiores a las normas nacionales, lo que podría estar relacionado con la autoselección de los participantes y con el hecho de que los puntajes fueron autoinformados. Por esta razón, los resultados obtenidos en el proyecto deberán interpretarse dentro del contexto de esta base de datos y no generalizarse automáticamente a toda la población.
Los lineamientos generales de elaboración, entrega, reproducibilidad y presentación utilizados en el curso se mantienen vigentes:
https://rpubs.com/hllinas/R_Lineamiento_EstInf
El trabajo se realizará en los 10 grupos ya conformados. Cada grupo trabajará con una muestra aleatoria diferente y reproducible, así como con una combinación específica de variables.
Antes de iniciar el proyecto, cada grupo deberá verificar con el profesor el número que le ha sido asignado. Esta verificación es responsabilidad del grupo, ya que el número determina tanto la semilla como las variables que deberán utilizarse.
Por esta razón, se recomienda realizar esta verificación antes de comenzar el análisis.
Si el proyecto se desarrolla utilizando un número de grupo diferente al asignado, se aplicará la penalización de 50 puntos en la calificación final del proyecto.
La siguiente tabla presenta la semilla y las variables asignadas a cada grupo.
La Variable explicativa 1 será utilizada inicialmente en la regresión lineal simple. Posteriormente, se incorporará la Variable explicativa 2 para construir el modelo de regresión lineal múltiple.
| Grupo | Semilla | Respuesta | Explicativa 1 | Explicativa 2 |
|---|---|---|---|---|
| 1 | 20260901 | ACT | SATV | SATQ |
| 2 | 20260902 | ACT | SATQ | age |
| 3 | 20260903 | ACT | age | SATV |
| 4 | 20260904 | SATV | ACT | SATQ |
| 5 | 20260905 | SATV | SATQ | age |
| 6 | 20260906 | SATV | age | ACT |
| 7 | 20260907 | SATQ | ACT | SATV |
| 8 | 20260908 | SATQ | SATV | age |
| 9 | 20260909 | SATQ | age | ACT |
| 10 | 20260910 | ACT | SATQ | SATV |
Una vez confirmado el número de su grupo con el profesor, realice los siguientes pasos.
Modifique únicamente el valor asignado al objeto
grupo.
Por ejemplo, si pertenece al grupo 1:
grupo <- 1
Ejecute el siguiente código sin modificarlo:
if (!(grupo %in% 1:10)) {
stop("El número del grupo debe estar entre 1 y 10.")
}
asignacion <- asignaciones[asignaciones$Grupo == grupo, ]
semilla <- asignacion$Semilla
variable_respuesta <- asignacion$Respuesta
variable_x1 <- asignacion$`Explicativa 1`
variable_x2 <- asignacion$`Explicativa 2`
asignacion
La salida mostrará el número del grupo, la semilla y las tres variables que deberán utilizarse durante todo el proyecto.
No modifique manualmente la semilla ni las variables asignadas.
Conserve únicamente las cuatro variables que pueden utilizarse en el proyecto y elimine las observaciones con datos faltantes:
base_proyecto <- sat.act[
complete.cases(
sat.act[, c("age", "ACT", "SATV", "SATQ")]
),
c("age", "ACT", "SATV", "SATQ")
]
Cada grupo trabajará con una muestra aleatoria de 180 observaciones.
Ejecute el siguiente código sin modificarlo:
set.seed(semilla)
indices <- sample(
seq_len(nrow(base_proyecto)),
size = 180,
replace = FALSE
)
muestra <- base_proyecto[indices, ]
Compruebe el tamaño de la muestra:
nrow(muestra)
El resultado debe ser:
180
Esta configuración garantiza que cada grupo pueda reproducir exactamente su muestra.
Importante: una muestra aleatoria no garantiza por sí sola representatividad. Por esta razón, posteriormente cada grupo deberá comparar descriptivamente su muestra con la base completa.
Conociendo la base de datos
Indique cuántas observaciones y variables contiene
sat.act.
Muestre los nombres de las variables y explique la esttructura de la base de datos.
Describa brevemente qué representan age,
ACT, SATV y SATQ.
Identificación de la muestra y de las variables asignadas
Utilizando los resultados obtenidos durante la configuración inicial:
Indique el número de su grupo (paso 1).
Indique la semilla asignada (paso 2).
Identifique la variable respuesta.
Identifique la Variable explicativa 1.
Identifique la Variable explicativa 2.
Compruebe que su muestra contiene 180 observaciones
(paso 4).
Importante: no modifique manualmente las observaciones seleccionadas.
Comprobación descriptiva de la muestra
Compare la muestra con la base completa para las tres variables asignadas a su grupo.
Como mínimo, compare:
Comente si la muestra reproduce razonablemente las principales características descriptivas de la base completa.
Pregunta de investigación
A partir de las variables asignadas a su grupo, formule una pregunta de investigación contextualizada. La pregunta deberá escribirse utilizando el significado de las variables y no únicamente sus códigos.
Puede utilizar como guía la siguiente estructura:
¿Cómo se relaciona la variable respuesta con la Variable explicativa 1 cuando también se tiene en cuenta la Variable explicativa 2?
Análisis exploratorio
Utilizando únicamente la muestra de su grupo:
Presente una tabla descriptiva de las tres variables.
Construya los histogramas o gráficos de densidad que considere apropiados.
Calcule la matriz de correlaciones.
Construya un mapa de calor de las correlaciones.
Construya una matriz de gráficos mediante
GGally::ggpairs().
Describa los principales patrones observados.
Regresión lineal simple
Utilice la variable respuesta y la variable explicativa 1 asignadas a su grupo.
Construya un diagrama de dispersión con la recta estimada.
Calcule e interprete el coeficiente de correlación.
Ajuste el modelo de regresión lineal simple.
Escriba la ecuación estimada.
Interprete la pendiente y el intercepto.
Utilice el p-valor para evaluar si existe evidencia de una relación lineal.
Construya e interprete el intervalo del 95% de confianza para la pendiente.
Interprete \(R^2\).
Realice una predicción para un valor razonable de la variable explicativa.
Explique por qué los resultados no implican necesariamente causalidad.
Regresión lineal múltiple
Mantenga la misma variable respuesta e incorpore la variable explicativa 1 y la variable explicativa 2 asignadas a su grupo.
Ajuste el modelo de regresión lineal múltiple.
Escriba la ecuación estimada.
Interprete cada coeficiente en el contexto del problema, utilizando explícitamente la idea de mantener constante la otra variable explicativa.
Interprete los p-valores asociados con cada coeficiente.
Construya e interprete intervalos del 95% de confianza para las pendientes.
Interprete \(R^2\) y \(R^2\) ajustado.
Compare los coeficientes obtenidos con los correspondientes resultados de la regresión simple.
Explique por qué un coeficiente de regresión múltiple no debe interpretarse como una correlación simple.
Comparación entre los modelos
Compare la regresión simple y la regresión múltiple.
Responda:
¿Cambió la pendiente de la primera variable explicativa al incorporar la segunda?
¿Cambió la evidencia estadística asociada con dicha variable?
¿Cómo cambió \(R^2\)?
¿Qué información adicional aporta el modelo con dos variables explicativas?
¿El aumento en \(R^2\) es suficiente, por sí solo, para afirmar que el segundo modelo es mejor? Explique.
Diagnóstico básico
Para el modelo múltiple:
Construya un gráfico de residuos frente a valores ajustados.
Construya un gráfico Q-Q de los residuos estandarizados.
Identifique si observa patrones claramente problemáticos.
Comente brevemente los supuestos de linealidad, variabilidad de los residuos, normalidad e independencia.
Conclusión
Escriba una conclusión de dos o tres párrafos en la que:
Responda la pregunta de investigación.
Describa la dirección y magnitud de las principales asociaciones.
Sseñale cuáles asociaciones presentan evidencia estadística.
Compare el modelo simple con el múltiple.
Interprete la capacidad explicativa del modelo.
Diferencie claramente asociación de causalidad.
Mencione al menos una limitación del análisis.
La semilla asignada al grupo debe aparecer explícitamente en el documento.
No cambie la muestra después de observar los resultados.
Todas las tablas y figuras deben tener título y numeración.
Utilice nombres claros para los ejes y las variables.
Interprete siempre los resultados en el contexto del problema.
Las afirmaciones sobre evidencia estadística deben sustentarse con los resultados obtenidos.
No confunda correlación con causalidad.
En regresión múltiple, interprete cada coeficiente manteniendo constantes las demás variables explicativas.
El código debe estar comentado y ejecutarse sin errores.
El documento debe ser completamente reproducible a partir del archivo R Markdown.
Los ejercicios se organizan en tres secciones.
En la primera sección se proporcionan directamente resultados, tablas o gráficos. El objetivo es concentrarse en la interpretación estadística de la información presentada.
En la segunda sección se proporciona una base de datos simulada. El estudiante deberá realizar el análisis en R y posteriormente interpretar los resultados obtenidos.
En la tercera sección se presentan ejercicios de integración y aplicación, en los que el estudiante deberá utilizar los conceptos estudiados para analizar diferentes situaciones y justificar sus respuestas.
En las dos primeras secciones se trabaja inicialmente con dos variables y, posteriormente, con una variable respuesta y dos variables explicativas. De esta manera, se avanza progresivamente desde la correlación y la regresión lineal simple hasta la regresión lineal múltiple.
En esta sección no es necesario ajustar nuevamente los modelos. Para cada ejercicio se proporcionan los principales resultados y, en algunos casos, una representación gráfica.
El objetivo es interpretar correctamente la información estadística en el contexto del problema.
Se estudió la relación entre horas de sueño y estrés académico.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 71.494 | 3.496 | 20.450 | <0.001 |
| sueno | -5.010 | 0.530 | -9.448 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.641 |
| R² ajustado | 0.634 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -6.075 |
| 97.5 % | Superior | -3.945 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas de sueño y estrés académico.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Para un estudiante que duerme 6.5 horas, obtenga el puntaje de estrés predicho por el modelo.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre horas semanales de actividad física y síntomas depresivos.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 30.447 | 1.26 | 24.160 | <0.001 |
| actividad | -2.254 | 0.25 | -9.007 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.628 |
| R² ajustado | 0.621 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -2.757 |
| 97.5 % | Superior | -1.751 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas semanales de actividad física y síntomas depresivos.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje predicho para una persona que realiza 5 horas semanales de actividad física.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre minutos diarios de mindfulness y estrés percibido.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 41.300 | 1.055 | 39.143 | <0.001 |
| mindfulness | -0.394 | 0.045 | -8.835 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.629 |
| R² ajustado | 0.621 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -0.484 |
| 97.5 % | Superior | -0.304 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre minutos diarios de mindfulness y estrés percibido.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje predicho para una persona que practica mindfulness durante 20 minutos diarios.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre horas diarias de estudio y autoeficacia académica.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 37.221 | 1.774 | 20.983 | <0.001 |
| estudio | 2.937 | 0.388 | 7.566 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.524 |
| R² ajustado | 0.515 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | 2.158 |
| 97.5 % | Superior | 3.716 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas diarias de estudio y autoeficacia académica.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje predicho para un estudiante que estudia 4 horas al día.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre consumo diario de café y calidad del sueño.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 78.554 | 1.935 | 40.601 | <0.001 |
| cafeina | -5.262 | 0.565 | -9.309 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.644 |
| R² ajustado | 0.636 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -6.398 |
| 97.5 % | Superior | -4.125 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre consumo diario de café y calidad del sueño.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje predicho para una persona que consume 3 tazas de café al día.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre número de sesiones de terapia y bienestar psicológico.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 41.701 | 1.505 | 27.715 | <0.001 |
| sesiones | 2.040 | 0.159 | 12.800 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.788 |
| R² ajustado | 0.783 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | 1.719 |
| 97.5 % | Superior | 2.361 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre número de sesiones de terapia y bienestar psicológico.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje predicho para una persona que ha completado 10 sesiones.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre puntaje de soledad y satisfacción con la vida.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 86.686 | 2.429 | 35.685 | <0.001 |
| soledad | -0.944 | 0.060 | -15.660 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.814 |
| R² ajustado | 0.811 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -1.065 |
| 97.5 % | Superior | -0.823 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre puntaje de soledad y satisfacción con la vida.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga la satisfacción predicha para un puntaje de soledad de 30.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre horas diarias de pantalla y atención.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 78.272 | 1.912 | 40.944 | <0.001 |
| pantalla | -3.557 | 0.326 | -10.901 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.712 |
| R² ajustado | 0.706 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | -4.214 |
| 97.5 % | Superior | -2.901 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas diarias de pantalla y atención.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje de atención predicho para 5 horas diarias de pantalla.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
Se estudió la relación entre apoyo familiar y resiliencia.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 26.706 | 1.920 | 13.913 | <0.001 |
| apoyo | 1.002 | 0.063 | 15.948 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.825 |
| R² ajustado | 0.822 |
| Limite | Valor | |
|---|---|---|
| 2.5 % | Inferior | 0.876 |
| 97.5 % | Superior | 1.128 |
Responda:
Identifique la variable respuesta y la variable explicativa.
Describa la dirección general de la relación observada en el gráfico.
Interprete la pendiente estimada en el contexto del problema.
Interprete el intercepto e indique si su interpretación práctica resulta razonable.
Utilizando el p-valor, determine si existe evidencia de una relación lineal entre apoyo familiar y resiliencia.
Interprete el intervalo del 95% de confianza para la pendiente.
Interprete el valor de \(R^2\).
Obtenga el puntaje de resiliencia predicho para un nivel de apoyo familiar de 35.
¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.
En estos ejercicios se analiza una variable respuesta utilizando simultáneamente dos variables explicativas.
Preste especial atención a la interpretación de cada coeficiente manteniendo constante la otra variable explicativa.
Se estudió estrés académico utilizando como variables explicativas horas de sueño y horas de estudio.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 55.215 | 2.555 | 21.607 | <0.001 |
| sueno | -3.836 | 0.332 | -11.551 | <0.001 |
| estudio | 2.578 | 0.242 | 10.658 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.816 |
| R² ajustado | 0.810 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante horas de estudio.
Interprete el coeficiente correspondiente a horas de estudio, manteniendo constante horas de sueño.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con estrés académico.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió síntomas depresivos utilizando como variables explicativas actividad física y horas de sueño.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 51.858 | 2.697 | 19.231 | <0.001 |
| actividad | -1.758 | 0.226 | -7.777 | <0.001 |
| sueno | -2.701 | 0.392 | -6.883 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.673 |
| R² ajustado | 0.661 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a actividad física, manteniendo constante horas de sueño.
Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante actividad física.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con síntomas depresivos.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió agotamiento utilizando como variables explicativas carga académica y horas de sueño.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 23.280 | 3.349 | 6.951 | <0.001 |
| carga | 0.908 | 0.060 | 15.037 | <0.001 |
| sueno | -2.032 | 0.415 | -4.902 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.801 |
| R² ajustado | 0.795 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a carga académica, manteniendo constante horas de sueño.
Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante carga académica.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con agotamiento.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió autoeficacia académica utilizando como variables explicativas horas de estudio y procrastinación.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 47.387 | 2.161 | 21.929 | <0.001 |
| estudio | 3.208 | 0.365 | 8.777 | <0.001 |
| procrastinacion | -0.512 | 0.046 | -11.166 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.772 |
| R² ajustado | 0.764 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a horas de estudio, manteniendo constante procrastinación.
Interprete el coeficiente correspondiente a procrastinación, manteniendo constante horas de estudio.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con autoeficacia académica.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió atención utilizando como variables explicativas tiempo de pantalla y horas de sueño.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 51.762 | 3.556 | 14.556 | <0.001 |
| pantalla | -2.752 | 0.263 | -10.483 | <0.001 |
| sueno | 3.703 | 0.448 | 8.268 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.797 |
| R² ajustado | 0.790 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a tiempo de pantalla, manteniendo constante horas de sueño.
Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante tiempo de pantalla.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con atención.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió resiliencia utilizando como variables explicativas apoyo familiar y eventos estresantes.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 42.365 | 2.312 | 18.326 | <0.001 |
| apoyo | 0.762 | 0.061 | 12.592 | <0.001 |
| eventos | -1.569 | 0.218 | -7.192 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.782 |
| R² ajustado | 0.775 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a apoyo familiar, manteniendo constante eventos estresantes.
Interprete el coeficiente correspondiente a eventos estresantes, manteniendo constante apoyo familiar.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con resiliencia.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
Se estudió ansiedad ante exámenes utilizando como variables explicativas horas de preparación y horas de sueño.
| Variable | Estimación | Error estándar | Valor t | p-valor |
|---|---|---|---|---|
| (Intercept) | 70.077 | 4.062 | 17.250 | <0.001 |
| preparacion | -2.336 | 0.257 | -9.100 | <0.001 |
| sueno | -2.965 | 0.550 | -5.396 | <0.001 |
| Medida | Valor |
|---|---|
| R² | 0.642 |
| R² ajustado | 0.629 |
Responda:
Identifique la variable respuesta y las dos variables explicativas.
A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.
Interprete el coeficiente correspondiente a horas de preparación, manteniendo constante horas de sueño.
Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante horas de preparación.
Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con ansiedad ante exámenes.
Interprete el valor de \(R^2\) del modelo completo.
Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.
¿Puede establecerse una relación causal a partir de estos resultados? Justifique.
En esta sección se proporciona el código necesario para generar una base de datos simulada y reproducible.
El estudiante deberá:
Ejecutar el código.
Explorar los datos.
Realizar el análisis solicitado en R.
Presentar tablas y gráficos apropiados.
Interpretar los resultados en el contexto del problema.
Para cada ejercicio realice, como mínimo:
un diagrama de dispersión con ggplot2;
el coeficiente de correlación;
una regresión lineal simple;
la ecuación estimada;
la interpretación de la pendiente y del intercepto;
la interpretación del p-valor de la pendiente;
el intervalo del 95% de confianza para la pendiente;
la interpretación de \(R^2\);
una predicción para un valor razonable de la variable explicativa;
un gráfico de residuos frente a valores ajustados y un gráfico Q-Q;
una conclusión de un párrafo, diferenciando claramente asociación de causalidad.
set.seed(3021)
n <- 45
preparacion <- runif(n, 1, 12)
ansiedad <- 68 - 2.4 * preparacion + rnorm(n, 0, 5.0)
datos_21 <- data.frame(
preparacion = preparacion,
ansiedad = ansiedad
)
head(datos_21)
## preparacion ansiedad
## 1 11.020870 28.55252
## 2 6.398477 48.98855
## 3 2.475623 58.46368
## 4 3.825520 53.01834
## 5 10.533662 45.14654
## 6 2.905242 67.83186
Analice la relación entre horas de preparación semanal y puntaje de ansiedad ante exámenes siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3023)
n <- 48
telefono <- runif(n, 1, 10)
estres <- 22 + 3.0 * telefono + rnorm(n, 0, 5.0)
datos_23 <- data.frame(
telefono = telefono,
estres = estres
)
head(datos_23)
## telefono estres
## 1 1.359089 28.84988
## 2 5.031487 40.92063
## 3 4.965812 34.57916
## 4 8.945949 48.92403
## 5 7.993926 46.10814
## 6 9.635587 47.21506
Analice la relación entre horas diarias de uso del teléfono y puntaje de estrés percibido siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3024)
n <- 46
sueno <- runif(n, 4, 9)
bienestar <- 25 + 6.2 * sueno + rnorm(n, 0, 6.0)
datos_24 <- data.frame(
sueno = sueno,
bienestar = bienestar
)
head(datos_24)
## sueno bienestar
## 1 5.506290 61.63897
## 2 5.010316 55.90162
## 3 8.880070 76.39063
## 4 4.599152 54.63832
## 5 5.654642 55.90903
## 6 7.850259 77.45378
Analice la relación entre horas de sueño y puntaje de bienestar siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3025)
n <- 52
actividad <- runif(n, 0, 8)
depresion <- 31 - 2.0 * actividad + rnorm(n, 0, 4.8)
datos_25 <- data.frame(
actividad = actividad,
depresion = depresion
)
head(datos_25)
## actividad depresion
## 1 0.8525675 21.14259
## 2 2.3207158 25.14572
## 3 2.9251674 28.52305
## 4 3.2824772 30.13623
## 5 7.0162408 17.16323
## 6 1.6205627 26.47823
Analice la relación entre horas semanales de actividad física y puntaje de síntomas depresivos siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3026)
n <- 44
meditacion <- runif(n, 0, 35)
atencion <- 48 + 0.65 * meditacion + rnorm(n, 0, 5.0)
datos_26 <- data.frame(
meditacion = meditacion,
atencion = atencion
)
head(datos_26)
## meditacion atencion
## 1 11.269678 51.27865
## 2 8.255383 52.91006
## 3 32.126956 71.02560
## 4 3.572094 53.69108
## 5 2.828698 48.93715
## 6 2.572333 56.82351
Analice la relación entre minutos diarios de meditación y puntaje de atención siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3027)
n <- 50
trabajo <- runif(n, 20, 60)
agotamiento <- 15 + 0.9 * trabajo + rnorm(n, 0, 6.5)
datos_27 <- data.frame(
trabajo = trabajo,
agotamiento = agotamiento
)
head(datos_27)
## trabajo agotamiento
## 1 32.62027 37.48138
## 2 44.35140 66.39188
## 3 51.59857 70.82320
## 4 47.04836 51.33340
## 5 29.64426 50.45201
## 6 26.38318 48.24533
Analice la relación entre horas de trabajo por semana y puntaje de agotamiento siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3028)
n <- 47
apoyo <- runif(n, 10, 50)
autoestima <- 32 + 0.82 * apoyo + rnorm(n, 0, 5.0)
datos_28 <- data.frame(
apoyo = apoyo,
autoestima = autoestima
)
head(datos_28)
## apoyo autoestima
## 1 29.99392 50.84661
## 2 45.50175 76.22582
## 3 22.14166 46.68562
## 4 35.28118 68.12315
## 5 49.36038 74.69799
## 6 35.85919 62.88288
Analice la relación entre puntaje de apoyo de pares y puntaje de autoestima siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3029)
n <- 45
cafeina <- runif(n, 0, 6)
ansiedad <- 28 + 4.2 * cafeina + rnorm(n, 0, 5.5)
datos_29 <- data.frame(
cafeina = cafeina,
ansiedad = ansiedad
)
head(datos_29)
## cafeina ansiedad
## 1 3.8557978 42.77508
## 2 1.4249815 34.19607
## 3 0.5834201 28.33439
## 4 3.5795858 49.48355
## 5 1.8745108 38.99702
## 6 2.3578837 33.28124
Analice la relación entre tazas de café por día y puntaje de ansiedad ante exámenes siguiendo los pasos indicados al comienzo de esta sección.
set.seed(3030)
n <- 50
afrontamiento <- runif(n, 15, 60)
resiliencia <- 24 + 0.9 * afrontamiento + rnorm(n, 0, 5.8)
datos_30 <- data.frame(
afrontamiento = afrontamiento,
resiliencia = resiliencia
)
head(datos_30)
## afrontamiento resiliencia
## 1 24.43757 47.92461
## 2 36.33050 47.51276
## 3 21.08109 38.97192
## 4 36.90999 58.63266
## 5 41.94613 53.76095
## 6 50.37778 62.27524
Analice la relación entre puntaje de estrategias de afrontamiento y puntaje de resiliencia siguiendo los pasos indicados al comienzo de esta sección.
Para cada ejercicio realice, como mínimo:
una tabla descriptiva de las tres variables;
una matriz de correlaciones;
un mapa de calor de las correlaciones;
una matriz de gráficos con
GGally::ggpairs();
una regresión lineal simple utilizando una de las variables explicativas;
una regresión lineal múltiple utilizando las dos variables explicativas;
la interpretación contextual de todos los coeficientes del modelo múltiple;
la interpretación de los p-valores y de los intervalos de confianza;
la interpretación y comparación de \(R^2\) entre el modelo simple y el múltiple;
los gráficos básicos de diagnóstico;
una conclusión de dos párrafos, diferenciando asociación de causalidad.
set.seed(4032)
n <- 52
trabajo <- runif(n,20,60)
actividad <- runif(n,0,8)
estres <- 20 + 0.75*trabajo - 1.8*actividad + rnorm(n,0,5.0)
datos_32 <- data.frame(
trabajo = trabajo,
actividad = actividad,
estres = estres
)
head(datos_32)
## trabajo actividad estres
## 1 24.45646 0.5054714 30.18525
## 2 40.21227 7.9063202 35.24325
## 3 56.12415 1.7303813 51.88230
## 4 33.58976 2.3607143 42.38489
## 5 46.06305 3.5117742 55.21984
## 6 41.28127 6.3079376 36.50942
Considere puntaje de estrés como variable respuesta y horas de trabajo y actividad física como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4034)
n <- 58
soledad <- runif(n,10,60)
actividad <- runif(n,0,8)
depresion <- 10 + 0.52*soledad - 1.6*actividad + rnorm(n,0,4.8)
datos_34 <- data.frame(
soledad = soledad,
actividad = actividad,
depresion = depresion
)
head(datos_34)
## soledad actividad depresion
## 1 47.80379 6.5652862 26.56501
## 2 14.23279 3.8138091 20.20104
## 3 31.50962 0.4466517 30.69081
## 4 54.98058 6.1354900 24.61993
## 5 39.24334 3.5969733 29.55164
## 6 35.37198 1.6512207 25.94889
Considere síntomas depresivos como variable respuesta y soledad y actividad física como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4035)
n <- 54
carga <- runif(n,10,45)
recuperacion <- runif(n,10,50)
agotamiento <- 28 + 1.0*carga - 0.72*recuperacion + rnorm(n,0,5.2)
datos_35 <- data.frame(
carga = carga,
recuperacion = recuperacion,
agotamiento = agotamiento
)
head(datos_35)
## carga recuperacion agotamiento
## 1 13.73731 40.59353 10.09043
## 2 27.02797 28.24634 35.63465
## 3 24.29816 25.61586 32.46819
## 4 22.54035 29.66185 32.46352
## 5 18.97896 30.45431 17.13324
## 6 32.11721 11.24608 49.43462
Considere agotamiento como variable respuesta y carga académica y recuperación como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4036)
n <- 50
pantalla <- runif(n,1,10)
sueno <- runif(n,4,9)
atencion <- 52 - 2.8*pantalla + 3.3*sueno + rnorm(n,0,5.2)
datos_36 <- data.frame(
pantalla = pantalla,
sueno = sueno,
atencion = atencion
)
head(datos_36)
## pantalla sueno atencion
## 1 9.593635 6.998433 47.32984
## 2 1.068439 6.807005 69.11125
## 3 4.569486 7.513190 65.96547
## 4 9.753299 6.950700 41.50914
## 5 4.124507 5.365720 58.93419
## 6 2.580103 7.941871 70.94398
Considere puntaje de atención como variable respuesta y tiempo de pantalla y horas de sueño como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4037)
n <- 52
apoyo <- runif(n,10,50)
acoso <- runif(n,0,15)
autoestima <- 38 + 0.70*apoyo - 1.25*acoso + rnorm(n,0,5.0)
datos_37 <- data.frame(
apoyo = apoyo,
acoso = acoso,
autoestima = autoestima
)
head(datos_37)
## apoyo acoso autoestima
## 1 39.37687 14.604141 46.96989
## 2 10.51580 9.529926 28.73014
## 3 25.79612 9.141267 40.50817
## 4 48.24437 1.285079 67.35407
## 5 11.35241 7.126743 35.43459
## 6 10.21357 9.741301 32.53777
Considere autoestima como variable respuesta y apoyo de pares y experiencias de acoso como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4038)
n <- 56
afrontamiento <- runif(n,15,60)
adversidad <- runif(n,0,15)
resiliencia <- 35 + 0.82*afrontamiento - 1.15*adversidad + rnorm(n,0,5.5)
datos_38 <- data.frame(
afrontamiento = afrontamiento,
adversidad = adversidad,
resiliencia = resiliencia
)
head(datos_38)
## afrontamiento adversidad resiliencia
## 1 46.09044 13.388757 55.49601
## 2 59.76327 10.948847 71.76586
## 3 59.09142 9.330728 75.27519
## 4 51.94027 3.143521 79.31265
## 5 56.24745 4.800582 69.89453
## 6 50.35002 7.578707 73.99308
Considere resiliencia como variable respuesta y afrontamiento y adversidad como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
set.seed(4040)
n <- 55
estudio <- runif(n,1,8)
procrastinacion <- runif(n,10,60)
autoeficacia <- 45 + 3.1*estudio - 0.58*procrastinacion + rnorm(n,0,5.0)
datos_40 <- data.frame(
estudio = estudio,
procrastinacion = procrastinacion,
autoeficacia = autoeficacia
)
head(datos_40)
## estudio procrastinacion autoeficacia
## 1 3.008575 54.75972 22.24762
## 2 5.964877 49.00816 38.86142
## 3 6.266869 52.72925 41.56923
## 4 5.995789 21.65589 52.74847
## 5 6.163366 56.59411 22.86616
## 6 7.204435 57.90131 25.86277
Considere autoeficacia académica como variable respuesta y horas de estudio y procrastinación como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.
Un investigador estudia la relación entre las horas promedio de sueño por noche y el puntaje de estrés académico de estudiantes universitarios.
El modelo obtenido fue:
\[ \widehat{\text{Estrés}} = 48.6-2.4(\text{Horas de sueño}) \]
Identifique la variable respuesta y la variable explicativa.
Interprete el valor -2.4 en el contexto del problema.
Obtenga el puntaje de estrés esperado para un estudiante que duerme 6 horas por noche.
Si el p-valor asociado con las horas de sueño es 0.003, ¿qué puede concluir utilizando un nivel de significancia de 0.05?
¿Puede concluir que aumentar las horas de sueño necesariamente reduce el estrés? Explique.
En un modelo que estudia la relación entre actividad física y síntomas depresivos, el intervalo del 95% de confianza para el cambio promedio asociado con una hora adicional de actividad física semanal fue:
\[ (-2.8,\;-0.7) \]
Interprete el intervalo en el contexto del problema.
¿Existe evidencia de una relación entre las variables? Explique utilizando el intervalo de confianza.
Un investigador estudia el puntaje de ansiedad utilizando las horas de sueño y las horas diarias de uso de redes sociales.
Se obtuvo:
| Variable | Estimación | p-valor |
|---|---|---|
| Horas de sueño | -2.30 | 0.004 |
| Redes sociales | 1.70 | 0.021 |
Interprete el coeficiente correspondiente a las horas de sueño.
Interprete el coeficiente correspondiente al uso de redes sociales.
¿Qué significa la expresión “manteniendo constante la otra variable”?
Determine cuáles variables presentan evidencia de asociación con la ansiedad utilizando un nivel de significancia de 0.05.
Un modelo que utiliza las horas de sueño y las horas de estudio para explicar el estrés académico presenta un coeficiente de determinación de 0.46.
Interprete este valor en el contexto del problema.
¿Significa este resultado que el 46% del estrés de cada estudiante es causado por las horas de sueño y de estudio? Explique.
Se estudió el puntaje de ansiedad de 80 estudiantes utilizando las horas de sueño y las horas diarias de uso de redes sociales.
Los resultados del modelo fueron:
| Variable | Coeficiente | Error estándar | p-valor |
|---|---|---|---|
| Intercepto | 51.30 | 4.80 | <0.001 |
| Horas de sueño | -2.60 | 0.65 | 0.001 |
| Redes sociales | 1.35 | 0.48 | 0.008 |
Además,
\[ R^2=0.44 \]
Responda:
¿Cuál es la variable respuesta?
¿Cuáles son las variables explicativas?
Interprete el coeficiente -2.60 correspondiente a las horas de sueño.
Interprete el coeficiente 1.35 correspondiente al uso de redes sociales.
¿Existe evidencia de una relación entre las horas de sueño y la ansiedad? Justifique utilizando el p-valor.
¿Existe evidencia de una relación entre el uso de redes sociales y la ansiedad?
Interprete el valor del coeficiente de determinación.
Dos estudiantes utilizan redes sociales durante el mismo número de horas diarias. Uno duerme una hora más que el otro. ¿Qué diferencia promedio predice el modelo entre sus puntajes de ansiedad?
¿Puede concluirse que dormir una hora adicional causa una disminución de 2.60 puntos en la ansiedad? Explique.
LLinás, H., Rojas, C. (2005). Estadística descriptiva y distribuciones de probabilidad. Barranquilla: Editorial Universidad del Norte.
Consultar mis notas de clase: Estadística inferencial
Notas de clase - Cap. 6: Click derecho aquí.
Consultar el documento RPubs :: Enlace y materiales de ayuda.
Agresti, A., Franklin, C., & Klingenberg, B. (2018). Statistics: The Art and Science of Learning from Data, 4/E.
Puede consultarse mis siguientes documentos:
También, puede consultarse mis Notas de clase - Cap. 6: Click derecho aquí.
If you found any ERRORS or have SUGGESTIONS, please report them to my email. Thanks.