hllinas2023

1 Paquetes

Para el desarrollo de los ejemplos de este capítulo utilizaremos los siguientes paquetes de R, que nos permitirán construir gráficos y presentar tablas de manera clara y organizada.

library(ggplot2)
library(GGally)
library(knitr)
library(kableExtra)

2 Preliminares: recordando la ecuación de una recta

2.0.1 Relación lineal entre dos variables

Antes de estudiar la regresión lineal, recordemos brevemente algunos elementos de la ecuación de una recta.

Una de las formas más sencillas de representar la relación entre dos variables cuantitativas \(x\) y \(y\) es:

\[ y=\delta+\beta x \]

donde:

  • \(x\) representa la variable explicativa o predictora;

  • \(y\) representa la variable respuesta;

  • \(\delta\) es el intercepto o punto de partida de la recta;

  • \(\beta\) es la pendiente de la recta.

La pendiente es particularmente importante porque indica cuánto cambia \(y\) cuando \(x\) aumenta una unidad.

2.0.2 Un ejemplo en Psicología

a) Contexto

Suponga que un investigador desea relacionar el número de horas de sueño de los estudiantes con su puntaje de estrés académico.

En este caso podríamos definir:

  • \(x\): horas de sueño por noche;

  • \(y\): puntaje de estrés académico.

b) La ecuación

Suponga, a manera de ejemplo, que la relación pudiera representarse mediante:

\[ y=50-3x \]

c) Valor de la pendiente e interpetación

La pendiente es

\[ \beta= -3. \]

De acuerdo con la recta, Esto significa que:

  • Por cada hora adicional de sueño, el puntaje de estrés disminuye 3 puntos.

d) Predicción

Por ejemplo, para un estudiante que duerme 6 horas:

\[ y=50-3(6)=32 \]

Por tanto, la recta asignaría un puntaje de estrés de 32 puntos.

2.0.3 El signo de la pendiente

La pendiente indica cuánto cambia la variable respuesta cuando la variable explicativa aumenta una unidad.

Además, su signo permite conocer la dirección de la relación.

a) Pendiente positiva

Cuando la pendiente es positiva, al aumentar la variable explicativa, la variable respuesta también tiende a aumentar.

Por ejemplo, imagine una relación entre:

  • \(x\): horas semanales dedicadas al estudio;

  • \(y\): puntaje obtenido en una prueba.

Una pendiente positiva indicaría que un mayor número de horas de estudio está asociado con puntajes más altos.

b) Pendiente negativa

Cuando la pendiente es negativa, al aumentar la variable explicativa, la variable respuesta tiende a disminuir.

Por ejemplo:

  • \(x\): horas de sueño;

  • \(y\): puntaje de estrés académico.

Una pendiente negativa indicaría que un mayor número de horas de sueño está asociado con menores puntajes de estrés.

c) Pendiente igual a cero

Cuando la pendiente es igual a cero, al aumentar la variable explicativa, el valor representado por la recta permanece constante.

Por ejemplo, una pendiente igual o muy cercana a cero indicaría que no se observa un cambio lineal en el puntaje psicológico al aumentar la variable explicativa.

2.0.4 El intercepto

El intercepto representa el valor de \(y\) cuando \(x=0\).

a) Ejemplo

Considere nuevamente:

\[ y=50-3x \]

b) Interpretación del intercepto

El intercepto es \[ \delta=50. \]

Matemáticamente, esto significa que cuando:

\[ x=0, \]

entonces:

\[ y=50. \]

c) Comentario importante sobre el intercepto

Sin embargo, en una aplicación real el intercepto no siempre tiene una interpretación práctica útil.

Por ejemplo, si \(x\) representa las horas de sueño, interpretar el puntaje de estrés de una persona que duerme cero horas podría no ser relevante para el estudio.

Por esta razón, en regresión no todos los valores de la ecuación deben interpretarse de manera automática.

2.0.5 De una recta matemática a datos reales

Hasta ahora hemos considerado la relación entre dos variables mediante una recta.

Sin embargo, en Psicología los datos reales rara vez se encuentran exactamente sobre una línea.

a) Ejemplo

Suponga que se registran las horas promedio de sueño, las horas diarias de estudio y el puntaje de estrés académico de 20 estudiantes universitarios.

Los siguientes datos son únicamente ilustrativos:

datos <- data.frame(
  estudiante = 1:20,
  sueno = c(5.0, 6.0, 7.0, 5.5, 6.5, 7.5, 4.5, 8.0, 6.0, 5.0,
            7.0, 6.5, 5.5, 7.5, 4.0, 8.0, 6.0, 5.0, 7.0, 6.5),
  estudio = c(4, 3, 2, 5, 4, 2, 6, 2, 4, 5,
              6, 3, 2, 4, 5, 3, 2, 6, 3, 5),
  estres = c(44, 39, 31, 46, 38, 28, 52, 26, 40, 47,
             39, 33, 36, 34, 50, 29, 35, 45, 32, 41)
)

datos |>
  kbl(
    col.names = c(
      "Estudiante",
      "Horas de sueño",
      "Horas de estudio",
      "Puntaje de estrés"
    ),
    align = "c",
    booktabs = TRUE,
    caption = "Datos ilustrativos de 20 estudiantes"
  ) |>
  kable_styling(
    bootstrap_options = c("striped", "hover", "condensed"),
    full_width = FALSE,
    position = "center"
  )
Datos ilustrativos de 20 estudiantes
Estudiante Horas de sueño Horas de estudio Puntaje de estrés
1 5.0 4 44
2 6.0 3 39
3 7.0 2 31
4 5.5 5 46
5 6.5 4 38
6 7.5 2 28
7 4.5 6 52
8 8.0 2 26
9 6.0 4 40
10 5.0 5 47
11 7.0 6 39
12 6.5 3 33
13 5.5 2 36
14 7.5 4 34
15 4.0 5 50
16 8.0 3 29
17 6.0 2 35
18 5.0 6 45
19 7.0 3 32
20 6.5 5 41

Inicialmente nos concentraremos únicamente en la relación entre:

  • \(x\): horas de sueño por noche;

  • \(y\): puntaje de estrés académico.

b) Interpretación de cada observación

Cada estudiante proporciona un par de valores, formado por sus horas de sueño y su puntaje de estrés:

\[ (\text{horas de sueño},\;\text{puntaje de estrés}) \]

Por ejemplo, para el primer estudiante tenemos:

\[ (5.0,\;44) \]

mientras que para el sexto estudiante tenemos:

\[ (7.5,\;28). \]

Observe que la base de datos contiene también las horas de estudio. Esta variable no será utilizada inicialmente, pero la incorporaremos más adelante cuando estudiemos modelos con más de una variable explicativa.

2.0.6 Diagrama de dispersión

Un primer paso para estudiar la relación entre dos variables cuantitativas consiste en construir un diagrama de dispersión.

a) Componentes en el gráfico

En este gráfico:

  • La variable explicativa se representa en el eje horizontal.

  • La variable respuesta se representa en el eje vertical.

  • Cada estudiante aparece representado mediante un punto.

b) Ejemplo en R

En R podemos construirlo de la siguiente manera:

ggplot(datos, aes(x = sueno, y = estres)) +
  geom_point(size = 2.5, color = "blue") +
  labs(
    title = "Relación entre horas de sueño y estrés académico",
    x = "Horas de sueño",
    y = "Puntaje de estrés académico"
  ) +
  theme_minimal(base_size = 12)

c) Preguntas para interpretar el gráfico

Observe el gráfico y responda:

  1. ¿Parece existir alguna relación entre las horas de sueño y el estrés académico?

  2. ¿La relación parece creciente o decreciente?

  3. ¿Los puntos parecen seguir aproximadamente una línea recta?

  4. ¿Todos los estudiantes presentan exactamente el mismo patrón?

2.0.7 De la recta a la regresión

En el ejemplo anterior se observa una tendencia: los estudiantes que duermen más horas tienden a presentar menores puntajes de estrés académico.

Sin embargo, los puntos no se encuentran exactamente sobre una misma recta.

Esto plantea una nueva pregunta:

¿Podemos encontrar una recta que represente adecuadamente la tendencia general observada en los datos?

La regresión lineal proporciona una herramienta estadística para responder esta pregunta.

A partir de este momento ya no estudiaremos una recta únicamente como una expresión matemática, sino como un modelo que permite describir y cuantificar la relación entre variables observadas.

3 Relaciones entre variables y regresión lineal

3.0.1 Introducción

En la sección anterior vimos que un diagrama de dispersión permite visualizar la relación entre dos variables cuantitativas.

a) Ejemplo

Continuaremos trabajando con los mismos datos de los 20 estudiantes y, en una primera etapa, estudiaremos la relación entre:

  • Variable explicativa (\(x\)): horas de sueño.

  • Variable respuesta (\(y\)): puntaje de estrés académico.

b) Preguntas iniciales

Ahora queremos ir más allá de la descripción gráfica y responder preguntas como:

  • ¿Qué tan fuerte es la relación entre las variables?

  • ¿La relación es positiva o negativa?

  • ¿Cuánto cambia, en promedio, el estrés cuando cambian las horas de sueño?

  • ¿Existe evidencia estadística de esa relación?

  • ¿Podemos utilizar las horas de sueño para predecir el puntaje de estrés?

c) ¿Cómo se pueden responder esas preguntas iniciales?

Para responder estas preguntas estudiaremos inicialmente la correlación y posteriormente la regresión lineal.

El énfasis estará en la interpretación de los resultados y no en el desarrollo matemático de las fórmulas.

Más adelante incorporaremos las horas de estudio como una segunda variable explicativa.

3.0.2 Correlación

a) Definición

El coeficiente de correlación, representado por \(r\), permite resumir la dirección y la intensidad de la relación lineal entre dos variables cuantitativas.

b) Propiedades

El coeficiente de correlación toma valores entre -1 y 1:

  • Un valor positivo indica una relación lineal creciente;

  • Un valor negativo indica una relación lineal decreciente;

  • Cuanto más próximo se encuentre \(r\) a 1 o a -1, mayor será la intensidad de la relación lineal;

  • Cuanto más próximo se encuentre \(r\) a cero, menor será la intensidad de la relación lineal.

Es importante observar que un valor cercano a cero indica poca relación lineal, pero no necesariamente ausencia de cualquier tipo de relación entre las variables.

c) Ejemplo en R

En R podemos calcularlo mediante:

cor(datos$sueno, datos$estres)
## [1] -0.9046659

Para nuestros datos se obtiene aproximadamente:

\[ r\;=\;-0.905 \]

El signo negativo indica que la relación es decreciente: los estudiantes que duermen más horas tienden a presentar menores puntajes de estrés académico.

Además, el valor se encuentra relativamente cerca de -1, lo que indica una relación lineal marcada en estos datos.

d) Comentario importante

Es importante recordar que el coeficiente de correlación describe una asociación entre las variables.

Correlación no implica causalidad.

Por tanto, estos resultados no permiten afirmar, por sí solos, que dormir más horas sea la causa de una reducción del estrés académico.

3.0.3 Regresión lineal simple

La correlación permite conocer la dirección y la intensidad de una relación lineal, pero podemos ir un paso más allá y preguntarnos:

¿Cuánto cambia, en promedio, el puntaje de estrés académico cuando cambian las horas de sueño?

La regresión lineal simple permite responder esta pregunta mediante una recta que representa la tendencia general observada en los datos.

En términos generales, podemos pensar en la ecuación de regresión como:

\[ \text{Valor esperado de la respuesta} \;=\; \text{punto de partida} \;+\; \text{cambio asociado con la variable explicativa} \]

3.0.4 Ajuste del modelo en R

a) La función lm()

En R, el modelo de regresión lineal simple se ajusta mediante la función lm():

modelo1 <- lm(estres ~ sueno, data = datos)
modelo1
## 
## Call:
## lm(formula = estres ~ sueno, data = datos)
## 
## Coefficients:
## (Intercept)        sueno  
##      74.417       -5.833

La expresión

estres ~ sueno

se puede leer como:

estudiar el estrés en función de las horas de sueño.

b) La función summary()

Para obtener información más detallada sobre el modelo utilizamos:

summary(modelo1)
## 
## Call:
## lm(formula = estres ~ sueno, data = datos)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -6.3333 -1.9583 -0.3333  2.1458  5.4167 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  74.4167     4.0806  18.237 4.71e-13 ***
## sueno        -5.8333     0.6476  -9.007 4.35e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 3.251 on 18 degrees of freedom
## Multiple R-squared:  0.8184, Adjusted R-squared:  0.8083 
## F-statistic: 81.13 on 1 and 18 DF,  p-value: 4.352e-08

La función summary() proporciona diferentes resultados relacionados con el modelo de regresión.

Por ahora, no es necesario interpretar toda la información que aparece en esta salida. En estas notas centraremos nuestra atención principalmente en dos elementos:

  1. La tabla Coefficients, que contiene información sobre el intercepto y la pendiente del modelo.

  2. El Multiple R-squared, que corresponde al coeficiente de determinación \(R^2\).

Los demás elementos de la salida se irán utilizando únicamente cuando sean necesarios.

Para facilitar su identificación, podemos resumir las partes que nos interesan:

Información de la tabla Coefficients que utilizaremos
Coeficiente Estimación Error estándar Valor t p-valor
Intercepto 74.4167 4.0806 18.2368 <0.001
Horas de sueño -5.8333 0.6476 -9.0072 <0.001

El segundo elemento que utilizaremos se encuentra hacia el final de la salida:

Medida de ajuste del modelo
Medida Valor
Coeficiente de determinación (R²) 0.8184

El valor de \(R^2\) será interpretado más adelante, después de estudiar los coeficientes, las predicciones y los residuos. En las siguientes secciones iremos interpretando paso a paso la información seleccionada de la salida de summary().

c) La recta estimada

A partir de los datos de los 20 estudiantes, la recta estimada es:

\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(\text{Horas de sueño}) \]

El símbolo \(\widehat{\text{Estrés}}\) indica que se trata del puntaje de estrés estimado o predicho por el modelo.

Como vimos anteriormente, una recta está determinada principalmente por su pendiente y su intercepto. En regresión utilizaremos:

  • \(\hat{\beta}\) para representar la pendiente estimada;

  • \(\hat{\delta}\) para representar el intercepto estimado.

En nuestro ejemplo:

\[ \hat{\beta}\;=\;-5.8333, \qquad \hat{\delta}\;=\;74.4167 \]

3.0.5 Interpretación de los coeficientes

a) Pendiente

La pendiente estimada es:

\[ \hat{\beta}=-5.8333. \]

Su signo negativo indica que la relación entre las horas de sueño y el estrés académico es decreciente.

En el contexto del estudio:

Por cada hora adicional de sueño, el puntaje promedio esperado de estrés académico disminuye aproximadamente 5.8333 puntos.

La palabra promedio es importante.

Esto no significa que todos los estudiantes que duerman una hora adicional presenten exactamente 5.8333 puntos menos de estrés. La regresión describe una tendencia promedio en el conjunto de estudiantes.

b) Intercepto

El intercepto estimado es:

\[ \hat{\delta}=74.4167. \]

Este valor representa el puntaje de estrés que el modelo estimaría cuando las horas de sueño son iguales a cero.

Sin embargo, como vimos anteriormente, el intercepto no siempre tiene una interpretación práctica relevante.

En este ejemplo, cero horas de sueño se encuentra fuera del rango habitual de los datos estudiados, por lo que no resulta conveniente atribuirle una interpretación sustantiva.

3.0.6 Representación gráfica del modelo

Podemos representar los datos mediante un diagrama de dispersión y agregar la recta estimada:

ggplot(datos, aes(x = sueno, y = estres)) +
  geom_point(size = 3) +
  geom_smooth(method = "lm", se = FALSE, linewidth = 1) +
  labs(
    title = "Relación entre horas de sueño y estrés académico",
    x = "Horas de sueño",
    y = "Puntaje de estrés académico"
  ) +
  theme_minimal(base_size = 13)

Observe que los puntos no se encuentran exactamente sobre la recta.

La recta representa la tendencia general de la relación entre las horas de sueño y el estrés académico.

3.0.7 ¿Existe evidencia de una relación?

Además de estimar cuánto cambia el estrés cuando cambian las horas de sueño, podemos preguntarnos:

¿Existe evidencia estadística de una relación lineal entre las horas de sueño y el estrés académico?

a) Pruebas de hipótesis para responder la pregunta anterior

Esta pregunta puede estudiarse utilizando la misma lógica de las pruebas de hipótesis vistas anteriormente.

En este caso, nos interesa determinar si existe evidencia de que la pendiente poblacional es diferente de cero.

Una pendiente igual a cero indicaría que, en promedio, no existe una relación lineal entre las horas de sueño y el puntaje de estrés académico.

b) Información de la tabla Coefficients en la función summary()

La salida de summary() proporciona un p-valor asociado con el coeficiente de las horas de sueño:

Información de la tabla Coefficients en summary()
Coeficiente Estimate Std. Error t value Pr(>|t|)
(Intercept) 74.4167 4.0806 18.2368 <0.001
sueno -5.8333 0.6476 -9.0072 <0.001

c) Interpretación de los p-valores

El p-valor correspondiente a las horas de sueño es menor que 0.05.

Por tanto, los datos proporcionan evidencia de una relación lineal entre las horas de sueño y el puntaje de estrés académico.

d) Conclusión

Una conclusión apropiada sería:

Se encontró evidencia de una relación lineal entre las horas de sueño y el estrés académico (p < 0.001). En promedio, una hora adicional de sueño se asocia con una disminución aproximada de 5.8333 puntos en el puntaje de estrés académico.

Observe que esta conclusión proporciona dos tipos de información:

  • Evidencia estadística: proporcionada por el p-valor.

  • Magnitud y dirección de la asociación: proporcionadas por la pendiente.

3.0.8 Intervalo de confianza para la pendiente

El p-valor permite evaluar si existe evidencia de una relación, pero no informa por sí solo acerca de la precisión con la que hemos estimado la magnitud de dicha relación.

Para ello podemos construir un intervalo de confianza para la pendiente.

a) Ejemplo en R

En R:

confint(modelo1)
##                2.5 %    97.5 %
## (Intercept) 65.84370 82.989631
## sueno       -7.19395 -4.472717

Para las horas de sueño se obtiene el siguiente intervalo del 95% de confianza para la pendiente poblacional:

\[ -7.19 < \beta < -4.47 \]

Equivalentemente,

\[ IC_{95\%}(\beta)=(-7.19,\;-4.47). \]

b) Interpretación del resultado obtenido

Una interpretación apropiada sería:

Con un 95% de confianza, se estima que una hora adicional de sueño está asociada con una disminución promedio del puntaje de estrés académico comprendida aproximadamente entre 4.47 y 7.19 puntos.

Observe que todo el intervalo se encuentra por debajo de cero, lo cual es consistente con la existencia de una relación negativa entre las horas de sueño y el estrés académico.

3.0.9 Predicción

La ecuación de regresión también puede utilizarse para obtener el puntaje de estrés que el modelo espera para determinadas horas de sueño.

a) Ejemplo a mano

Considere nuevamente:

\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(\text{Horas de sueño}) \]

Para un estudiante que duerme 6 horas:

\[ \widehat{\text{Estrés}} \;=\; 74.4167\;-\;5.8333(6) \]

por lo que:

\[ \widehat{\text{Estrés}} \;\approx\;39.41667. \]

Por tanto, el modelo predice un puntaje de estrés académico de aproximadamente 39.4 puntos para un estudiante que duerme 6 horas por noche.

b) Ejemplo en R

En R también podemos obtener esta predicción mediante:

predicho6 <- predict(modelo1, newdata = data.frame(sueno = 6))
predicho6
##        1 
## 39.41667

3.0.10 Valores observados, valores predichos y residuos

El valor predicho por el modelo no tiene que coincidir exactamente con el valor observado en cada estudiante.

a) Ejemplo de una predicción

Por ejemplo, consideremos al estudiante 2 de nuestra base de datos. Este estudiante duerme 6 horas y presenta un puntaje de estrés de 39 puntos.

Podemos obtener directamente este valor observado desde la base de datos:

observado6 <- datos$estres[datos$estudiante == 2]
observado6
## [1] 39

Por otra parte, para un estudiante que duerme 6 horas, sabemos que el modelo predice:

predicho6
##        1 
## 39.41667

Por tanto, mientras el valor observado es 39, el valor predicho por el modelo es aproximadamente 39.4 puntos.

b) Definición de residuo

La diferencia entre el valor observado y el valor predicho se denomina residuo:

\[ \text{Residuo} \;=\; \text{valor observado} \;-\; \text{valor predicho}. \]

c) Ejemplo de un residuo

Para el estudiante considerado, el valor observado es 39 y el valor predicho es aproximadamente 39.41667.

Por tanto:

\[ \text{Residuo} \;=\; 39 \;-\; 39.41667 \;\approx \; -0.41667. \]

Residuo6 <- observado6 - predicho6
Residuo6
##          1 
## -0.4166667

El residuo negativo indica que el valor observado de estrés es ligeramente menor que el valor predicho por el modelo.

3.0.11 ¿Qué tan bien explica el modelo los datos?

Una medida que permite resumir qué tan bien el modelo explica la variabilidad observada en la variable respuesta es el coeficiente de determinación, representado por \(R^2\).

a) Ejemplo

En nuestro ejemplo se obtiene aproximadamente:

\[ R^2=0.818. \]

Esto significa que:

Aproximadamente el 81.8% de la variabilidad observada en los puntajes de estrés académico es explicada por el modelo lineal que utiliza las horas de sueño como variable explicativa.

El porcentaje restante corresponde a variabilidad que este modelo no logra explicar.

b) Comentarios importantes

Es importante interpretar correctamente este resultado.

  • Un valor de \(R^2=0.818\) no significa que el 81.8% del estrés de cada estudiante sea causado por las horas de sueño.

  • Es decir:

El coeficiente de determinación tampoco demuestra una relación causal.

  • El coeficiente de determinación describe cuánto de la variabilidad observada en la variable respuesta es explicada por el modelo lineal utilizado.

4 De una a dos variables explicativas

4.0.1 ¿Por qué incluir una segunda variable explicativa?

a) Justificación

Hasta este momento hemos estudiado la relación entre las horas de sueño y el estrés académico.

Sin embargo, nuestra base de datos contiene una tercera variable: las horas de estudio.

Es razonable pensar que el estrés académico podría estar relacionado simultáneamente con las horas de sueño y con el tiempo dedicado al estudio.

b) Variables que usaremos en a partir de ahora

Por tanto, ahora estudiaremos conjuntamente:

  • Variable respuesta (\(y\)): puntaje de estrés académico.

  • Variable explicativa 1 (\(x_1\)): horas de sueño.

  • Variable explicativa 2 (\(x_2\)): horas de estudio.

c) pregunta más completa

Nuestro interés ya no se limita a preguntar si el sueño está relacionado con el estrés. Ahora podemos plantear una pregunta más completa:

¿Cómo se relacionan las horas de sueño con el estrés académico cuando también tenemos en cuenta las horas de estudio?

4.0.2 Exploración conjunta de las variables

Antes de ajustar un modelo con dos variables explicativas, es conveniente examinar cómo se relacionan entre sí las tres variables consideradas en el estudio:

  • horas de sueño;
  • horas de estudio;
  • puntaje de estrés académico.

Para realizar esta exploración inicial utilizaremos dos herramientas que estudiaremos con mayor detalle más adelante:

  • La matriz de correlaciones.

  • La matriz de diagramas de dispersión.

Estas herramientas nos permitirán obtener una primera aproximación a la dirección y la intensidad de las relaciones entre las variables, así como identificar posibles patrones en los datos.

4.0.3 Matriz de correlaciones

a) Matriz de correlaciones con la función cor()

Una forma sencilla de estudiar conjuntamente estas relaciones consiste en calcular las correlaciones entre cada par de variables.

En R:

correlaciones <- cor(
  datos[, c("sueno", "estudio", "estres")]
)

rownames(correlaciones) <- c(
  "Horas de sueño",
  "Horas de estudio",
  "Puntaje de estrés"
)

colnames(correlaciones) <- c(
  "Horas de sueño",
  "Horas de estudio",
  "Puntaje de estrés"
)

round(correlaciones, 3) |>
  kbl(
    align = "c",
    booktabs = TRUE,
    caption = "Matriz de correlaciones entre las variables"
  ) |>
  kable_styling(
    bootstrap_options = c("striped", "hover", "condensed"),
    full_width = FALSE,
    position = "center"
  )
Matriz de correlaciones entre las variables
Horas de sueño Horas de estudio Puntaje de estrés
Horas de sueño 1.000 -0.531 -0.905
Horas de estudio -0.531 1.000 0.809
Puntaje de estrés -0.905 0.809 1.000

Cada valor de la matriz representa la correlación entre dos variables.

Observe que los valores de la diagonal son iguales a 1, porque corresponden a la correlación de cada variable consigo misma.

b) Matriz de correlaciones mediante un mapa de calor

La misma información puede representarse gráficamente mediante un mapa de calor de correlaciones (heatmap).

Este gráfico permite identificar visualmente la dirección y la intensidad de las relaciones lineales entre las variables.

cor_long <- as.data.frame(as.table(correlaciones))

names(cor_long) <- c(
  "Variable1",
  "Variable2",
  "Correlacion"
)

ggplot(
  cor_long,
  aes(
    x = Variable1,
    y = Variable2,
    fill = Correlacion
  )
) +
  geom_tile() +
  geom_text(
    aes(label = sprintf("%.2f", Correlacion)),
    size = 4
  ) +
  scale_fill_gradient2(
    low = "red",
    mid = "white",
    high = "blue",
    midpoint = 0,
    limits = c(-1, 1)
  ) +
  coord_equal() +
  labs(
    title = "Mapa de calor de las correlaciones",
    x = NULL,
    y = NULL,
    fill = "Correlación"
  ) +
  theme_minimal(base_size = 13) +
  theme(
    panel.grid = element_blank(),
    axis.text.x = element_text(
      angle = 30,
      hjust = 1
    )
  )

Los valores de correlación se encuentran entre -1 y 1. El signo indica la dirección de la relación, mientras que la cercanía a 1 o a -1 indica una relación lineal más intensa.

c) Notación para las correlaciones entre pares de variables

Como ahora estamos estudiando varias variables simultáneamente, necesitamos indicar con claridad a qué par de variables corresponde cada coeficiente de correlación.

En general, utilizaremos la notación

\[ r_{X,Y} \]

para representar el coeficiente de correlación entre las variables \(X\) y \(Y\).

Por ejemplo:

  • \(r_{\text{Sueño, Estrés}}\) representa la correlación entre las horas de sueño y el puntaje de estrés académico.

  • De manera similar, \(r_{\text{Estudio, Estrés}}\) representa la correlación entre las horas de estudio y el puntaje de estrés académico.

  • Mientras que \(r_{\text{Sueño, Estudio}}\) representa la correlación entre las horas de sueño y las horas de estudio.

d) Interpretación de las correlaciones

Para nuestros datos se obtiene aproximadamente:

\[ r_{\text{Sueño, Estrés}} \;=\; -0.905 \]

\[ r_{\text{Estudio, Estrés}}\;=\;0.809 \]

\[ r_{\text{Sueño, Estudio}}\;=\;-0.531 \]

A partir de estos resultados se observa que:

  • Las horas de sueño y el estrés académico presentan una relación lineal negativa marcada (\(r=-0.905\)).

  • Las horas de estudio y el estrés académico presentan una relación lineal positiva (\(r=0.809\)).

  • Las horas de sueño y las horas de estudio presentan una relación lineal negativa (\(r=-0.531\)).

e) Comentarios finales

En conclusión:

  • Al considerar las variables por pares, tanto las horas de sueño como las horas de estudio presentan una relación lineal con el estrés académico.

  • Además, las dos variables explicativas también presentan cierta relación entre sí.

Esto motiva estudiar ambas variables simultáneamente mediante un modelo de regresión lineal múltiple, que permitirá analizar la relación de cada variable explicativa con el estrés académico teniendo en cuenta la presencia de la otra.

4.0.4 Matriz de gráficos de dispersión

El mapa de calor permite resumir las correlaciones entre las variables. Sin embargo, también resulta útil observar directamente cómo se distribuyen los datos y qué forma presentan las relaciones entre cada par de variables.

Para ello podemos utilizar una matriz de gráficos, construida mediante la función ggpairs() del paquete GGally:

datos_graficos <- datos[, c("sueno", "estudio", "estres")]

names(datos_graficos) <- c(
  "Horas de sueño",
  "Horas de estudio",
  "Puntaje de estrés"
)

GGally::ggpairs(
  datos_graficos,
  upper = list(
    continuous = GGally::wrap(
      "cor",
      size = 4
    )
  ),
  lower = list(
    continuous = GGally::wrap(
      "smooth",
      method = "lm",
      se = FALSE,
      color = "blue",
      alpha = 0.75,
      size = 2
    )
  ),
  diag = list(
    continuous = GGally::wrap(
      "densityDiag",
      fill = "lightblue",
      alpha = 0.7
    )
  )
) +
  theme_minimal(base_size = 12) +
  theme(
    strip.text = element_text(face = "bold"),
    panel.grid.minor = element_blank()
  )

En esta representación:

  • La diagonal muestra la distribución de cada variable.

  • Los diagramas de dispersión permiten observar la relación entre cada par de variables.

  • Los coeficientes de correlación resumen la dirección y la intensidad de esas relaciones lineales.

Esta representación complementa la matriz de correlaciones y el mapa de calor, ya que permite observar directamente la forma de las relaciones antes de construir el modelo de regresión múltiple.

4.0.5 Regresión lineal múltiple

Cuando se utiliza una variable respuesta y más de una variable explicativa hablamos de regresión lineal múltiple.

a) Ejemplo con R

En nuestro ejemplo queremos estudiar el estrés académico utilizando simultáneamente las horas de sueño y las horas de estudio.

En R podemos ajustar el modelo mediante:

modelo2 <- lm(estres ~ sueno + estudio, data = datos)

summary(modelo2)
## 
## Call:
## lm(formula = estres ~ sueno + estudio, data = datos)
## 
## Residuals:
##     Min      1Q  Median      3Q     Max 
## -3.5747 -0.5908  0.2395  0.7993  1.9245 
## 
## Coefficients:
##             Estimate Std. Error t value Pr(>|t|)    
## (Intercept)  55.6988     2.7017  20.616 1.82e-13 ***
## sueno        -4.2649     0.3259 -13.085 2.65e-10 ***
## estudio       2.3667     0.2613   9.056 6.49e-08 ***
## ---
## Signif. codes:  0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
## 
## Residual standard error: 1.386 on 17 degrees of freedom
## Multiple R-squared:  0.9688, Adjusted R-squared:  0.9652 
## F-statistic: 264.1 on 2 and 17 DF,  p-value: 1.576e-13

La expresión

estres ~ sueno + estudio

se puede leer como:

estudiar el estrés en función de las horas de sueño y las horas de estudio.

b) El modelo ajustado

A partir de nuestros datos, la ecuación estimada es aproximadamente:

\[ \widehat{\text{Estrés}} \;=\; 55.70 \;-\; 4.26(\text{Horas de sueño}) \;+\; 2.37(\text{Horas de estudio}) \]

Ahora tenemos dos pendientes estimadas, una para cada variable explicativa.

4.0.6 Interpretación de los coeficientes

La interpretación de las pendientes requiere una idea fundamental: cada coeficiente se interpreta teniendo en cuenta la presencia de la otra variable explicativa en el modelo.

a) Horas de sueño

El coeficiente estimado para las horas de sueño es:

\[ \hat{\beta}_{\text{Sueño}}\;=\;-4.26. \]

Su interpretación es:

Manteniendo constantes las horas de estudio, una hora adicional de sueño se asocia con una disminución promedio de aproximadamente 4.26 puntos en el puntaje de estrés académico.

b) Horas de estudio

El coeficiente estimado para las horas de estudio es:

\[ \hat{\beta}_{\text{Estudio}}=2.37. \]

Su interpretación es:

Manteniendo constantes las horas de sueño, una hora adicional de estudio se asocia con un aumento promedio de aproximadamente 2.37 puntos en el puntaje de estrés académico.

La expresión “manteniendo constante la otra variable” es fundamental para interpretar los coeficientes de una regresión múltiple.

Observe además que la pendiente correspondiente a las horas de sueño cambió:

\[ -5.8333 \quad\longrightarrow\quad -4.26. \]

c) Comentarios finales

En el primer modelo solo considerábamos las horas de sueño. En el segundo modelo también tenemos en cuenta las horas de estudio.

Por esta razón, los coeficientes de una regresión múltiple no tienen que coincidir con los obtenidos en una regresión simple.

4.0.7 ¿Existe evidencia de relación con cada variable explicativa?

Al igual que en la regresión lineal simple, podemos utilizar los p-valores para evaluar si existe evidencia de una relación lineal entre cada variable explicativa y la variable respuesta, teniendo en cuenta las demás variables incluidas en el modelo.

a) Resultados con summary()

Podemos presentar los principales resultados de summary(modelo2) en una tabla:

tabla_modelo2 <- as.data.frame(coef(summary(modelo2)))

tabla_modelo2 <- data.frame(
  Variable = c(
    "Intercepto",
    "Horas de sueño",
    "Horas de estudio"
  ),
  Estimación = round(tabla_modelo2[, 1], 2),
  `Error estándar` = round(tabla_modelo2[, 2], 2),
  `Valor t` = round(tabla_modelo2[, 3], 2),
  `p-valor` = c("<0.001", "<0.001", "<0.001"),
  check.names = FALSE
)

tabla_modelo2 |>
  kbl(
    align = "c",
    booktabs = TRUE,
    caption = "Resultados del modelo de regresión lineal múltiple"
  ) |>
  kable_styling(
    bootstrap_options = c("striped", "hover", "condensed"),
    full_width = FALSE,
    position = "center"
  )
Resultados del modelo de regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
Intercepto 55.70 2.70 20.62 <0.001
Horas de sueño -4.26 0.33 -13.08 <0.001
Horas de estudio 2.37 0.26 9.06 <0.001

b) Horas de sueño

Para las horas de sueño, el p-valor es menor de 0.001. Por tanto:

Manteniendo constantes las horas de estudio, existe evidencia de una relación lineal entre las horas de sueño y el estrés académico.

c) Horas de estudio

Para las horas de estudio, el p-valor también es menor de 0.001. Por tanto:

Manteniendo constantes las horas de sueño, existe evidencia de una relación lineal entre las horas de estudio y el estrés académico.

La interpretación completa debe considerar tanto la evidencia estadística, proporcionada por el p-valor, como la magnitud y dirección de la asociación, proporcionadas por cada coeficiente estimado.

4.0.8 ¿Qué tan bien explica el modelo con dos variables?

a) Coeficiente de determinación

Para el modelo que utiliza simultáneamente las horas de sueño y las horas de estudio se obtiene aproximadamente:

\[ R^2=0.969. \]

Esto significa que:

Aproximadamente el 96.9% de la variabilidad observada en los puntajes de estrés académico es explicada conjuntamente por el modelo lineal que incluye las horas de sueño y las horas de estudio.

b) Comparación de los dos modelos: simple vs múltiple

Podemos comparar descriptivamente los dos modelos:

comparacion_modelos <- data.frame(
  Modelo = c(
    "Sueño",
    "Sueño + estudio"
  ),
  `Variables explicativas` = c(
    "Horas de sueño",
    "Horas de sueño y horas de estudio"
  ),
  `R²` = c(
    summary(modelo1)$r.squared,
    summary(modelo2)$r.squared
  ),
  check.names = FALSE
)

comparacion_modelos$`R²` <- round(
  comparacion_modelos$`R²`,
  3
)

comparacion_modelos |>
  kbl(
    align = "c",
    booktabs = TRUE,
    caption = "Comparación descriptiva de los modelos"
  ) |>
  kable_styling(
    bootstrap_options = c("striped", "hover", "condensed"),
    full_width = FALSE,
    position = "center"
  )
Comparación descriptiva de los modelos
Modelo Variables explicativas R²
Sueño Horas de sueño 0.818
Sueño + estudio Horas de sueño y horas de estudio 0.969

c) Interpretación relacionada con la comparación

El modelo que incluye ambas variables explicativas presenta un \(R^2\) mayor.

En estos datos ilustrativos, incorporar las horas de estudio permite explicar una mayor proporción de la variabilidad observada en el estrés académico.

Sin embargo, un valor elevado de \(R^2\) no demuestra causalidad ni implica, por sí solo, que un modelo sea apropiado.

Además, estos datos fueron construidos con fines didácticos y presentan relaciones particularmente marcadas.

4.0.9 Asociación no significa causalidad

Una de las precauciones más importantes en la interpretación de los modelos de regresión consiste en distinguir entre asociación y causalidad.

Por ejemplo, nuestro modelo muestra que, manteniendo constantes las horas de estudio, un mayor número de horas de sueño está asociado con menores puntajes de estrés.

Sin embargo, esto no permite concluir automáticamente que aumentar las horas de sueño cause una reducción del estrés académico.

Pueden existir otras características de los estudiantes que no han sido incluidas en el modelo y que también estén relacionadas con el estrés.

Por esta razón, expresiones como:

“las horas de sueño están asociadas con el nivel de estrés”

son generalmente más apropiadas que:

“las horas de sueño causan una reducción del estrés”

a menos que el diseño de la investigación permita establecer relaciones causales.

4.0.10 Supuestos básicos del modelo

Para utilizar adecuadamente un modelo de regresión lineal es conveniente examinar algunos aspectos de los datos y de los residuos del modelo.

Aspectos básicos para examinar un modelo de regresión lineal
Aspecto Pregunta orientadora
Linealidad ¿Las relaciones estudiadas son aproximadamente lineales?
Independencia ¿Las observaciones corresponden a unidades independientes?
Variabilidad de los residuos ¿La dispersión de los residuos es aproximadamente similar?
Normalidad de los residuos ¿Los residuos presentan una distribución aproximadamente normal?
Valores atípicos ¿Existen observaciones extremadamente alejadas del patrón general?

Es importante señalar que la normalidad se refiere principalmente a los residuos del modelo, no a que cada una de las variables tenga que presentar individualmente una distribución normal.

En este curso no realizaremos un diagnóstico avanzado. Nuestro objetivo será reconocer gráficamente situaciones claramente problemáticas.

4.0.11 Diagnóstico gráfico básico

Después de ajustar el modelo podemos estudiar sus residuos. Estos nos permiten analizar, de manera sencilla, qué tan diferentes son los valores observados de los valores predichos por el modelo.

a) Cálculo de valores predichos y los residuos

Primero construiremos una base sencilla que reúna tres cantidades útiles para el diagnóstico del modelo:

  • ajustado: valor predicho por el modelo para cada observación;

  • residuo: diferencia entre el valor observado y el valor predicho;

  • residuo_estandarizado: versión estandarizada del residuo, que facilita la comparación entre observaciones.

diagnostico <- data.frame(
  ajustado = fitted(modelo2),
  residuo = residuals(modelo2),
  residuo_estandarizado = rstandard(modelo2)
)

diagnostico
##    ajustado    residuo residuo_estandarizado
## 1  43.84123  0.1587735             0.1220837
## 2  37.20959  1.7904119             1.3484519
## 3  30.57795  0.4220502             0.3269405
## 4  44.07552  1.9244834             1.4543554
## 5  37.44388  0.5561217             0.4136307
## 6  28.44550 -0.4455004            -0.3482641
## 7  50.70715  1.2928451             1.0464615
## 8  26.31305 -0.3130510            -0.2511931
## 9  39.57633  0.4236723             0.3138733
## 10 46.20797  0.7920340             0.6066799
## 11 40.04491 -1.0449080            -0.9281227
## 12 35.07714 -2.0771387            -1.5508695
## 13 36.97530 -0.9752980            -0.8133223
## 14 33.17898  0.8210205             0.6451430
## 15 50.47286 -0.4728648            -0.3924506
## 16 28.67979  0.3202095             0.2557350
## 17 34.84285  0.1571514             0.1255306
## 18 48.57471 -3.5747056            -2.8431639
## 19 32.94469 -0.9446893            -0.7097508
## 20 39.81062  1.1893822             0.9163001

Cada fila de esta nueva base corresponde a una observación del conjunto de datos original.

Por ejemplo:

  • En la primera fila el modelo predice un valor aproximado de 43.84, mientras que el residuo es aproximadamente 0.16.

  • Un residuo positivo indica que el valor observado fue mayor que el valor predicho por el modelo.

  • Un residuo negativo indica que el valor observado fue menor que el predicho.

En las siguientes secciones utilizaremos estas cantidades para construir algunos gráficos básicos de diagnóstico.

b) Residuos frente a valores ajustados

ggplot(diagnostico, aes(x = ajustado, y = residuo)) +
  geom_point(
    size = 2.5,
    color = "blue",
    alpha = 0.8
  ) +
  geom_hline(
    yintercept = 0,
    linetype = "dashed",
    linewidth = 0.8,
    color = "red"
  ) +
  labs(
    title = "Residuos frente a valores ajustados",
    x = "Valor predicho de estrés",
    y = "Residuo"
  ) +
  theme_minimal(base_size = 12)

En términos generales, esperamos observar los puntos distribuidos alrededor de cero sin un patrón claramente definido.

Patrones curvos o cambios muy marcados en la dispersión pueden indicar que el modelo lineal no representa adecuadamente algunos aspectos de los datos.

c) Gráfico Q-Q de los residuos

ggplot(
  diagnostico,
  aes(sample = residuo_estandarizado)
) +
  stat_qq(
    size = 2.5,
    color = "blue",
    alpha = 0.8
  ) +
  stat_qq_line(
    linewidth = 0.8,
    linetype = "dashed",
    color = "red"
  ) +
  labs(
    title = "Gráfico Q-Q de los residuos",
    x = "Cuantiles teóricos",
    y = "Residuos estandarizados"
  ) +
  theme_minimal(base_size = 12)

Si los puntos siguen aproximadamente la línea de referencia, la distribución de los residuos puede considerarse razonablemente compatible con una distribución normal.

No esperamos que todos los puntos se encuentren exactamente sobre la línea. El objetivo es identificar desviaciones claramente importantes.

5 Ideas clave de la unidad

Al finalizar esta unidad, usted debería ser capaz de:

  1. Identificar la variable respuesta y las variables explicativas.

  2. Reconocer visualmente la dirección y la forma general de una relación entre variables cuantitativas.

  3. Interpretar el coeficiente de correlación en términos de dirección e intensidad de la relación lineal.

  4. Interpretar la pendiente y el intercepto de un modelo de regresión lineal simple.

  5. Obtener e interpretar una predicción a partir de una ecuación de regresión.

  6. Comprender qué representa un residuo.

  7. Interpretar el p-valor asociado con un coeficiente de regresión.

  8. Interpretar un intervalo de confianza para un coeficiente de regresión.

  9. Interpretar el coeficiente de determinación \(R^2\).

  10. Interpretar los coeficientes de una regresión lineal múltiple utilizando la idea de mantener constantes las demás variables explicativas.

  11. Distinguir entre asociación y causalidad.

  12. Reconocer posibles problemas del modelo mediante gráficos básicos de residuos.

6 Proyecto: relaciones entre variables y regresión lineal

6.0.1 Tema

Correlación, regresión lineal simple y regresión lineal múltiple.

6.0.2 Objetivo

Aplicar los procedimientos estudiados para explorar, modelar e interpretar relaciones entre variables cuantitativas utilizando un conjunto de datos real. Asimismo, fortalecer las habilidades para seleccionar una muestra aleatoria reproducible, construir representaciones gráficas, interpretar coeficientes de regresión, evaluar evidencia estadística y documentar adecuadamente todo el proceso mediante R Markdown.

6.0.3 Base de datos

Para el desarrollo del proyecto se utilizará el conjunto de datos sat.act del paquete psych.

Esta base contiene información de 700 participantes recopilada como parte del proyecto Synthetic Aperture Personality Assessment (SAPA), un proyecto de evaluación psicológica realizado a través de Internet.

El conjunto de datos contiene seis variables:

  • gender: sexo registrado en la base;
  • education: nivel educativo reportado;
  • age: edad del participante;
  • ACT: puntaje compuesto obtenido en la prueba ACT;
  • SATV: puntaje correspondiente al componente verbal del SAT;
  • SATQ: puntaje correspondiente al componente cuantitativo del SAT.

En particular, los puntajes de las pruebas tienen las siguientes escalas:

  • ACT: puede tomar valores entre 1 y 36;
  • SATV: puede tomar valores entre 200 y 800;
  • SATQ: puede tomar valores entre 200 y 800.

Los puntajes de ACT, SATV y SATQ fueron reportados por los propios participantes, por lo que deben interpretarse teniendo en cuenta esta característica de la base.

Para cargar los datos en R, ejecute:

# Instalar una sola vez, si es necesario:
# install.packages("psych")

data("sat.act", package = "psych")

str(sat.act)

Puede consultar la documentación del conjunto de datos directamente desde R mediante:

?psych::sat.act

o mediante:

help("sat.act", package = "psych")

o en estos links:

En este proyecto trabajaremos únicamente con las siguientes cuatro variables cuantitativas:

  • age: edad del participante;
  • ACT: puntaje compuesto en la prueba ACT;
  • SATV: puntaje verbal en la prueba SAT;
  • SATQ: puntaje cuantitativo en la prueba SAT.

Las variables gender y education forman parte de la base original, pero no serán utilizadas en los modelos de regresión de este proyecto.

Nota:

Esta base fue incluida en el paquete con fines de demostración y análisis. Los autores señalan que los puntajes promedio son superiores a las normas nacionales, lo que podría estar relacionado con la autoselección de los participantes y con el hecho de que los puntajes fueron autoinformados. Por esta razón, los resultados obtenidos en el proyecto deberán interpretarse dentro del contexto de esta base de datos y no generalizarse automáticamente a toda la población.

6.0.4 Lineamientos

Los lineamientos generales de elaboración, entrega, reproducibilidad y presentación utilizados en el curso se mantienen vigentes:

https://rpubs.com/hllinas/R_Lineamiento_EstInf

El trabajo se realizará en los 10 grupos ya conformados. Cada grupo trabajará con una muestra aleatoria diferente y reproducible, así como con una combinación específica de variables.

Antes de iniciar el proyecto, cada grupo deberá verificar con el profesor el número que le ha sido asignado. Esta verificación es responsabilidad del grupo, ya que el número determina tanto la semilla como las variables que deberán utilizarse.

Por esta razón, se recomienda realizar esta verificación antes de comenzar el análisis.

Si el proyecto se desarrolla utilizando un número de grupo diferente al asignado, se aplicará la penalización de 50 puntos en la calificación final del proyecto.

6.0.5 Asignación por grupo

La siguiente tabla presenta la semilla y las variables asignadas a cada grupo.

La Variable explicativa 1 será utilizada inicialmente en la regresión lineal simple. Posteriormente, se incorporará la Variable explicativa 2 para construir el modelo de regresión lineal múltiple.

Semilla y variables asignadas a cada grupo
Grupo Semilla Respuesta Explicativa 1 Explicativa 2
1 20260901 ACT SATV SATQ
2 20260902 ACT SATQ age
3 20260903 ACT age SATV
4 20260904 SATV ACT SATQ
5 20260905 SATV SATQ age
6 20260906 SATV age ACT
7 20260907 SATQ ACT SATV
8 20260908 SATQ SATV age
9 20260909 SATQ age ACT
10 20260910 ACT SATQ SATV

6.0.6 Configuración inicial del proyecto

Una vez confirmado el número de su grupo con el profesor, realice los siguientes pasos.

Paso 1. Indique el número de su grupo

Modifique únicamente el valor asignado al objeto grupo.

Por ejemplo, si pertenece al grupo 1:

grupo <- 1

Paso 2. Recupere la asignación correspondiente

Ejecute el siguiente código sin modificarlo:

if (!(grupo %in% 1:10)) {
  stop("El número del grupo debe estar entre 1 y 10.")
}

asignacion <- asignaciones[asignaciones$Grupo == grupo, ]

semilla <- asignacion$Semilla
variable_respuesta <- asignacion$Respuesta
variable_x1 <- asignacion$`Explicativa 1`
variable_x2 <- asignacion$`Explicativa 2`

asignacion

La salida mostrará el número del grupo, la semilla y las tres variables que deberán utilizarse durante todo el proyecto.

No modifique manualmente la semilla ni las variables asignadas.

Paso 3. Prepare la base de datos

Conserve únicamente las cuatro variables que pueden utilizarse en el proyecto y elimine las observaciones con datos faltantes:

base_proyecto <- sat.act[
  complete.cases(
    sat.act[, c("age", "ACT", "SATV", "SATQ")]
  ),
  c("age", "ACT", "SATV", "SATQ")
]

Paso 4. Seleccione la muestra

Cada grupo trabajará con una muestra aleatoria de 180 observaciones.

Ejecute el siguiente código sin modificarlo:

set.seed(semilla)

indices <- sample(
  seq_len(nrow(base_proyecto)),
  size = 180,
  replace = FALSE
)

muestra <- base_proyecto[indices, ]

Compruebe el tamaño de la muestra:

nrow(muestra)

El resultado debe ser:

180

Esta configuración garantiza que cada grupo pueda reproducir exactamente su muestra.

Importante: una muestra aleatoria no garantiza por sí sola representatividad. Por esta razón, posteriormente cada grupo deberá comparar descriptivamente su muestra con la base completa.

6.0.7 Actividades

  1. Conociendo la base de datos

    1. Indique cuántas observaciones y variables contiene sat.act.

    2. Muestre los nombres de las variables y explique la esttructura de la base de datos.

    3. Describa brevemente qué representan age, ACT, SATV y SATQ.

  1. Identificación de la muestra y de las variables asignadas

    Utilizando los resultados obtenidos durante la configuración inicial:

    1. Indique el número de su grupo (paso 1).

    2. Indique la semilla asignada (paso 2).

    3. Identifique la variable respuesta.

    4. Identifique la Variable explicativa 1.

    5. Identifique la Variable explicativa 2.

    6. Compruebe que su muestra contiene 180 observaciones (paso 4).

    Importante: no modifique manualmente las observaciones seleccionadas.

  1. Comprobación descriptiva de la muestra

    Compare la muestra con la base completa para las tres variables asignadas a su grupo.

    Como mínimo, compare:

    • media;
    • desviación estándar;
    • mínimo;
    • máximo.

    Comente si la muestra reproduce razonablemente las principales características descriptivas de la base completa.

  1. Pregunta de investigación

    A partir de las variables asignadas a su grupo, formule una pregunta de investigación contextualizada. La pregunta deberá escribirse utilizando el significado de las variables y no únicamente sus códigos.

    Puede utilizar como guía la siguiente estructura:

¿Cómo se relaciona la variable respuesta con la Variable explicativa 1 cuando también se tiene en cuenta la Variable explicativa 2?

  1. Análisis exploratorio

    Utilizando únicamente la muestra de su grupo:

    1. Presente una tabla descriptiva de las tres variables.

    2. Construya los histogramas o gráficos de densidad que considere apropiados.

    3. Calcule la matriz de correlaciones.

    4. Construya un mapa de calor de las correlaciones.

    5. Construya una matriz de gráficos mediante GGally::ggpairs().

    6. Describa los principales patrones observados.

  1. Regresión lineal simple

    Utilice la variable respuesta y la variable explicativa 1 asignadas a su grupo.

    1. Construya un diagrama de dispersión con la recta estimada.

    2. Calcule e interprete el coeficiente de correlación.

    3. Ajuste el modelo de regresión lineal simple.

    4. Escriba la ecuación estimada.

    5. Interprete la pendiente y el intercepto.

    6. Utilice el p-valor para evaluar si existe evidencia de una relación lineal.

    7. Construya e interprete el intervalo del 95% de confianza para la pendiente.

    8. Interprete \(R^2\).

    9. Realice una predicción para un valor razonable de la variable explicativa.

    10. Explique por qué los resultados no implican necesariamente causalidad.

  1. Regresión lineal múltiple

    Mantenga la misma variable respuesta e incorpore la variable explicativa 1 y la variable explicativa 2 asignadas a su grupo.

    1. Ajuste el modelo de regresión lineal múltiple.

    2. Escriba la ecuación estimada.

    3. Interprete cada coeficiente en el contexto del problema, utilizando explícitamente la idea de mantener constante la otra variable explicativa.

    4. Interprete los p-valores asociados con cada coeficiente.

    5. Construya e interprete intervalos del 95% de confianza para las pendientes.

    6. Interprete \(R^2\) y \(R^2\) ajustado.

    7. Compare los coeficientes obtenidos con los correspondientes resultados de la regresión simple.

    8. Explique por qué un coeficiente de regresión múltiple no debe interpretarse como una correlación simple.

  1. Comparación entre los modelos

    Compare la regresión simple y la regresión múltiple.

    Responda:

    1. ¿Cambió la pendiente de la primera variable explicativa al incorporar la segunda?

    2. ¿Cambió la evidencia estadística asociada con dicha variable?

    3. ¿Cómo cambió \(R^2\)?

    4. ¿Qué información adicional aporta el modelo con dos variables explicativas?

    5. ¿El aumento en \(R^2\) es suficiente, por sí solo, para afirmar que el segundo modelo es mejor? Explique.

  1. Diagnóstico básico

    Para el modelo múltiple:

    1. Construya un gráfico de residuos frente a valores ajustados.

    2. Construya un gráfico Q-Q de los residuos estandarizados.

    3. Identifique si observa patrones claramente problemáticos.

    4. Comente brevemente los supuestos de linealidad, variabilidad de los residuos, normalidad e independencia.

  1. Conclusión

    Escriba una conclusión de dos o tres párrafos en la que:

    • Responda la pregunta de investigación.

    • Describa la dirección y magnitud de las principales asociaciones.

    • Sseñale cuáles asociaciones presentan evidencia estadística.

    • Compare el modelo simple con el múltiple.

    • Interprete la capacidad explicativa del modelo.

    • Diferencie claramente asociación de causalidad.

    • Mencione al menos una limitación del análisis.

6.0.8 Recomendaciones

  • La semilla asignada al grupo debe aparecer explícitamente en el documento.

  • No cambie la muestra después de observar los resultados.

  • Todas las tablas y figuras deben tener título y numeración.

  • Utilice nombres claros para los ejes y las variables.

  • Interprete siempre los resultados en el contexto del problema.

  • Las afirmaciones sobre evidencia estadística deben sustentarse con los resultados obtenidos.

  • No confunda correlación con causalidad.

  • En regresión múltiple, interprete cada coeficiente manteniendo constantes las demás variables explicativas.

  • El código debe estar comentado y ejecutarse sin errores.

  • El documento debe ser completamente reproducible a partir del archivo R Markdown.

7 Ejercicios

Los ejercicios se organizan en tres secciones.

  • En la primera sección se proporcionan directamente resultados, tablas o gráficos. El objetivo es concentrarse en la interpretación estadística de la información presentada.

  • En la segunda sección se proporciona una base de datos simulada. El estudiante deberá realizar el análisis en R y posteriormente interpretar los resultados obtenidos.

  • En la tercera sección se presentan ejercicios de integración y aplicación, en los que el estudiante deberá utilizar los conceptos estudiados para analizar diferentes situaciones y justificar sus respuestas.

En las dos primeras secciones se trabaja inicialmente con dos variables y, posteriormente, con una variable respuesta y dos variables explicativas. De esta manera, se avanza progresivamente desde la correlación y la regresión lineal simple hasta la regresión lineal múltiple.

8 Sección I. Interpretación de salidas ya proporcionadas

En esta sección no es necesario ajustar nuevamente los modelos. Para cada ejercicio se proporcionan los principales resultados y, en algunos casos, una representación gráfica.

El objetivo es interpretar correctamente la información estadística en el contexto del problema.

8.1 A. Regresión lineal simple: ejercicios 1–10

1. Horas de sueño y estrés académico

Se estudió la relación entre horas de sueño y estrés académico.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 71.494 3.496 20.450 <0.001
sueno -5.010 0.530 -9.448 <0.001
Medidas de ajuste
Medida Valor
R² 0.641
R² ajustado 0.634
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -6.075
97.5 % Superior -3.945

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas de sueño y estrés académico.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Para un estudiante que duerme 6.5 horas, obtenga el puntaje de estrés predicho por el modelo.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


2. Uso de redes sociales y ansiedad

Se estudió la relación entre horas diarias de uso de redes sociales y ansiedad.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 16.985 1.723 9.860 <0.001
redes 3.043 0.400 7.616 <0.001
Medidas de ajuste
Medida Valor
R² 0.523
R² ajustado 0.514
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior 2.242
97.5 % Superior 3.845

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas diarias de uso de redes sociales y ansiedad.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje de ansiedad predicho para 4 horas diarias de uso de redes sociales.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


3. Actividad física y síntomas depresivos

Se estudió la relación entre horas semanales de actividad física y síntomas depresivos.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 30.447 1.26 24.160 <0.001
actividad -2.254 0.25 -9.007 <0.001
Medidas de ajuste
Medida Valor
R² 0.628
R² ajustado 0.621
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -2.757
97.5 % Superior -1.751

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas semanales de actividad física y síntomas depresivos.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje predicho para una persona que realiza 5 horas semanales de actividad física.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


4. Práctica de mindfulness y estrés percibido

Se estudió la relación entre minutos diarios de mindfulness y estrés percibido.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 41.300 1.055 39.143 <0.001
mindfulness -0.394 0.045 -8.835 <0.001
Medidas de ajuste
Medida Valor
R² 0.629
R² ajustado 0.621
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -0.484
97.5 % Superior -0.304

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre minutos diarios de mindfulness y estrés percibido.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje predicho para una persona que practica mindfulness durante 20 minutos diarios.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


5. Horas de estudio y autoeficacia académica

Se estudió la relación entre horas diarias de estudio y autoeficacia académica.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 37.221 1.774 20.983 <0.001
estudio 2.937 0.388 7.566 <0.001
Medidas de ajuste
Medida Valor
R² 0.524
R² ajustado 0.515
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior 2.158
97.5 % Superior 3.716

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas diarias de estudio y autoeficacia académica.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje predicho para un estudiante que estudia 4 horas al día.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


6. Consumo de cafeína y calidad del sueño

Se estudió la relación entre consumo diario de café y calidad del sueño.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 78.554 1.935 40.601 <0.001
cafeina -5.262 0.565 -9.309 <0.001
Medidas de ajuste
Medida Valor
R² 0.644
R² ajustado 0.636
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -6.398
97.5 % Superior -4.125

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre consumo diario de café y calidad del sueño.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje predicho para una persona que consume 3 tazas de café al día.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


7. Sesiones de terapia y bienestar psicológico

Se estudió la relación entre número de sesiones de terapia y bienestar psicológico.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 41.701 1.505 27.715 <0.001
sesiones 2.040 0.159 12.800 <0.001
Medidas de ajuste
Medida Valor
R² 0.788
R² ajustado 0.783
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior 1.719
97.5 % Superior 2.361

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre número de sesiones de terapia y bienestar psicológico.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje predicho para una persona que ha completado 10 sesiones.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


8. Soledad y satisfacción con la vida

Se estudió la relación entre puntaje de soledad y satisfacción con la vida.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 86.686 2.429 35.685 <0.001
soledad -0.944 0.060 -15.660 <0.001
Medidas de ajuste
Medida Valor
R² 0.814
R² ajustado 0.811
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -1.065
97.5 % Superior -0.823

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre puntaje de soledad y satisfacción con la vida.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga la satisfacción predicha para un puntaje de soledad de 30.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


9. Tiempo de pantalla y atención

Se estudió la relación entre horas diarias de pantalla y atención.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 78.272 1.912 40.944 <0.001
pantalla -3.557 0.326 -10.901 <0.001
Medidas de ajuste
Medida Valor
R² 0.712
R² ajustado 0.706
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior -4.214
97.5 % Superior -2.901

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre horas diarias de pantalla y atención.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje de atención predicho para 5 horas diarias de pantalla.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


10. Apoyo familiar y resiliencia

Se estudió la relación entre apoyo familiar y resiliencia.

Resultados de la regresión lineal simple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 26.706 1.920 13.913 <0.001
apoyo 1.002 0.063 15.948 <0.001
Medidas de ajuste
Medida Valor
R² 0.825
R² ajustado 0.822
Intervalo del 95% de confianza para la pendiente
Limite Valor
2.5 % Inferior 0.876
97.5 % Superior 1.128

Responda:

  1. Identifique la variable respuesta y la variable explicativa.

  2. Describa la dirección general de la relación observada en el gráfico.

  3. Interprete la pendiente estimada en el contexto del problema.

  4. Interprete el intercepto e indique si su interpretación práctica resulta razonable.

  5. Utilizando el p-valor, determine si existe evidencia de una relación lineal entre apoyo familiar y resiliencia.

  6. Interprete el intervalo del 95% de confianza para la pendiente.

  7. Interprete el valor de \(R^2\).

  8. Obtenga el puntaje de resiliencia predicho para un nivel de apoyo familiar de 35.

  9. ¿Puede concluirse que la variable explicativa causa cambios en la variable respuesta? Justifique.


8.2 B. Regresión con dos variables explicativas: ejercicios 11–20

En estos ejercicios se analiza una variable respuesta utilizando simultáneamente dos variables explicativas.

Preste especial atención a la interpretación de cada coeficiente manteniendo constante la otra variable explicativa.

11. Sueño, redes sociales y ansiedad

Se estudió ansiedad utilizando como variables explicativas horas de sueño y horas en redes sociales.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 48.677 2.540 19.164 <0.001
sueno -3.858 0.385 -10.025 <0.001
redes 2.429 0.283 8.581 <0.001
Medidas de ajuste
Medida Valor
R² 0.700
R² ajustado 0.691

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante horas en redes sociales.

  4. Interprete el coeficiente correspondiente a horas en redes sociales, manteniendo constante horas de sueño.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con ansiedad.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


12. Sueño, horas de estudio y estrés académico

Se estudió estrés académico utilizando como variables explicativas horas de sueño y horas de estudio.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 55.215 2.555 21.607 <0.001
sueno -3.836 0.332 -11.551 <0.001
estudio 2.578 0.242 10.658 <0.001
Medidas de ajuste
Medida Valor
R² 0.816
R² ajustado 0.810

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante horas de estudio.

  4. Interprete el coeficiente correspondiente a horas de estudio, manteniendo constante horas de sueño.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con estrés académico.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


13. Actividad física, sueño y síntomas depresivos

Se estudió síntomas depresivos utilizando como variables explicativas actividad física y horas de sueño.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 51.858 2.697 19.231 <0.001
actividad -1.758 0.226 -7.777 <0.001
sueno -2.701 0.392 -6.883 <0.001
Medidas de ajuste
Medida Valor
R² 0.673
R² ajustado 0.661

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a actividad física, manteniendo constante horas de sueño.

  4. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante actividad física.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con síntomas depresivos.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


14. Apoyo social, soledad y bienestar

Se estudió bienestar psicológico utilizando como variables explicativas apoyo social y soledad.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 48.219 3.205 15.046 <0.001
apoyo 0.639 0.068 9.380 <0.001
soledad -0.559 0.060 -9.376 <0.001
Medidas de ajuste
Medida Valor
R² 0.753
R² ajustado 0.744

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a apoyo social, manteniendo constante soledad.

  4. Interprete el coeficiente correspondiente a soledad, manteniendo constante apoyo social.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con bienestar psicológico.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


15. Carga académica, sueño y agotamiento

Se estudió agotamiento utilizando como variables explicativas carga académica y horas de sueño.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 23.280 3.349 6.951 <0.001
carga 0.908 0.060 15.037 <0.001
sueno -2.032 0.415 -4.902 <0.001
Medidas de ajuste
Medida Valor
R² 0.801
R² ajustado 0.795

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a carga académica, manteniendo constante horas de sueño.

  4. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante carga académica.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con agotamiento.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


16. Horas de estudio, procrastinación y autoeficacia

Se estudió autoeficacia académica utilizando como variables explicativas horas de estudio y procrastinación.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 47.387 2.161 21.929 <0.001
estudio 3.208 0.365 8.777 <0.001
procrastinacion -0.512 0.046 -11.166 <0.001
Medidas de ajuste
Medida Valor
R² 0.772
R² ajustado 0.764

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a horas de estudio, manteniendo constante procrastinación.

  4. Interprete el coeficiente correspondiente a procrastinación, manteniendo constante horas de estudio.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con autoeficacia académica.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


17. Tiempo de pantalla, sueño y atención

Se estudió atención utilizando como variables explicativas tiempo de pantalla y horas de sueño.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 51.762 3.556 14.556 <0.001
pantalla -2.752 0.263 -10.483 <0.001
sueno 3.703 0.448 8.268 <0.001
Medidas de ajuste
Medida Valor
R² 0.797
R² ajustado 0.790

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a tiempo de pantalla, manteniendo constante horas de sueño.

  4. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante tiempo de pantalla.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con atención.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


18. Apoyo familiar, eventos estresantes y resiliencia

Se estudió resiliencia utilizando como variables explicativas apoyo familiar y eventos estresantes.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 42.365 2.312 18.326 <0.001
apoyo 0.762 0.061 12.592 <0.001
eventos -1.569 0.218 -7.192 <0.001
Medidas de ajuste
Medida Valor
R² 0.782
R² ajustado 0.775

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a apoyo familiar, manteniendo constante eventos estresantes.

  4. Interprete el coeficiente correspondiente a eventos estresantes, manteniendo constante apoyo familiar.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con resiliencia.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


19. Actividad física, conexión social y satisfacción vital

Se estudió satisfacción con la vida utilizando como variables explicativas actividad física y conexión social.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 34.534 1.732 19.941 <0.001
actividad 2.456 0.228 10.763 <0.001
conexion 0.655 0.049 13.293 <0.001
Medidas de ajuste
Medida Valor
R² 0.850
R² ajustado 0.845

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a actividad física, manteniendo constante conexión social.

  4. Interprete el coeficiente correspondiente a conexión social, manteniendo constante actividad física.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con satisfacción con la vida.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


20. Preparación, sueño y ansiedad ante exámenes

Se estudió ansiedad ante exámenes utilizando como variables explicativas horas de preparación y horas de sueño.

Resultados de la regresión lineal múltiple
Variable Estimación Error estándar Valor t p-valor
(Intercept) 70.077 4.062 17.250 <0.001
preparacion -2.336 0.257 -9.100 <0.001
sueno -2.965 0.550 -5.396 <0.001
Medidas de ajuste
Medida Valor
R² 0.642
R² ajustado 0.629

Responda:

  1. Identifique la variable respuesta y las dos variables explicativas.

  2. A partir del mapa de calor, describa la dirección de las relaciones entre cada par de variables.

  3. Interprete el coeficiente correspondiente a horas de preparación, manteniendo constante horas de sueño.

  4. Interprete el coeficiente correspondiente a horas de sueño, manteniendo constante horas de preparación.

  5. Utilizando los p-valores, determine cuáles variables presentan evidencia de asociación lineal con ansiedad ante exámenes.

  6. Interprete el valor de \(R^2\) del modelo completo.

  7. Explique por qué los coeficientes del modelo múltiple no deben interpretarse como correlaciones simples.

  8. ¿Puede establecerse una relación causal a partir de estos resultados? Justifique.


9 Sección II. Ejercicios con bases de datos simuladas

En esta sección se proporciona el código necesario para generar una base de datos simulada y reproducible.

El estudiante deberá:

  1. Ejecutar el código.

  2. Explorar los datos.

  3. Realizar el análisis solicitado en R.

  4. Presentar tablas y gráficos apropiados.

  5. Interpretar los resultados en el contexto del problema.

9.1 A. Dos variables: ejercicios 21–30

Para cada ejercicio realice, como mínimo:

  1. un diagrama de dispersión con ggplot2;

  2. el coeficiente de correlación;

  3. una regresión lineal simple;

  4. la ecuación estimada;

  5. la interpretación de la pendiente y del intercepto;

  6. la interpretación del p-valor de la pendiente;

  7. el intervalo del 95% de confianza para la pendiente;

  8. la interpretación de \(R^2\);

  9. una predicción para un valor razonable de la variable explicativa;

  10. un gráfico de residuos frente a valores ajustados y un gráfico Q-Q;

  11. una conclusión de un párrafo, diferenciando claramente asociación de causalidad.

21. Preparación para exámenes y ansiedad

set.seed(3021)
n <- 45

preparacion <- runif(n, 1, 12)
ansiedad <- 68 - 2.4 * preparacion + rnorm(n, 0, 5.0)

datos_21 <- data.frame(
  preparacion = preparacion,
  ansiedad = ansiedad
)

head(datos_21)
##   preparacion ansiedad
## 1   11.020870 28.55252
## 2    6.398477 48.98855
## 3    2.475623 58.46368
## 4    3.825520 53.01834
## 5   10.533662 45.14654
## 6    2.905242 67.83186

Analice la relación entre horas de preparación semanal y puntaje de ansiedad ante exámenes siguiendo los pasos indicados al comienzo de esta sección.


22. Interacción social y soledad

set.seed(3022)
n <- 50

interaccion <- runif(n, 1, 20)
soledad <- 58 - 1.55 * interaccion + rnorm(n, 0, 5.5)

datos_22 <- data.frame(
  interaccion = interaccion,
  soledad = soledad
)

head(datos_22)
##   interaccion  soledad
## 1    9.063045 48.85933
## 2   11.848831 38.90650
## 3   19.994181 29.05630
## 4   12.689716 37.02189
## 5   14.702708 42.52536
## 6    4.128585 42.79084

Analice la relación entre horas semanales de interacción social y puntaje de soledad siguiendo los pasos indicados al comienzo de esta sección.


23. Uso del teléfono y estrés percibido

set.seed(3023)
n <- 48

telefono <- runif(n, 1, 10)
estres <- 22 + 3.0 * telefono + rnorm(n, 0, 5.0)

datos_23 <- data.frame(
  telefono = telefono,
  estres = estres
)

head(datos_23)
##   telefono   estres
## 1 1.359089 28.84988
## 2 5.031487 40.92063
## 3 4.965812 34.57916
## 4 8.945949 48.92403
## 5 7.993926 46.10814
## 6 9.635587 47.21506

Analice la relación entre horas diarias de uso del teléfono y puntaje de estrés percibido siguiendo los pasos indicados al comienzo de esta sección.


24. Sueño y bienestar

set.seed(3024)
n <- 46

sueno <- runif(n, 4, 9)
bienestar <- 25 + 6.2 * sueno + rnorm(n, 0, 6.0)

datos_24 <- data.frame(
  sueno = sueno,
  bienestar = bienestar
)

head(datos_24)
##      sueno bienestar
## 1 5.506290  61.63897
## 2 5.010316  55.90162
## 3 8.880070  76.39063
## 4 4.599152  54.63832
## 5 5.654642  55.90903
## 6 7.850259  77.45378

Analice la relación entre horas de sueño y puntaje de bienestar siguiendo los pasos indicados al comienzo de esta sección.


25. Actividad física y síntomas depresivos

set.seed(3025)
n <- 52

actividad <- runif(n, 0, 8)
depresion <- 31 - 2.0 * actividad + rnorm(n, 0, 4.8)

datos_25 <- data.frame(
  actividad = actividad,
  depresion = depresion
)

head(datos_25)
##   actividad depresion
## 1 0.8525675  21.14259
## 2 2.3207158  25.14572
## 3 2.9251674  28.52305
## 4 3.2824772  30.13623
## 5 7.0162408  17.16323
## 6 1.6205627  26.47823

Analice la relación entre horas semanales de actividad física y puntaje de síntomas depresivos siguiendo los pasos indicados al comienzo de esta sección.


26. Meditación y atención

set.seed(3026)
n <- 44

meditacion <- runif(n, 0, 35)
atencion <- 48 + 0.65 * meditacion + rnorm(n, 0, 5.0)

datos_26 <- data.frame(
  meditacion = meditacion,
  atencion = atencion
)

head(datos_26)
##   meditacion atencion
## 1  11.269678 51.27865
## 2   8.255383 52.91006
## 3  32.126956 71.02560
## 4   3.572094 53.69108
## 5   2.828698 48.93715
## 6   2.572333 56.82351

Analice la relación entre minutos diarios de meditación y puntaje de atención siguiendo los pasos indicados al comienzo de esta sección.


27. Horas de trabajo y agotamiento

set.seed(3027)
n <- 50

trabajo <- runif(n, 20, 60)
agotamiento <- 15 + 0.9 * trabajo + rnorm(n, 0, 6.5)

datos_27 <- data.frame(
  trabajo = trabajo,
  agotamiento = agotamiento
)

head(datos_27)
##    trabajo agotamiento
## 1 32.62027    37.48138
## 2 44.35140    66.39188
## 3 51.59857    70.82320
## 4 47.04836    51.33340
## 5 29.64426    50.45201
## 6 26.38318    48.24533

Analice la relación entre horas de trabajo por semana y puntaje de agotamiento siguiendo los pasos indicados al comienzo de esta sección.


28. Apoyo de pares y autoestima

set.seed(3028)
n <- 47

apoyo <- runif(n, 10, 50)
autoestima <- 32 + 0.82 * apoyo + rnorm(n, 0, 5.0)

datos_28 <- data.frame(
  apoyo = apoyo,
  autoestima = autoestima
)

head(datos_28)
##      apoyo autoestima
## 1 29.99392   50.84661
## 2 45.50175   76.22582
## 3 22.14166   46.68562
## 4 35.28118   68.12315
## 5 49.36038   74.69799
## 6 35.85919   62.88288

Analice la relación entre puntaje de apoyo de pares y puntaje de autoestima siguiendo los pasos indicados al comienzo de esta sección.


29. Cafeína y ansiedad ante exámenes

set.seed(3029)
n <- 45

cafeina <- runif(n, 0, 6)
ansiedad <- 28 + 4.2 * cafeina + rnorm(n, 0, 5.5)

datos_29 <- data.frame(
  cafeina = cafeina,
  ansiedad = ansiedad
)

head(datos_29)
##     cafeina ansiedad
## 1 3.8557978 42.77508
## 2 1.4249815 34.19607
## 3 0.5834201 28.33439
## 4 3.5795858 49.48355
## 5 1.8745108 38.99702
## 6 2.3578837 33.28124

Analice la relación entre tazas de café por día y puntaje de ansiedad ante exámenes siguiendo los pasos indicados al comienzo de esta sección.


30. Afrontamiento y resiliencia

set.seed(3030)
n <- 50

afrontamiento <- runif(n, 15, 60)
resiliencia <- 24 + 0.9 * afrontamiento + rnorm(n, 0, 5.8)

datos_30 <- data.frame(
  afrontamiento = afrontamiento,
  resiliencia = resiliencia
)

head(datos_30)
##   afrontamiento resiliencia
## 1      24.43757    47.92461
## 2      36.33050    47.51276
## 3      21.08109    38.97192
## 4      36.90999    58.63266
## 5      41.94613    53.76095
## 6      50.37778    62.27524

Analice la relación entre puntaje de estrategias de afrontamiento y puntaje de resiliencia siguiendo los pasos indicados al comienzo de esta sección.


9.2 B. Tres variables: ejercicios 31–40

Para cada ejercicio realice, como mínimo:

  1. una tabla descriptiva de las tres variables;

  2. una matriz de correlaciones;

  3. un mapa de calor de las correlaciones;

  4. una matriz de gráficos con GGally::ggpairs();

  5. una regresión lineal simple utilizando una de las variables explicativas;

  6. una regresión lineal múltiple utilizando las dos variables explicativas;

  7. la interpretación contextual de todos los coeficientes del modelo múltiple;

  8. la interpretación de los p-valores y de los intervalos de confianza;

  9. la interpretación y comparación de \(R^2\) entre el modelo simple y el múltiple;

  10. los gráficos básicos de diagnóstico;

  11. una conclusión de dos párrafos, diferenciando asociación de causalidad.

31. Sueño, redes sociales y ansiedad

set.seed(4031)
n <- 55

sueno <- runif(n,4,9)
redes <- runif(n,0.5,7)
ansiedad <- 50 - 3.7*sueno + 2.5*redes + rnorm(n,0,4.0)

datos_31 <- data.frame(
  sueno = sueno,
  redes = redes,
  ansiedad = ansiedad
)

head(datos_31)
##      sueno     redes ansiedad
## 1 4.468613 4.5459509 46.43219
## 2 7.999390 6.9538894 38.82855
## 3 8.783220 4.7263869 27.63701
## 4 7.375908 0.9411442 19.32467
## 5 7.273024 5.4884081 35.62861
## 6 6.372262 2.8024333 38.68964

Considere puntaje de ansiedad como variable respuesta y horas de sueño y horas en redes sociales como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


32. Trabajo, actividad física y estrés

set.seed(4032)
n <- 52

trabajo <- runif(n,20,60)
actividad <- runif(n,0,8)
estres <- 20 + 0.75*trabajo - 1.8*actividad + rnorm(n,0,5.0)

datos_32 <- data.frame(
  trabajo = trabajo,
  actividad = actividad,
  estres = estres
)

head(datos_32)
##    trabajo actividad   estres
## 1 24.45646 0.5054714 30.18525
## 2 40.21227 7.9063202 35.24325
## 3 56.12415 1.7303813 51.88230
## 4 33.58976 2.3607143 42.38489
## 5 46.06305 3.5117742 55.21984
## 6 41.28127 6.3079376 36.50942

Considere puntaje de estrés como variable respuesta y horas de trabajo y actividad física como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


33. Apoyo social, sueño y bienestar

set.seed(4033)
n <- 50

apoyo <- runif(n,10,50)
sueno <- runif(n,4,9)
bienestar <- 22 + 0.70*apoyo + 3.2*sueno + rnorm(n,0,5.2)

datos_33 <- data.frame(
  apoyo = apoyo,
  sueno = sueno,
  bienestar = bienestar
)

head(datos_33)
##      apoyo    sueno bienestar
## 1 45.21365 4.000228  74.84538
## 2 31.66459 8.344916  72.70199
## 3 20.75625 4.518129  40.42625
## 4 41.40787 8.726508  77.52302
## 5 38.10081 8.420905  78.33621
## 6 39.47726 7.077090  74.75070

Considere bienestar psicológico como variable respuesta y apoyo social y horas de sueño como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


34. Soledad, actividad física y depresión

set.seed(4034)
n <- 58

soledad <- runif(n,10,60)
actividad <- runif(n,0,8)
depresion <- 10 + 0.52*soledad - 1.6*actividad + rnorm(n,0,4.8)

datos_34 <- data.frame(
  soledad = soledad,
  actividad = actividad,
  depresion = depresion
)

head(datos_34)
##    soledad actividad depresion
## 1 47.80379 6.5652862  26.56501
## 2 14.23279 3.8138091  20.20104
## 3 31.50962 0.4466517  30.69081
## 4 54.98058 6.1354900  24.61993
## 5 39.24334 3.5969733  29.55164
## 6 35.37198 1.6512207  25.94889

Considere síntomas depresivos como variable respuesta y soledad y actividad física como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


35. Carga académica, recuperación y agotamiento

set.seed(4035)
n <- 54

carga <- runif(n,10,45)
recuperacion <- runif(n,10,50)
agotamiento <- 28 + 1.0*carga - 0.72*recuperacion + rnorm(n,0,5.2)

datos_35 <- data.frame(
  carga = carga,
  recuperacion = recuperacion,
  agotamiento = agotamiento
)

head(datos_35)
##      carga recuperacion agotamiento
## 1 13.73731     40.59353    10.09043
## 2 27.02797     28.24634    35.63465
## 3 24.29816     25.61586    32.46819
## 4 22.54035     29.66185    32.46352
## 5 18.97896     30.45431    17.13324
## 6 32.11721     11.24608    49.43462

Considere agotamiento como variable respuesta y carga académica y recuperación como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


36. Pantalla, sueño y atención

set.seed(4036)
n <- 50

pantalla <- runif(n,1,10)
sueno <- runif(n,4,9)
atencion <- 52 - 2.8*pantalla + 3.3*sueno + rnorm(n,0,5.2)

datos_36 <- data.frame(
  pantalla = pantalla,
  sueno = sueno,
  atencion = atencion
)

head(datos_36)
##   pantalla    sueno atencion
## 1 9.593635 6.998433 47.32984
## 2 1.068439 6.807005 69.11125
## 3 4.569486 7.513190 65.96547
## 4 9.753299 6.950700 41.50914
## 5 4.124507 5.365720 58.93419
## 6 2.580103 7.941871 70.94398

Considere puntaje de atención como variable respuesta y tiempo de pantalla y horas de sueño como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


37. Apoyo de pares, acoso y autoestima

set.seed(4037)
n <- 52

apoyo <- runif(n,10,50)
acoso <- runif(n,0,15)
autoestima <- 38 + 0.70*apoyo - 1.25*acoso + rnorm(n,0,5.0)

datos_37 <- data.frame(
  apoyo = apoyo,
  acoso = acoso,
  autoestima = autoestima
)

head(datos_37)
##      apoyo     acoso autoestima
## 1 39.37687 14.604141   46.96989
## 2 10.51580  9.529926   28.73014
## 3 25.79612  9.141267   40.50817
## 4 48.24437  1.285079   67.35407
## 5 11.35241  7.126743   35.43459
## 6 10.21357  9.741301   32.53777

Considere autoestima como variable respuesta y apoyo de pares y experiencias de acoso como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


38. Afrontamiento, adversidad y resiliencia

set.seed(4038)
n <- 56

afrontamiento <- runif(n,15,60)
adversidad <- runif(n,0,15)
resiliencia <- 35 + 0.82*afrontamiento - 1.15*adversidad + rnorm(n,0,5.5)

datos_38 <- data.frame(
  afrontamiento = afrontamiento,
  adversidad = adversidad,
  resiliencia = resiliencia
)

head(datos_38)
##   afrontamiento adversidad resiliencia
## 1      46.09044  13.388757    55.49601
## 2      59.76327  10.948847    71.76586
## 3      59.09142   9.330728    75.27519
## 4      51.94027   3.143521    79.31265
## 5      56.24745   4.800582    69.89453
## 6      50.35002   7.578707    73.99308

Considere resiliencia como variable respuesta y afrontamiento y adversidad como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


39. Sueño, conexión social y satisfacción vital

set.seed(4039)
n <- 50

sueno <- runif(n,4,9)
conexion <- runif(n,10,50)
satisfaccion <- 18 + 3.3*sueno + 0.70*conexion + rnorm(n,0,5.0)

datos_39 <- data.frame(
  sueno = sueno,
  conexion = conexion,
  satisfaccion = satisfaccion
)

head(datos_39)
##      sueno conexion satisfaccion
## 1 4.208126 16.92394     56.40084
## 2 4.860298 40.24537     60.31946
## 3 8.143197 41.61403     76.30125
## 4 6.255658 41.11448     79.95597
## 5 4.189164 24.47748     45.79178
## 6 4.516120 19.55485     40.29784

Considere satisfacción con la vida como variable respuesta y horas de sueño y conexión social como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


40. Estudio, procrastinación y autoeficacia

set.seed(4040)
n <- 55

estudio <- runif(n,1,8)
procrastinacion <- runif(n,10,60)
autoeficacia <- 45 + 3.1*estudio - 0.58*procrastinacion + rnorm(n,0,5.0)

datos_40 <- data.frame(
  estudio = estudio,
  procrastinacion = procrastinacion,
  autoeficacia = autoeficacia
)

head(datos_40)
##    estudio procrastinacion autoeficacia
## 1 3.008575        54.75972     22.24762
## 2 5.964877        49.00816     38.86142
## 3 6.266869        52.72925     41.56923
## 4 5.995789        21.65589     52.74847
## 5 6.163366        56.59411     22.86616
## 6 7.204435        57.90131     25.86277

Considere autoeficacia académica como variable respuesta y horas de estudio y procrastinación como variables explicativas. Realice el análisis siguiendo los pasos indicados al comienzo de esta sección.


10 Sección III. Ejercicios de integración y aplicación

41. Horas de sueño y estrés académico

Un investigador estudia la relación entre las horas promedio de sueño por noche y el puntaje de estrés académico de estudiantes universitarios.

El modelo obtenido fue:

\[ \widehat{\text{Estrés}} = 48.6-2.4(\text{Horas de sueño}) \]

  1. Identifique la variable respuesta y la variable explicativa.

  2. Interprete el valor -2.4 en el contexto del problema.

  3. Obtenga el puntaje de estrés esperado para un estudiante que duerme 6 horas por noche.

  4. Si el p-valor asociado con las horas de sueño es 0.003, ¿qué puede concluir utilizando un nivel de significancia de 0.05?

  5. ¿Puede concluir que aumentar las horas de sueño necesariamente reduce el estrés? Explique.


42. Uso de redes sociales y ansiedad

Se estudió la relación entre el número de horas diarias de uso de redes sociales y un puntaje de ansiedad.

El coeficiente estimado para las horas de uso de redes sociales fue 1.85 y su p-valor fue 0.018.

Interprete ambos resultados en el contexto del estudio.


43. Interpretación de un intervalo de confianza

En un modelo que estudia la relación entre actividad física y síntomas depresivos, el intervalo del 95% de confianza para el cambio promedio asociado con una hora adicional de actividad física semanal fue:

\[ (-2.8,\;-0.7) \]

Interprete el intervalo en el contexto del problema.

¿Existe evidencia de una relación entre las variables? Explique utilizando el intervalo de confianza.


44. Regresión con dos variables explicativas

Un investigador estudia el puntaje de ansiedad utilizando las horas de sueño y las horas diarias de uso de redes sociales.

Se obtuvo:

Variable Estimación p-valor
Horas de sueño -2.30 0.004
Redes sociales 1.70 0.021
  1. Interprete el coeficiente correspondiente a las horas de sueño.

  2. Interprete el coeficiente correspondiente al uso de redes sociales.

  3. ¿Qué significa la expresión “manteniendo constante la otra variable”?

  4. Determine cuáles variables presentan evidencia de asociación con la ansiedad utilizando un nivel de significancia de 0.05.


45. Interpretación del modelo completo

Un modelo que utiliza las horas de sueño y las horas de estudio para explicar el estrés académico presenta un coeficiente de determinación de 0.46.

Interprete este valor en el contexto del problema.

¿Significa este resultado que el 46% del estrés de cada estudiante es causado por las horas de sueño y de estudio? Explique.


10.0.1 46. Puntajes de ansiedad

Se estudió el puntaje de ansiedad de 80 estudiantes utilizando las horas de sueño y las horas diarias de uso de redes sociales.

Los resultados del modelo fueron:

Variable Coeficiente Error estándar p-valor
Intercepto 51.30 4.80 <0.001
Horas de sueño -2.60 0.65 0.001
Redes sociales 1.35 0.48 0.008

Además,

\[ R^2=0.44 \]

Responda:

  1. ¿Cuál es la variable respuesta?

  2. ¿Cuáles son las variables explicativas?

  3. Interprete el coeficiente -2.60 correspondiente a las horas de sueño.

  4. Interprete el coeficiente 1.35 correspondiente al uso de redes sociales.

  5. ¿Existe evidencia de una relación entre las horas de sueño y la ansiedad? Justifique utilizando el p-valor.

  6. ¿Existe evidencia de una relación entre el uso de redes sociales y la ansiedad?

  7. Interprete el valor del coeficiente de determinación.

  8. Dos estudiantes utilizan redes sociales durante el mismo número de horas diarias. Uno duerme una hora más que el otro. ¿Qué diferencia promedio predice el modelo entre sus puntajes de ansiedad?

  9. ¿Puede concluirse que dormir una hora adicional causa una disminución de 2.60 puntos en la ansiedad? Explique.


Texto guía

  1. LLinás, H. (2006); Estadística inferencial. Barranquilla: Editorial Universidad del Norte.

Bibliografía complementaria

  1. LLinás, H., Rojas, C. (2005). Estadística descriptiva y distribuciones de probabilidad. Barranquilla: Editorial Universidad del Norte.

  2. Consultar mis notas de clase: Estadística inferencial

  3. Notas de clase - Cap. 6: Click derecho aquí.

  4. Consultar el documento RPubs :: Enlace y materiales de ayuda.

  5. Agresti, A., Franklin, C., & Klingenberg, B. (2018). Statistics: The Art and Science of Learning from Data, 4/E.

  6. Puede consultarse mis siguientes documentos:

  7. También, puede consultarse mis Notas de clase - Cap. 6: Click derecho aquí.

 

 
If you found any ERRORS or have SUGGESTIONS, please report them to my email. Thanks.