Módulo 7: Métodos de Regresión — Ejercicios de Práctica

Bioestadística Fundamental y Estadística Fundamental para las Ciencias de la Salud

Authors
Affiliations

Jose Miguel Leon Puentes

Universidad Nacional de Colombia

Johann David Sanchez Niño

Andrés Felipe Rache

Laura Camila Matheus Barrios

Brayan Stiven Martínez Rodríguez

Departamento de Estadística

Introducción

Este documento reúne 5 ejercicios de práctica para reforzar el Módulo 7: Métodos de Regresión. Los conjuntos de datos utilizados son simulados (generados de forma reproducible en R a partir de relaciones lineales realistas más ruido aleatorio). Ningún dato corresponde a mediciones reales de pacientes.

Ejercicio 1

Un grupo de investigadores en salud cardiovascular desea estudiar la relación entre la edad (en años) y la presión arterial sistólica (PAS, en mmHg) en una muestra de 15 personas adultas aparentemente sanas, con el fin de establecer si la edad es un buen predictor lineal de la presión arterial. Se registraron los siguientes datos:

Paciente 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15
Edad (años) 25 31 38 42 29 54 60 47 33 58 45 22 36 51 63
PAS (mmHg) 125 121 135 137 122 134 151 137 130 150 138 115 131 145 143
  1. Ajuste un modelo de regresión lineal simple donde la PAS sea la variable respuesta y la edad la variable explicativa.
  2. Interprete el intercepto y la pendiente del modelo ajustado.
  3. Evalúe, al nivel de significancia del 5 %, si la edad tiene un efecto estadísticamente significativo sobre la PAS.
  4. Calcule e interprete el coeficiente de determinación \(R^2\).
  5. Estime la presión arterial sistólica esperada para una persona de 55 años, tanto “manualmente” (reemplazando en la ecuación estimada) como utilizando la función predict().

Ejercicio 2

Un laboratorio farmacéutico está evaluando un nuevo medicamento para reducir el colesterol LDL. En un ensayo con 12 pacientes se administraron distintas dosis del fármaco (en mg) y se midió la reducción en el nivel de colesterol (en mg/dL) después de 8 semanas de tratamiento:

Dosis (mg) 5 10 15 20 25 30 35 40 45 50 55 60
Reducción colesterol (mg/dL) 10.5 10.7 12.2 11.2 20.3 19.3 23.0 21.2 35.8 33.2 43.7 46.1
  1. Ajuste el modelo de regresión lineal simple correspondiente.
  2. Pruebe, con un nivel de significancia del 5 %, si el intercepto del modelo es significativamente distinto de cero. Interprete el resultado en el contexto del problema (¿tiene sentido clínico un intercepto igual a cero aquí?).
  3. Interprete la pendiente estimada.
  4. Grafique los residuales del modelo en función de los valores ajustados (plot(modelo, which = 1) o manualmente con plot(fitted(modelo), resid(modelo))). A partir del gráfico, ¿hay evidencia visual de heterocedasticidad (varianza no constante de los residuales)?

Ejercicio 3

Un fisiólogo pediátrico quiere modelar la capacidad pulmonar (FEV, en litros) de niños y adolescentes en función de su estatura (en cm) y su edad (en años). Se midieron estas tres variables en 20 sujetos:

Estatura (cm) 161 168 181 154 162 157 164 162 174 167 149 167 150 146 169 146 164 150 177 169
Edad (años) 12 12 17 12 15 12 9 17 13 9 10 10 15 15 11 14 12 18 9 12
FEV (litros) 4.86 5.57 6.92 4.71 5.78 4.86 4.69 5.56 5.97 4.40 4.49 4.82 5.07 4.95 5.41 5.03 5.06 5.65 5.18 6.23
  1. Ajuste un modelo de regresión lineal múltiple que incluya el término de interacción entre estatura y edad (es decir, fev ~ altura * edad3).
  2. Al nivel de significancia del 5 %, evalúe si el efecto de la estatura sobre la capacidad pulmonar esperada depende de la edad (es decir, si la interacción es significativa). Use tanto el \(p\)-valor del coeficiente de interacción en summary() como una comparación de modelos con anova().
  3. De acuerdo con el resultado del punto anterior, decida si conviene simplificar el modelo eliminando la interacción. Ajuste el modelo final que usted considere más adecuado e interprete sus coeficientes (excepto el intercepto).
  4. Con el modelo final, estime la capacidad pulmonar esperada para un adolescente de 165 cm de estatura y 13 años de edad.

Ejercicio 4

Un centro de nutrición está comparando el efecto de dos programas de dieta (Dieta A y Dieta B) combinados con distintas cargas de ejercicio semanal sobre la pérdida de peso corporal. Se registran 8 pacientes en cada dieta, cada uno con un número distinto de horas de ejercicio a la semana, y se mide su pérdida de peso (en kg) después de 6 semanas:

Horas de ejercicio/semana 1 2 3 4 5 6 7 8
Pérdida de peso, Dieta A (kg) 1.18 1.16 2.01 1.64 3.10 2.44 2.68 3.68
Pérdida de peso, Dieta B (kg) 2.04 2.40 2.80 4.27 5.47 4.42 6.49 6.41
  1. Organice los datos en un data frame con tres columnas: horas, dieta (variable categórica con niveles “A” y “B”) y perdida.
  2. Ajuste un modelo de regresión lineal múltiple con interacción entre horas y dieta.
  3. Al 5 % de significancia, ¿el efecto de las horas de ejercicio sobre la pérdida de peso depende del tipo de dieta? Interprete el coeficiente de interacción.
  4. Interprete el coeficiente asociado a dietaB (manteniendo constante el número de horas de ejercicio).
  5. Estime la pérdida de peso esperada para una persona que hace 6 horas de ejercicio semanal con la Dieta B, usando predict().

Ejercicio 5

Un grupo de investigación en salud pública quiere explicar el nivel de colesterol total (mg/dL) de 25 personas a partir de su edad (años), su índice de masa corporal (IMC) y sus horas de ejercicio a la semana:

Como son 25 observaciones con 4 variables cada una (más de 20 datos), la tabla completa se encuentra en el archivo adjunto mod7_E05_datos.csv (columnas edad, imc, ejercicio_h, colesterol). Una vista previa de las primeras observaciones:

Obs 1 2 3 4 5
Edad 55 27 42 35 40
IMC 30.4 16.1 27.3 26.9 21.9
Ejercicio (h/sem) 0.4 5.3 1.2 3.7 4.6
Colesterol 272 196 251 231 237
  1. Ajuste un modelo de regresión lineal múltiple para el colesterol en función de las tres variables explicativas (sin interacciones). Interprete cada coeficiente.
  2. Calcule la correlación de Pearson entre edad e imc. ¿Sugiere este valor un problema de colinealidad? Calcule además el Factor de Inflación de la Varianza (VIF) para cada variable explicativa y concluya si existe multicolinealidad problemática (recuerde que valores de VIF mayores a 5 o 10 suelen considerarse preocupantes).
  3. Calcule la distancia de Cook para cada observación e identifique si existen observaciones influyentes (use el criterio \(D_i > 4/n\)).
  4. Calcule los valores de apalancamiento (leverage, \(h_{ii}\)) y determine si existen puntos de alto apalancamiento (use el criterio \(h_{ii} > 2(p+1)/n\), con \(p\) el número de variables explicativas).
  5. Con base en los puntos b), c) y d), redacte una breve conclusión sobre la calidad y estabilidad del modelo ajustado.

Referencias

  • Timbers, T., Campbell, T., & Lee, M. (2024). Data Science: A First Introduction. CRC Press. https://datasciencebook.ca/ (texto de referencia general del Módulo 7).

Copyright © 2026 - Created with Quarto