title: “Trabajo final Estadistica II” output: “Nataly Jimenez, Simon Velez, Santiago Zapata” word_document: default html_document: default date: “2024-07-09” —
#En este problema, analizaremos las transacciones un universitario. Se nos proporciona un conjunto de datos con 5 observaciones sobre el valor de cada transacción correspondiente a un servicio de transporte y se tiene en cuenta la cantidad de transportes diarios que se hizo en cada transacción por día. Usaremos un modelo de regresión lineal simple para ajustar estos datos y evaluar la relación entre las dos variable.
## H0 -> El modelo no es significativo
## H1 -> El modelo es significativo
#Datos
gastos_transporte_y <-c(21000,6100,12200,12200,31845)
cantidad_de_viajes_x <-c(3,1,2,2,4)
# En este problema, analizaremos las transacciones de un universitario. Se nos proporciona un conjunto de datos con 5 observaciones sobre el valor de cada transacción correspondiente a un servicio de transporte y se tiene en cuenta la cantidad de transportes diarios que se hizo en cada transacción por día. Usaremos un modelo de regresión lineal simple para ajustar estos datos y evaluar la relación entre las dos variables.
# Datos
gastos_transporte_y <- c(21000, 6100, 12200, 12200, 31845)
cantidad_de_viajes_x <- c(3, 1, 2, 2, 4)
# Organizar los datos por medio de un data.frame
df <- data.frame(gastos_transporte_y, cantidad_de_viajes_x)
# Ajustar el modelo de regresión lineal
modelo <- lm(gastos_transporte_y ~ cantidad_de_viajes_x, data = df)
# Resumen del modelo
resumen_modelo <- summary(modelo)
print(resumen_modelo)
##
## Call:
## lm(formula = gastos_transporte_y ~ cantidad_de_viajes_x, data = df)
##
## Residuals:
## 1 2 3 4 5
## -890.4 1614.2 -988.1 -988.1 1252.3
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -4216 1737 -2.428 0.093506 .
## cantidad_de_viajes_x 8702 666 13.067 0.000968 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 1519 on 3 degrees of freedom
## Multiple R-squared: 0.9827, Adjusted R-squared: 0.977
## F-statistic: 170.7 on 1 and 3 DF, p-value: 0.0009681
# Coeficientes del modelo
coeficientes <- resumen_modelo$coefficients
print(coeficientes)
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) -4216.538 1736.7053 -2.427895 0.0935058391
## cantidad_de_viajes_x 8702.308 665.9961 13.066605 0.0009680556
# R² del modelo
r_cuadrado <- resumen_modelo$r.squared
print(r_cuadrado)
## [1] 0.9827324
# Predicciones
predicciones <- predict(modelo, newdata = df)
print(predicciones)
## 1 2 3 4 5
## 21890.385 4485.769 13188.077 13188.077 30592.692
# Calcular los residuos
residuos <- df$gastos_transporte_y - predicciones
print(residuos)
## 1 2 3 4 5
## -890.3846 1614.2308 -988.0769 -988.0769 1252.3077
# Tabla de valores observados, predichos y residuos
tabla_resultados <- data.frame(Gasto_transporte = df$gastos_transporte_y,
Cantidad_Actuales = df$cantidad_de_viajes_x,
Cantidad_Predichas = predicciones,
Residuos = residuos)
print(tabla_resultados)
## Gasto_transporte Cantidad_Actuales Cantidad_Predichas Residuos
## 1 21000 3 21890.385 -890.3846
## 2 6100 1 4485.769 1614.2308
## 3 12200 2 13188.077 -988.0769
## 4 12200 2 13188.077 -988.0769
## 5 31845 4 30592.692 1252.3077
# Prueba Chi-cuadrado para bondad de ajuste
observed <- df$gastos_transporte_y
expected <- predicciones
chi_squared <- sum((observed - expected)^2 / expected)
print(chi_squared)
## [1] 816.4271
# Grados de libertad (número de observaciones - número de parámetros estimados)
df_grados_libertad <- length(observed) - 2
p_value <- pchisq(chi_squared, df_grados_libertad, lower.tail = FALSE)
print(p_value)
## [1] 1.184513e-176
# Visualización
plot(gastos_transporte_y, cantidad_de_viajes_x, main="Gráfico de Dispersión: gastos de transporte vs Cantidad de viajes",
xlab="gastos de transporte", ylab="Cantidad de viajes", pch=16, col="blue")
plot(gastos_transporte_y~cantidad_de_viajes_x,pch=16)
abline(lm(gastos_transporte_y~cantidad_de_viajes_x),col="red")
# Mostrar los coeficientes del modelo y el \(Rˆ2\)
print(paste("Intercepto:", coeficientes[1, 1]))
## [1] "Intercepto: -4216.53846153847"
print(paste("Pendiente:", coeficientes[2, 1]))
## [1] "Pendiente: 8702.3076923077"
print(paste("Rˆ2:", r_cuadrado))
## [1] "Rˆ2: 0.982732437664509"
##Teniendo en cuenta que el p-valor < 0.05 entonces se rechaza la H0 por lo que se puede concluir que el modelo es significativo y es bastante util a la hora de predecir gastos supuestos entre la cantidad de viajes que se va a realizar y el costo que tendrían
##Hipotesis 2
## Tenemos un grupo de datos que corresponden a una clasificación en las transacciones realizadas por un estudiante universitario, para la clasificación se tuvo en cuenta si las transacciones tuvieron un impacto individual o grupal y si estuvieron relacionadas con alguna aplicación de transporte u otro gasto hechas en un mismo día en busca de confirmar una posible relación entre el gasto en transportes y otros gastos como salir a comer con amigos o su pareja, o invitar a su familia a comer, de esta manera el estudiante busca trabajar en uno de los gastos externos que involucra compartir con personas.
## Planteando las siguientes hipotesis: H0 -> no hay asosiación entre el impacto final en el numero de personas y el tipo de gasto que se realiza y H1 -> Existe una asosiación entre el impacto final del numero de personas y el tipo de gasto que se realiza
datos <-data.frame(cantidad_personas = c("Individual", "Grupal", "Individual", "Grupal", "Individual", "Grupal", "Individual", "Grupal", "Individual", "Grupal","Individual","Grupal","Grupal","Grupal","Individual","Individual","Individual","Grupal","Grupal","Grupal","Grupal","Individual","Individual","Individual"),Tipo_gasto = c("Transporte", "Otros gastos", "Otros gastos", "Transporte", "Transporte", "Otros gastos", "Transporte", "Otros gastos", "Transporte", "Otros gastos","Transporte","Transporte","Transporte","Transporte","Transporte","Transporte","Transporte","Otros gastos","Otros gastos","Otros gastos","Otros gastos","Otros gastos","Otros gastos","Otros gastos"))
# Crear una tabla de contingencia
tabla_contingencia<-table(datos$cantidad_personas, datos$Tipo_gasto)
print(tabla_contingencia)
##
## Otros gastos Transporte
## Grupal 8 4
## Individual 4 8
# Realizar la prueba de chi-cuadrado
resultado_chi2 <-chisq.test(tabla_contingencia)
# Mostrar el resultado de la prueba
print(resultado_chi2)
##
## Pearson's Chi-squared test with Yates' continuity correction
##
## data: tabla_contingencia
## X-squared = 1.5, df = 1, p-value = 0.2207
## Como p-valor > 0,05 se rechaza H0 -> no hay asosiación entre el impacto final en el numero de personas y el tipo de gasto que se realiza por lo que concluimos que con un nivel de significancia de 0,05, H1 -> Existe una asosiación entre el impacto final del numero de personas y el tipo de gasto que se realiza
##Hipotesis 3
## El estudiante considera reorganizar sus finanzas teniendo en cuenta la clasificación de gastos que realizó, para esto desea hacer una prueba que demuestre que tan significativa es actualmente la diferencia entre las cantidades de viajes que puede llegar a tomar en un día, suponiendo que la cantidad necesaria es dos, una para salir de su casa y otra para volver
##Para determinar lo anterior el estudiante decide desarrollar una prueba de homogeneidad y así tomar una decisón sobre las acciones que debería tomar.
##H0 -> La distribución es homogenea en todas las cantidades de viajes estudiadas; H1 -> La distribución no es homogenea en todas las cantidades de viajes estudiadas
# Datos observados
cantidad_de_viajes_dia <- c(3,1,2,2,4)
# Datos esperados
viajes_esperados_segunnecesidad <- c(2,2,2,2,2)
# Realizar la prueba Chi-cuadrado
chi_cuadrado <- sum((cantidad_de_viajes_dia - viajes_esperados_segunnecesidad)^2 / viajes_esperados_segunnecesidad)
# Grados de libertad
grados_libertad <- length(cantidad_de_viajes_dia) - 1
# Valor crítico al 5% de significancia
valor_critico <- qchisq(0.95, grados_libertad)
# Resultado de la prueba
resultado <- ifelse(chi_cuadrado > valor_critico, "Rechazar H0", "No Rechazar H0")
# Mostrar resultados
resultado
## [1] "No Rechazar H0"
##De acuerdo al resultado se puede concluir que si sus viajes se mantienen entre 1 y 4 la diferencia entre estos no será significativa por lo que si el estudiante busca algún cambio impactante en sus finanzas, la cantidad de viajes realizadas es una variable que no tendrá un impacto significativo en éstas