library(ggplot2)

datos <- read.csv("conjunto_de_datos_tper_vic1_envipe2025.csv")

datos2 <- subset(datos, RESUL_H %in% c("A", "B"))

datos2 <- subset(datos2, AP4_4_A %in% 1:4)

datos2$victima <- ifelse(datos2$RESUL_H == "A", 1, 0)

#percepcion al caminar de noche (1=muy seguro a 4=muy inseguro)
datos2$percep_noche <- datos2$AP4_4_A

#inseguridad (0=muy seguro o 1=muy inseguro)
datos2$inseguro_bin <- ifelse(datos2$AP4_4_A %in% c(3,4), 1, 0)

datos2$victima_fac <- factor(datos2$victima,
                             levels = c(0,1),
                             labels = c("Sin victimización", "Con victimización"))

datos2$percep_noche_fac <- factor(datos2$percep_noche,
                                  levels = 1:4,
                                  labels = c("Muy seguro(a)", "Seguro(a)",
                                             "Inseguro(a)", "Muy inseguro(a)"))

#frecuencias de victimizacion
table(datos2$victima_fac)
## 
## Sin victimización Con victimización 
##             63398             21472
prop.table(table(datos2$victima_fac))
## 
## Sin victimización Con victimización 
##         0.7470013         0.2529987
#distribucion global de percepcion al caminar de noche
table(datos2$percep_noche_fac)
## 
##   Muy seguro(a)       Seguro(a)     Inseguro(a) Muy inseguro(a) 
##            5186           30624           36799           12261
prop.table(table(datos2$percep_noche_fac))
## 
##   Muy seguro(a)       Seguro(a)     Inseguro(a) Muy inseguro(a) 
##      0.06110522      0.36083422      0.43359255      0.14446801
#distribucion por victimizacion
table(datos2$victima_fac, datos2$percep_noche_fac)
##                    
##                     Muy seguro(a) Seguro(a) Inseguro(a) Muy inseguro(a)
##   Sin victimización          4243     24714       26550            7891
##   Con victimización           943      5910       10249            4370
prop.table(table(datos2$victima_fac, datos2$percep_noche_fac), 1)
##                    
##                     Muy seguro(a)  Seguro(a) Inseguro(a) Muy inseguro(a)
##   Sin victimización    0.06692640 0.38982302  0.41878293      0.12446765
##   Con victimización    0.04391766 0.27524218  0.47731930      0.20352086
#medias y desviacion estandar
tapply(datos2$percep_noche, datos2$victima, mean)
##        0        1 
## 2.600792 2.840443
tapply(datos2$percep_noche, datos2$victima, sd)
##         0         1 
## 0.7890747 0.7930981
#grafica de barras apiladas de percepcion por victimizacion
datos2$victima_et <- factor(datos2$victima,
                         levels = c(0,1),
                         labels = c("Sin victimización","Con victimización"))

datos2$percep_et <- factor(datos2$percep_noche,
                        levels = 1:4,
                        labels = c("Muy seguro(a)",
                                   "Seguro(a)",
                                   "Inseguro(a)",
                                   "Muy inseguro(a)"))

ggplot(datos2, aes(x = victima_et, fill = percep_et)) +
  geom_bar(position = "fill") +
  labs(x = "Victimización del hogar",
       y = "Proporción",
       fill = "Percepción al caminar de noche")

#t de Student. Ha: media víctimas > media no víctimas
t.test(percep_noche ~ victima,
       data = datos2,
       alternative = "greater")
## 
##  Welch Two Sample t-test
## 
## data:  percep_noche by victima
## t = -38.318, df = 36877, p-value = 1
## alternative hypothesis: true difference in means between group 0 and group 1 is greater than 0
## 95 percent confidence interval:
##  -0.2499391        Inf
## sample estimates:
## mean in group 0 mean in group 1 
##        2.600792        2.840443
#proporción de personas inseguras (3 o 4)
tabla_inseg <- table(datos2$victima_fac, datos2$inseguro_bin)
tabla_inseg
##                    
##                         0     1
##   Sin victimización 28957 34441
##   Con victimización  6853 14619
#comparar proporción de inseguridad
x <- c(tabla_inseg[1,2], tabla_inseg[2,2])
n <- c(sum(tabla_inseg[1,]), sum(tabla_inseg[2,]))

prop.test(x, n, alternative = "less")
## 
##  2-sample test for equality of proportions with continuity correction
## 
## data:  x out of n
## X-squared = 1244.4, df = 1, p-value < 2.2e-16
## alternative hypothesis: less
## 95 percent confidence interval:
##  -1.0000000 -0.1313965
## sample estimates:
##    prop 1    prop 2 
## 0.5432506 0.6808402