Una municipalidad evalúa su modalidad digital de atención. El archivo facsimil_A_atencion_municipal.xlsx contiene 160 solicitudes y las variables: • id: identificador de la solicitud. • modalidad: modalidad de atención (Digital o Presencial). • tiempo_resolucion: tiempo de resolución en días. • satisfecho: satisfacción de la persona usuaria (Sí o No). Se pide: a. Examine la estructura de la base e identifique los valores perdidos. Luego, determine las observaciones válidas para analizar el tiempo de resolución de las solicitudes digitales. Informe el tamaño muestral utilizado, junto con la media y desviación estándar del tiempo de resolución. (0,5 pts.)

library(readxl)
facsimil_A_atencion_municipal <- read_excel("~/Downloads/facsimil_A_atencion_municipal.xlsx")
library(naniar)
library(summarytools)
library(BSDA)
## Loading required package: lattice
## 
## Attaching package: 'BSDA'
## The following object is masked from 'package:datasets':
## 
##     Orange
library(tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr     1.2.1     ✔ readr     2.2.0
## ✔ forcats   1.0.1     ✔ stringr   1.6.0
## ✔ ggplot2   4.0.2     ✔ tibble    3.3.1
## ✔ lubridate 1.9.5     ✔ tidyr     1.3.2
## ✔ purrr     1.2.1
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag()    masks stats::lag()
## ✖ tibble::view()  masks summarytools::view()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
miss_var_summary(facsimil_A_atencion_municipal)
## # A tibble: 4 × 3
##   variable          n_miss pct_miss
##   <chr>              <int>    <num>
## 1 tiempo_resolucion      4      2.5
## 2 id                     0      0  
## 3 modalidad              0      0  
## 4 satisfecho             0      0

La variable “tiempo_resolucion” cuenta con un 2.5% de datos NA, 4 datos de 160.

base_unavariablefiltrada<- filter(facsimil_A_atencion_municipal, !is.na(tiempo_resolucion))
base_filtrada <- drop_na(facsimil_A_atencion_municipal)
descr(base_filtrada$tiempo_resolucion)
## Descriptive Statistics  
## base_filtrada$tiempo_resolucion  
## N: 156  
## 
##                     tiempo_resolucion
## ----------------- -------------------
##              Mean               26.19
##           Std.Dev                6.88
##               Min                9.20
##                Q1               21.45
##            Median               26.10
##                Q3               30.70
##               Max               46.10
##               MAD                6.89
##               IQR                9.18
##                CV                0.26
##          Skewness                0.13
##       SE.Skewness                0.19
##          Kurtosis               -0.11
##           N.Valid              156.00
##                 N              156.00
##         Pct.Valid              100.00

La variable tiempo_resolucion consta de el tiempo de resolución en dias, su promedio es de 26.

  1. La municipalidad desea evaluar si el tiempo medio de resolución de las solicitudes digitales es inferior a 26 días. Identifique el parámetro de interés, formule las hipótesis y seleccione el procedimiento inferencial apropiado. Realice el contraste e interprete el valor p y la conclusión en el contexto de la evaluación de la modalidad digital. (0,5 pts.)
t.test(base_filtrada$tiempo_resolucion, mu = 25, alternative = "less",  var.equal = TRUE, conf.level = 0.95)
## 
##  One Sample t-test
## 
## data:  base_filtrada$tiempo_resolucion
## t = 2.1681, df = 155, p-value = 0.9842
## alternative hypothesis: true mean is less than 25
## 95 percent confidence interval:
##      -Inf 27.10681
## sample estimates:
## mean of x 
##  26.19487
  1. La municipalidad desea determinar si puede sostener que más del 70% de las personas que utilizaron la modalidad digital se encuentra satisfecha. Identifique el parámetro de interés, formule las hipótesis y seleccione el procedimiento inferencial apropiado. Realice el contraste e interprete el resultado en términos de la afirmación planteada. (0,5 pts.)
satisfechos<- filter(base_filtrada, satisfecho == "Sí")

prop.test(110, 156, 0.7, alternative = "greater", conf.level = 0.95)
## 
##  1-sample proportions test with continuity correction
## 
## data:  110 out of 156, null probability 0.7
## X-squared = 0.0027473, df = 1, p-value = 0.4791
## alternative hypothesis: true p is greater than 0.7
## 95 percent confidence interval:
##  0.6386589 1.0000000
## sample estimates:
##         p 
## 0.7051282

Se comparan los tiempos de tramitación de dos oficinas. Las desviaciones estándar poblacionales son desconocidas, pero, de acuerdo con los supuestos del problema, las varianzas poblacionales pueden considerarse iguales Oficina Tamaño muestral Media Desviación estándar A 65 31,2 días 7,4 días B 60 27,8 días 7,1 días Se pide: a. La institución desea determinar si existe evidencia estadística de que los tiempos medios de tramitación difieren entre ambas oficinas. Identifique el parámetro de interés, formule las hipótesis, seleccione el procedimiento inferencial apropiado, realice el contraste e interprete el resultado. (0,5 pts.)

tsum.test(mean.x = 31.2, s.x = 7.4, n.x = 65, 
          mean.y = 27.8, s.y = 7.1, n.y = 60, alternative = "two.sided", mu = 0, var.equal = TRUE, conf.level = 0.95)
## 
##  Standard Two-Sample t-Test
## 
## data:  Summarized x and y
## t = 2.6167, df = 123, p-value = 0.00999
## alternative hypothesis: true difference in means is not equal to 0
## 95 percent confidence interval:
##  0.828062 5.971938
## sample estimates:
## mean of x mean of y 
##      31.2      27.8
  1. Considere ahora la afirmación de que la oficina A presenta un tiempo medio de tramitación superior al de la oficina B. Identifique cómo cambia la hipótesis alternativa respecto del apartado anterior y realice el contraste correspondiente. Informe el estadístico de prueba, los grados de libertad y el valor p, e interprete el resultado en el contexto del problema. (0,5 pts.)
tsum.test(mean.x = 31.2, s.x = 7.4, n.x = 65, 
          mean.y = 27.8, s.y = 7.1, n.y = 60, alternative = "greater", mu = 0, var.equal = TRUE, conf.level = 
            0.95)
## 
##  Standard Two-Sample t-Test
## 
## data:  Summarized x and y
## t = 2.6167, df = 123, p-value = 0.004995
## alternative hypothesis: true difference in means is greater than 0
## 95 percent confidence interval:
##  1.246578       NA
## sample estimates:
## mean of x mean of y 
##      31.2      27.8

Construya e interprete un intervalo bilateral del 95% para la diferencia entre los tiempos medios poblacionales μ_A-μ_B. A partir del intervalo, determine qué valores de la diferencia son compatibles con los datos y explique si los resultados permiten afirmar que la diferencia observada es relevante para la gestión, distinguiendo entre significancia estadística y relevancia práctica. (0,5 pts.)

95 percent confidence interval: 0.828062 5.971938

  1. (1,5 puntos) Dos municipios implementaron estrategias diferentes para promover el uso de una plataforma digital. En el municipio X, 138 de 220 personas encuestadas utilizaron la plataforma. En el municipio Y, lo hicieron 110 de 210 personas.

Los municipios desean determinar si los resultados observados permiten sostener que el nivel de utilización de la plataforma difiere entre ambas poblaciones. Se pide:

  1. A partir de los datos disponibles, estime la proporción de utilización en cada municipio e identifique el parámetro de interés. Determine si existe evidencia estadística suficiente para sostener que las proporciones poblacionales de utilización difieren entre X e Y. Formule las hipótesis, seleccione el procedimiento inferencial apropiado, realice el contraste e interprete el resultado. (0,5 pts.)
138/220 
## [1] 0.6272727
11/210
## [1] 0.05238095
prop.test(x = c(138,110), n = c(220,210), alternative = "two.sided", conf.level = 0.95)
## 
##  2-sample test for equality of proportions with continuity correction
## 
## data:  c(138, 110) out of c(220, 210)
## X-squared = 4.2972, df = 1, p-value = 0.03818
## alternative hypothesis: two.sided
## 95 percent confidence interval:
##  0.005829702 0.201096705
## sample estimates:
##    prop 1    prop 2 
## 0.6272727 0.5238095
  1. Considere ahora la afirmación de que la proporción de utilización es mayor en el municipio X que en el municipio Y. Plantee y realice el contraste correspondiente. Compare el valor p obtenido con el del apartado anterior y explique por qué ambos contrastes pueden producir valores p diferentes utilizando los mismos datos. (0,5 pts.)
prop.test(x = c(138,110), n = c(220,210), alternative = "greater", conf.level = 0.95)
## 
##  2-sample test for equality of proportions with continuity correction
## 
## data:  c(138, 110) out of c(220, 210)
## X-squared = 4.2972, df = 1, p-value = 0.01909
## alternative hypothesis: greater
## 95 percent confidence interval:
##  0.0207784 1.0000000
## sample estimates:
##    prop 1    prop 2 
## 0.6272727 0.5238095
Construya e interprete un intervalo bilateral del 95% para la diferencia entre las proporciones poblacionales para p_X-p_Y. Explique qué información proporciona el intervalo sobre la magnitud de la diferencia y por qué, aun cuando exista evidencia estadística de una diferencia, los resultados por sí solos no permiten atribuir causalmente dicha diferencia a las estrategias implementadas. (0,5 pts.)

95 percent confidence interval: 0.005829702 0.201096705