Una municipalidad evalúa su modalidad digital de atención. El archivo facsimil_A_atencion_municipal.xlsx contiene 160 solicitudes y las variables: • id: identificador de la solicitud. • modalidad: modalidad de atención (Digital o Presencial). • tiempo_resolucion: tiempo de resolución en días. • satisfecho: satisfacción de la persona usuaria (Sí o No). Se pide: a. Examine la estructura de la base e identifique los valores perdidos. Luego, determine las observaciones válidas para analizar el tiempo de resolución de las solicitudes digitales. Informe el tamaño muestral utilizado, junto con la media y desviación estándar del tiempo de resolución. (0,5 pts.)
library(readxl)
facsimil_A_atencion_municipal <- read_excel("~/Downloads/facsimil_A_atencion_municipal.xlsx")
library(naniar)
library(summarytools)
library(BSDA)
## Loading required package: lattice
##
## Attaching package: 'BSDA'
## The following object is masked from 'package:datasets':
##
## Orange
library(tidyverse)
## ── Attaching core tidyverse packages ──────────────────────── tidyverse 2.0.0 ──
## ✔ dplyr 1.2.1 ✔ readr 2.2.0
## ✔ forcats 1.0.1 ✔ stringr 1.6.0
## ✔ ggplot2 4.0.2 ✔ tibble 3.3.1
## ✔ lubridate 1.9.5 ✔ tidyr 1.3.2
## ✔ purrr 1.2.1
## ── Conflicts ────────────────────────────────────────── tidyverse_conflicts() ──
## ✖ dplyr::filter() masks stats::filter()
## ✖ dplyr::lag() masks stats::lag()
## ✖ tibble::view() masks summarytools::view()
## ℹ Use the conflicted package (<http://conflicted.r-lib.org/>) to force all conflicts to become errors
miss_var_summary(facsimil_A_atencion_municipal)
## # A tibble: 4 × 3
## variable n_miss pct_miss
## <chr> <int> <num>
## 1 tiempo_resolucion 4 2.5
## 2 id 0 0
## 3 modalidad 0 0
## 4 satisfecho 0 0
La variable “tiempo_resolucion” cuenta con un 2.5% de datos NA, 4 datos de 160.
base_unavariablefiltrada<- filter(facsimil_A_atencion_municipal, !is.na(tiempo_resolucion))
base_filtrada <- drop_na(facsimil_A_atencion_municipal)
descr(base_filtrada$tiempo_resolucion)
## Descriptive Statistics
## base_filtrada$tiempo_resolucion
## N: 156
##
## tiempo_resolucion
## ----------------- -------------------
## Mean 26.19
## Std.Dev 6.88
## Min 9.20
## Q1 21.45
## Median 26.10
## Q3 30.70
## Max 46.10
## MAD 6.89
## IQR 9.18
## CV 0.26
## Skewness 0.13
## SE.Skewness 0.19
## Kurtosis -0.11
## N.Valid 156.00
## N 156.00
## Pct.Valid 100.00
La variable tiempo_resolucion consta de el tiempo de resolución en dias, su promedio es de 26.
t.test(base_filtrada$tiempo_resolucion, mu = 25, alternative = "less", var.equal = TRUE, conf.level = 0.95)
##
## One Sample t-test
##
## data: base_filtrada$tiempo_resolucion
## t = 2.1681, df = 155, p-value = 0.9842
## alternative hypothesis: true mean is less than 25
## 95 percent confidence interval:
## -Inf 27.10681
## sample estimates:
## mean of x
## 26.19487
satisfechos<- filter(base_filtrada, satisfecho == "Sí")
prop.test(110, 156, 0.7, alternative = "greater", conf.level = 0.95)
##
## 1-sample proportions test with continuity correction
##
## data: 110 out of 156, null probability 0.7
## X-squared = 0.0027473, df = 1, p-value = 0.4791
## alternative hypothesis: true p is greater than 0.7
## 95 percent confidence interval:
## 0.6386589 1.0000000
## sample estimates:
## p
## 0.7051282
Se comparan los tiempos de tramitación de dos oficinas. Las desviaciones estándar poblacionales son desconocidas, pero, de acuerdo con los supuestos del problema, las varianzas poblacionales pueden considerarse iguales Oficina Tamaño muestral Media Desviación estándar A 65 31,2 días 7,4 días B 60 27,8 días 7,1 días Se pide: a. La institución desea determinar si existe evidencia estadística de que los tiempos medios de tramitación difieren entre ambas oficinas. Identifique el parámetro de interés, formule las hipótesis, seleccione el procedimiento inferencial apropiado, realice el contraste e interprete el resultado. (0,5 pts.)
tsum.test(mean.x = 31.2, s.x = 7.4, n.x = 65,
mean.y = 27.8, s.y = 7.1, n.y = 60, alternative = "two.sided", mu = 0, var.equal = TRUE, conf.level = 0.95)
##
## Standard Two-Sample t-Test
##
## data: Summarized x and y
## t = 2.6167, df = 123, p-value = 0.00999
## alternative hypothesis: true difference in means is not equal to 0
## 95 percent confidence interval:
## 0.828062 5.971938
## sample estimates:
## mean of x mean of y
## 31.2 27.8
tsum.test(mean.x = 31.2, s.x = 7.4, n.x = 65,
mean.y = 27.8, s.y = 7.1, n.y = 60, alternative = "greater", mu = 0, var.equal = TRUE, conf.level =
0.95)
##
## Standard Two-Sample t-Test
##
## data: Summarized x and y
## t = 2.6167, df = 123, p-value = 0.004995
## alternative hypothesis: true difference in means is greater than 0
## 95 percent confidence interval:
## 1.246578 NA
## sample estimates:
## mean of x mean of y
## 31.2 27.8
Construya e interprete un intervalo bilateral del 95% para la diferencia entre los tiempos medios poblacionales μ_A-μ_B. A partir del intervalo, determine qué valores de la diferencia son compatibles con los datos y explique si los resultados permiten afirmar que la diferencia observada es relevante para la gestión, distinguiendo entre significancia estadística y relevancia práctica. (0,5 pts.)
95 percent confidence interval: 0.828062 5.971938
Los municipios desean determinar si los resultados observados permiten sostener que el nivel de utilización de la plataforma difiere entre ambas poblaciones. Se pide:
138/220
## [1] 0.6272727
11/210
## [1] 0.05238095
prop.test(x = c(138,110), n = c(220,210), alternative = "two.sided", conf.level = 0.95)
##
## 2-sample test for equality of proportions with continuity correction
##
## data: c(138, 110) out of c(220, 210)
## X-squared = 4.2972, df = 1, p-value = 0.03818
## alternative hypothesis: two.sided
## 95 percent confidence interval:
## 0.005829702 0.201096705
## sample estimates:
## prop 1 prop 2
## 0.6272727 0.5238095
prop.test(x = c(138,110), n = c(220,210), alternative = "greater", conf.level = 0.95)
##
## 2-sample test for equality of proportions with continuity correction
##
## data: c(138, 110) out of c(220, 210)
## X-squared = 4.2972, df = 1, p-value = 0.01909
## alternative hypothesis: greater
## 95 percent confidence interval:
## 0.0207784 1.0000000
## sample estimates:
## prop 1 prop 2
## 0.6272727 0.5238095
Construya e interprete un intervalo bilateral del 95% para la diferencia entre las proporciones poblacionales para p_X-p_Y. Explique qué información proporciona el intervalo sobre la magnitud de la diferencia y por qué, aun cuando exista evidencia estadística de una diferencia, los resultados por sí solos no permiten atribuir causalmente dicha diferencia a las estrategias implementadas. (0,5 pts.)
95 percent confidence interval: 0.005829702 0.201096705