La Pregunta de Investigación asignada es 5) En la función pública ¿Tener un montón de título no sirve para nada?, basado en los datos abiertos (microdatos) disponible en la página oficial del Insituto Nacional de Estadística (INE)
##Introducción
##Fuente: Encuesta Permanente de Hogares (EPH) 2019
url.eph.2019="https://www.ine.gov.py/datos/encuestas/eph/Poblacion/EPH-2019/data/4edb7reg02_ephc2019.csv"
data.eph.2019= read.csv(url.eph.2019,";",header=T,dec=",")
Ahora seleccionaremos las variables con las que trabajaremos de la base de datos del año 2019 que contiene 260 variables, lo visualizamos de la siguiente forma:
#Visualizamos los nombres de las variables en data.eph.2019
names(data.eph.2019)
## [1] "UPM" "NVIVI" "NHOGA" "DPTOREP" "AREA" "L02"
## [7] "P02" "P03" "P04" "P04A" "P04B" "P05C"
## [13] "P05P" "P05M" "P06" "P08D" "P08M" "P08A"
## [19] "P09" "P10A" "P10AB" "P10Z" "P11A" "P11AB"
## [25] "P11Z" "P12" "A01" "A01A" "A02" "A03"
## [31] "A04" "A04A" "A05" "A07" "A08" "A10"
## [37] "A11A" "A11M" "A11S" "A12" "A13REC" "A14REC"
## [43] "A15" "A16" "A17A" "A17M" "A17S" "A18"
## [49] "B01REC" "B02REC" "B03LU" "B03MA" "B03MI" "B03JU"
## [55] "B03VI" "B03SA" "B03DO" "B04" "B05" "B06"
## [61] "B07A" "B07M" "B07S" "B08" "B09A" "B09M"
## [67] "B09S" "B10" "B11" "B12" "B12A" "B12B"
## [73] "B12C" "B13" "B14" "B15" "B16G" "B16U"
## [79] "B16D" "B16T" "B17" "B18AG" "B18AU" "B18BG"
## [85] "B18BU" "B19" "B20G" "B20U" "B20D" "B20T"
## [91] "B21" "B22" "B23" "B24" "B25" "B26"
## [97] "B271" "B272" "B28" "B29" "B30" "B31"
## [103] "C01REC" "C02REC" "C03" "C04" "C05" "C06"
## [109] "C07" "C08" "C09" "C101" "C102" "C11G"
## [115] "C11U" "C11D" "C11T" "C12" "C13AG" "C13AU"
## [121] "C13BG" "C13BU" "C14" "C14A" "C14B" "C14C"
## [127] "C15" "C16REC" "C17REC" "C18" "C18A" "C18B"
## [133] "C19" "D01" "D02" "D03" "D04" "D05"
## [139] "E01A" "E01B" "E01C" "E01D" "E01E" "E01F"
## [145] "E01G" "E01H" "E01I" "E01J" "E01K" "E01L"
## [151] "E01M" "ED01" "ED02" "ED03" "ED0504" "ED06C"
## [157] "ED08" "ED09" "ED10" "ED11B1" "ED11B2" "ED11B3"
## [163] "ED11B4" "ED11B5" "ED11B6" "ED11B7" "ED11B8" "ED11B9"
## [169] "ED11C1" "ED11D1" "ED11E1" "ED11F1" "ED11F1A" "ED11F1B"
## [175] "ED11G1" "ED11G1A" "ED11G1B" "ED11H1" "ED11H1A" "ED11H1B"
## [181] "ED12" "ED13" "ED14" "ED14A" "ED15" "S01A"
## [187] "S01B" "S02" "S03" "S04" "S05" "S06"
## [193] "S07" "S08" "S09" "CATE_PEA" "TAMA_PEA" "OCUP_PEA"
## [199] "RAMA_PEA" "HORAB" "HORABC" "HORABCO" "PEAD" "PEAA"
## [205] "TIPOHOGA" "FEX" "NJEF" "NCON" "NPAD" "NMAD"
## [211] "TIC01" "TIC02" "TIC03" "TIC0401" "TIC0402" "TIC0403"
## [217] "TIC0404" "TIC0405" "TIC0406" "TIC0407" "TIC0408" "TIC0409"
## [223] "TIC0501" "TIC0502" "TIC0503" "TIC0504" "TIC0505" "TIC0506"
## [229] "TIC0507" "TIC0508" "TIC0509" "TIC0510" "TIC0511" "TIC0512"
## [235] "TIC0513" "TIC06" "añoest" "ra06ya09" "e01aimde" "e01bimde"
## [241] "e01cimde" "e01dde" "e01ede" "e01fde" "e01gde" "e01hde"
## [247] "e01ide" "e01jde" "e01kde" "e01lde" "e01mde" "e01kjde"
## [253] "e02bde" "ipcm" "pobrezai" "pobnopoi" "quintili" "decili"
## [259] "quintiai" "decilai"
Seleccionamos las variables añoest (Años de Estudio), CATE_PEA (Categoría ocupacional en la ocupación principal (ocupados) / Categoría en la última ocupación (desocupados) recodificada) que permite verificar que su actividad sea de la función pública, así mismo consideramos e01aimde (Ingreso mensual que habitualmente recibe de la actividad principal) conforme se accede al Diccionario de variables de la base de datos de EPH
data.eph.2019.fil<-subset(data.eph.2019,(añoest>=1&añoest<=18)& CATE_PEA==1&e01aimde>0,select=c(añoest,CATE_PEA,e01aimde))
#seleccionamos las variables de la base EPH 2019
summary(data.eph.2019.fil)
## añoest CATE_PEA e01aimde
## Min. : 2.00 Min. :1 Min. : 270000
## 1st Qu.:14.00 1st Qu.:1 1st Qu.: 2400000
## Median :15.00 Median :1 Median : 3513346
## Mean :14.69 Mean :1 Mean : 3988074
## 3rd Qu.:16.00 3rd Qu.:1 3rd Qu.: 4691090
## Max. :18.00 Max. :1 Max. :30000000
# explorar y codificar las variables de interes
#Etiquetado de la variable CATE_PEA
data.eph.2019.fil$CATE_PEA<-factor(data.eph.2019.fil$CATE_PEA,labels = "Empleado / obrero público")
summary(data.eph.2019.fil)
## añoest CATE_PEA e01aimde
## Min. : 2.00 Empleado / obrero público:885 Min. : 270000
## 1st Qu.:14.00 1st Qu.: 2400000
## Median :15.00 Median : 3513346
## Mean :14.69 Mean : 3988074
## 3rd Qu.:16.00 3rd Qu.: 4691090
## Max. :18.00 Max. :30000000
Estadisticas Descriptivas sobre las variables seleccionadas
names(data.eph.2019.fil)
## [1] "añoest" "CATE_PEA" "e01aimde"
Para intentar responder a la pregunta de investigación planteamos la posible relación lineal entre las variables años de estudio y salario en la ocupación principal:
regresion<-lm(e01aimde~añoest,data=data.eph.2019.fil)
summary(regresion)
##
## Call:
## lm(formula = e01aimde ~ añoest, data = data.eph.2019.fil)
##
## Residuals:
## Min 1Q Median 3Q Max
## -3901804 -1393010 -387785 711628 25450036
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 418182 423299 0.988 0.323
## añoest 243046 28213 8.615 <2e-16 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 2568000 on 883 degrees of freedom
## Multiple R-squared: 0.07753, Adjusted R-squared: 0.07648
## F-statistic: 74.21 on 1 and 883 DF, p-value: < 2.2e-16
Aquí se establece la ecuación de regresión estimada dada Y=Salario en función a X=Años Estudios, siendo la ecuación de regresión estimada dada por: Yi=418182 +243046 Xi El analisis de Regresión se puede verificarse si esta relación es de naturaleza lineal o no
anova(regresion)
## Analysis of Variance Table
##
## Response: e01aimde
## Df Sum Sq Mean Sq F value Pr(>F)
## añoest 1 4.8958e+14 4.8958e+14 74.211 < 2.2e-16 ***
## Residuals 883 5.8252e+15 6.5971e+12
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Al esablecer como Hipotesis Nula H0: B1=0 No existe relación lineal entre el salario que percibe en su ocupación principal y los años de estudios H1: B1 ≠0 existe relación lineal entre el salario que percibe en su ocupación principal y los años de estudios
Criterios de decisión
Para un \(\alpha=0,05\), si \(p_{valor} > 0,05\) no se rechaza la \(H_0\).
Para un \(\alpha=0,05\), si \(p_{valor} \le 0,05\) se rechaza la \(H_0\).
##Conclusión como p-valor:2.2e-16< 0,05 entonces se rechaza la H0, es decir, existe relación lineal entre el salario que percibe en su ocupación principal y los años de estudios, es decir los años de estudios es una variable significativa del salario que percibe el funcionario público.
#Tema2 Desarrolle de la forma que le sea posible un breve ensayo respecto de como sería posible estimar la cantidad de canicas de color rojo proveniente de una urna que contiene un total de 2600 canicas, pero resulta desconocido la cantidad de canicas de color rojo existentes. Considere la posibilidad de presentar ecuaciones, tablas, gráficas y/o pruebas estadísticas Puedo describir la forma intuitiva en que el profesor nos ha demostrado abordar este tema, iniciando con la disposición en forma aleatoria de todas las canicas, siendo seleccionados por cada estudiante recogió 30 canicas y cada uno fue estableciendo las proporciones de canicas rojas entre las plateadas, garantizando la aleatoriedad y estableciendo una proporción desconciendo incluso la cantidad total del atributo observado, Una vez establecido la información de proporciones de canicas rojas se procedidó a esquematizar la población (parametro desconcido) y establecer la estadistica como variable aleatoria a ser investigada, en este caso proceder a verificar en las 2600 canicas si realmente esa proporción es la que la representa.
#Tema3 a) El tema abordado en Inferencia Bayesiana fue la de Distribución a priori y distribución aposterior desde el analisis bayesiano, en este contexto resalté lo descripto por el Profesor: “Uno acepta tentativamente un modelo estadístico formal, típicamente sugerido por una evaluación descriptiva informal. Las conclusiones están obviamente condicionadas a la suposición de que el modelo es correcto”, Un caso particular importante surge cuando no se cuenta con información inicial objetiva relevante. El análisis bayesiano requiere entonces distribuciones previas basadas exclusivamente en supuestos del modelo. Este es el tema de la Estadística Bayesiana Objetiva.”, y me explaye con el ejemplo del Teorema de Bayes b)Desarrollo del tema de Inferencia Clásica, en este caso trabajé con la EPH de hogares del año 2019 y año 2020 , especificamente respecto a la variable de PEAA (Población Economicamente Activa y Agrupada: Ocupados y Desocupados) verificando la signficancia de la diferencia de proporciones para población de hombres y mujeres, encontrandose en ambos años diferencias (establecidas en Hipotesis bilateral) debido a que las proporciones obtenidas mediante estadística básica no delataba una dirección propiamente sino más bien una diferencia leve, que mediante pruebas estadísticas se logró evidenciar que eran significativas (rechazo de la Hipotesis nula planteada)