A partir de unas bases de datos descargadas de Our World in Data, se estimará un modelo de regresión, que permita explicar una tasa de reducción en la pobreza. Para ello se tomarán unos datos ecnómicos como el Pib, las exportaciones de comida y el índice de Gini, valorando como respuesta, el indicador de pobreza extrema por país.
Para ello, se filtran bases de datos de las variables: extrema pobreza (porcentaje de población con salarios muy bajos diarios), GDP (índice de Producto Interno Bruto), índice de GINI (desigualdad en la repartición de los recursos), exportaciones de comida vs totales y población (Millones de USD), conectando y depurando las bases, se obtiene una muestra de 79 paises, con datos para el año 2019, ya que la base de datos debe ser transversal y no longitudinal para este modelo a estimar, que es de regresión múltiple.
Es necesario realizar algunos análisis descriptivos previos, para determinar cuales variables deberían ser incorporadas al modelo de regresión múltiple, y cuáles no.
library(GGally)
## Cargando paquete requerido: ggplot2
library(lattice)
library(car)
## Cargando paquete requerido: carData
library(forecast)
library(tseries)
## Registered S3 method overwritten by 'quantmod':
## method from
## as.zoo.data.frame zoo
base1=retimeSeriesbase1=recarbase1=read.csv('BASEXTGDP2019.csv',sep=';',dec=',',head=TRUE)
attach(base1)
View(base1)
La base de datos tiene una representación de todas las regiones del mundo, habiendo más de Europa, seguido de Asia y América, Africa y Oceanía.
regiones=table(REGION)
region2=rbind(regiones,round(prop.table(regiones)*100,2))
barplot(region2)
cuantis=cbind(base1$EXTRP,base1$GDP_P_CAP,base1$GINIS,base1$FOODEX)
pairs(cuantis)
Acorde con los diagramas de dispersion, se aprecian algunas asociaciones posibles entre pares de variables, como extrema pobreza con respecto al Gdp, inversamente proporcional.
En los diagramas de caja, puede verse la mediana y varianza de la extrema pobreza vs la región, encontrando el continente Africano con mayor mediana y varianza, teniendo los países con más pobreza de la muestra de datos. Para el GDP, es el continente europeo el de mayor rango intercuartil y Africa el menor, así como Oceanía, esto permite mostrar que la pobreza es mayor en Africa, pero su productividad es la menor de todas.
boxplot(EXTRP~REGION)
boxplot(GDP_P_CAP~REGION)
boxplot(GINIS~REGION)
Al realizar la estimación del indicador de correlacion de pearson entre los pares de variables cuantitativas, se aprecian valores importantes, y negativos en algunos casos, pero no tienen mucha fortaleza correlacional. Posiblemente se puede deber a la escala de las variables de GDP y exportaciones.
Sin embargo, sí puede hablarse de una asociación tentativa entre la pobreza extrema y otras variables económicas por país, en esta muestra de datos del año 2019.
matcor=cor(cuantis)
colnames(matcor)=c('EXTRP','GDP_P_CAP','GINIS','FOODEX')
rownames(matcor)=c('EXTRP','GDP_P_CAP','GINIS','FOODEX')
matcor
## EXTRP GDP_P_CAP GINIS FOODEX
## EXTRP 1.0000000 -0.3950466 0.4212164 0.2824868
## GDP_P_CAP -0.3950466 1.0000000 -0.3619166 -0.3123920
## GINIS 0.4212164 -0.3619166 1.0000000 0.2853237
## FOODEX 0.2824868 -0.3123920 0.2853237 1.0000000
Es de esperar algunas posibles correlaciones negativas, por ejemplo, a mayor pobreza, mayor índice de desigualdad GINI, y a mayor GDP menor pobreza por país. Dadas las descripciones preliminares, es posible estimar un modelo de regresión múltiple.
El modelo contempla como variable respuesta la población en Extrema Pobreza por país, y las covariables o variables regresoras serían: ln(GDP), Índice de Gini, el logaritmo natural de las exportaciones de comida (ln(foodex)).
RGDP=(GDP_P_CAP)**(0.25)
Rfoode=(FOODEX)**(0.25)
modelo=lm(EXTRP~RGDP+GINIS+Rfoode+REGION)
summary(modelo)
##
## Call:
## lm(formula = EXTRP ~ RGDP + GINIS + Rfoode + REGION)
##
## Residuals:
## Min 1Q Median 3Q Max
## -33.115 -2.836 0.146 3.219 28.240
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 18.5215 10.5654 1.753 0.083975 .
## RGDP -1.0943 0.4286 -2.553 0.012857 *
## GINIS 80.2179 19.9404 4.023 0.000143 ***
## Rfoode 1.5427 1.6034 0.962 0.339304
## REGIONAsia -33.6703 4.6157 -7.295 3.61e-10 ***
## REGIONEurope -29.5052 5.0994 -5.786 1.86e-07 ***
## REGIONN_America -38.5342 5.0273 -7.665 7.56e-11 ***
## REGIONOceania -27.2944 6.3640 -4.289 5.65e-05 ***
## REGIONS_America -41.4414 4.7859 -8.659 1.12e-12 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 8.213 on 70 degrees of freedom
## Multiple R-squared: 0.729, Adjusted R-squared: 0.6981
## F-statistic: 23.54 on 8 and 70 DF, p-value: < 2.2e-16
Anova(modelo,type='III')
## Anova Table (Type III tests)
##
## Response: EXTRP
## Sum Sq Df F value Pr(>F)
## (Intercept) 207.3 1 3.0731 0.0839754 .
## RGDP 439.7 1 6.5185 0.0128575 *
## GINIS 1091.7 1 16.1837 0.0001434 ***
## Rfoode 62.4 1 0.9257 0.3393037
## REGION 6261.0 5 18.5630 1.076e-11 ***
## Residuals 4722.0 70
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
En este modelo es posible analizar la significancia de cada una da las covariables empleadas, observando le última columna en la tabla ANOVA (Valor p: Pr(>f)). Se encuentra significancia al comparar con el nivel alpha=0.05, para las covariables raíz de GDP, el índice de Gini, la región, porque sus valores p son inferiores a alpha, pero no se encuentra significancia para la raiz de las exportaciones de comida vs total, por ello se re-estimará otro modelo sin dicha covariable, analizando de nuevo la significancia de las demás covariables.
RGDP=(GDP_P_CAP)**(0.25)
Rfoode=(FOODEX)**(0.25)
modelo2=lm(EXTRP~RGDP+GINIS+REGION)
summary(modelo2)
##
## Call:
## lm(formula = EXTRP ~ RGDP + GINIS + REGION)
##
## Residuals:
## Min 1Q Median 3Q Max
## -34.128 -2.606 -0.117 3.087 29.339
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 22.434 9.746 2.302 0.024288 *
## RGDP -1.023 0.422 -2.425 0.017848 *
## GINIS 78.418 19.842 3.952 0.000181 ***
## REGIONAsia -35.095 4.370 -8.032 1.46e-11 ***
## REGIONEurope -31.171 4.794 -6.502 9.49e-09 ***
## REGIONN_America -39.016 5.000 -7.804 3.87e-11 ***
## REGIONOceania -30.168 5.617 -5.371 9.43e-07 ***
## REGIONS_America -41.592 4.781 -8.700 8.44e-13 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 8.209 on 71 degrees of freedom
## Multiple R-squared: 0.7254, Adjusted R-squared: 0.6984
## F-statistic: 26.8 on 7 and 71 DF, p-value: < 2.2e-16
Anova(modelo2,type='III')
## Anova Table (Type III tests)
##
## Response: EXTRP
## Sum Sq Df F value Pr(>F)
## (Intercept) 357.0 1 5.2979 0.0242879 *
## RGDP 396.3 1 5.8813 0.0178478 *
## GINIS 1052.5 1 15.6192 0.0001808 ***
## REGION 6528.4 5 19.3759 4.086e-12 ***
## Residuals 4784.4 71
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
En el segundo modelo sí se encuentra una significancia de la raíz de GDP, el índice de Gini y la Región, mostrando que sus valores p son todos menores de 0.05, es decir, estas serían variables significativas con un nivel de confianza de ‘95%’.
Observando que el intercepto es el que representa al valor de Extrema pobreza del continente Africano, es el de mayor valor, aspecto que rezalta la diferencia de la pobreza con respecto a los demás.
Lo anterior confirma que hay una relación inversa entre la extrema pobreza, y la productividad regional. No sólo por el índice de correlación, y el efecto, sino al observar los casos como Africa, que tiene la mayor pobreza, la mayor desigualdad y la menor productividad regional (GDP), así como Europa, con una menor desigualdad, menor pobreza y mayor GDP o productividad. El modelo de regresión tambièn encuentra una relación directamente proporcional entre el índice de Gini y la pobreza extrema, lo que en los gráficos parecía también mostrarse, a más desigualdad (GINI), más pobreza.
Dado el valor del coeficiente de determinación, puede afirmarse que el modelo logra explicar un 73% de la variabilidad de los datos, dato que respalda una adecuada explicación de su varianza total. Sin embago, aún es necesario validar los supuestos del modelo, por medio de las pruebas de hipótesis de normalidad y varianza constante, aplicadas sobre sus residuales.
resid=residuals(modelo2)
hist(resid)
boxplot(resid)
shapiro.test(resid)
##
## Shapiro-Wilk normality test
##
## data: resid
## W = 0.79092, p-value = 3.123e-09
jarque.bera.test(resid)
##
## Jarque Bera Test
##
## data: resid
## X-squared = 226.77, df = 2, p-value < 2.2e-16
bartlett.test(resid~REGION)
##
## Bartlett test of homogeneity of variances
##
## data: resid by REGION
## Bartlett's K-squared = 89.648, df = 5, p-value < 2.2e-16
Al estimar las pruebas, se comparan sus respectivos valores P, con el nivel de significancia del caso, 0.05, encontrando que están por debajo de este, por lo tanto, se rechazan las hipótesis, es decir, no hay distribución normal ni varianza constante. Lo anterior y la asimetría de sus residuos, hace pensar en la gran infuencia de valores atípicos en la respuesta. Por ello, se filtrará una base sin dichos valores extremos, que son Mozambique, Malawi y Uganda. Sin embargo, se debe aplicar una transformación en la variable respuesta, la raiz cuarta.
En este caso el residual cumple el comportamiento de normalidad, y disminuye su varianza. El modelo final puede escribirse con base en los coeficientes estimados de la tabla (extraida con summary) que se muestra al final.
posisf=which(EXTRP<59,arr.ind=T)
base2=base1[posisf,]
attach(base2)
## The following objects are masked from base1:
##
## Code, COUNTRY, EXTRP, FOODEX, GDP_P_CAP, GINIS, Population, REGION
RGDP=(GDP_P_CAP)**(0.25)
Rfoode=(FOODEX)**(0.25)
REXTRP=(EXTRP)^(0.25)
modelo2=lm(REXTRP~RGDP+GINIS+REGION)
summary(modelo2)
##
## Call:
## lm(formula = REXTRP ~ RGDP + GINIS + REGION)
##
## Residuals:
## Min 1Q Median 3Q Max
## -1.13837 -0.17168 0.01383 0.20084 0.76164
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 0.476847 0.442066 1.079 0.28454
## RGDP -0.046652 0.018447 -2.529 0.01377 *
## GINIS 4.831731 0.887016 5.447 7.63e-07 ***
## REGIONAsia -0.636241 0.228700 -2.782 0.00699 **
## REGIONEurope -0.570733 0.237378 -2.404 0.01893 *
## REGIONN_America -0.724818 0.255901 -2.832 0.00607 **
## REGIONOceania -0.008568 0.276860 -0.031 0.97540
## REGIONS_America -0.775434 0.251829 -3.079 0.00299 **
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 0.3539 on 68 degrees of freedom
## Multiple R-squared: 0.596, Adjusted R-squared: 0.5544
## F-statistic: 14.33 on 7 and 68 DF, p-value: 2.741e-11
Anova(modelo2,type='III')
## Anova Table (Type III tests)
##
## Response: REXTRP
## Sum Sq Df F value Pr(>F)
## (Intercept) 0.1458 1 1.1635 0.284543
## RGDP 0.8011 1 6.3955 0.013766 *
## GINIS 3.7168 1 29.6717 7.634e-07 ***
## REGION 2.2474 5 3.5883 0.006129 **
## Residuals 8.5181 68
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
resid2=residuals(modelo2)
hist(resid2)
boxplot(resid2)
boxplot(resid2~REGION)
shapiro.test(resid2)
##
## Shapiro-Wilk normality test
##
## data: resid2
## W = 0.97956, p-value = 0.2584
jarque.bera.test(resid2)
##
## Jarque Bera Test
##
## data: resid2
## X-squared = 6.2373, df = 2, p-value = 0.04422
bartlett.test(resid2~REGION)
##
## Bartlett test of homogeneity of variances
##
## data: resid2 by REGION
## Bartlett's K-squared = 17.789, df = 5, p-value = 0.003223
REXT_POVERTY= 0.476847 -0.046652 * RGDP + 4.831731 * GINIS -0.636241* REGIONAsia -0.570733* REGIONEurope -0.724818* REGIONN_America - 0.008568* REGIONOceania -0.775434*REGIONS_America
La estimación de la extrema pobreza se encuentra sustituyendo los valores de las covariables respectivas en la ecuación anterior, y su resutado se eleva a 4.
Para las bases de datos consignadas en Our World in Data, la pobreza extrema se mide como los ingresos más bajos posibles (‘$3.65, $6.85, y $30 por día’ según el país), indicando en algunas investigaciones, que su asociación con el GDP parece confirmarse a lo largo del tiempo, como la medida del acceso de las personas a los bienes y servicios, por ello son inversas.
El crecimiento económico se podría definir como la medida de acceso a los bienes y servicios en cantidad y calidad que se producen en la región, si se incrementan, se dirá que sí hubo crecimiento. En el caso analizado, es Africa el continente que no revela buen crecimiento económico, exponiendo mayor pobreza de dicha región (Roser, 2021).
Por lo anterior, definir un crecimiento por sí solo como una medida de GDP o de Gini, no revela demasiado acerca del desarrollo regional, por esto es bueno analizar el conjunto de indicadores, en este caso, confirmando la relación inversa entre pobreza extrema y GDP y la relación creciente entre pobreza y GINI, lo que infiere que a más desigualdad, más pobreza.
Roser, M. (2021). “What is economic growth? And why is it so important?” Published online at OurWorldinData.org. Retrieved from: ‘https://archive.ourworldindata.org/20260910-011030/what-is-economic-growth.html’ [Online Resource] (archived on September 10, 2026).
Our World in Data. (2026). Research and data to make progress against the world’s largest problems. En: https://ourworldindata.org/