Las librerias son paquetes o bibliotecas de codigo los cuales ya contienen ciertas funciones, datos y documentación que amplia las capacidades de R.
A continuación la lista de librerias usadas en el trabajo y el codigo necesario para poder instalarlas.
Se realizará un análisis descriptivo de la base de datos credito, de la cual se tomara una muestra de 100 datos con respecto al credito, donde se encuentran datos tanto cualitativos como cuantitativos.
A continuación haremos la importación de la base de datos de excel a Rstudio
Ahora visualizaremos la base de datos
Con esta base de datos estaremos haciendo los respectivos analisis durante el trabajo contando asi con distintos tipos de datos
Las variables cualitativas que podemos encontrar en esta dase de datos son: estado, vivienda, estado civil y trabajo, empezaremos con dichas variables, ya que, estas nos expresan ciertas caracteristicas sobre los elementos a analizar.
Representa el estado actual del crédito.
Esta tabla representa la frecuencia absoluta con la cual podremos realizar las respectivas graficas.
barra_Estado <- ggplot(muestra, aes(x = estado, fill = estado)) +
geom_bar(lwd = 1, color = "black") + # Cambiar el color del borde de las barras a negro
scale_fill_manual(values = c("white", "#2e44a7", "#FFA500", "#00FF00")) +
theme(legend.position = "bottom") + theme(panel.background = element_rect(fill = "#CCE0F0"), plot.background = element_rect(fill = "white"), axis.text = element_text(color = "black"), legend.text = element_text(color = "black"), legend.title = element_text(color = "black"))
print(barra_Estado)
En en el anterior diagrama de barras podemos observar los cambios en el
estado del crédito de nuestra muestra, donde “bueno” representa una
mayor cantidad, este se repite 67 veces y “malo” siendo menor, se repite
33 veces.
Indica el tipo de vivienda que habita la persona siendo que esta pueda ser alquilada, propia, privada, entre otras.
Esta tabla representa la frecuencia absoluta con la cual podremos realizar las respectivas graficas.
barra_Vivienda <- ggplot(muestra, aes(x = vivienda, fill = vivienda)) +
geom_bar(lwd = 1, color = "black") + # Cambiar el color del borde de las barras a negro
scale_fill_manual(values = c("#2e44a7", "#769ed3", "#9acae9", "#bef7ff", "white")) +
theme(legend.position = "bottom") + theme(panel.background = element_rect(fill = "#CCE0F0"), plot.background = element_rect(fill = "white"), axis.text = element_text(color = "black"), legend.text = element_text(color = "black"), legend.title = element_text(color = "black"))
print(barra_Vivienda)Este diagrama de barra nos muestra las cantidades de cada uno de los tipos de vivienda, encontramos una frecuencia mayor en las personas que son propietarias, esta se repite 49 veces, con frecuencias menores encontramos a las personas que viven con los padres o alquilan la propiedad,18 y 19 respectivamente, finalmente se encuentran las frecuencias de las personas que cuentan con propiedad privada u otras, con valores de 6 y 8 para cada una.
Da la información respecto al estado civil de la persona, siendo que pueda encontrarse casado, viudo, divorciado, soltero, etc.
Esta tabla representa la frecuencia absoluta con la cual podremos realizar las respectivas graficas.
barra_EstadoCivil1 <- ggplot(muestra, aes(x = e_c, fill = e_c)) +
geom_bar(lwd = 1, color = "black") + # Cambiar el color del borde de las barras a negro
scale_fill_manual(values = c("#2e44a7", "#769ed3", "#9acae9", "#bef7ff", "white")) +
theme(legend.position = "bottom") + theme(panel.background = element_rect(fill = "#CCE0F0"), plot.background = element_rect(fill = "white"), axis.text = element_text(color = "black"), legend.text = element_text(color = "black"), legend.title = element_text(color = "black"))
print(barra_EstadoCivil1)En este diagrama de barras podemos observar distintas variables acerca del estado civil de las personas, encontramos a quienes están casados con una frecuencia de 70, muy por encima de las demás. Las siguientes son las personas que están solteras, con una frecuencia de 21, finalmente observamos frecuencias muy similares para las personas divorciadas, separadas y viudas, con valores de 2, 4 y 3. Todos los datos anteriores nos ofrecen información acerca de las variaciones que pueden ser de vital importancia al momento de considerar a las personas participantes en nuestra muestra.
Especifica el tipo de trabajo que realiza la persona.
Esta tabla representa la frecuencia absoluta con la cual podremos realizar las respectivas graficas.
barra_Trabajo <- ggplot(muestra, aes(x = trabajo, fill = trabajo)) +
geom_bar(lwd = 1, color = "black") + # Cambiar el color del borde de las barras a negro
scale_fill_manual(values = c("#2e44a7", "#5271bd", "#9acae9", "white")) +
theme(legend.position = "bottom") + theme(panel.background = element_rect(fill = "#CCE0F0"), plot.background = element_rect(fill = "white"), axis.text = element_text(color = "black"), legend.text = element_text(color = "black"), legend.title = element_text(color = "black"))
print(barra_Trabajo)Acerca del trabajo de las personas y el diagrama de barras, tenemos la siguiente información: una frecuencia de 65 para las personas con trabajo fijo, 26 para freelance, 8 en personas que trabajan a tiempo parcial y 1 en otros tipos de trabajo de los que no tenemos conocimiento. Esta información es bastante relevante si consideramos que nuestros datos pertenecen a creditos de consumo sobre estas personas.
Las variables cuantitativas, son aquellas que representan cantidades numéricas y se pueden medir de manera cuantitativa, dichas variables se expresan en números.
Este tipo de variables se dividen en dos tipos de categorias:
Variables Cuantitativas Discretas: Estas variables representan valores numéricos especificos que son contables.
Variables Cuantitativas Continuas: Estas varables representan valores numéricos que pueden tomar cualquier valor dentro de un rango especifico y puede inclir valores decimales.
Dentro de este trabajo se pueden encontrar variables cuantitativas como lo son: la antiguedad, el plazo, los gastos, el ingreso, activos, deuda y precio, a medida que desarrollemos el trabajo designaremos si cada una de estas es Continua o Discreta
Para esta parte del trabajo es importante tener encuenta los conceptos de moda, media y mediana, ya que, los usaremos cuando estemos, analizando las medidas de tendencia central.
Moda : Este nos representa el valor o los valores que aparecen con mayor frecuencia en una muestra de datos.
Para calcular esta en R se usa la función mode
Media : Esta se utiliza para representar un valor central dentro de un conjunto de datos numéricos, para calcular esta se suman todos los valores en el conjunto de datos y luego divides esa suma por la cantidad de valores.
Para calcular esta en R se usa la función mean
Mediana : Esta se utiliza para representar un valor central dentro de un conjunto de datos, en otras palabras este es el valor que ocupa la posición central cuando los datos estan ordenados en orden ascendente o descendente.
Para calcular esta en R se usa la función median
En este caso haremos uso de la función ds_tidy_stats la cual nos hara un resumen de estos datos y algunos otros los cuales nos ayudaran con el analisis
Al igual tambien podemos hacer uso de la función summary la cual nos permitira obtener algunos de estos datos
## estado antigüedad vivienda plazo
## Length:100 Min. : 0.00 Length:100 Min. : 6.00
## Class :character 1st Qu.: 1.75 Class :character 1st Qu.:36.00
## Mode :character Median : 4.00 Mode :character Median :48.00
## Mean : 7.33 Mean :45.48
## 3rd Qu.:11.00 3rd Qu.:60.00
## Max. :40.00 Max. :60.00
## edad e_c registros trabajo
## Min. :19.00 Length:100 Length:100 Length:100
## 1st Qu.:29.00 Class :character Class :character Class :character
## Median :35.00 Mode :character Mode :character Mode :character
## Mean :36.34
## 3rd Qu.:42.25
## Max. :66.00
## gastos ingresos activos deuda
## Min. : 35.00 Min. : 45.00 Min. : 0 Min. : 0.0
## 1st Qu.: 35.00 1st Qu.: 93.75 1st Qu.: 0 1st Qu.: 0.0
## Median : 53.50 Median :121.00 Median : 3500 Median : 0.0
## Mean : 56.33 Mean :152.04 Mean : 5596 Mean : 581.7
## 3rd Qu.: 72.75 3rd Qu.:195.75 3rd Qu.: 8000 3rd Qu.: 0.0
## Max. :135.00 Max. :535.00 Max. :60000 Max. :10500.0
## cantidad precio
## Min. : 250 Min. : 500
## 1st Qu.: 700 1st Qu.:1100
## Median :1000 Median :1372
## Mean :1037 Mean :1462
## 3rd Qu.:1262 3rd Qu.:1677
## Max. :2700 Max. :4138
ggplot(muestra, aes(x = antigüedad)) +
geom_histogram(bins = 20, fill = "#685ad3", alpha = 0.5, colour = "black") +
theme(panel.background = element_rect(fill="#e4dcff"))par(bg = "#e4dcff")
boxplot(muestra$antigüedad, horizontal = TRUE,
boxwex = 1,
boxlty = 1,
boxlwd = 1,
boxcol = 1,
boxfill = "#685ad3",
whisklty = 2,
whisklwd = 2,
whiskcol = "#BC3030",
border = "black",
main = "Box plot de Antiguedad")Para esta variable cuantitativa discreta, se tiene una clasificación por periodos de tiempo. Se tiene que; el dato mínimo, es de 0 periodos; el máximo, de 40; el promedio, 7.4 periodos; la mediana, 4 periodos; y por último, la moda en 4 periodos.
Los datos tienen una desviación estándar de 8.5, por lo que se infiere que están relativamente dispersos del promedio, sin embargo, vale la pena aclarar que existen varios datos atípicos que se acercan al máximo de los datos.
Por otro lado, para esta variable se tiene una curtosis de 2.9, muy cercana a 3, por lo que se concluye que se acerca a la mesocurtosis, es decir, los datos están concentrados alrededor del promedio.
Estos datos dan a entender que la compañía suele dar créditos a gente con poca o intermedia experiencia laboral, pues la mayoría de datos se concentran entre 0 y 10 periodos laborales
ggplot(muestra, aes(x = plazo)) +
geom_histogram(bins = 5, fill = "#685ad3", alpha = 0.5, colour = "black") +
theme(panel.background = element_rect(fill="#e4dcff"))par(bg = "#e4dcff")
boxplot(muestra$plazo, horizontal = TRUE,
boxwex = 1,
boxlty = 1,
boxlwd = 1,
boxcol = 1,
boxfill = "#685ad3",
whisklty = 2,
whisklwd = 2,
whiskcol = "#BC3030",
border = "black",
main = "Box plot de Plazo")Para esta variable se tiene que el valor máximo plazo del crédito son 60 meses, y el mínimo, 6. Las medidas de tendencia central son; el promedio, 46.2 meses; la mediana, 48 meses; y la moda, 60.
La desviación de la duración del crédito en meses, respecto a su promedio (46.2 meses), es de 14.5 meses. Por otra parte su curtosis es de -0.15, que es menor que tres, lo que indica que es platicúrtica, es decir, sus datos no están concentrados en gran cantidad, respecto al promedio.
De esto se puede inferir que la empresa desembolsa créditos, en su mayoría, de largo plazo, pues las medidas de tendencia central superan los 12 meses. Y no posee datos atípicos.
ggplot(muestra, aes(x = gastos)) +
geom_histogram(bins = 15, fill = "#685ad3", alpha = 0.5, colour = "black") +
theme(panel.background = element_rect(fill="#e4dcff"))par(bg = "#e4dcff")
boxplot(muestra$gastos, horizontal = TRUE,
boxwex = 1,
boxlty = 1,
boxlwd = 1,
boxcol = 1,
boxfill = "#685ad3",
whisklty = 2,
whisklwd = 2,
whiskcol = "#BC3030",
border = "black",
main = "Box plot de Gastos")Para el análisis del gasto de los clientes se tiene que el valor máximo de los gastos es de 105 unidades monetarias, y el mínimo de 35. Las medidas de tendencia central son el promedio: 55.4 unidades monetarias; la moda, 35 unidades monetarias; la mediana es de 47.5 unidades monetarias
La desviación estándar de los gastos de los clientes en esta compañía respecto a su promedio es de 19 unidades monetarias. Su curtosis es de -0.4, menor a 3, por lo que es platicúrtica, es decir, sus datos no están concentrados en gran cantidad, respecto al promedio. Posee un dato atípico que es el máximo.
Los clientes de esta compañía tienen un gasto medio, lo cual no puede ser buen indicador para el pago oportuno de las cuotas del crédito, puesto que no se conoce el ratio entre los gastos y el ingreso del usuario.
ggplot(muestra, aes(x = activos)) +
geom_histogram(bins = 15, fill = "#685ad3", alpha = 0.5, colour = "black") +
theme(panel.background = element_rect(fill="#e4dcff"))par(bg = "#e4dcff")
boxplot(muestra$activos, horizontal = TRUE,
boxwex = 1,
boxlty = 1,
boxlwd = 1,
boxcol = 1,
boxfill = "#685ad3",
whisklty = 2,
whisklwd = 2,
whiskcol = "#BC3030",
border = "black",
main = "Box plot de Activos")Para el análisis de los activos y su valor se tiene que el valor máximo de los activos de un cliente es de 60000 unidades monetarias, y el mínimo de 0. Las medidas de tendencia central son el promedio: 156.7 unidades monetarias; la moda, 0 unidades monetarias; la mediana es de 135 unidades monetarias.
La desviación estándar del valor de los activos de los clientes en esta compañía, respecto a su promedio, es de 8629.99 unidades monetarias. Su curtosis es de 19, mayor a 3, por lo que es leptocúrtica, es decir, sus datos no están concentrados en gran cantidad, respecto al promedio. Posee varios datos atípicos que se encuentran desde las 20000 unidades monetarias, lo que afecta al promedio.
La perspectiva de esta variable puede ser ambigua, porque si bien existe una garantía hipotecaria, al tener una distribución leptocúrtica, con un promedio distinto de 0, es menester resaltar que la moda es de 0, por lo que muchos clientes no tienen garantía hipotecaría al incumplimiento del pago del crédito. Esto es un grave problema para la compañía que presta dinero. Sin embargo, al complementar este análisis con otras variables, se puede entender desde una mejor perspectiva el comportamiento y caracterización de los clientes.
ggplot(muestra, aes(x = precio)) +
geom_histogram(bins = 12, fill = "#685ad3", alpha = 0.5, colour = "black") +
theme(panel.background = element_rect(fill="#e4dcff"))par(bg = "#e4dcff")
boxplot(muestra$precio, horizontal = TRUE,
boxwex = 1,
boxlty = 1,
boxlwd = 1,
boxcol = 1,
boxfill = "#685ad3",
whisklty = 2,
whisklwd = 2,
whiskcol = "#BC3030",
border = "black",
main = "Box plot de Precio")Tenemos una variable cuantitativa continua, que puede ser expresada en distintas cantidades monetarias y que posee las siguientes características: Dato Mínimo de 500 el cual indica el precio más bajo en el conjunto de datos, un dato Máximo de 4,138 el cual establece el límite superior de la distribución de precios.
Para las medidas de tendencia central tenemos una media de 1,448.74, esta es el promedio de los precios en el conjunto de datos. Una mediana de 1360 que es el valor que separa el 50% superior e inferior de los precios en orden. Es menos sensible a valores extremos que la media y es una medida de tendencia central robusta. También contamos con una moda de 800 la cual indica que el valor más común en la variable “Precio” es 800.
La desviación estándar es de 579.8 y mide la dispersión de los precios. Indica que los precios tienden a variar en torno a la media de 1,448.74 en un rango de aproximadamente ±579.8. También poseemos información acerca de la curtosis la cual es de 5.05 y esta indica que la distribución de los precios es leptocúrtica, es decir, tiene colas pesadas y picos pronunciados.
Debemos tener en cuenta que algunos de estos datos pueden ser altamente variables y atípicos. Para tener una vista más detallada, se pueden analizar cada uno de los gráficos dispuestos para esto, en ellos se encuentra toda la información mencionada anteriormente pero de forma gráfica.
De los reportes automatizados el que mas me llamo la atención fue el segundo el que hace uso de la libreria ExPanDaR, puesto que este muestra diversas graficas como lo son de barras para las variables cualitativas, histogramas para la variables cuantitativas, ademas de otros graficos como el de correlación entre variables, los cuales nos pueden permitir visualizar los datos de las bases de otras maneras y asi poder realizar distintos analisis, ademas de permitirnos visualizar un resumen de los datos enseñandonos asi la mediana, media, min, max, entre otros datos.
De los distintos graficos y analisis que aparecian en los tres reportes automaticos agregaria el grafico que generaba una correlación entre las variables que aparece en el reporte de DataExplorer, por otro lado tambien agreagaria las tablas que dan un resumen de la base de datos de la libreria dataMaid, ya que en este podemos encontrar las clases de las variables, cuantos valores distintos hay en cada variable y si existe algun tipo de inconsistencia y por ultimo de ExPanDaR tomaria el que se pueda tener una lista desplegable en cada grafico para asi poder seleccionar la variable del grafico que uno desea observar.