A continuation se realiza un análisis descriptivo de la base de datos de la calidad del vino. http://rmarkdown.rstudio.com.
# Importar la base de datos y realizar un resumen de la data
data <- read.csv("C:/Users/User/Downloads/winequality-red.csv")
# Imprimir la dimensión de la base de datos
dim(data)
## [1] 1599 12
# Los nomnres de la base de datos
names(data)
## [1] "fixed.acidity" "volatile.acidity" "citric.acid"
## [4] "residual.sugar" "chlorides" "free.sulfur.dioxide"
## [7] "total.sulfur.dioxide" "density" "pH"
## [10] "sulphates" "alcohol" "quality"
# La cantidad de columnas de la base de datos
columna<- dim (data)[2]
columna
## [1] 12
# La composición de la data
str(data)
## 'data.frame': 1599 obs. of 12 variables:
## $ fixed.acidity : num 7.4 7.8 7.8 11.2 7.4 7.4 7.9 7.3 7.8 7.5 ...
## $ volatile.acidity : num 0.7 0.88 0.76 0.28 0.7 0.66 0.6 0.65 0.58 0.5 ...
## $ citric.acid : num 0 0 0.04 0.56 0 0 0.06 0 0.02 0.36 ...
## $ residual.sugar : num 1.9 2.6 2.3 1.9 1.9 1.8 1.6 1.2 2 6.1 ...
## $ chlorides : num 0.076 0.098 0.092 0.075 0.076 0.075 0.069 0.065 0.073 0.071 ...
## $ free.sulfur.dioxide : num 11 25 15 17 11 13 15 15 9 17 ...
## $ total.sulfur.dioxide: num 34 67 54 60 34 40 59 21 18 102 ...
## $ density : num 0.998 0.997 0.997 0.998 0.998 ...
## $ pH : num 3.51 3.2 3.26 3.16 3.51 3.51 3.3 3.39 3.36 3.35 ...
## $ sulphates : num 0.56 0.68 0.65 0.58 0.56 0.56 0.46 0.47 0.57 0.8 ...
## $ alcohol : num 9.4 9.8 9.8 9.8 9.4 9.4 9.4 10 9.5 10.5 ...
## $ quality : int 5 5 5 6 5 5 5 7 7 5 ...
# Resumen de los cuartiles de la data
summary(data)
## fixed.acidity volatile.acidity citric.acid residual.sugar
## Min. : 4.60 Min. :0.1200 Min. :0.000 Min. : 0.900
## 1st Qu.: 7.10 1st Qu.:0.3900 1st Qu.:0.090 1st Qu.: 1.900
## Median : 7.90 Median :0.5200 Median :0.260 Median : 2.200
## Mean : 8.32 Mean :0.5278 Mean :0.271 Mean : 2.539
## 3rd Qu.: 9.20 3rd Qu.:0.6400 3rd Qu.:0.420 3rd Qu.: 2.600
## Max. :15.90 Max. :1.5800 Max. :1.000 Max. :15.500
## chlorides free.sulfur.dioxide total.sulfur.dioxide density
## Min. :0.01200 Min. : 1.00 Min. : 6.00 Min. :0.9901
## 1st Qu.:0.07000 1st Qu.: 7.00 1st Qu.: 22.00 1st Qu.:0.9956
## Median :0.07900 Median :14.00 Median : 38.00 Median :0.9968
## Mean :0.08747 Mean :15.87 Mean : 46.47 Mean :0.9967
## 3rd Qu.:0.09000 3rd Qu.:21.00 3rd Qu.: 62.00 3rd Qu.:0.9978
## Max. :0.61100 Max. :72.00 Max. :289.00 Max. :1.0037
## pH sulphates alcohol quality
## Min. :2.740 Min. :0.3300 Min. : 8.40 Min. :3.000
## 1st Qu.:3.210 1st Qu.:0.5500 1st Qu.: 9.50 1st Qu.:5.000
## Median :3.310 Median :0.6200 Median :10.20 Median :6.000
## Mean :3.311 Mean :0.6581 Mean :10.42 Mean :5.636
## 3rd Qu.:3.400 3rd Qu.:0.7300 3rd Qu.:11.10 3rd Qu.:6.000
## Max. :4.010 Max. :2.0000 Max. :14.90 Max. :8.000
indexn<- NULL
indexc <- NULL
par(mfrow = c(2,6))
for(i in 1:columna){
if(is.numeric(data[ , i])==TRUE){
titulo <- paste("Análisis de la variable: ", colnames(data[i]))
hist(data[ , i], col = i, main=titulo)
indexn <- c(indexn,i)
} else{
titulo <- paste("Análisis de la variable: ", colnames(data[i]))
pie(table(data[ , i]), main=titulo)
indexc <- c(indexc,i)
}
}
Análisis de la variable: fixed.acidity Conclusión: La mayoría de los valores de acidez fija están entre 6 y 9. Esto significa que la mayoría de los objetos o productos que estamos viendo tienen una acidez que no es ni muy alta ni muy baja.
Análisis de la variable: volatile.acidity Conclusión: La mayoría de los objetos tienen baja acidez volátil (cerca de 0.5). Hay algunos con un poco más de acidez, pero son menos comunes.
Análisis de la variable: citric.acid Conclusión: La mayoría de los objetos tienen muy poco ácido cítrico, alrededor de 0.2. Pocos tienen más ácido cítrico, ya que se vuelve algo raro.
Análisis de la variable: residual.sugar Conclusión: La mayoría de los objetos tienen poco azúcar (menos de 2 gramos). Sin embargo, algunos tienen un poco más de azúcar, pero son pocos.
Análisis de la variable: chlorides Conclusión: La mayoría de los objetos tienen bajos niveles de cloruros, cerca de 0.1. Hay pocos con niveles altos de cloruros (más de 0.3), lo que los hace raros.
Análisis de la variable: free.sulfur.dioxide Conclusión: La mayoría de los objetos tienen bajos niveles de dióxido de azufre libre (alrededor de 10 a 20). Sin embargo, algunos tienen niveles mucho más altos, pero estos son menos comunes.
Análisis de la variable: total.sulfur.dioxide Conclusión: La mayoría de los objetos tienen niveles de dióxido de azufre total entre 50 y 150. Hay algunos con niveles muy altos (más de 200), pero son pocos.
Análisis de la variable: density Conclusión: La mayoría de los objetos tienen densidad entre 0.995 y 1.000. Esto quiere decir que son muy similares en cuanto a su “peso” comparado con el volumen.
Análisis de la variable: pH Conclusión: La mayoría de los objetos tienen un pH entre 3.2 y 3.4, lo que significa que son ligeramente ácidos. No hay muchos con valores fuera de este rango.
Análisis de la variable: sulphates Conclusión: La mayoría de los objetos tienen niveles de sulfatos entre 0.5 y 0.7. Pocos tienen niveles más altos, pero esto es raro.
Análisis de la variable: alcohol Conclusión: La mayoría de los objetos tienen entre 9.5% y 11.5% de alcohol. Solo algunos tienen más de 13% de alcohol, pero son muy pocos.
Análisis de la variable: quality Conclusión: La mayoría de los objetos tienen calidad 5 o 6, lo que significa que son de calidad promedio. Hay pocos con calidad alta (7 u 8) o baja (4).