Importando Data de la calidad del Vino

Iniciamos importando la data de la calida del vino tinto. Esta data cuenta con 12 atributos y 1599 registros.En el presente docuemnto vamos a realizar un analisis desciptivo de la información recolectada.

BD <- read.csv("D:/BA Diplomado/winequality-red.csv")
summary(BD)
##  fixed.acidity   volatile.acidity  citric.acid    residual.sugar  
##  Min.   : 4.60   Min.   :0.1200   Min.   :0.000   Min.   : 0.900  
##  1st Qu.: 7.10   1st Qu.:0.3900   1st Qu.:0.090   1st Qu.: 1.900  
##  Median : 7.90   Median :0.5200   Median :0.260   Median : 2.200  
##  Mean   : 8.32   Mean   :0.5278   Mean   :0.271   Mean   : 2.539  
##  3rd Qu.: 9.20   3rd Qu.:0.6400   3rd Qu.:0.420   3rd Qu.: 2.600  
##  Max.   :15.90   Max.   :1.5800   Max.   :1.000   Max.   :15.500  
##    chlorides       free.sulfur.dioxide total.sulfur.dioxide    density      
##  Min.   :0.01200   Min.   : 1.00       Min.   :  6.00       Min.   :0.9901  
##  1st Qu.:0.07000   1st Qu.: 7.00       1st Qu.: 22.00       1st Qu.:0.9956  
##  Median :0.07900   Median :14.00       Median : 38.00       Median :0.9968  
##  Mean   :0.08747   Mean   :15.87       Mean   : 46.47       Mean   :0.9967  
##  3rd Qu.:0.09000   3rd Qu.:21.00       3rd Qu.: 62.00       3rd Qu.:0.9978  
##  Max.   :0.61100   Max.   :72.00       Max.   :289.00       Max.   :1.0037  
##        pH          sulphates         alcohol         quality     
##  Min.   :2.740   Min.   :0.3300   Min.   : 8.40   Min.   :3.000  
##  1st Qu.:3.210   1st Qu.:0.5500   1st Qu.: 9.50   1st Qu.:5.000  
##  Median :3.310   Median :0.6200   Median :10.20   Median :6.000  
##  Mean   :3.311   Mean   :0.6581   Mean   :10.42   Mean   :5.636  
##  3rd Qu.:3.400   3rd Qu.:0.7300   3rd Qu.:11.10   3rd Qu.:6.000  
##  Max.   :4.010   Max.   :2.0000   Max.   :14.90   Max.   :8.000

Graficos de los atributos.

El summary de la data presente, nos permite identificar que contamos con datos continuos de tipo numerico. Para analizar los datos los datos vamos a emplear histogramas para identificar tendencias y distribuciones.

You can also embed plots, for example:

dimension <- dim(BD)
filas <- dimension[1]
columnas <- dimension[2]


#Generar histogramas para los atributos 
for (i in 1:columnas) {
  texto <- paste('analisis del atributo ',colnames(BD)[i])
  #print(texto)
  hist(BD[,i],col=i, main = texto)
}

Eliminación de Outliers.

En los graficos anteriores se evidencia la presencia de algunos valores outliers. Por lo que se graficaran boxplots para mayor visibilidad.

#Generar Boxplots para los atributos 
for (i in 1:columnas) {
  texto <- paste('analisis del atributo ',colnames(BD)[i])
  #print(texto)
  boxplot(BD[,i],col=i, main = texto)
}

Conclusiones.

Concluimos que en la muestra predominan vinos de calidad 5 y 6. En los atributos de “acidity”, “sugar”, “chlorides”, “sulfur dioxide”, “alcohol” y “sulphates” presentan outliers que generan una asimetria hacia la derecha. En los atributos “citric acid”, “density”, “pH” se presentan pocos outliers o con poca asimetria.

Las variables “volatile acidity” y “alcohol levels” suelen estar fuertemente correlacionados con la calidad del vino. Un mayor contenido de alcohol generalmente se correlaciona con calificaciones de calidad más altas, mientras que niveles más altos de acidez volátil pueden disminuir la calidad.