Iniciamos importando la data de la calida del vino tinto. Esta data cuenta con 12 atributos y 1599 registros.En el presente docuemnto vamos a realizar un analisis desciptivo de la información recolectada.
BD <- read.csv("D:/BA Diplomado/winequality-red.csv")
summary(BD)
## fixed.acidity volatile.acidity citric.acid residual.sugar
## Min. : 4.60 Min. :0.1200 Min. :0.000 Min. : 0.900
## 1st Qu.: 7.10 1st Qu.:0.3900 1st Qu.:0.090 1st Qu.: 1.900
## Median : 7.90 Median :0.5200 Median :0.260 Median : 2.200
## Mean : 8.32 Mean :0.5278 Mean :0.271 Mean : 2.539
## 3rd Qu.: 9.20 3rd Qu.:0.6400 3rd Qu.:0.420 3rd Qu.: 2.600
## Max. :15.90 Max. :1.5800 Max. :1.000 Max. :15.500
## chlorides free.sulfur.dioxide total.sulfur.dioxide density
## Min. :0.01200 Min. : 1.00 Min. : 6.00 Min. :0.9901
## 1st Qu.:0.07000 1st Qu.: 7.00 1st Qu.: 22.00 1st Qu.:0.9956
## Median :0.07900 Median :14.00 Median : 38.00 Median :0.9968
## Mean :0.08747 Mean :15.87 Mean : 46.47 Mean :0.9967
## 3rd Qu.:0.09000 3rd Qu.:21.00 3rd Qu.: 62.00 3rd Qu.:0.9978
## Max. :0.61100 Max. :72.00 Max. :289.00 Max. :1.0037
## pH sulphates alcohol quality
## Min. :2.740 Min. :0.3300 Min. : 8.40 Min. :3.000
## 1st Qu.:3.210 1st Qu.:0.5500 1st Qu.: 9.50 1st Qu.:5.000
## Median :3.310 Median :0.6200 Median :10.20 Median :6.000
## Mean :3.311 Mean :0.6581 Mean :10.42 Mean :5.636
## 3rd Qu.:3.400 3rd Qu.:0.7300 3rd Qu.:11.10 3rd Qu.:6.000
## Max. :4.010 Max. :2.0000 Max. :14.90 Max. :8.000
El summary de la data presente, nos permite identificar que contamos con datos continuos de tipo numerico. Para analizar los datos los datos vamos a emplear histogramas para identificar tendencias y distribuciones.
You can also embed plots, for example:
dimension <- dim(BD)
filas <- dimension[1]
columnas <- dimension[2]
#Generar histogramas para los atributos
for (i in 1:columnas) {
texto <- paste('analisis del atributo ',colnames(BD)[i])
#print(texto)
hist(BD[,i],col=i, main = texto)
}
En los graficos anteriores se evidencia la presencia de algunos valores outliers. Por lo que se graficaran boxplots para mayor visibilidad.
#Generar Boxplots para los atributos
for (i in 1:columnas) {
texto <- paste('analisis del atributo ',colnames(BD)[i])
#print(texto)
boxplot(BD[,i],col=i, main = texto)
}
Concluimos que en la muestra predominan vinos de calidad 5 y 6. En los atributos de “acidity”, “sugar”, “chlorides”, “sulfur dioxide”, “alcohol” y “sulphates” presentan outliers que generan una asimetria hacia la derecha. En los atributos “citric acid”, “density”, “pH” se presentan pocos outliers o con poca asimetria.
Las variables “volatile acidity” y “alcohol levels” suelen estar fuertemente correlacionados con la calidad del vino. Un mayor contenido de alcohol generalmente se correlaciona con calificaciones de calidad más altas, mientras que niveles más altos de acidez volátil pueden disminuir la calidad.