El presente informe realiza un análisis exploratorio del mercado de cervezas a partir de la muestra de datos representada en el Dashboard de Cervezas, desarrollado en RStudio.
El objetivo principal es evaluar las relaciones entre el contenido de alcohol, los precios, el contenido calórico y el origen de las marcas analizadas, con el fin de identificar patrones de consumo y segmentos de mercado dentro de las 69 marcas registradas en la base de datos.
A partir del procesamiento y depuración de los datos recolectados, se destacan los siguientes indicadores macro (KPIs):
| Indicador | Valor |
|---|---|
| Total de Marcas Analizadas | 69 marcas |
| Precio Promedio | $424.58 |
| Calorías Promedio | 142 kcal |
| Porcentaje de Alcohol Promedio | 36.25% Vol |
Al examinar la tabla de estructura del dataset (tamaño 69 x 6)
durante la carga inicial en RStudio, se identificó un problema de
importación/parseo en el archivo beer.csv:
"m1,""6,24"",159,""5,2"",1,1"). El lector de R interpretaba
toda la fila como un único valor de texto, generando NA en
las variables precio, calorías, poralcoh, tipo y origen.Corrección aplicada en R (ver chunk
setup de este documento):
raw_lines <- readLines("beer.csv", encoding = "UTF-8")
header <- raw_lines[1]
data_lines <- raw_lines[-1]
data_lines <- sub('^"', '', data_lines)
data_lines <- sub('"$', '', data_lines)
data_lines <- gsub('""', '"', data_lines, fixed = TRUE)
clean_text <- paste(c(header, data_lines), collapse = "\n")
beer <- read_csv(I(clean_text), show_col_types = FALSE)
beer <- beer %>%
mutate(precio = as.numeric(gsub(",", ".", precio)),
poralcoh = as.numeric(gsub(",", ".", poralcoh)))
Tras la corrección, las 69 filas y 6 columnas quedaron completamente pobladas, permitiendo el análisis estadístico y visual que se presenta a continuación.
Variable X: Porcentaje de Alcohol (% Vol). Variable Y: Precio.
La mayoría de las cervezas se concentra entre 4% y 5.5% de alcohol, con precios que oscilan entre $3.5 y $6.5. Las marcas de Tipo 2 se ubican en la parte superior del gráfico, con los precios más altos del mercado, mientras que las de Tipo 4 y Tipo 5 tienden a ubicarse en el rango de menor precio. Se observa un grupo de cervezas con 0% de alcohol (categoría sin alcohol) con precios variables, lo que indica que el precio no depende exclusivamente del grado alcohólico.
El Tipo 2 presenta el precio mediano más alto (~$6.4) y la menor dispersión relativa entre sus marcas, lo que sugiere un segmento premium consistente. El Tipo 4 tiene el precio mediano más bajo (~$3.8), asociado a un segmento económico. Los Tipos 1 y 5 muestran mayor dispersión de precios, incluyendo valores atípicos por encima de $6.5, lo que indica variabilidad interna dentro de esas categorías.
El origen 1 concentra el 78.3% de las marcas (54 de 69), frente a un 21.7% del origen 0. Se destaca que el Tipo 2 está representado casi en su totalidad por el origen 1, mientras que el Tipo 3 se concentra por completo en el origen 0. Esta distribución sugiere que ciertos tipos de cerveza están fuertemente asociados a un origen específico dentro de la muestra.
Al analizar la distribución del porcentaje de alcohol según el tipo de cerveza, se observa que los Tipos 1, 3 y 4 presentan concentraciones altas y homogéneas alrededor de 4.5% y 5% de alcohol, lo que indica que las marcas dentro de estas categorías son bastante consistentes entre sí en cuanto a graduación alcohólica. El Tipo 2, en cambio, muestra una dispersión más amplia, con valores que alcanzan hasta 6% de alcohol, lo cual es coherente con su posicionamiento como el segmento premium de mayor precio identificado anteriormente. Por su parte, el Tipo 5 presenta un comportamiento bimodal: un grupo de marcas concentradas cerca de 0% de alcohol (correspondientes a cervezas sin alcohol) y otro grupo disperso entre 3% y 6%, lo que evidencia que esta categoría agrupa productos con perfiles muy distintos entre sí. # 5. Conclusiones y Recomendaciones