1 - PROCESAMIENTO DE DATOS

1.1 Objetivo

Esta parte documenta la construcción de las matrices de datos que integran la información química (GC-FID, GC-MS, fenoles totales por Folin, variables fermentativas JU) con la información sensorial (catas de panel y catas individuales), a partir de las tablas originales.

El objetivo general de este trabajo es entender qué variables químicas podrían estar relacionadas con la calidad sensorial del whisky chileno. Esto se hace en un contexto de small data, es decir, con pocas muestras que tienen cata sensorial completa, muchas variables químicas disponibles y distintas fuentes de datos que no siempre coinciden entre sí. Por esta razón, no se construyó una única matriz de análisis, sino seis matrices diferentes, cada una con un propósito específico dentro del estudio. Así, cada matriz permite abordar una parte distinta del problema, evitando mezclar datos que no son directamente comparables y manteniendo claro qué información se está usando en cada caso.

1.2 Las 6 matrices son las siguientes

# Matriz Escenario de modelamiento Filas Rol
1 Matriz pura M_pura 34 Escenario principal. Cruce estricto química–sensorial de panel, sin la cata individual JU (que tiene un margen de error distinto por ser un solo catador, no un promedio de panel).
2 Matriz expandida por evaluador M_expandida_evaluador 685 Igual cobertura que la pura, pero sin promediar por evaluador (complementaria).
3 Química M_quimica Solo predictores químicos, sin targets sensoriales. Uso diagnóstico (colinealidad), no para modelar.
4 Sensorial M_sensorial Solo targets sensoriales, sin predictores químicos. Uso diagnóstico exploratorio.
5 Matriz cata individual M_cata_individual 52 A la matriz pura (34) se le agrega la cata individual (18 filas). Usada como análisis de sensibilidad frente a la matriz principal.
6 Matriz IA exploratoria M_ia_exploratoria 42 Catas sintéticas generadas por consenso de 3 LLM (Gemini, Claude, GPT) como escenario exploratorio, nunca como reemplazo de cata real. Las 42 filas corresponden a filas químicas (de las 63 de la Matriz 3) que pudieron recibir una estimación IA utilizable; provienen de solo 24 muestras físicas únicas (ver Matriz 6 para el detalle).

1.3 Descripción de los datos y variables

En esta investigación se trabaja con dos tipos de variables: variables de entrada (predictoras), que son mediciones químicas del destilado, y variables de salida (objetivo), que son puntajes sensoriales asignados por un panel de cata. El modelo busca predecir las segundas a partir de las primeras.

1.3.1 Variables de entrada: 32 mediciones químicas, agrupadas en 4 técnicas

Ninguna muestra pasó por las 4 técnicas a la vez — por eso los predictores se agrupan por técnica y no se mezclan libremente entre sí.

Técnica N° variables Qué mide Unidad
GC-FID (cromatografía de gases, detector de llama) 13 Concentración de compuestos puntuales ya conocidos: fenoles volátiles (guaiacol, o-cresol, p-cresol, 4-etil-guaiacol) y ésteres (etil octanoato, etil decanoato, etc.) ppm
GC-MS (cromatografía de gases + espectrometría de masas) 5 Composición porcentual del cromatograma agrupada por familia química (% ésteres, % fenólicos, % aldehídos, % aroma fermentativo, % área válida) % de área
JU (variables fermentativas) 13 Cinética del proceso de fermentación (consumo de maltosa, producción de etanol, pérdida de CO₂) + algunos compuestos medidos en el mismo ensayo g/L, ppm, %
Folin (Folin-Ciocalteu) 1 Fenoles totales del destilado (ensayo colorimétrico, un solo valor agregado, no compuesto a compuesto) µg ácido gálico/mL

En el escenario principal (M_pura) solo 18 de estas 32 variables tienen datos suficientes para usarse como predictor (mínimo 3 valores no vacíos y variabilidad); el resto casi no se solapa con las muestras que tienen cata.

1.3.2 Variables de salida: 4 puntajes sensoriales, construidos desde la cata original

El panel evaluó cada muestra con descriptores individuales en escala 1-5 (aroma, sabor, regusto y calidad global: ahumado, medicinal, frutal, vainilla, cereal, terroso, amaderado, etc.). Para el modelamiento, esos descriptores se combinaron por promedio en 4 targets:

Target Se construye promediando Cobertura en M_pura
y_fenolico_comun (principal) aroma_ahumado + sabor_ahumado + regusto_ahumado + aroma_medicinal + sabor_medicinal 34/34 (100%)
y_ahumado_comun aroma_ahumado + sabor_ahumado + regusto_ahumado 30/34
y_medicinal_comun aroma_medicinal + sabor_medicinal 30/34
y_frutal_comun (secundario) aroma_frutal + sabor_frutal 13/34

y_fenolico_comun combina ahumado + medicinal porque ambos son las dos caras sensoriales del carácter fenólico del whisky (turba/humo y notas “yodadas”), y es el único target con cobertura completa.

1.3.3 Detalle técnico completo (referencia)

Para quien necesite el detalle variable por variable (nombre exacto, completitud, rango, si se usa o no como predictor) o el resumen por escenario (filas, unidades, bloques), la tabla completa está disponible en data/modelamiento/datos_modelamiento.xlsx.

escenario_id escenario_nombre n_filas n_unidades_analiticas n_muestras_base n_bloques n_predictores_quimicos n_targets_presentes targets_con_datos observacion_metodologica
M_pura Matriz pura real 34 34 12 5 32 4 y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun Escenario principal real. No incluye la cata individual JU (ver M_cata_individual).
M_expandida_evaluador Matriz expandida por evaluador 685 34 12 5 32 4 y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun Usar solo con validación agrupada por muestra para evitar fuga de información.
M_cata_individual Matriz pura + cata individual JU 52 52 18 6 32 4 y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun Escenario de sensibilidad: matriz pura (M_pura) mas la cata individual JU agregada. Comparar directamente contra M_pura para evaluar el efecto de incluir esa fuente.
M_ia_exploratoria Matriz IA exploratoria 42 42 14 2 32 4 y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun Escenario sintético exploratorio; no equivale a cata real.
M_quimica Matriz solo química 63 63 24 4 32 0 NA Sin targets sensoriales (y_*); no apto para modelamiento supervisado. Solo para diagnóstico/colinealidad de predictores químicos (scripts 13 y 13b).
M_sensorial Matriz solo sensorial 37 NA NA NA 0 4 y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun Sin predictores químicos (x_*); no apto para modelamiento supervisado. Solo para diagnóstico exploratorio de los targets sensoriales (scripts 13 y 13b).

1.4 Matriz 1 — Matriz pura (M_pura)

Cruce entre química y sensorial de panel, sin cata individual. Es la evidencia principal para los resultados de la tesis.

Vista de las primeras filas de la matriz integrada (34 filas en total; tabla completa en data/procesamiento/matriz_pura.xlsx, hoja 01_matriz_pura):

tipo_dato grupo_matriz unidad_analitica_id bloque_id bloque_sensorial muestra_base muestra_cata identificador_quimico identificador_sensorial replica_id tecnica_quimica archivo_quimico hoja_quimica archivo_sensorial hoja_sensorial archivo_sensorial_asociado muestra_cata_asociada tiene_cata_confirmada_quimica tiene_quimica_confirmada_sensorial n_evaluadores nivel_quimico nivel_sensorial fuente_target cruce_quimica_sensorial_ok n_targets_disponibles observacion_metodologica y_aroma_ahumado y_aroma_medicinal y_aroma_terroso y_aroma_amaderado y_aroma_cafe y_sabor_ahumado y_sabor_medicinal y_sabor_terroso y_sabor_amaderado y_sabor_cafe y_regusto_duracion y_regusto_ahumado y_regusto_complejidad y_global_integracion_ahumado y_global_tomabilidad y_frutal_comun y_ahumado_comun y_medicinal_comun y_fenolico_comun y_aroma_frutal y_aroma_vainilla y_aroma_cereal y_sabor_frutal y_sabor_vainilla y_sabor_cereal y_global_armonia y_sabor_sensacion_boca y_intensidad y_floral y_nuez y_sulfuroso y_mantecoso y_maltoso y_caramelo x_gcfid_ethyl_octanoate_ppm x_gcfid_isoamyl_acetate_ppm x_gcfid_furfural_ppm x_gcfid_o_cresol_ppm x_gcfid_p_cresol_ppm x_gcfid_4_ethyl_guaiacol_ppm x_gcfid_creosol_ppm x_gcfid_guaiacol_ppm x_gcfid_ethyl_decanoate_ppm x_gcfid_isoamyl_octanoate_ppm x_gcfid_ethyl_dodecanoate_ppm x_gcfid_ethyl_tetradecanoate_ppm x_gcfid_ethyl_hexadecanoate_ppm x_ju_final_co2_loss_g_l x_ju_maltose_consumption_g_l x_ju_ethanol_production_g_l x_ju_ferulic_acid_conversion_index_faci_percent x_ju_o_cresol_ppm x_ju_p_cresol_ppm x_ju_isoamyl_acetate_ppm x_ju_ethyl_decanoate_ppm x_ju_isoamyl_octanoate_ppm x_ju_ethyl_dodecanoate_ppm x_ju_ethyl_myristate_ppm x_ju_ethyl_hexadecanoate_ppm x_ju_ethyl_octanoate_ppm x_folin_fenoles_totales_ug_ag_ml x_gcms_esteres_pct x_gcms_fenolicos_pct x_gcms_aldehidos_pct x_gcms_aroma_fermentativo_pct ctrl_gcms_siloxano_pct n_compuestos_detectados x_gcms_area_valida_pct
puro_agregado gcms gcms_constanza_comerciales__c1_r1 gcms_constanza_comerciales cata_social_enero_2025 C1 Muestra 4 C1 / Dalwhinnie C1 / Dalwhinnie 1 GC-MS Resultados GC-MS-Constanza Vidal.zip CV-01-C1-duplicado_04_Reporte modelo Excel.xls Cata Social_Enero_2025.xlsx Respuestas de formulario 1 Cata Social_Enero_2025.xlsx Muestra 4 TRUE TRUE 27 unidad_analitica promedio_muestra cata_real_agregada TRUE 19 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 2.600000 1.461539 1.185185 2.153846 1.259259 3.444444 2.444444 2.407407 3.370370 1.851852 3.370370 2.814815 2.888889 2.962963 3.074074 NA 2.975309 1.981481 2.569753 NA NA NA NA NA NA NA 3.037037 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 75.53992 3.6200952 1.5258775 77.06580 2.543417 600 97.45658
puro_agregado gcms gcms_constanza_comerciales__c1_r2 gcms_constanza_comerciales cata_social_enero_2025 C1 Muestra 4 C1 / Dalwhinnie C1 / Dalwhinnie 2 GC-MS Resultados GC-MS-Constanza Vidal.zip CV-01-control1_01_Reporte modelo Excel.xls Cata Social_Enero_2025.xlsx Respuestas de formulario 1 Cata Social_Enero_2025.xlsx Muestra 4 TRUE TRUE 27 unidad_analitica promedio_muestra cata_real_agregada TRUE 19 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 2.600000 1.461539 1.185185 2.153846 1.259259 3.444444 2.444444 2.407407 3.370370 1.851852 3.370370 2.814815 2.888889 2.962963 3.074074 NA 2.975309 1.981481 2.569753 NA NA NA NA NA NA NA 3.037037 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 78.16346 1.6877813 1.2026648 79.36613 4.007941 600 95.99206
puro_agregado gcms gcms_constanza_comerciales__c2_r1 gcms_constanza_comerciales cata_social_enero_2025 C2 Muestra 7 C2 / Caol Ila C2 / Caol Ila 1 GC-MS Resultados GC-MS-Constanza Vidal.zip CV-01-C2-duplicado_05_Reporte modelo Excel.xls Cata Social_Enero_2025.xlsx Respuestas de formulario 1 Cata Social_Enero_2025.xlsx Muestra 7 TRUE TRUE 30 unidad_analitica promedio_muestra cata_real_agregada TRUE 19 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 3.482759 2.833333 2.066667 2.233333 1.379310 4.233333 2.866667 2.862069 3.066667 1.900000 3.517241 3.466667 2.620690 2.600000 2.700000 NA 3.738889 2.850000 3.383333 NA NA NA NA NA NA NA 2.533333 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 82.13948 2.9337469 1.2898238 83.42931 2.904282 600 97.09572
puro_agregado gcms gcms_constanza_comerciales__c2_r2 gcms_constanza_comerciales cata_social_enero_2025 C2 Muestra 7 C2 / Caol Ila C2 / Caol Ila 2 GC-MS Resultados GC-MS-Constanza Vidal.zip CV-02-control2_02_Reporte modelo Excel.xls Cata Social_Enero_2025.xlsx Respuestas de formulario 1 Cata Social_Enero_2025.xlsx Muestra 7 TRUE TRUE 30 unidad_analitica promedio_muestra cata_real_agregada TRUE 19 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 3.482759 2.833333 2.066667 2.233333 1.379310 4.233333 2.866667 2.862069 3.066667 1.900000 3.517241 3.466667 2.620690 2.600000 2.700000 NA 3.738889 2.850000 3.383333 NA NA NA NA NA NA NA 2.533333 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 77.60664 1.6072317 0.7167857 78.32343 5.173913 600 94.82609
puro_agregado gcms gcms_noviembre__nov_m1_r1 gcms_noviembre panel_noviembre NOV_M1 Muestra 1 NOV_M1 NOV_M1 1 GC-MS Panel sensorial_06_Noviembre_GC_MS.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Muestra 1 TRUE TRUE 10 unidad_analitica promedio_muestra cata_real_agregada TRUE 9 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 2.6 NA NA 1.800000 NA NA NA NA NA NA NA NA 3.7 2.5 2.1 1.1 2.1 2.8 2.2 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 94.80506 0.2454962 0.2266671 95.03173 0.000000 22 100.00000
puro_agregado gcms gcms_noviembre__nov_m2_r1 gcms_noviembre panel_noviembre NOV_M2 Muestra 2 NOV_M2 NOV_M2 1 GC-MS Panel sensorial_06_Noviembre_GC_MS.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Muestra 2 TRUE TRUE 10 unidad_analitica promedio_muestra cata_real_agregada TRUE 9 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 3.3 NA NA 2.100000 NA NA NA NA NA NA NA NA 3.4 2.0 2.7 1.2 2.0 2.1 2.4 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 92.88892 0.0000000 0.1885537 93.07747 0.000000 21 100.00000
puro_agregado gcms gcms_noviembre__nov_m3_r1 gcms_noviembre panel_noviembre NOV_M3 Muestra 3 NOV_M3 NOV_M3 1 GC-MS Panel sensorial_06_Noviembre_GC_MS.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Muestra 3 TRUE TRUE 10 unidad_analitica promedio_muestra cata_real_agregada TRUE 9 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 2.9 NA NA 2.400000 NA NA NA NA NA NA NA NA 3.1 2.3 2.2 1.1 1.8 2.5 2.4 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 96.26849 0.2043085 0.2569325 96.52542 0.000000 22 100.00000
puro_agregado gcms gcms_noviembre__nov_m4_r1 gcms_noviembre panel_noviembre NOV_M4 Muestra 4 NOV_M4 NOV_M4 1 GC-MS Panel sensorial_06_Noviembre_GC_MS.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Hoja1 Panel sensorial_06_Noviembre.xlsx Muestra 4 TRUE TRUE 10 unidad_analitica promedio_muestra cata_real_agregada TRUE 9 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 3.1 NA NA 2.600000 NA NA NA NA NA NA NA NA 3.9 2.5 2.2 1.2 2.1 3.2 2.7 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 91.88683 0.3384489 0.4014629 92.28829 0.000000 23 100.00000
puro_agregado historico_gcfid alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r1 alexandra_260603_pilsner_gcfid cata_alexandra_260603 Pilsner_H76R1R2 Muestra 1 Pilsner sin ahumar H76 Pilsner sin ahumar H76 1 GC-FID 260603_Alexandra.xlsx CVs GC-FID 260603_Resultados cata_Alexandra.xlsx Respuestas de formulario 1 260603_Resultados cata_Alexandra.xlsx Muestra 1 TRUE TRUE 9 unidad_analitica promedio_muestra cata_real_agregada TRUE 18 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 2.222222 1.111111 1.666667 2.777778 2.222222 2.555556 1.666667 2.444444 3.111111 2.111111 3.666667 1.888889 3.666667 4.333333 4.333333 NA 2.222222 1.388889 1.888889 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 84.93424 2.132395 NA 0.0044147 0.0294286 0.0037554 0.0126984 -0.0580932 40.54952 0.8474191 28.69528 6.918760 19.02811 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA
puro_agregado historico_gcfid alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r2 alexandra_260603_pilsner_gcfid cata_alexandra_260603 Pilsner_H76R1R2 Muestra 1 Pilsner sin ahumar H76 Pilsner sin ahumar H76 2 GC-FID 260603_Alexandra.xlsx CVs GC-FID 260603_Resultados cata_Alexandra.xlsx Respuestas de formulario 1 260603_Resultados cata_Alexandra.xlsx Muestra 1 TRUE TRUE 9 unidad_analitica promedio_muestra cata_real_agregada TRUE 18 Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. 2.222222 1.111111 1.666667 2.777778 2.222222 2.555556 1.666667 2.444444 3.111111 2.111111 3.666667 1.888889 3.666667 4.333333 4.333333 NA 2.222222 1.388889 1.888889 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA 87.21893 2.207052 NA 0.0037648 0.0181587 0.0086091 0.1100000 -0.0578633 44.54221 0.9081365 30.56440 8.341887 20.08032 NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA NA

1.5 Matriz 2 — Expandida por evaluador (M_expandida_evaluador)

Esta matriz toma las mismas 34 unidades químicas de la matriz pura, pero en vez de una fila por unidad (promediando entre evaluadores), deja una fila por cada evaluación individual de cada catador. Por eso tiene 685 filas: no son 685 muestras nuevas, son las mismas 34 muestras químicas repetidas tantas veces como evaluadores las calificaron. Por este motivo no se muestra la tabla completa, sino que se listan solo las primeras filas a modo de ejemplo:

Vista de las primeras filas (tabla completa en data/procesamiento/matriz_pura_expandida_evaluador.xlsx, hoja 02_modelamiento):

unidad_analitica_id muestra_cata nombre_catador categoria_catador y_fenolico_comun y_frutal_comun
gcms_constanza_comerciales__c1_r1 Muestra 4 Andrea hinojoss Consumidor General de Destilados 1.6 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Beatriz solari Consumidor General de Destilados 3.6 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Bernardo Morales Aficionado al whisky 2.2 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Camila Aguirre Consumidor General de Destilados 3.6 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Carlos Reyes Consumidor General de Destilados 2.8 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Caro Carriel Consumidor General de Destilados 2.6 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Chabi Cadiz Consumidor General de Destilados 2.4 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Claudia Ortiz Calderón Aficionado al whisky 1.6 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Claudio Martínez Consumidor General de Destilados 1.8 NA
gcms_constanza_comerciales__c1_r1 Muestra 4 Claudio Perez-Leighton Aficionado al whisky 1.6 NA

Se usa únicamente con validación agrupada por unidad analítica (para que el mismo grupo de evaluaciones no aparezca a la vez en entrenamiento y en prueba), y sirve para estudiar la variabilidad entre evaluadores sobre una misma muestra, no para aumentar el tamaño muestral real.

1.6 Matriz 3 — Química (M_quimica)

Contiene solo predictores químicos, sin evaluación sensorial asociada. No tiene target, por lo tanto no se usa para ajustar modelos y sirve como diagnóstico químico no supervisado (distribución de variables, colinealidad) sobre unidades que no llegaron a tener cata.

Bloque analítico Técnica Unidades Muestras base
Fenoles totales (malta) Fenoles totales 24 8
GC-MS comerciales GC-MS 8 4
GC-MS experimentales GC-MS 10 5
JU (cepas fermentativas) Variables fermentativas / química JU 21 7
Total 63

Las 32 variables predictoras son las mismas 4 familias químicas que en la matriz pura (GC-FID, GC-MS, JU, Folin) — lo único que cambia es que estas 63 unidades no tienen cata de panel confirmada, por eso quedan fuera del modelamiento supervisado y solo aportan a diagnóstico exploratorio.

¿Por qué solo aparecen estos bloques aquí?

Igual que en la matriz sensorial, esta tabla no representa toda la química generada — es el residuo de unidades que quedaron sin cata asociada. En total hay 8 bloques químicos en el proyecto:

Bloque químico Técnica Unidades totales Con cata Sin cata
Fenoles totales (malta) Fenoles totales 24 0 24
GC-FID Constanza (enero) GC-FID 15 15 0
GC-FID Constanza (septiembre) GC-FID 9 9 0
GC-FID Pilsner GC-FID 2 2 0
GC-MS comerciales GC-MS 12 4 8
GC-MS experimentales GC-MS 10 0 10
GC-MS noviembre GC-MS 4 4 0
JU (cepas fermentativas) Variables fermentativas / química JU 39 18 21

Cuatro bloques (GC-FID Pilsner, GC-FID Constanza de enero y de septiembre, GC-MS noviembre) tuvieron el 100% de sus unidades con cata confirmada — por eso no aportan ninguna fila a esta matriz: van completas a M_pura. Los otros cuatro (Fenoles totales, GC-MS comerciales, GC-MS experimentales, JU) tienen una porción sin cata asociada, y esa porción es la que se muestra en la tabla anterior.

1.7 Matriz 4 — Sensorial (M_sensorial)

Contiene solo evaluaciones sensoriales (targets), sin química asociada confirmada. No tiene predictores, por lo tanto no se usa para ajustar modelos — sirve como análisis sensorial descriptivo.

Sesión de cata Muestras Evaluaciones individuales Evaluadores
Cata Alexandra 3 27 27
Panel noviembre 1 10 10
Total 4 37

Al agregar por muestra (promedio entre evaluadores) quedan 4 filas — 3 de la cata Alexandra y 1 del panel de noviembre. Hay hasta 18 targets sensoriales disponibles por evaluación individual: los 4 targets “comunes” usados en el modelamiento (y_fenolico_comun, y_frutal_comun, y_ahumado_comun, y_medicinal_comun) más descriptores puntuales de aroma, sabor, regusto y calidad global (ahumado, medicinal, terroso, amaderado, café, entre otros).

¿Por qué solo aparecen 2 sesiones aquí?

Esta matriz no representa todas las catas realizadas es el residuo de muestras que quedaron sin cruce químico dentro de cada sesión. En total hay 5 sesiones de cata en el proyecto:

Sesión de cata Muestras Evaluaciones con química Evaluaciones sin química
Cata Alexandra (260603) 4 9 27
Cata Social Enero 2025 5 145 0
Cata Septiembre 2024 3 26 0
Cata individual JU 6 6 0
Panel noviembre 5 40 10

Tres sesiones (Cata Social Enero 2025, Cata Septiembre 2024 y la cata individual JU) tuvieron el 100% de sus muestras con química confirmada, por eso no aportan ninguna fila a esta matriz: van completas a M_pura (o a M_cata_individual en el caso de la cata JU). Solo Cata Alexandra (3 de sus 4 muestras sin química asociada) y Panel noviembre (1 de sus 5 muestras sin GC-MS asociado) dejan un remanente sin cruce, y ese remanente es exactamente lo que se muestra en la tabla de arriba.

1.8 Matriz 5 — Cata individual JU (M_cata_individual)

Para qué se usa: responde una pregunta puntual — ¿cambia el resultado del modelo si, además de la cata de panel (varios catadores promediados), se agrega la cata individual del bloque JU (un solo catador por muestra, sin promediar)? Por eso M_cata_individual = M_pura (34 filas) + 18 filas nuevas aportadas por esa cata individual. No reemplaza a la matriz pura, ya que es un escenario aparte para probar qué tan sensible es el resultado a este tipo de evidencia.

1.8.1 Composición de la matriz

Componente Filas Bloques químicos Muestras base Con y_fenolico_comun Con y_frutal_comun
Solo lo aportado por la cata JU 18 1 6 18 0
M_pura (sin JU) 34 5 12 34 13
M_cata_individual (pura + JU) 52 6 18 52 13

Las 18 filas aportadas por la cata JU corresponden a 6 muestras (cepas de fermentación), cada una con 3 réplicas químicas evaluadas por un único catador. Aportan cobertura completa al target principal (y_fenolico_comun, 18/18), pero cero al target secundario (y_frutal_comun) — ese descriptor no se registró en esa sesión de cata.

1.8.2 De dónde viene cada bloque (matriz completa, 52 filas)

Bloque químico Filas Muestras base Evaluadores promedio
GC-FID Pilsner 2 1 9.00
GC-FID Constanza (enero) 15 5 29.00
GC-FID Constanza (septiembre) 9 3 8.67
GC-MS comerciales 4 2 28.50
GC-MS noviembre 4 4 10.00
JU (cepas, cata individual) 18 6 1.00

Nótese la diferencia en “evaluadores promedio”: los 5 bloques de cata de panel promedian entre 8 y 29 evaluadores por muestra, mientras que el bloque JU tiene 1 evaluador por muestra — es justamente esa diferencia de margen de error la que motiva tratarlo como escenario de sensibilidad y no como parte de la matriz principal. El efecto real de esto sobre el desempeño del modelo (¿cambia la predicción al agregar esta cata?) ## Matriz 6 — IA exploratoria (M_ia_exploratoria)

La Matriz 6 corresponde a un escenario exploratorio construido a partir de la Matriz 3, que contiene información química sin cata sensorial real asociada. Aunque la Matriz 3 posee 63 filas, estas no representan 63 muestras físicas distintas, sino réplicas analíticas de laboratorio correspondientes a 24 muestras físicas únicas. Por ejemplo, una misma muestra, como “Malta 1”, puede haber sido medida químicamente más de una vez, generando varias filas en la matriz, aunque todas correspondan a la misma muestra física.

Por esta razón, no sería metodológicamente adecuado solicitar a un modelo de lenguaje que estime un perfil sensorial distinto para cada réplica de laboratorio, ya que dichas réplicas no representan muestras diferentes. En cambio, la estimación se realiza sobre las 24 muestras físicas únicas, utilizando un consenso entre tres modelos de lenguaje: Gemini, Claude y GPT. Cada modelo estima el perfil sensorial de las muestras a partir de su composición química y de reglas generales reportadas en la literatura sobre relaciones entre familias químicas y percepción sensorial.

El resultado de este procedimiento corresponde a una estimación sensorial sintética, de carácter exploratorio y complementario. Esta estimación no reemplaza una cata real, ni debe mezclarse con los datos sensoriales experimentales sin declarar explícitamente su origen. Una vez obtenido el consenso para cada una de las 24 muestras físicas únicas, el valor estimado se intenta asignar a las réplicas analíticas de la misma muestra dentro de las 63 filas químicas de la Matriz 3, de modo que las réplicas de una muestra física comparten el mismo puntaje sintético (mismo criterio que se usa con la cata real). Esa asignación no siempre es posible: como se detalla en “Qué tan útil resultó el consenso IA, por bloque químico” más abajo, solo 42 de las 63 filas químicas (67%) terminan recibiendo una estimación sintética utilizable; las 21 filas restantes (33%), pertenecientes a bloques químicos sin una interpretación aromática suficientemente directa, quedan sin estimación en vez de forzar un valor arbitrario. Por eso M_ia_exploratoria como matriz final de modelamiento tiene 42 filas, no 24: el número de 24 corresponde a las muestras físicas únicas sobre las que se generó el consenso IA (un perfil sensorial sintético por muestra), mientras que el número de 42 corresponde a las filas químicas de la Matriz 3 que efectivamente heredan una estimación utilizable, una vez que ese perfil por muestra se propaga a sus réplicas analíticas y se descartan las que caen en bloques no estimables. Ambos números son correctos, pero miden cosas distintas (muestras físicas vs. filas químicas modelables) y no deben confundirse entre sí ni con el tamaño de la matriz de modelamiento.

1.8.3 Cuántos datos aporta cada modelo de IA

Modelo de IA Filas generadas (3 réplicas × 24 muestras)
Claude 72
Gemini 72
GPT 72

Cada modelo de lenguaje generó 3 corridas independientes sobre las 24 muestras físicas únicas, dando un total de 72 estimaciones por modelo. Considerando los tres modelos utilizados, el conjunto inicial contiene:

3 modelos × 3 corridas × 24 muestras = 216 estimaciones El consenso se construye en dos etapas. Primero, se consolida internamente cada modelo a partir de sus tres corridas, evitando tratarlas como opiniones completamente independientes. Luego, se calcula un consenso final entre los tres modelos ya consolidados. De esta forma, el resultado final queda reducido a 24 perfiles sensoriales sintéticos, uno por cada muestra física única. Posteriormente, estos perfiles se asignan a las 63 filas químicas según la muestra física correspondiente.

1.8.4 Qué tan útil resultó el consenso IA, por bloque químico

Las 24 muestras con consenso IA se cruzaron con las 63 unidades químicas sin cata de la Matriz 3. Sin embargo, no todas las unidades pudieron recibir una estimación sensorial útil. El consenso IA solo se considera aprovechable cuando existe evidencia química suficiente para inferir un perfil aromático de manera razonable. Cuando la información química no permite una interpretación sensorial mínima, la unidad se clasifica como no_estimable, dejando el target vacío y evitando asignar un valor arbitrario.

Bloque químico Unidades Modelables con IA No estimables
Fenoles totales (malta) 24 24 0
GC-MS comerciales 8 0 8
GC-MS experimentales 10 0 10
JU (cepas fermentativas) 21 18 3

El patrón observado muestra una diferencia clara entre bloques químicos: fenoles totales y JU resultan mayoritariamente modelables, ya que corresponden a variables agregadas y más fáciles de interpretar desde una lógica química-sensorial. En cambio, los bloques de GC-MS comerciales y GC-MS experimentales quedan completamente clasificados como no_estimable, debido a que su información corresponde a composiciones porcentuales de numerosos compuestos por cromatograma, sin una clasificación aromática suficientemente directa para asignar un puntaje sensorial confiable. En total, de las 63 unidades químicas sin cata, 42 unidades (67%) pudieron recibir una estimación sintética mediante consenso IA, mientras que 21 unidades (33%) se mantuvieron sin estimación para evitar asignar valores arbitrarios donde la evidencia química no era suficiente.

1.9 Clasificación de compuestos GC-MS por familia química

Las variables x_gcms_esteres_pct, x_gcms_fenolicos_pct y x_gcms_aldehidos_pct se calculan agrupando los compuestos detectados por GC-MS según su familia química. El archivo de la sesión de noviembre trae esa familia explícita (columna nature), pero los archivos de Constanza (bloques gcms_constanza_comerciales y gcms_constanza_experimentales, 22 unidades) son reportes crudos de librería NIST/Wiley — solo traen nombre de compuesto, no familia — por lo que esas tres variables quedaban en 0 exacto para esas unidades.

Se construyó un clasificador por nombre de compuesto (scripts/R/procesamiento/02b_clasificar_compuestos_gcms.R, integrado a 02_extraer_quimica.R), con reglas basadas en sufijos y patrones de nomenclatura química (tipo IUPAC: ésteres terminados en “-oato”/“-ato”/“ester”, aldehídos en “-anal”/“-enal”, fenólicos que contienen “phenol/cresol/guaiacol”, hidrocarburos en “-ano”/“-eno”, siloxanos como contaminante de columna, etc.), validado al 100% contra los 24 compuestos de noviembre que sí tienen familia real. Esta clasificación ya está incorporada al cálculo real de las variables químicas usadas en el modelamiento. Cabe declarar explícitamente el tamaño de este conjunto de validación: 24 compuestos es una muestra pequeña, y el 100% de acierto sobre ella no garantiza el mismo desempeño sobre los 968 compuestos de Constanza a los que se aplicó el clasificador (ver más abajo). Por eso las variables GC-MS derivadas de esta clasificación se tratan, en las conclusiones de la tesis, con mayor cautela que las variables GC-FID (que provienen de una cuantificación directa por compuesto, sin este paso de clasificación por nombre); el análisis de sensibilidad de la sección “Sensibilidad a la imputación de variables GC-MS” (Parte 4) es, en parte, una respuesta a esta misma incertidumbre.

1.9.1 Reglas de clasificación utilizadas

Cada compuesto se clasifica evaluando estas reglas en orden, y se asigna a la primera familia que calce con su nombre:

Orden Familia Qué busca en el nombre Variable final
1 Siloxano (contaminante de columna) Contiene “silox” Excluido del área válida
2 Ftalato (contaminante/plastificante) Contiene “phthalate” o “ftalato” Descartado (contaminante)
3 Fenólico Contiene “phenol”, “cresol”, “guaiacol”, “creosol”, “syringol” o “catechol” x_gcms_fenolicos_pct
4 Éster Contiene “ester”, o termina en “-ato” (ej. “-oato”, “-acetate”) x_gcms_esteres_pct
5 Aldehído Contiene “aldehyde”, o termina en “-anal”/“-enal” x_gcms_aldehidos_pct
6 Ácido carboxílico Contiene “acid” No usado en el modelo actual
7 Alcohol Contiene “alcohol”, o termina en “-anol”/“-enol” No usado en el modelo actual
8 Cetona Contiene “ketone”, o termina en “-anone”/“-enone” No usado en el modelo actual
9 Tiol Contiene “thiol” o “mercaptan” No usado en el modelo actual
10 Hidrocarburo aromático Contiene “benzene”, “toluene”, “styrene”, “naphthalene”, “xylene” o “phenyl” No usado en el modelo actual
11 Hidrocarburo (alcano/alqueno) Termina en “-ano”/“-eno” (ej. “-ane”, “-ene”) No usado en el modelo actual

1.9.2 Qué tan bien funcionó la clasificación

Indicador Valor
Compuestos con familia real conocida (sesión noviembre) 24
Compuestos clasificados por nombre (sesión Constanza) 968
Precisión del clasificador (validado contra la familia real) 100%
Unidades químicas recalculadas con la nueva clasificación 11
Familias químicas distintas detectadas en total 11

El clasificador se validó comparando sus resultados contra los 24 compuestos de la sesión de noviembre, que sí traían la familia química real asignada por el equipo, acertando en el 100% de los casos. Con esa confianza, pero reconociendo que el conjunto de validación es pequeño (24 compuestos) frente al conjunto donde efectivamente se aplica (968 compuestos de la sesión Constanza), se usó el clasificador para recalcular 11 unidades químicas que antes quedaban sin clasificar. Un 100% de acierto en 24 casos no es lo mismo que un 100% de acierto garantizado en 968: es razonable esperar que la precisión real sobre Constanza sea alta (las reglas son de nomenclatura química general, no ajustadas a los 24 compuestos de validación), pero no hay evidencia directa que la cuantifique con la misma certeza que en el conjunto de noviembre. Esta es la razón por la que las variables GC-MS de Constanza se declaran con mayor incertidumbre que las variables GC-FID en las conclusiones de la tesis.

1.9.3 Compuestos por familia y fuente

fuente familia_asignada n_compuestos_unicos
gcms_constanza (comerciales + experimentales) Ester 289
gcms_constanza (comerciales + experimentales) Sin clasificar 233
gcms_constanza (comerciales + experimentales) Hidrocarburo (alcano/alqueno) 160
gcms_constanza (comerciales + experimentales) Hidrocarburo aromatico 97
gcms_constanza (comerciales + experimentales) Acido carboxilico 49
gcms_constanza (comerciales + experimentales) Alcohol 47
gcms_constanza (comerciales + experimentales) Aldehido 27
gcms_constanza (comerciales + experimentales) Siloxano (contaminante de columna) 22
gcms_constanza (comerciales + experimentales) Cetona 21
gcms_constanza (comerciales + experimentales) Fenolico (fenoles, cresoles, guaiacoles) 19
gcms_constanza (comerciales + experimentales) Tiol 4
gcms_noviembre Ester 16
gcms_noviembre Hidrocarburo (alcano/alqueno) 4
gcms_noviembre Hidrocarburo aromatico 2
gcms_noviembre Aldehido 1
gcms_noviembre Fenolico (fenoles, cresoles, guaiacoles) 1

1.9.4 Detalle compuesto → familia → variable final (muestra)

Se muestran ejemplos por familia; la tabla completa (~990 compuestos) está en data/procesamiento/clasificacion_compuestos_gcms.xlsx, hoja 02_compuestos_clasificados.

fuente compound_name familia_original_nature familia_asignada variable_final_propuesta
gcms_constanza (comerciales + experimentales) 1-Methyl-7-azabicyclo[4.1.0]hepta-2,4-diene-7-carboxylic acid, 3,17-diacetoxy-4,4,10,13-tetramethylhexadecahydrocyclopenta[a]phenanthrene NA Acido carboxilico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 10,12,14-Nonacosatriynoic acid NA Acido carboxilico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 10,12-Tricosadiynoic acid, TMS derivative NA Acido carboxilico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (4-Isopropyl-1-methyl-6,7-dimethylenebicyclo[3.2.1]oct-8-yl)methanol NA Alcohol no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (t-Butyl-dimethylsilyl)[2-methyl-2-(4-methyl-pent-3-enyl)-cyclopropyl]-methanol NA Alcohol no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1,2-Benzenedimethanol NA Alcohol no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 10-Octadecenal NA Aldehido x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) 12-Octadecenal NA Aldehido x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) 14-Octadecenal NA Aldehido x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) 1H-2-Indenone,2,4,5,6,7,7a-hexahydro-3-(1-methylethyl)-7a-methyl NA Cetona no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 2’-Hydroxybutyrophenone, TMS derivative NA Cetona no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 2’-Hydroxypropiophenone, TMS derivative NA Cetona no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (-)-1-Methylbutyl decanoate NA Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) (5á)Pregnane-3,20á-diol, 14à,18à-[4-methyl-3-oxo-(1-oxa-4-azabutane-1,4-diyl)]-, diacetate NA Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) (E)-9-Octadecenoic acid ethyl ester NA Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_constanza (comerciales + experimentales) 2,4-Di-tert-butylphenol NA Fenolico (fenoles, cresoles, guaiacoles) x_gcms_fenolicos_pct
gcms_constanza (comerciales + experimentales) 2,4-Di-tert-butylthiophenol NA Fenolico (fenoles, cresoles, guaiacoles) x_gcms_fenolicos_pct
gcms_constanza (comerciales + experimentales) 4-Isopropylphenol, TMS derivative NA Fenolico (fenoles, cresoles, guaiacoles) x_gcms_fenolicos_pct
gcms_constanza (comerciales + experimentales) (1R,2R,5R,E)-7-Ethylidene-1,2,8,8-tetramethylbicyclo[3.2.1]octane NA Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) .psi.,.psi.-Carotene, 1,1’,2,2’-tetrahydro-1,1’-dimethoxy- NA Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1,3,5,7-Cyclooctatetraene NA Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (4,4-Diphenyl-butyl)-(3-phenyl-piperidin-4-yl)-amine NA Hidrocarburo aromatico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (E)-1-(2,3,6-trimethylphenyl)buta-1,3-diene (TPB, 1) NA Hidrocarburo aromatico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1, 1, 5-Trimethyl-1, 2-dihydronaphthalene NA Hidrocarburo aromatico no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1,1,3,3,5,5,7,7,9,9-Decamethyl-9-(2-methylpropoxy)pentasiloxan-1-ol NA Siloxano (contaminante de columna) ctrl_gcms_siloxano_pct (excluido del area valida)
gcms_constanza (comerciales + experimentales) 1,1,3,3,5,5,7,7-Octamethyl-7-(2-methylpropoxy)tetrasiloxan-1-ol NA Siloxano (contaminante de columna) ctrl_gcms_siloxano_pct (excluido del area valida)
gcms_constanza (comerciales + experimentales) 2-Trimethylsiloxy-6-hexadecenoic acid, methyl ester NA Siloxano (contaminante de columna) ctrl_gcms_siloxano_pct (excluido del area valida)
gcms_constanza (comerciales + experimentales) (1R,7S,E)-7-Isopropyl-4,10-dimethylenecyclodec-5-enol NA Sin clasificar no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (1aR,4S,7R,7aS,7bR)-1,1,4,7-Tetramethyl-1a,2,3,4,6,7,7a,7b-octahydro-1H-cyclopropa[e]azulen-4-ol NA Sin clasificar no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) (3S,3aR,3bR,4S,7R,7aR)-4-Isopropyl-3,7-dimethyloctahydro-1H-cyclopenta[1,3]cyclopropa[1,2]benzen-3-ol NA Sin clasificar no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1,3-Benzenedimethanethiol, 2TMS derivative NA Tiol no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 1-Hexanethiol, 2-ethyl- NA Tiol no clasificado en variable final actual
gcms_constanza (comerciales + experimentales) 2-Phenylethanethiol, TMS derivative NA Tiol no clasificado en variable final actual
gcms_noviembre Nonanal Aldehidos Aldehido x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct
gcms_noviembre 2-Methylbutyl octanoate Esters Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_noviembre 2-methyl butyl decanoate Esters Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_noviembre 3-Methylbutyl octanoate Esters Ester x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct
gcms_noviembre 2,4-Di-tert-butylphenol Phenols Fenolico (fenoles, cresoles, guaiacoles) x_gcms_fenolicos_pct
gcms_noviembre 2,6,10-Trimethyltridecane Hydrocarbon Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_noviembre 2,6-Dimethylundecane Hydrocarbon Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_noviembre 4,6-Dimethyldodecane  Hydrocarbon Hidrocarburo (alcano/alqueno) no clasificado en variable final actual
gcms_noviembre Benzene, 1,3-bis(1,1-dimethylethyl) Aromatic hydrocarbon Hidrocarburo aromatico no clasificado en variable final actual
gcms_noviembre Styrene Aromatic hydrocarbon Hidrocarburo aromatico no clasificado en variable final actual

1.9.5 Comparación: variables GC-MS antes vs. después de clasificar por nombre (unidades Constanza)

Recalculando x_gcms_esteres_pct, x_gcms_fenolicos_pct y x_gcms_aldehidos_pct con la clasificación por nombre, en vez de los ceros anteriores aparece señal real y sustancial: entre 50% y 87% de área asignable a ésteres, y hasta 6% a compuestos fenólicos, según la unidad.

bloque_id muestra_base n_compuestos esteres_pct_actual esteres_pct_reclasificado fenolicos_pct_actual fenolicos_pct_reclasificado aldehidos_pct_actual aldehidos_pct_reclasificado aroma_fermentativo_pct_reclasificado
gcms_constanza_comerciales C1 327 0 75.54 0 3.62 0 1.53 77.07
gcms_constanza_comerciales C2 255 0 82.14 0 2.93 0 1.29 83.43
gcms_constanza_comerciales C3 309 0 61.30 0 6.13 0 1.66 62.96
gcms_constanza_comerciales C4 320 0 82.38 0 2.46 0 0.78 83.16
gcms_constanza_comerciales C5 268 0 87.31 0 1.29 0 0.85 88.16
gcms_constanza_comerciales C6 297 0 79.78 0 2.40 0 0.73 80.51
gcms_constanza_experimentales XP1 268 0 67.41 0 0.55 0 0.25 67.66
gcms_constanza_experimentales XP2 331 0 50.29 0 0.73 0 0.50 50.80
gcms_constanza_experimentales XP3 218 0 65.81 0 0.33 0 0.15 65.95
gcms_constanza_experimentales XP4 262 0 70.11 0 0.54 0 0.16 70.27
gcms_constanza_experimentales XP5 265 0 59.07 0 0.70 0 0.30 59.37

2 - ANÁLISIS EXPLORATORIO DE DATOS

2.1 Marco metodológico del análisis exploratorio

Esta sección documenta la etapa de análisis exploratorio (EDA), aplicada sobre la matriz pura (M_pura, 34 filas) y sus componentes química y sensorial por separado. Se usó el marco clásico de 5 etapas de EDA (descriptivo, tipos de variable, datos ausentes, valores atípicos, correlación), complementado con técnicas específicas para small data:

  • Test de Dixon (Dixon, 1950, 1951; Rorabacher, 1991): detección de valores atípicos univariados apropiada para muestras pequeñas, donde tests basados en asintóticas (como Grubbs con n grande) son menos confiables.
  • T² de Hotelling y Q-residuals (Jackson & Mudholkar, 1979): detección de atípicos multivariados sobre los scores de componentes principales, considerando tanto la distancia dentro del subespacio PCA (T²) como fuera de él (Q).
  • ICC(1) de efectos aleatorios de una vía: concordancia entre catadores dentro de la categoría de catador, implementado directamente (sin paquete externo) para transparencia del cálculo.
  • PCA/biplot por bloque analítico (GC-FID, GC-MS, JU, Folin; y por sesión de cata en el lado sensorial), evitando mezclar bloques que no se solapan completamente.

2.2 Análisis exploratorio químico

indicador valor
Unidad de analisis quimica Unidad analitica quimica
Unidades analiticas quimicas totales 115
Unidades con cata confirmada 52
Unidades sin cata confirmada 63
Bloques quimicos 8
Grupos quimicos (tecnica analitica) 4
Variables quimicas detectadas 34
Uso de este analisis Analisis exploratorio de datos (EDA) no supervisado. No usa targets sensoriales.

2.2.1 Completitud de datos por bloque

Mapa de calor de completitud de variables químicas por bloque analítico

El mapa de completitud confirma que los vacíos de la matriz son principalmente estructurales y no errores de captura. Cada bloque analítico mide un conjunto distinto de variables: los bloques GC-FID concentran información en compuestos cuantificados por FID, los bloques GC-MS en variables derivadas de cromatografía de gases acoplada a espectrometría de masas, el bloque JU en variables fermentativas y el bloque Folin en fenoles totales. Por esta razón, no tendría sentido exigir que todos los bloques tengan datos en todas las columnas. Lo relevante es observar la completitud dentro de cada bloque. En ese sentido, GC-FID y GC-MS presentan alta cobertura en sus propias variables, mientras que JU muestra una cobertura más parcial en algunas variables específicas. Esta estructura justifica que el análisis exploratorio se realice por bloque y no como una matriz química única.

2.2.2 Distribuciones (histogramas y boxplots) por bloque

Los histogramas muestran la forma de cada variable (¿se concentra en un rango, o está dispersa? ¿hay más de un grupo de valores?) y los boxplots resumen lo mismo de forma más compacta, marcando como punto aparte cualquier valor que quede fuera de 1.5 veces el rango intercuartílico. Con tamaños de muestra tan chicos por bloque (entre 2 y 39 unidades), es normal que las distribuciones se vean discretas o con “huecos” en vez de curvas suaves — eso no es un error, es la consecuencia directa de trabajar en un contexto de small data.

2.2.2.1 Histogramas

El histograma de fenoles totales muestra una distribución amplia, con valores concentrados principalmente entre rangos intermedios, pero también con grupos de muestras en valores bajos y altos. Esto indica que las muestras no presentan un nivel homogéneo de fenoles totales, sino que existe variabilidad química relevante entre ellas. La mayor parte de los valores se ubica aproximadamente en la zona media de la distribución, mientras que algunos casos aparecen bastante más bajos o más altos. Esta dispersión es útil para el análisis, ya que los fenoles totales pueden relacionarse con diferencias en carácter fenólico, tostado, amaderado o potencialmente ahumado.

Los histogramas del bloque GC-FID muestran comportamientos distintos entre compuestos. Algunos, como guaiacol, 4-ethyl guaiacol, o-cresol y p-cresol, tienen muchas observaciones concentradas en valores muy bajos y pocos casos con concentraciones más altas, lo que sugiere que estos compuestos no aparecen con la misma intensidad en todas las muestras. En cambio, varios ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl octanoate e isoamyl acetate, presentan rangos más amplios y distribuciones más dispersas. Esto refleja que el bloque GC-FID captura diferencias relevantes entre perfiles químicos, especialmente en compuestos asociados a familias fenólicas y fermentativas.

Los histogramas del bloque GC-MS reflejan una mezcla entre variables químicas interpretables y variables de control del proceso cromatográfico. El área válida se concentra en valores altos, cercanos al 96–100%, lo que sugiere que en la mayoría de los casos gran parte de la señal fue considerada utilizable, mientras que la variable de siloxanos presenta mayor dispersión, con algunos valores altos que podrían indicar ruido instrumental o contaminación de columna. En particular, el número de compuestos detectados muestra una diferencia marcada entre un grupo cercano a 600 y otros casos considerablemente más bajos, lo que refleja diferencias entre las distintas fuentes de datos GC-MS. Las variables de ésteres y aroma fermentativo presentan distribuciones con rangos amplios, mientras que los fenólicos se concentran mayoritariamente en valores bajos, por lo que estas últimas deben interpretarse como señales químicas puntuales dentro del bloque y no como un patrón dominante.

Los histogramas del bloque JU reflejan alta variabilidad entre variables fermentativas. La producción de etanol, la pérdida final de CO₂ y el consumo de maltosa muestran distribuciones amplias, lo que sugiere diferencias importantes entre condiciones experimentales de fermentación. En particular, el consumo de maltosa aparece dividido entre valores bajos y valores cercanos al máximo, lo que podría indicar fermentaciones con distinto grado de avance o eficiencia. Los ésteres del bloque JU presentan distribuciones más discretas y, en algunos casos, con pocos valores disponibles, por lo que deben interpretarse como señales exploratorias del perfil fermentativo y no como patrones concluyentes.

2.2.2.2 Boxplots

El boxplot de fenoles totales muestra una mediana ubicada en un rango intermedio, con una dispersión considerable entre muestras. La caja concentra la mayor parte de los valores aproximadamente entre niveles medios y altos, mientras que aparece un valor bajo marcado como atípico según la regla IQR. Este punto no debe interpretarse automáticamente como error, ya que puede corresponder a una muestra con menor contenido real de fenoles totales. En este estudio, el valor se documenta como atípico, pero se mantiene en la matriz para no alterar artificialmente la variabilidad química observada.

Los boxplots del bloque GC-FID muestran varios valores atípicos, especialmente en compuestos fenólicos como 4-ethyl guaiacol, guaiacol, o-cresol y p-cresol, además de algunos ésteres como ethyl hexadecanoate, ethyl octanoate e isoamyl octanoate. Esto indica que ciertas muestras tienen concentraciones químicas claramente distintas respecto del grupo central. En algunos compuestos, la mayoría de los valores se concentra cerca de cero y solo unas pocas muestras presentan valores elevados, lo que explica la aparición de atípicos. Dado que son mediciones químicas reales y el tamaño muestral es reducido, estos puntos se conservan y se interpretan como posibles señales diferenciadoras entre muestras, no como datos a eliminar automáticamente.

Los boxplots del bloque GC-MS muestran atípicos en variables de control y resumen, como siloxanos, área válida y número de compuestos detectados. En particular, la variable de siloxanos presenta valores extremos altos y bajos, lo que refuerza su utilidad como indicador de ruido instrumental o contaminación cromatográfica. El número de compuestos detectados también muestra una separación fuerte, probablemente asociada a diferencias entre fuentes de datos GC-MS. Las variables de ésteres y aroma fermentativo presentan rangos amplios, mientras que los fenólicos muestran un valor alto marcado como atípico. En conjunto, estos resultados indican que el bloque GC-MS debe interpretarse con cautela, distinguiendo entre señales químicas de interés y variables asociadas a la calidad del cromatograma.

Los boxplots del bloque JU muestran que varias variables fermentativas tienen rangos amplios, especialmente producción de etanol, pérdida de CO₂, consumo de maltosa y ethyl octanoate. También aparecen valores atípicos puntuales en algunos ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate. Estos casos pueden representar condiciones experimentales específicas donde ciertos compuestos se produjeron en mayor proporción. En lugar de eliminarse, estos valores se mantienen como parte de la variabilidad del proceso fermentativo, ya que podrían ser relevantes para explicar diferencias químicas entre muestras.

Estos gráficos son el primer filtro visual para detectar candidatos a valor atípico, que luego se confirman formalmente con el test de Dixon en la siguiente sección.

2.2.3 Valores atípicos: resumen clásico + test de Dixon

variable_quimica n_outliers
ctrl_gcms_siloxano_pct 6
x_gcfid_ethyl_hexadecanoate_ppm 6
x_gcfid_o_cresol_ppm 6
x_gcfid_p_cresol_ppm 6
x_gcms_area_valida_pct 6
x_gcfid_4_ethyl_guaiacol_ppm 5
x_gcfid_guaiacol_ppm 5
n_compuestos_detectados 4
x_gcfid_creosol_ppm 4
x_folin_fenoles_totales_ug_ag_ml 3
x_gcfid_ethyl_octanoate_ppm 3
x_gcfid_isoamyl_octanoate_ppm 2
x_gcms_fenolicos_pct 1
x_ju_ethyl_decanoate_ppm 1
x_ju_ethyl_dodecanoate_ppm 1
x_ju_ethyl_hexadecanoate_ppm 1
x_ju_ethyl_myristate_ppm 1
es_outlier_dixon n_variables
sin_outlier 17
outlier_detectado 13

2.2.4 Correlación entre variables químicas

Estos mapas de calor muestran la correlación de Pearson entre pares de variables dentro de cada bloque (no existe un mapa único global porque, como se vio en completitud, las variables de distintos bloques casi no comparten unidades para calcular una correlación válida). Sirven para anticipar colinealidad antes de modelar.

El mapa de correlación GC-FID muestra asociaciones importantes entre varios compuestos. Destaca la relación positiva entre 4-ethyl guaiacol y guaiacol, así como entre guaiacol y algunos cresoles, lo que sugiere que ciertos compuestos fenólicos tienden a variar de manera conjunta. También se observan correlaciones positivas entre varios ésteres, como ethyl decanoate, ethyl tetradecanoate e isoamyl octanoate, indicando posibles patrones compartidos dentro de la fracción fermentativa o aromática. Al mismo tiempo, aparecen correlaciones negativas relevantes, por ejemplo entre isoamyl acetate y ethyl dodecanoate, o entre furfural y algunos compuestos fenólicos. Esto confirma que las variables GC-FID no son independientes entre sí y que el modelamiento posterior debe considerar la colinealidad.

El mapa de correlación GC-MS muestra relaciones muy fuertes entre algunas variables, varias de ellas esperables por construcción. Por ejemplo, x_gcms_esteres_pct y x_gcms_aroma_fermentativo_pct presentan correlación perfecta, ya que el aroma fermentativo incluye directamente a los ésteres dentro de su cálculo. También destaca la correlación negativa perfecta entre siloxanos y área válida, lo que indica que cuando aumenta la proporción asociada a siloxanos disminuye la proporción de área considerada útil. Además, aldehídos y fenólicos muestran una correlación positiva alta, mientras que el área válida se relaciona positivamente con ésteres y aroma fermentativo. En conjunto, el bloque GC-MS combina variables químicas con variables de control de calidad de señal, por lo que sus correlaciones deben interpretarse considerando cómo fueron construidas.

El mapa de correlación JU muestra una estructura interna muy marcada. Las variables asociadas a producción de etanol, pérdida de CO₂ y consumo de maltosa presentan correlaciones positivas altas, lo que es coherente con su relación directa dentro del proceso fermentativo. También se observan correlaciones muy fuertes entre varios ésteres de cadena larga, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate, lo que sugiere que estos compuestos tienden a aumentar o disminuir conjuntamente. En contraste, algunos cresoles presentan correlaciones negativas con variables fermentativas y con ciertos ésteres. Esto indica que el bloque JU no contiene variables aisladas, sino grupos de variables que representan procesos químicos conectados, aspecto que debe considerarse en el modelamiento para evitar interpretar señales redundantes como independientes.

Pares con correlación muy alta (por ejemplo, distintos ésteres de una misma familia química que suben y bajan juntos) son la razón por la que en el modelamiento se prefieren métodos regularizados (Ridge, PLS) en vez de una regresión lineal múltiple simple.

2.2.5 Componentes principales (PCA/biplot) y atípicos multivariados (T²/Q-residual)

grupo_pca estado n_filas n_variables pc1_varianza pc2_varianza pc1_pc2_varianza motivo t2_n_comp t2_limite q_limite
Fenoles_totales no_calculado 24 1 NA NA NA Se requieren al menos 3 filas y 2 variables con variabilidad. NA NA NA
GCFID calculado 26 13 0.3632469 0.2744804 0.6377273 NA 2 7.089221 12.736922
GCMS calculado 26 7 0.6427447 0.2291118 0.8718565 NA 2 7.089221 2.579909
JU calculado 39 13 0.4468083 0.1983791 0.6451874 NA 2 6.679627 10.798231

La tabla muestra que el PCA no se calculó para el bloque de fenoles totales, ya que este bloque contiene solo una variable útil y el análisis de componentes principales requiere al menos dos variables. En los demás bloques, los dos primeros componentes resumen una proporción importante de la variabilidad: 63,8% en GC-FID, 87,2% en GC-MS y 64,5% en JU. Esto indica que, aunque cada bloque tiene varias variables químicas, una parte relevante de la estructura de los datos puede representarse en un plano bidimensional. Por esta razón, los biplots permiten visualizar de forma resumida qué variables empujan la separación entre muestras y qué unidades quedan más alejadas del grupo principal.

En el biplot del bloque GC-FID, el primer componente principal separa principalmente variables fenólicas ubicadas hacia la izquierda, como guaiacol, 4-ethyl guaiacol y o-cresol, de otras variables ubicadas hacia la derecha, como creosol, furfural y ethyl hexadecanoate. El segundo componente está fuertemente influido por isoamyl acetate, que aparece aislado hacia la parte superior, mientras que varios ésteres de cadena más larga, como ethyl decanoate, ethyl dodecanoate, ethyl tetradecanoate e isoamyl octanoate, se proyectan hacia la zona inferior. Esto sugiere que el bloque GC-FID distingue al menos tres patrones químicos: uno asociado a compuestos fenólicos, otro a ésteres de cadena larga y otro a isoamyl acetate. Las muestras se agrupan en zonas diferenciadas del plano, lo que indica que no todas presentan el mismo perfil químico dentro de este bloque.

En el biplot GC-MS, el primer componente principal explica la mayor parte de la variabilidad del bloque y separa claramente las variables asociadas a área válida, ésteres y aroma fermentativo respecto de variables de control como siloxanos y número de compuestos detectados. Las variables x_gcms_esteres_pct y x_gcms_aroma_fermentativo_pct aparecen prácticamente superpuestas, lo que es esperable porque el aroma fermentativo incluye a los ésteres dentro de su cálculo. Por otra parte, aldehídos y fenólicos se proyectan juntos hacia la zona superior, indicando que tienden a variar en una dirección similar dentro de este bloque. La disposición de las muestras muestra algunos casos alejados hacia la derecha, asociados a mayor peso de siloxanos o número de compuestos detectados, por lo que este PCA refleja tanto diferencias químicas como diferencias en la calidad o estructura del cromatograma.

En el biplot del bloque JU se observa una separación clara entre grupos de variables fermentativas. Hacia la zona inferior derecha se agrupan variables directamente asociadas al avance de la fermentación, como producción de etanol, pérdida final de CO₂ y consumo de maltosa, lo que confirma que estas variables representan una señal común del proceso fermentativo. Hacia la zona superior derecha se proyectan varios ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate, indicando que estos compuestos tienden a comportarse de forma conjunta. En cambio, o-cresol, p-cresol e isoamyl acetate se ubican hacia la izquierda, sugiriendo un comportamiento distinto respecto del grupo principal de ésteres y variables fermentativas. Este resultado muestra que el bloque JU no solo captura intensidad fermentativa, sino también diferencias internas entre familias de compuestos.

Sobre esos mismos componentes se calcula la distancia T² de Hotelling (qué tan lejos está una unidad del centro, dentro del plano de los componentes usados) y el Q-residual (qué tan mal representada queda esa unidad por esos componentes) — el complemento multivariado al test de Dixon univariado.

En el gráfico T²–Q residual del bloque GC-FID, la mayoría de las unidades queda dentro de los límites multivariados definidos al 95%, lo que indica que son razonablemente representadas por los componentes principales calculados. Sin embargo, las dos réplicas de la muestra Pilsner H76R1R2 aparecen por sobre el límite de Q-residual. Esto significa que no son necesariamente las más lejanas dentro del plano PCA, pero sí quedan mal representadas por los componentes principales usados. En términos prácticos, estas réplicas presentan una estructura química particular que el PCA no logra resumir completamente, por lo que se documentan como candidatas a atípicos multivariados, sin eliminarlas de la matriz.

En el bloque GC-MS, la mayoría de las unidades se mantiene dentro de los límites de T² de Hotelling y Q-residual. No obstante, la muestra gcms_constanza_experimentales__xp2_r1 queda fuera de ambos límites, lo que indica un comportamiento multivariado claramente distinto al resto. Al superar el límite de T², la muestra se ubica lejos del centro del espacio PCA; al mismo tiempo, al superar el límite de Q-residual, también queda mal representada por los componentes principales retenidos. Por lo tanto, esta unidad debe considerarse un caso atípico multivariado relevante dentro del bloque GC-MS. Aun así, se mantiene en la matriz y se documenta para revisión posterior, ya que puede reflejar una diferencia real de composición o de calidad cromatográfica.

En el bloque JU se observa una mayor cantidad de unidades fuera de los límites multivariados. La muestra ju_260507_quimica_cepas__m1_r1 destaca por superar ampliamente el límite de T² de Hotelling, lo que indica que se encuentra muy alejada del centro del espacio PCA, aunque no presenta un Q-residual elevado. Esto sugiere que es una muestra extrema, pero bien representada por los componentes principales. En cambio, otras unidades, como sc476_1e_r1, sc481_3e_r1, b1_1_r1, 705_1_r1 y 815_3_r1, superan principalmente el límite de Q-residual, lo que indica que sus perfiles no quedan bien resumidos por el plano PCA. En conjunto, estos resultados muestran que el bloque JU tiene una estructura interna más heterogénea, probablemente asociada a diferencias reales entre cepas o condiciones fermentativas.

En conjunto, los análisis PCA y T²–Q residual permiten identificar patrones multivariados que no siempre son visibles en los análisis univariados. GC-FID muestra diferencias asociadas principalmente a compuestos fenólicos y ésteres; GC-MS combina señales químicas con variables de control cromatográfico; y JU presenta una estructura marcada por variables fermentativas y producción de ésteres. Los casos que superan los límites de T² o Q-residual se consideran unidades candidatas a revisión, pero no se eliminan automáticamente, ya que en un contexto de small data pueden representar diferencias químicas reales entre muestras. Por lo tanto, estos gráficos se utilizan como evidencia exploratoria para documentar perfiles particulares y orientar la interpretación del modelamiento posterior.

El detalle completo de las unidades que superan estos límites se muestra en la siguiente tabla:

grupo_pca unidad_analitica_id bloque_id muestra_base t2_hotelling excede_t2 q_residual excede_q
GCFID alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r2 alexandra_260603_pilsner_gcfid Pilsner_H76R1R2 2.0242056 FALSE 23.647634 TRUE
GCFID alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r1 alexandra_260603_pilsner_gcfid Pilsner_H76R1R2 0.7192313 FALSE 22.686269 TRUE
GCMS gcms_constanza_experimentales__xp2_r1 gcms_constanza_experimentales XP2 7.7781919 TRUE 5.589873 TRUE
JU ju_260507_quimica_cepas__m1_r1 ju_260507_quimica_cepas M1 29.4083893 TRUE 3.183925 FALSE
JU ju_260507_quimica_cepas__sc476_1e_r1 ju_260507_quimica_cepas SC476_1e 4.6504401 FALSE 31.028108 TRUE
JU ju_260507_quimica_cepas__705_1_r1 ju_260507_quimica_cepas 705.1 4.5737151 FALSE 21.783158 TRUE
JU ju_260507_quimica_cepas__b1_1_r1 ju_260507_quimica_cepas B1.1 3.4151925 FALSE 23.056589 TRUE
JU ju_260507_quimica_cepas__815_3_r1 ju_260507_quimica_cepas 815.3 2.2894972 FALSE 17.107556 TRUE
JU ju_260507_quimica_cepas__sc481_3e_r1 ju_260507_quimica_cepas SC481_3e 0.8398602 FALSE 27.525023 TRUE

2.3 Análisis exploratorio sensorial

indicador valor
Unidad individual sensorial Evaluacion individual de catador
Muestras sensoriales totales 23
Evaluaciones individuales totales 263
Evaluaciones con quimica confirmada 226
Evaluaciones sin quimica confirmada 37
Bloques sensoriales 5
Targets sensoriales detectados 34
Muestras sensoriales agregadas 23
Uso de este analisis Analisis exploratorio de datos (EDA), no usa predictores quimicos.
Advertencia metodologica Las evaluaciones individuales son reales, pero no equivalen a muestras quimicas independientes.

2.3.1 Completitud y distribuciones de los targets sensoriales

El mapa de completitud muestra que los datos faltantes en el bloque sensorial son principalmente estructurales. Esto ocurre porque cada sesión o formulario de cata evaluó un subconjunto distinto de descriptores, por lo que no todos los atributos están disponibles para todas las muestras. En este sentido, los vacíos no deben interpretarse como errores de registro, sino como diferencias propias del diseño de cada evaluación sensorial. La figura permite identificar qué targets tienen mayor cobertura entre sesiones y cuáles quedan restringidos a bloques específicos, aspecto importante antes de comparar o cruzar estos datos con las variables químicas.

Los histogramas muestran la distribución de los puntajes individuales asignados por los catadores a cada descriptor sensorial. En general, varios atributos se concentran en valores bajos e intermedios, lo que indica que no todas las notas sensoriales aparecen con alta intensidad en las muestras evaluadas. Sin embargo, atributos como ahumado, fenólico, medicinal, amaderado, terroso, regusto ahumado y complejidad presentan mayor dispersión, lo que sugiere diferencias perceptibles entre muestras y catadores. Estas distribuciones permiten identificar qué targets tienen variabilidad suficiente para aportar información en análisis posteriores y cuáles podrían tener menor poder explicativo por estar demasiado concentrados en pocos puntajes.

2.3.2 Distribuciones por sesión de cata

Los boxplots por bloque sensorial muestran que los puntajes de los atributos principales cambian según la sesión de cata. En variables como ahumado, fenólico, frutal y medicinal se observan diferencias en medianas y dispersión entre bloques, lo que indica que las evaluaciones no son completamente homogéneas entre sesiones. Esto puede deberse a diferencias en las muestras evaluadas, en el formulario utilizado o en el grupo de catadores. Por esta razón, los bloques sensoriales deben analizarse considerando su origen, evitando mezclar directamente sesiones que no midieron exactamente los mismos atributos bajo las mismas condiciones.

A nivel de muestra individual dentro de cada sesión (detalle en outputs/exploratorio/sensorial/04_boxplots_muestra_*), el patrón se repite: siempre hay una o dos muestras que se separan del resto en los atributos ahumado/fenólico/medicinal. El caso más claro es la cata social de enero 2025, que es también la única sesión que junta muestras comerciales (C1/Dalwhinnie, C2/Caol Ila) con las experimentales/locales (B1, C70, H76):

En la cata social de enero de 2025 se observa una mayor variabilidad entre muestras y catadores. La muestra 7 (C2/Caol Ila) destaca por presentar puntajes más altos en ahumado, fenólico y medicinal, lo que sugiere un perfil sensorial más marcado en atributos asociados a humo, compuestos fenólicos o notas medicinales. También se aprecia dispersión amplia en varias muestras, lo que es esperable en una cata social con distintos tipos de catadores. Esta figura muestra que algunas muestras fueron percibidas de forma más intensa y consistente, mientras que otras presentan evaluaciones más variables.

Las demás sesiones siguen el mismo patrón exploratorio con menor contraste: en cata_alexandra_260603 la percepción fenólica y de ahumado crece de la muestra 1 a la 4; en cata_septiembre_2024 la muestra 3 se percibe más intensa en ahumado, fenólico y frutal; en panel_noviembre la muestra 5 destaca en fenólico y las muestras 2/4/5 en frutal; y en sensorial_cepas_ju los puntajes son más acotados y con menor dispersión, por lo que ese bloque se trata como una señal exploratoria adicional y no como una caracterización sensorial robusta.

2.3.3 Correlación entre targets sensoriales

El mapa de correlación muestra que varios targets sensoriales están relacionados entre sí. Destacan asociaciones positivas entre atributos como ahumado, aroma ahumado, sabor ahumado, regusto ahumado, fenólico y medicinal, lo que indica que estos descriptores tienden a aumentar conjuntamente en las evaluaciones. Esto sugiere la presencia de una dimensión sensorial común asociada al carácter ahumado-fenólico del whisky. También se observan correlaciones entre atributos de sabor, aroma y regusto, aunque no todos los descriptores se relacionan con la misma intensidad. La presencia de valores NA se debe a que no todos los atributos fueron evaluados en todas las sesiones, por lo que estas correlaciones deben interpretarse como evidencia exploratoria y no como relaciones definitivas.

2.3.4 Categoría de catador: perfil y concordancia (ICC)

Esta sección usa el campo “categoría de catador” (experto/sommelier, aficionado al whisky, consumidor general de destilados), registrado en el cuestionario de cada cata. Se usa para dos cosas: ver si el promedio de puntaje cambia según el tipo de catador, y medir qué tan de acuerdo están entre sí los catadores de una misma categoría.

Perfil por muestra y categoría: para cada muestra, categoría de catador y target sensorial se calcula el número de evaluaciones, el promedio y la desviación estándar. Por su tamaño (285 combinaciones muestra–categoría–target), se muestran solo las primeras filas a modo de ejemplo; el detalle completo está en data/procesamiento/analisis_sensorial.xlsx, hoja 16_perfil_categoria_catador.

grupo_sensorial bloque_sensorial muestra_cata identificador_sensorial categoria_catador target n_evaluaciones media desviacion_estandar
historico_enero cata_social_enero_2025 Muestra 1 C70 Aficionado al whisky y_ahumado_comun 7 2.1904762 1.0157490
historico_enero cata_social_enero_2025 Muestra 1 C70 Consumidor General de Destilados y_ahumado_comun 20 2.0666667 0.8207827
historico_enero cata_social_enero_2025 Muestra 1 C70 Experto/ Sommelier y_ahumado_comun 4 0.9166667 0.3191424
historico_enero cata_social_enero_2025 Muestra 1 C70 Aficionado al whisky y_aroma_ahumado 7 2.2857143 0.9511897
historico_enero cata_social_enero_2025 Muestra 1 C70 Consumidor General de Destilados y_aroma_ahumado 20 2.5000000 1.1002392
historico_enero cata_social_enero_2025 Muestra 1 C70 Experto/ Sommelier y_aroma_ahumado 4 1.0000000 0.0000000
historico_enero cata_social_enero_2025 Muestra 1 C70 Aficionado al whisky y_aroma_amaderado 7 1.7142857 1.4960265
historico_enero cata_social_enero_2025 Muestra 1 C70 Consumidor General de Destilados y_aroma_amaderado 19 1.7894737 0.9763280

Concordancia entre catadores (ICC): para saber si los catadores de una misma categoría puntúan de forma parecida entre sí (y no solo si su promedio es distinto), se calculó el ICC1 (coeficiente de correlación intraclase, modelo de un factor aleatorio) por categoría y target. Valores cercanos a 1 indican alta concordancia dentro del grupo; valores cercanos a 0 indican que incluso catadores de la misma categoría difieren bastante entre sí.

categoria_catador target icc1 n_muestras n_observaciones interpretacion
Experto/ Sommelier y_ahumado_comun 0.6000569 5 17 concordancia buena
Aficionado al whisky y_ahumado_comun 0.3750204 5 35 concordancia moderada
Consumidor General de Destilados y_ahumado_comun 0.2608232 5 93 concordancia moderada
Experto/ Sommelier y_fenolico_comun 0.7505654 5 17 concordancia excelente
Aficionado al whisky y_fenolico_comun 0.3427705 5 35 concordancia moderada
Consumidor General de Destilados y_fenolico_comun 0.2929327 5 93 concordancia moderada
Experto/ Sommelier y_medicinal_comun 0.4543738 5 17 concordancia moderada
Aficionado al whisky y_medicinal_comun 0.1442246 5 35 concordancia baja
Consumidor General de Destilados y_medicinal_comun 0.0993593 5 93 concordancia baja

Los boxplots por categoría de catador muestran que existen diferencias en la forma en que los grupos evaluaron los atributos principales. En ahumado, los consumidores generales de destilados presentan una distribución amplia, mientras que expertos/sommelier y aficionados al whisky muestran también alta variabilidad interna. En fenólico y medicinal se observan diferencias de mediana entre categorías, pero también una dispersión considerable dentro de cada grupo. Esto indica que la categoría del catador puede influir en la evaluación, aunque no permite establecer conclusiones firmes debido al tamaño reducido y al posible desbalance entre categorías. Por ello, esta variable se usa como referencia descriptiva del panel.

2.3.5 Perfiles sensoriales (radar) por muestra — caso destacado

Se generó un gráfico de radar por muestra y por dimensión sensorial (aroma, sabor, regusto final) para cada sesión de cata, automatizando lo que antes se armaba manualmente en Excel; el set completo está en outputs/exploratorio/sensorial/ (archivos 07_radar_*). Se muestra aquí la sesión social de enero 2025, por ser la única que compara directamente muestras comerciales (C1/Dalwhinnie, C2/Caol Ila) con las experimentales/locales (B1, C70, H76), lo que la hace la más ilustrativa del conjunto.

El radar de aroma de la cata social de enero de 2025 muestra una separación clara entre las muestras. C2/Caol Ila presenta el perfil aromático más amplio, destacando en intensidad de ahumado, medicinal, terroso, cereal, vainilla, café y amaderado. Esto es coherente con un whisky comercial de perfil más ahumado o intenso. C1/Dalwhinnie también muestra un perfil relativamente alto, aunque menor que C2. En cambio, B1, C70 y H76 presentan perfiles más moderados y cercanos entre sí. Este gráfico permite observar que las muestras comerciales se diferencian con claridad de las experimentales o locales en varios atributos aromáticos.

El radar de sabor de la cata social de enero de 2025 muestra que C2/Caol Ila presenta el perfil más intenso y amplio entre las muestras, especialmente en ahumado, medicinal, terroso, cereal, vainilla, frutal, café y sensación en boca. C1/Dalwhinnie aparece como una segunda muestra de perfil elevado, aunque menos extrema que C2. Las muestras B1, C70 y H76 presentan valores más bajos, con perfiles más compactos. Esto indica que el bloque de sabor permite separar con claridad las muestras comerciales de mayor intensidad sensorial respecto de las demás.

En el radar de regusto final de la cata social de enero de 2025, C2/Caol Ila vuelve a destacar con valores altos en ahumado, complejidad, duración e integración del ahumado. C1/Dalwhinnie también presenta un perfil amplio, aunque algo menor. Las muestras B1, C70 y H76 se ubican en rangos más bajos o intermedios, especialmente en ahumado y complejidad. Este patrón sugiere que las muestras comerciales no solo fueron percibidas como más intensas en aroma, sino también con un regusto más persistente y estructurado.

Las demás sesiones (cata_alexandra_260603, cata_septiembre_2024, panel_noviembre, sensorial_cepas_ju) siguen la misma lógica de análisis por muestra y confirman el mismo patrón general: siempre hay una o dos muestras que se distinguen del resto en intensidad ahumada/fenólica/medicinal, mientras que el bloque sensorial_cepas_ju en particular muestra señales más acotadas y debe interpretarse como exploratorio por su menor cantidad de evaluaciones.

2.3.6 Perfiles sensoriales por categoría de catador — caso destacado

De forma análoga, se generó un radar por categoría de catador (experto/sommelier, consumidor general, aficionado al whisky) para cada muestra, disponible en outputs/exploratorio/sensorial/ (archivos 08_radar_categoria_*). Se muestra C2/Caol Ila, donde la diferencia entre categorías es más marcada.

El radar de aroma de C2/Caol Ila muestra que los expertos/sommelier asignan puntajes claramente más altos que el resto de las categorías en casi todos los atributos, especialmente en intensidad de ahumado, medicinal, terroso, cereal, vainilla, frutal y café. Esto es coherente con un perfil comercial más marcado y complejo, probablemente más reconocible para catadores entrenados. Los consumidores generales y aficionados también perciben estas notas, pero con menor intensidad. El promedio queda por debajo del perfil experto, lo que indica que la lectura de C2/Caol Ila varía considerablemente según la experiencia del catador.

El radar de sabor de C2/Caol Ila muestra el perfil más intenso entre las muestras analizadas por categoría. Los expertos/sommelier asignan valores altos en intensidad de ahumado, cereal, vainilla, amaderado, sensación en boca y otros atributos, mostrando una lectura sensorial amplia de la muestra. Los consumidores generales y el promedio también presentan perfiles relativamente altos, aunque menos extremos. Los aficionados al whisky tienden a puntuar más bajo algunos atributos como medicinal, terroso y café. En conjunto, el gráfico confirma que C2/Caol Ila se diferencia por un sabor más intenso, complejo y marcado, especialmente en atributos ahumados y amaderados.

En el radar de regusto final de C2/Caol Ila, los expertos/sommelier vuelven a destacar con los puntajes más altos en duración, ahumado, complejidad, integración del ahumado, armonía y tomabilidad. Las demás categorías presentan perfiles más bajos y cercanos entre sí, aunque mantienen valores relativamente altos en comparación con otras muestras. Esto sugiere que C2/Caol Ila fue percibida como una muestra con regusto persistente y estructurado, especialmente por los catadores expertos. La diferencia entre categorías refuerza que el nivel de experiencia puede influir en la detección de atributos de final sensorial.

En las demás muestras (B1, C1/Dalwhinnie, C70, H76) la categoría de catador también influye, pero con diferencias más moderadas y sin un patrón tan marcado como en C2/Caol Ila: en general los expertos tienden a puntuar con mayor exigencia o detalle en atributos específicos (amaderado en C1/Dalwhinnie, sensación en boca en C70), mientras que consumidores generales y aficionados entregan perfiles más amplios pero menos diferenciados entre sí.

2.3.7 Componentes principales sensoriales y atípicos multivariados

** 09_biplot_pca_sensorial_cata_alexandra_260603 **

** 09_biplot_pca_sensorial_cata_septiembre_2024 **

** 09_biplot_pca_sensorial_cata_social_enero_2025 **

** 09_biplot_pca_sensorial_panel_noviembre **

** 09_biplot_pca_sensorial_sensorial_cepas_ju **

** 10_distancia_t2_q_cata_alexandra_260603 **

** 10_distancia_t2_q_cata_septiembre_2024 **

** 10_distancia_t2_q_cata_social_enero_2025 **

** 10_distancia_t2_q_panel_noviembre **

** 10_distancia_t2_q_sensorial_cepas_ju **

grupo_pca muestra_cata identificador_sensorial t2_hotelling excede_t2 q_residual excede_q
cata_septiembre_2024 Muestra 1 C70 1.333333 FALSE 0 TRUE
cata_septiembre_2024 Muestra 2 B1 1.333333 FALSE 0 TRUE
cata_septiembre_2024 Muestra 3 H76 1.333333 FALSE 0 TRUE

2.4 Cruce químico-sensorial

Esta sección cruza, de forma exploratoria y previa al modelamiento formal, los predictores químicos con los targets sensoriales, usando correlación de Pearson por pares (pairwise.complete.obs) y exigiendo al menos 5 pares con dato disponible para reportar un valor. Se usa el escenario M_pura (34 unidades con química real y cata real agregada), y no reemplaza el diagnóstico de colinealidad ni los modelos supervisados de la Parte 3 — es solo una primera mirada a qué variables podrían estar asociadas antes de entrar a esos análisis formales.

indicador valor
Escenario M_pura (quimica real + cata real agregada, evidencia principal)
Unidades analiticas (filas) 34
Predictores quimicos (x_*) 32
Targets sensoriales (y_*) 34
Targets principales y_frutal_comun, y_fenolico_comun, y_ahumado_comun, y_medicinal_comun
Uso de este analisis Vista exploratoria previa (EDA), no reemplaza el diagnostico de colinealidad ni el modelamiento supervisado.
Advertencia metodologica El VIF global no aplica por baja superposicion entre tecnicas analiticas (ver colinealidad_modelamiento.xlsx); esta hoja usa correlacion pareada simple, con n variable por par segun el bloque quimico disponible.

La tabla resume el escenario usado, los 32 predictores químicos evaluados y los 4 targets sensoriales principales considerados (y_frutal_comun, y_fenolico_comun, y_ahumado_comun, y_medicinal_comun).

2.4.1 Heatmap general: predictores químicos vs. targets principales

Este heatmap cruza los 32 predictores químicos contra los 4 targets principales. Las celdas en blanco indican que ese par no alcanzó el mínimo de 5 observaciones simultáneas para calcular una correlación confiable. Por eso solo aparecen valores para predictores de GC-FID (49 pares evaluados) y GC-MS (5 pares); los predictores de JU y Folin casi no se solapan con las unidades que tienen cata real dentro de M_pura y por lo tanto no alcanzan ese mínimo. Dentro de lo que sí se puede leer, destacan los fenoles volátiles de GC-FID — guaiacol, o-cresol, p-cresol y 4-etil-guaiacol — con correlaciones altas (r ≈ 0.7–0.9) tanto con y_ahumado_comun como con y_fenolico_comun, coherente con que estas mismas variables terminan siendo los predictores prioritarios en el modelamiento (Parte 4).

2.4.2 Heatmaps por bloque analítico

Como los bloques químicos no comparten unidades analíticas entre sí (ver completitud, sección 2.2.1), conviene además mirar cada bloque por separado en vez de solo el heatmap combinado.

El bloque GC-FID es el que más cobertura aporta a este cruce (todos sus predictores alcanzan el mínimo de pares frente a los 4 targets principales). Se confirma el mismo patrón que en el heatmap general: los fenoles volátiles correlacionan fuerte y positivamente con ahumado/fenólico/medicinal, mientras que varios ésteres (isoamyl octanoate, ethyl dodecanoate, ethyl decanoate, furfural) muestran su correlación más alta con y_frutal_comun en vez de con el carácter ahumado.

El bloque GC-MS solo alcanza el mínimo de pares frente a y_fenolico_comun (5 pares), por lo que es el único target con celda calculada para este bloque. El área válida y los ésteres/aroma fermentativo correlacionan negativamente con el fenólico (r ≈ -0.6 a -0.75), mientras que fenólicos y aldehídos correlacionan positivamente (r ≈ 0.55–0.59). Dado que son solo 5 pares, esta lectura es referencial y no debe compararse en fuerza con los resultados de GC-FID, que tienen bastante más respaldo muestral.

El bloque JU no genera un heatmap propio en este cruce: por definición, M_pura excluye la cata individual JU (ver Matriz 1 en la Parte 1), así que sus predictores fermentativos casi no se solapan con unidades que tengan cata real y no llegan al mínimo de 5 pares frente a ningún target. Para ver JU cruzado con sensorial hay que usar el escenario de sensibilidad M_cata_individual (Matriz 5, Parte 1), no este cruce exploratorio.

2.4.3 Pares con correlación alta (|r| ≥ 0.5)

predictor target n_pares correlacion abs_correlacion
x_gcfid_ethyl_dodecanoate_ppm y_global_armonia 9 0.9963613 0.9963613
x_gcfid_ethyl_tetradecanoate_ppm y_sabor_cereal 9 -0.9927572 0.9927572
x_gcfid_ethyl_dodecanoate_ppm y_aroma_frutal 9 0.9849455 0.9849455
x_gcfid_ethyl_decanoate_ppm y_sabor_frutal 9 0.9832958 0.9832958
x_gcfid_furfural_ppm y_sabor_frutal 9 0.9808440 0.9808440
x_gcfid_isoamyl_octanoate_ppm y_aroma_frutal 9 0.9783320 0.9783320
x_gcfid_isoamyl_octanoate_ppm y_aroma_vainilla 9 -0.9766505 0.9766505
x_gcfid_isoamyl_octanoate_ppm y_frutal_comun 9 0.9715324 0.9715324
x_gcfid_ethyl_hexadecanoate_ppm y_sabor_cereal 9 -0.9690804 0.9690804
x_gcfid_isoamyl_acetate_ppm y_sabor_cereal 9 0.9679891 0.9679891
x_gcfid_isoamyl_octanoate_ppm y_global_armonia 9 0.9597624 0.9597624
x_gcfid_ethyl_hexadecanoate_ppm y_aroma_cereal 9 -0.9540524 0.9540524
x_gcfid_ethyl_octanoate_ppm y_sabor_cereal 9 -0.9492496 0.9492496
x_gcfid_isoamyl_acetate_ppm y_global_armonia 9 -0.9439342 0.9439342
x_gcfid_furfural_ppm y_sabor_vainilla 9 0.9379441 0.9379441
x_gcfid_ethyl_dodecanoate_ppm y_aroma_vainilla 9 -0.9234281 0.9234281
x_gcfid_ethyl_decanoate_ppm y_sabor_vainilla 9 0.9103115 0.9103115
x_gcfid_ethyl_decanoate_ppm y_frutal_comun 9 0.9088917 0.9088917
x_gcfid_ethyl_dodecanoate_ppm y_frutal_comun 9 0.9088533 0.9088533
x_gcfid_o_cresol_ppm y_sabor_ahumado 26 0.9010245 0.9010245
x_gcfid_isoamyl_acetate_ppm y_aroma_frutal 9 -0.9007599 0.9007599
x_gcfid_ethyl_octanoate_ppm y_sabor_amaderado 26 0.8967265 0.8967265
x_gcfid_ethyl_tetradecanoate_ppm y_global_armonia 9 0.8952580 0.8952580
x_gcfid_ethyl_decanoate_ppm y_aroma_vainilla 9 -0.8943567 0.8943567
x_gcfid_guaiacol_ppm y_fenolico_comun 26 0.8809552 0.8809552
x_gcfid_furfural_ppm y_frutal_comun 9 0.8793002 0.8793002
x_gcfid_ethyl_octanoate_ppm y_global_armonia 9 0.8663784 0.8663784
x_gcfid_o_cresol_ppm y_ahumado_comun 26 0.8641168 0.8641168
x_gcfid_furfural_ppm y_aroma_vainilla 9 -0.8622242 0.8622242
x_gcfid_ethyl_dodecanoate_ppm y_sabor_cereal 9 -0.8605346 0.8605346
x_gcfid_o_cresol_ppm y_regusto_ahumado 26 0.8602664 0.8602664
x_gcfid_isoamyl_octanoate_ppm y_sabor_frutal 9 0.8484923 0.8484923
x_gcfid_4_ethyl_guaiacol_ppm y_fenolico_comun 26 0.8448986 0.8448986
x_gcfid_o_cresol_ppm y_fenolico_comun 26 0.8423274 0.8423274
x_gcfid_p_cresol_ppm y_global_tomabilidad 26 -0.8389385 0.8389385
x_gcfid_ethyl_tetradecanoate_ppm y_aroma_frutal 9 0.8384869 0.8384869
x_gcfid_4_ethyl_guaiacol_ppm y_sabor_ahumado 26 0.8362570 0.8362570
x_gcfid_4_ethyl_guaiacol_ppm y_ahumado_comun 26 0.8258943 0.8258943
x_gcfid_ethyl_tetradecanoate_ppm y_sabor_cafe 26 0.8229627 0.8229627
x_gcfid_o_cresol_ppm y_sabor_medicinal 26 0.8179613 0.8179613
x_gcfid_guaiacol_ppm y_ahumado_comun 26 0.8168512 0.8168512
x_gcfid_guaiacol_ppm y_medicinal_comun 26 0.8152067 0.8152067
x_gcfid_ethyl_octanoate_ppm y_aroma_frutal 9 0.8138715 0.8138715
x_gcfid_guaiacol_ppm y_aroma_ahumado 26 0.8095019 0.8095019
x_gcfid_guaiacol_ppm y_sabor_medicinal 26 0.8033102 0.8033102
x_gcfid_guaiacol_ppm y_sabor_ahumado 26 0.7996949 0.7996949
x_gcfid_p_cresol_ppm y_global_integracion_ahumado 26 -0.7941739 0.7941739
x_gcfid_ethyl_tetradecanoate_ppm y_aroma_cereal 9 -0.7877052 0.7877052
x_gcfid_isoamyl_acetate_ppm y_aroma_vainilla 9 0.7794642 0.7794642
x_gcfid_ethyl_decanoate_ppm y_aroma_frutal 9 0.7775763 0.7775763
x_gcfid_4_ethyl_guaiacol_ppm y_regusto_ahumado 26 0.7773562 0.7773562
x_gcfid_ethyl_octanoate_ppm y_sabor_ahumado 26 0.7588275 0.7588275
x_gcfid_guaiacol_ppm y_regusto_ahumado 26 0.7570855 0.7570855
x_gcfid_isoamyl_acetate_ppm y_frutal_comun 9 -0.7558923 0.7558923
x_gcfid_4_ethyl_guaiacol_ppm y_aroma_ahumado 26 0.7526858 0.7526858
x_gcms_area_valida_pct y_fenolico_comun 8 -0.7480740 0.7480740
x_gcfid_ethyl_octanoate_ppm y_aroma_cereal 9 -0.7431832 0.7431832
x_gcfid_furfural_ppm y_aroma_frutal 9 0.7307838 0.7307838
x_gcfid_o_cresol_ppm y_sabor_amaderado 26 0.7286389 0.7286389
x_gcfid_4_ethyl_guaiacol_ppm y_sabor_medicinal 26 0.7212464 0.7212464
x_gcfid_creosol_ppm y_sabor_cereal 9 -0.7167459 0.7167459
x_gcfid_p_cresol_ppm y_sabor_medicinal 26 0.7127539 0.7127539
x_gcfid_ethyl_decanoate_ppm y_global_armonia 9 0.7033662 0.7033662
x_gcfid_isoamyl_acetate_ppm y_aroma_cereal 9 0.6994710 0.6994710
x_gcfid_4_ethyl_guaiacol_ppm y_medicinal_comun 26 0.6980610 0.6980610
x_gcfid_ethyl_dodecanoate_ppm y_sabor_frutal 9 0.6977666 0.6977666
x_gcfid_ethyl_octanoate_ppm y_ahumado_comun 26 0.6944114 0.6944114
x_gcfid_ethyl_tetradecanoate_ppm y_aroma_vainilla 9 -0.6926326 0.6926326
x_gcfid_4_ethyl_guaiacol_ppm y_sabor_terroso 26 0.6916213 0.6916213
x_gcfid_ethyl_tetradecanoate_ppm y_sabor_sensacion_boca 15 0.6914966 0.6914966
x_gcfid_isoamyl_octanoate_ppm y_sabor_cafe 26 0.6908824 0.6908824
x_gcfid_isoamyl_octanoate_ppm y_sabor_cereal 9 -0.6893736 0.6893736
x_gcfid_ethyl_octanoate_ppm y_regusto_ahumado 26 0.6880721 0.6880721
x_gcfid_isoamyl_acetate_ppm y_sabor_sensacion_boca 15 -0.6825161 0.6825161
x_gcfid_ethyl_hexadecanoate_ppm y_global_armonia 9 0.6822133 0.6822133
x_gcfid_ethyl_hexadecanoate_ppm y_sabor_medicinal 26 -0.6780673 0.6780673
x_gcfid_ethyl_octanoate_ppm y_aroma_vainilla 9 -0.6774599 0.6774599
x_gcfid_isoamyl_acetate_ppm y_sabor_cafe 26 -0.6772284 0.6772284
x_gcfid_p_cresol_ppm y_medicinal_comun 26 0.6752541 0.6752541
x_gcfid_guaiacol_ppm y_aroma_medicinal 26 0.6731422 0.6731422
x_gcfid_ethyl_decanoate_ppm y_sabor_terroso 26 0.6678877 0.6678877
x_gcfid_ethyl_tetradecanoate_ppm y_frutal_comun 9 0.6655018 0.6655018
x_gcfid_o_cresol_ppm y_aroma_ahumado 26 0.6564175 0.6564175
x_gcfid_ethyl_octanoate_ppm y_frutal_comun 9 0.6519383 0.6519383
x_gcfid_creosol_ppm y_global_armonia 9 0.6511872 0.6511872
x_gcfid_furfural_ppm y_global_armonia 9 0.6501236 0.6501236
x_gcfid_o_cresol_ppm y_sabor_terroso 26 0.6492717 0.6492717
x_gcms_aroma_fermentativo_pct y_fenolico_comun 8 -0.6447762 0.6447762
x_gcms_esteres_pct y_fenolico_comun 8 -0.6436586 0.6436586
x_gcfid_guaiacol_ppm y_global_tomabilidad 26 -0.6363397 0.6363397
x_gcfid_guaiacol_ppm y_sabor_sensacion_boca 15 -0.6349961 0.6349961
x_gcfid_o_cresol_ppm y_medicinal_comun 26 0.6243595 0.6243595
x_gcfid_creosol_ppm y_sabor_amaderado 26 -0.6236295 0.6236295
x_gcfid_ethyl_hexadecanoate_ppm y_sabor_sensacion_boca 15 0.6128577 0.6128577
x_gcfid_creosol_ppm y_aroma_frutal 9 0.6110290 0.6110290
x_gcfid_p_cresol_ppm y_fenolico_comun 26 0.6012165 0.6012165
x_gcfid_p_cresol_ppm y_sabor_sensacion_boca 15 -0.5978947 0.5978947
x_gcfid_ethyl_decanoate_ppm y_sabor_amaderado 26 0.5965551 0.5965551
x_gcfid_ethyl_hexadecanoate_ppm y_aroma_frutal 9 0.5939159 0.5939159
x_gcfid_ethyl_decanoate_ppm y_regusto_complejidad 26 0.5923611 0.5923611
x_gcms_fenolicos_pct y_fenolico_comun 8 0.5898832 0.5898832
x_gcfid_o_cresol_ppm y_global_tomabilidad 26 -0.5883947 0.5883947
x_gcfid_guaiacol_ppm y_sabor_terroso 26 0.5849326 0.5849326
x_gcfid_isoamyl_octanoate_ppm y_sabor_vainilla 9 0.5806093 0.5806093
x_gcfid_ethyl_dodecanoate_ppm y_sabor_sensacion_boca 15 0.5784098 0.5784098
x_gcfid_isoamyl_acetate_ppm y_sabor_amaderado 26 -0.5771608 0.5771608
x_gcfid_isoamyl_acetate_ppm y_aroma_ahumado 26 -0.5767469 0.5767469
x_gcfid_isoamyl_octanoate_ppm y_aroma_cafe 26 0.5739225 0.5739225
x_gcfid_ethyl_octanoate_ppm y_fenolico_comun 26 0.5731743 0.5731743
x_gcfid_ethyl_hexadecanoate_ppm y_sabor_cafe 26 0.5711981 0.5711981
x_gcfid_4_ethyl_guaiacol_ppm y_sabor_sensacion_boca 15 -0.5676749 0.5676749
x_gcfid_ethyl_octanoate_ppm y_sabor_terroso 26 0.5657614 0.5657614
x_gcfid_ethyl_tetradecanoate_ppm y_sabor_medicinal 26 -0.5641450 0.5641450
x_gcfid_creosol_ppm y_aroma_cereal 9 -0.5640356 0.5640356
x_gcfid_4_ethyl_guaiacol_ppm y_aroma_medicinal 26 0.5600845 0.5600845
x_gcms_aldehidos_pct y_fenolico_comun 8 0.5505476 0.5505476
x_gcfid_isoamyl_acetate_ppm y_sabor_ahumado 26 -0.5490854 0.5490854
x_gcfid_p_cresol_ppm y_aroma_cafe 26 -0.5408289 0.5408289
x_gcfid_isoamyl_octanoate_ppm y_regusto_complejidad 26 0.5345286 0.5345286
x_gcfid_isoamyl_acetate_ppm y_ahumado_comun 26 -0.5319696 0.5319696
x_gcfid_p_cresol_ppm y_aroma_ahumado 26 0.5308668 0.5308668
x_gcfid_furfural_ppm y_sabor_medicinal 24 -0.5285771 0.5285771
x_gcfid_ethyl_decanoate_ppm y_aroma_cafe 26 0.5283003 0.5283003
x_gcfid_ethyl_hexadecanoate_ppm y_medicinal_comun 26 -0.5261929 0.5261929
x_gcfid_p_cresol_ppm y_aroma_medicinal 26 0.5185180 0.5185180
x_gcfid_furfural_ppm y_sabor_ahumado 24 -0.5178173 0.5178173
x_gcfid_ethyl_octanoate_ppm y_regusto_duracion 26 0.5168992 0.5168992
x_gcfid_ethyl_decanoate_ppm y_sabor_ahumado 26 0.5090973 0.5090973
x_gcfid_creosol_ppm y_aroma_vainilla 9 -0.5071497 0.5071497

Esta tabla lista, ya no solo los 4 targets principales sino los 25 descriptores sensoriales individuales, todos los pares predictor-target con |r| ≥ 0.5 (129 pares en total, sobre 18 predictores distintos, todos de GC-FID o GC-MS). Varias de las correlaciones más altas (cercanas a 0.9–0.99) corresponden a pares con solo 8-9 observaciones — típicamente contra y_frutal_comun, que tiene cobertura baja (13/34 unidades) — por lo que ese valor tan alto es en gran parte un efecto de tamaño de muestra pequeño y no debe leerse como una relación fuerte y confiable. Esta tabla es un insumo temprano de exploración, no una lista de importancia de variables: esa evaluación formal se hace recién en el modelamiento (Parte 3), con validación cruzada y bootstrap.

3 - MODELAMIENTO

3.1 Objetivo de esta parte

Esta parte documenta la etapa de modelamiento predictivo: diagnóstico de viabilidad y colinealidad de los predictores, ajuste de modelos candidatos y su validación por bootstrap agrupado, además del análisis de sensibilidad a valores atípicos químicos. El target principal es y_fenolico_comun (cobertura completa, 34/34 en M_pura); se reporta también y_frutal_comun como target secundario exploratorio, ya que su baja cobertura (13/34) deja grados de libertad negativos en varios escenarios y sus resultados no deben leerse con el mismo nivel de confianza.

Los escenarios evaluados son:

Escenario Filas Rol
M_pura 34 Principal — evidencia central de resultados
M_cata_individual 52 Sensibilidad — pura + cata individual JU agregada
M_expandida_evaluador 685 Complementario por evaluador (no independiente)
M_ia_exploratoria 42 Sintético exploratorio (no reemplaza cata real); 42 filas químicas con estimación IA utilizable, provenientes de 24 muestras físicas únicas

Antes de mostrar los resultados de cada etapa, las siguientes dos secciones explican qué modelos se probaron y cómo se compensa, metodológicamente, tener tan pocas muestras con cata real.

3.2 Modelos que se van a utilizar

Se prueban dos modelos base (piso mínimo de comparación) y seis modelos candidatos, todos evaluados sobre los mismos escenarios y targets:

Modelos base:

  • Media de entrenamiento: predice siempre el promedio del target visto en entrenamiento, sin usar ninguna variable química. Es el piso absoluto: cualquier modelo candidato que no le gane no está aportando información real.
  • Regresión lineal reducida: regresión lineal simple con hasta 3 predictores, elegidos por correlación con el target dentro de cada fold (para no filtrar información de test hacia el entrenamiento). Es un piso más exigente que la media, porque sí usa química, pero de forma muy simple.

Modelos candidatos (small data):

  • Ridge, Lasso y Elastic Net: regresiones lineales regularizadas, que penalizan coeficientes grandes para controlar el sobreajuste cuando hay más predictores correlacionados que observaciones independientes — justamente el escenario de colinealidad que se documenta más abajo. Lasso y Elastic Net además pueden llevar coeficientes a cero, funcionando como selección de variables automática.
  • PLS (mínimos cuadrados parciales): en vez de usar los predictores originales, construye combinaciones lineales de ellos que maximizan su relación con el target, reduciendo la dimensionalidad antes de ajustar. Útil cuando hay muchos predictores correlacionados entre sí, como ocurre en los grupos GC-FID y GC-MS.
  • Random Forest restringido (ranger) y Gradient Boosting restringido (gbm): modelos de árboles con su complejidad limitada a propósito (profundidad y número de árboles reducidos, mtry acotado) — un Random Forest o Gradient Boosting sin restricciones prácticamente memoriza el set de entrenamiento cuando hay 30-50 filas, así que se restringen para que generalicen en vez de sobreajustar.

Todos se ajustan con validación cruzada y se comparan primero con una pasada simple (sección “Modelos candidatos”) y luego con el bootstrap agrupado, que es el que finalmente determina el modelo recomendado por escenario.

3.3 Manejo del tamaño de muestra pequeño

En este estudio no se usan técnicas de aumento de datos sintéticas tipo SMOTE (pensadas para clasificación desbalanceada, no aplican a un target continuo con 34 muestras). En su lugar, el tamaño de muestra utilizable se maneja con tres estrategias complementarias:

  1. Escenarios adicionales que suman filas sin inventar química nueva. M_expandida_evaluador no promedia los puntajes de los catadores por muestra, sino que deja una fila por evaluador (685 filas sobre las mismas 34 muestras químicas); M_cata_individual agrega las 18 filas de la cata individual JU a las 34 de la matriz pura. Ambos aportan más señal de entrenamiento, pero se validan agrupando por unidad química (ver punto 2) para no contar la misma muestra química varias veces como si fuera evidencia independiente.
  2. Validación por bootstrap agrupado (sección más abajo): 100 iteraciones de remuestreo con reemplazo, agrupando por unidad analítica, de forma que todas las filas de una misma muestra química caen siempre juntas en entrenamiento o en prueba, nunca repartidas entre ambos. Esto evita una fuga de información que sobreestimaría el desempeño, y es la técnica central para exprimir al máximo los pocos datos disponibles sin inflar artificialmente los resultados.
  3. Regularización y restricción de modelos (Ridge/Lasso/Elastic Net, árboles restringidos): con tan pocas observaciones no hay margen para dejar un conjunto de validación completamente aparte sin sacrificar datos de entrenamiento, así que el control de sobreajuste se hace principalmente dentro del propio modelo (penalización de coeficientes, profundidad limitada) en vez de con un split de datos más grande.

Con este marco definido, las siguientes secciones muestran los resultados de cada etapa.

3.4 Diagnóstico de viabilidad por escenario

Antes de ajustar cualquier modelo se revisa una heurística de viabilidad — no un cálculo formal de un modelo específico, sino un chequeo rápido de EDA para small data: grados de libertad aproximados = filas modelables (con dato no vacío en el target) − predictores usables (predictores con al menos 3 valores, al menos 2 valores distintos y desviación estándar mayor que cero). Un valor negativo significa que hay más predictores que datos para estimarlos, y el ajuste no es confiable por más regularización que se use; valores por debajo de 15 quedan marcados como “alerta” y por debajo de 5 (u observaciones totales menores a 8) como “crítico”.

escenario target n_filas_totales n_filas_modelables n_predictores_usables grados_libertad_aprox severidad_small_data apto_modelamiento_supervisado
M_cata_individual y_ahumado_comun 52 48 31 17 aceptable_para_small_data TRUE
M_cata_individual y_fenolico_comun 52 52 31 21 aceptable_para_small_data TRUE
M_cata_individual y_frutal_comun 52 13 31 -18 critico_gl_insuficiente TRUE
M_cata_individual y_medicinal_comun 52 48 31 17 aceptable_para_small_data TRUE
M_expandida_evaluador y_ahumado_comun 685 645 18 627 aceptable_para_small_data TRUE
M_expandida_evaluador y_fenolico_comun 685 685 18 667 aceptable_para_small_data TRUE
M_expandida_evaluador y_frutal_comun 685 118 18 100 aceptable_para_small_data TRUE
M_expandida_evaluador y_medicinal_comun 685 645 18 627 aceptable_para_small_data TRUE
M_ia_exploratoria y_ahumado_comun 42 42 5 37 aceptable_para_small_data TRUE
M_ia_exploratoria y_fenolico_comun 42 42 5 37 aceptable_para_small_data TRUE
M_ia_exploratoria y_frutal_comun 42 6 5 1 critico_muy_pocos_datos TRUE
M_ia_exploratoria y_medicinal_comun 42 39 5 34 aceptable_para_small_data TRUE
M_pura y_ahumado_comun 34 30 18 12 alerta_gl_ajustado TRUE
M_pura y_fenolico_comun 34 34 18 16 aceptable_para_small_data TRUE
M_pura y_frutal_comun 34 13 18 -5 critico_gl_insuficiente TRUE
M_pura y_medicinal_comun 34 30 18 12 alerta_gl_ajustado TRUE
M_quimica NA 63 NA 10 NA sin_target FALSE
M_sensorial y_ahumado_comun 37 27 0 27 aceptable_para_small_data FALSE
M_sensorial y_fenolico_comun 37 37 0 37 aceptable_para_small_data FALSE
M_sensorial y_frutal_comun 37 10 0 10 alerta_gl_ajustado FALSE
M_sensorial y_medicinal_comun 37 27 0 27 aceptable_para_small_data FALSE

** 01_grados_libertad_por_escenario **

Para M_pura con y_fenolico_comun (target principal) hay 34 filas modelables, 18 predictores usables y 16 grados de libertad aproximados — viable. Para y_frutal_comun, en cambio, solo 13 filas quedan modelables (baja cobertura), lo que con los mismos 18 predictores da grados de libertad negativos (-5) y una marca de critico_gl_insuficiente: por eso este target se reporta siempre como secundario/exploratorio y nunca como evidencia central.

3.5 Colinealidad de predictores

Dado que los predictores provienen de técnicas analíticas no solapadas (GC-MS, GC-FID, Folin, JU fermentativo), no se aplica un VIF global; se usa correlación pareada de Pearson como diagnóstico principal, complementado con VIF por bloque y VIF del modelo base reducido.

escenario predictor n_filas n_no_na pct_no_na n_distintos desviacion_estandar usable_correlacion motivo
M_pura x_gcfid_ethyl_octanoate_ppm 34 26 76.47 17 27.481312 TRUE usable
M_pura x_gcfid_isoamyl_acetate_ppm 34 26 76.47 17 1.091867 TRUE usable
M_pura x_gcfid_furfural_ppm 34 24 70.59 15 0.497424 TRUE usable
M_pura x_gcfid_o_cresol_ppm 34 26 76.47 9 0.027408 TRUE usable
M_pura x_gcfid_p_cresol_ppm 34 26 76.47 17 0.078408 TRUE usable
M_pura x_gcfid_4_ethyl_guaiacol_ppm 34 26 76.47 9 0.007786 TRUE usable
M_pura x_gcfid_creosol_ppm 34 26 76.47 17 0.052505 TRUE usable
M_pura x_gcfid_guaiacol_ppm 34 26 76.47 6 0.124049 TRUE usable
M_pura x_gcfid_ethyl_decanoate_ppm 34 26 76.47 17 9.332234 TRUE usable
M_pura x_gcfid_isoamyl_octanoate_ppm 34 26 76.47 17 0.149908 TRUE usable
M_pura x_gcfid_ethyl_dodecanoate_ppm 34 26 76.47 17 64.814097 TRUE usable
M_pura x_gcfid_ethyl_tetradecanoate_ppm 34 26 76.47 17 1.240086 TRUE usable
M_pura x_gcfid_ethyl_hexadecanoate_ppm 34 26 76.47 17 13.955919 TRUE usable
M_pura x_ju_final_co2_loss_g_l 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_maltose_consumption_g_l 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethanol_production_g_l 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ferulic_acid_conversion_index_faci_percent 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_o_cresol_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_p_cresol_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_isoamyl_acetate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethyl_decanoate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_isoamyl_octanoate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethyl_dodecanoate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethyl_myristate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethyl_hexadecanoate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_ju_ethyl_octanoate_ppm 34 0 0.00 0 NA FALSE sin_datos
M_pura x_folin_fenoles_totales_ug_ag_ml 34 0 0.00 0 NA FALSE sin_datos
M_pura x_gcms_esteres_pct 34 8 23.53 8 8.627603 TRUE usable
M_pura x_gcms_fenolicos_pct 34 8 23.53 8 1.374087 TRUE usable
M_pura x_gcms_aldehidos_pct 34 8 23.53 8 0.540968 TRUE usable
M_pura x_gcms_aroma_fermentativo_pct 34 8 23.53 8 8.150737 TRUE usable
M_pura x_gcms_area_valida_pct 34 8 23.53 5 2.103868 TRUE usable
M_expandida_evaluador x_gcfid_ethyl_octanoate_ppm 685 531 77.52 17 29.522705 TRUE usable
M_expandida_evaluador x_gcfid_isoamyl_acetate_ppm 685 531 77.52 17 1.053544 TRUE usable
M_expandida_evaluador x_gcfid_furfural_ppm 685 513 74.89 15 0.492380 TRUE usable
M_expandida_evaluador x_gcfid_o_cresol_ppm 685 531 77.52 9 0.029977 TRUE usable
M_expandida_evaluador x_gcfid_p_cresol_ppm 685 531 77.52 17 0.062108 TRUE usable
M_expandida_evaluador x_gcfid_4_ethyl_guaiacol_ppm 685 531 77.52 9 0.008850 TRUE usable
M_expandida_evaluador x_gcfid_creosol_ppm 685 531 77.52 17 0.052980 TRUE usable
M_expandida_evaluador x_gcfid_guaiacol_ppm 685 531 77.52 6 0.141221 TRUE usable
M_expandida_evaluador x_gcfid_ethyl_decanoate_ppm 685 531 77.52 17 8.338102 TRUE usable
M_expandida_evaluador x_gcfid_isoamyl_octanoate_ppm 685 531 77.52 17 0.129285 TRUE usable
M_expandida_evaluador x_gcfid_ethyl_dodecanoate_ppm 685 531 77.52 17 59.698436 TRUE usable
M_expandida_evaluador x_gcfid_ethyl_tetradecanoate_ppm 685 531 77.52 17 1.092569 TRUE usable
M_expandida_evaluador x_gcfid_ethyl_hexadecanoate_ppm 685 531 77.52 17 13.822933 TRUE usable
M_expandida_evaluador x_ju_final_co2_loss_g_l 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_maltose_consumption_g_l 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethanol_production_g_l 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ferulic_acid_conversion_index_faci_percent 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_o_cresol_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_p_cresol_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_isoamyl_acetate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethyl_decanoate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_isoamyl_octanoate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethyl_dodecanoate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethyl_myristate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethyl_hexadecanoate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_ju_ethyl_octanoate_ppm 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_folin_fenoles_totales_ug_ag_ml 685 0 0.00 0 NA FALSE sin_datos
M_expandida_evaluador x_gcms_esteres_pct 685 154 22.48 8 7.189371 TRUE usable
M_expandida_evaluador x_gcms_fenolicos_pct 685 154 22.48 8 1.231849 TRUE usable
M_expandida_evaluador x_gcms_aldehidos_pct 685 154 22.48 8 0.475530 TRUE usable
M_expandida_evaluador x_gcms_aroma_fermentativo_pct 685 154 22.48 8 6.811220 TRUE usable
M_expandida_evaluador x_gcms_area_valida_pct 685 154 22.48 5 1.849278 TRUE usable
M_cata_individual x_gcfid_ethyl_octanoate_ppm 52 26 50.00 17 27.481312 TRUE usable
M_cata_individual x_gcfid_isoamyl_acetate_ppm 52 26 50.00 17 1.091867 TRUE usable
M_cata_individual x_gcfid_furfural_ppm 52 24 46.15 15 0.497424 TRUE usable
M_cata_individual x_gcfid_o_cresol_ppm 52 26 50.00 9 0.027408 TRUE usable
M_cata_individual x_gcfid_p_cresol_ppm 52 26 50.00 17 0.078408 TRUE usable
M_cata_individual x_gcfid_4_ethyl_guaiacol_ppm 52 26 50.00 9 0.007786 TRUE usable
M_cata_individual x_gcfid_creosol_ppm 52 26 50.00 17 0.052505 TRUE usable
M_cata_individual x_gcfid_guaiacol_ppm 52 26 50.00 6 0.124049 TRUE usable
M_cata_individual x_gcfid_ethyl_decanoate_ppm 52 26 50.00 17 9.332234 TRUE usable
M_cata_individual x_gcfid_isoamyl_octanoate_ppm 52 26 50.00 17 0.149908 TRUE usable
M_cata_individual x_gcfid_ethyl_dodecanoate_ppm 52 26 50.00 17 64.814097 TRUE usable
M_cata_individual x_gcfid_ethyl_tetradecanoate_ppm 52 26 50.00 17 1.240086 TRUE usable
M_cata_individual x_gcfid_ethyl_hexadecanoate_ppm 52 26 50.00 17 13.955919 TRUE usable
M_cata_individual x_ju_final_co2_loss_g_l 52 18 34.62 16 20.337762 TRUE usable
M_cata_individual x_ju_maltose_consumption_g_l 52 18 34.62 13 47.225011 TRUE usable
M_cata_individual x_ju_ethanol_production_g_l 52 18 34.62 18 1.842068 TRUE usable
M_cata_individual x_ju_ferulic_acid_conversion_index_faci_percent 52 18 34.62 18 2.930341 TRUE usable
M_cata_individual x_ju_o_cresol_ppm 52 5 9.62 5 0.469529 TRUE usable
M_cata_individual x_ju_p_cresol_ppm 52 5 9.62 5 0.041766 TRUE usable
M_cata_individual x_ju_isoamyl_acetate_ppm 52 5 9.62 5 0.140171 TRUE usable
M_cata_individual x_ju_ethyl_decanoate_ppm 52 5 9.62 5 0.211274 TRUE usable
M_cata_individual x_ju_isoamyl_octanoate_ppm 52 5 9.62 5 0.018618 TRUE usable
M_cata_individual x_ju_ethyl_dodecanoate_ppm 52 5 9.62 5 0.100646 TRUE usable
M_cata_individual x_ju_ethyl_myristate_ppm 52 5 9.62 5 0.011093 TRUE usable
M_cata_individual x_ju_ethyl_hexadecanoate_ppm 52 5 9.62 5 0.077457 TRUE usable
M_cata_individual x_ju_ethyl_octanoate_ppm 52 5 9.62 5 36.032610 TRUE usable
M_cata_individual x_folin_fenoles_totales_ug_ag_ml 52 0 0.00 0 NA FALSE sin_datos
M_cata_individual x_gcms_esteres_pct 52 8 15.38 8 8.627603 TRUE usable
M_cata_individual x_gcms_fenolicos_pct 52 8 15.38 8 1.374087 TRUE usable
M_cata_individual x_gcms_aldehidos_pct 52 8 15.38 8 0.540968 TRUE usable
M_cata_individual x_gcms_aroma_fermentativo_pct 52 8 15.38 8 8.150737 TRUE usable
M_cata_individual x_gcms_area_valida_pct 52 8 15.38 5 2.103868 TRUE usable
M_ia_exploratoria x_gcfid_ethyl_octanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_isoamyl_acetate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_furfural_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_o_cresol_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_p_cresol_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_4_ethyl_guaiacol_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_creosol_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_guaiacol_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_ethyl_decanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_isoamyl_octanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_ethyl_dodecanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_ethyl_tetradecanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcfid_ethyl_hexadecanoate_ppm 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_ju_final_co2_loss_g_l 42 18 42.86 18 20.465654 TRUE usable
M_ia_exploratoria x_ju_maltose_consumption_g_l 42 18 42.86 10 48.274170 TRUE usable
M_ia_exploratoria x_ju_ethanol_production_g_l 42 18 42.86 17 2.303190 TRUE usable
M_ia_exploratoria x_ju_ferulic_acid_conversion_index_faci_percent 42 18 42.86 18 4.415490 TRUE usable
M_ia_exploratoria x_ju_o_cresol_ppm 42 2 4.76 2 0.155331 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_p_cresol_ppm 42 2 4.76 2 0.002899 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_isoamyl_acetate_ppm 42 2 4.76 2 0.157284 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_ethyl_decanoate_ppm 42 2 4.76 2 0.718026 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_isoamyl_octanoate_ppm 42 2 4.76 2 0.054317 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_ethyl_dodecanoate_ppm 42 2 4.76 2 7.328001 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_ethyl_myristate_ppm 42 2 4.76 2 0.210325 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_ethyl_hexadecanoate_ppm 42 2 4.76 2 9.822821 FALSE menos_de_3_valores
M_ia_exploratoria x_ju_ethyl_octanoate_ppm 42 2 4.76 2 23.403703 FALSE menos_de_3_valores
M_ia_exploratoria x_folin_fenoles_totales_ug_ag_ml 42 24 57.14 21 45.804797 TRUE usable
M_ia_exploratoria x_gcms_esteres_pct 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcms_fenolicos_pct 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcms_aldehidos_pct 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcms_aroma_fermentativo_pct 42 0 0.00 0 NA FALSE sin_datos
M_ia_exploratoria x_gcms_area_valida_pct 42 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_ethyl_octanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_isoamyl_acetate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_furfural_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_o_cresol_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_p_cresol_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_4_ethyl_guaiacol_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_creosol_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_guaiacol_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_ethyl_decanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_isoamyl_octanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_ethyl_dodecanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_ethyl_tetradecanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_gcfid_ethyl_hexadecanoate_ppm 63 0 0.00 0 NA FALSE sin_datos
M_quimica x_ju_final_co2_loss_g_l 63 21 33.33 21 19.991714 TRUE usable
M_quimica x_ju_maltose_consumption_g_l 63 21 33.33 13 48.323460 TRUE usable
M_quimica x_ju_ethanol_production_g_l 63 21 33.33 19 2.265067 TRUE usable
M_quimica x_ju_ferulic_acid_conversion_index_faci_percent 63 21 33.33 21 4.222090 TRUE usable
M_quimica x_ju_o_cresol_ppm 63 2 3.17 2 0.155331 FALSE menos_de_3_valores
M_quimica x_ju_p_cresol_ppm 63 2 3.17 2 0.002899 FALSE menos_de_3_valores
M_quimica x_ju_isoamyl_acetate_ppm 63 2 3.17 2 0.157284 FALSE menos_de_3_valores
M_quimica x_ju_ethyl_decanoate_ppm 63 2 3.17 2 0.718026 FALSE menos_de_3_valores
M_quimica x_ju_isoamyl_octanoate_ppm 63 2 3.17 2 0.054317 FALSE menos_de_3_valores
M_quimica x_ju_ethyl_dodecanoate_ppm 63 2 3.17 2 7.328001 FALSE menos_de_3_valores
M_quimica x_ju_ethyl_myristate_ppm 63 2 3.17 2 0.210325 FALSE menos_de_3_valores
M_quimica x_ju_ethyl_hexadecanoate_ppm 63 2 3.17 2 9.822821 FALSE menos_de_3_valores
M_quimica x_ju_ethyl_octanoate_ppm 63 2 3.17 2 23.403703 FALSE menos_de_3_valores
M_quimica x_folin_fenoles_totales_ug_ag_ml 63 24 38.10 21 45.804797 TRUE usable
M_quimica x_gcms_esteres_pct 63 18 28.57 18 11.042743 TRUE usable
M_quimica x_gcms_fenolicos_pct 63 18 28.57 18 1.625560 TRUE usable
M_quimica x_gcms_aldehidos_pct 63 18 28.57 18 0.665586 TRUE usable
M_quimica x_gcms_aroma_fermentativo_pct 63 18 28.57 18 11.063739 TRUE usable
M_quimica x_gcms_area_valida_pct 63 18 28.57 18 2.179952 TRUE usable

De las 32 variables químicas, en M_pura quedan 18 usables para correlación; las otras 14 quedan fuera por sin_datos (todo el bloque JU salvo unos pocos compuestos, porque casi no se solapa con unidades que tienen cata real) o por menos_de_3_valores (muy pocos casos con dato para estimar una correlación mínimamente confiable).

escenario predictor_1 predictor_2 r_pearson abs_r n_comunes nivel_colinealidad recomendacion
M_cata_individual x_gcms_esteres_pct x_gcms_aroma_fermentativo_pct 0.999536 0.999536 8 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_final_co2_loss_g_l x_ju_maltose_consumption_g_l 0.981612 0.981612 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_maltose_consumption_g_l x_ju_ethanol_production_g_l 0.979573 0.979573 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_ferulic_acid_conversion_index_faci_percent x_ju_p_cresol_ppm -0.976759 0.976759 5 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_isoamyl_acetate_ppm x_ju_ethyl_myristate_ppm -0.969596 0.969596 5 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_ethanol_production_g_l x_ju_o_cresol_ppm -0.967134 0.967134 5 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_final_co2_loss_g_l x_ju_ethanol_production_g_l 0.966965 0.966965 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_gcms_fenolicos_pct x_gcms_aldehidos_pct 0.962871 0.962871 8 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_final_co2_loss_g_l x_ju_ethyl_hexadecanoate_ppm 0.954601 0.954601 5 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_cata_individual x_ju_maltose_consumption_g_l x_ju_o_cresol_ppm -0.945054 0.945054 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_maltose_consumption_g_l x_ju_ethyl_hexadecanoate_ppm 0.935886 0.935886 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_final_co2_loss_g_l x_ju_o_cresol_ppm -0.929634 0.929634 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_maltose_consumption_g_l x_ju_ethyl_octanoate_ppm 0.921003 0.921003 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcfid_4_ethyl_guaiacol_ppm x_gcfid_guaiacol_ppm 0.913114 0.913114 26 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcms_aroma_fermentativo_pct x_gcms_area_valida_pct 0.912165 0.912165 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_ethanol_production_g_l x_ju_ethyl_hexadecanoate_ppm 0.911190 0.911190 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcms_esteres_pct x_gcms_area_valida_pct 0.905297 0.905297 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_ethyl_decanoate_ppm x_ju_ethyl_octanoate_ppm 0.904462 0.904462 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_p_cresol_ppm x_ju_ethyl_dodecanoate_ppm -0.901211 0.901211 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_ethanol_production_g_l x_ju_ethyl_octanoate_ppm 0.900524 0.900524 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcms_esteres_pct x_gcms_aldehidos_pct -0.888494 0.888494 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_ethyl_hexadecanoate_ppm x_ju_ethyl_octanoate_ppm 0.888461 0.888461 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcms_aldehidos_pct x_gcms_aroma_fermentativo_pct -0.874105 0.874105 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_o_cresol_ppm x_ju_ethyl_hexadecanoate_ppm -0.873413 0.873413 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcms_esteres_pct x_gcms_fenolicos_pct -0.860194 0.860194 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_gcfid_ethyl_decanoate_ppm x_gcfid_isoamyl_octanoate_ppm 0.858392 0.858392 26 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_cata_individual x_ju_final_co2_loss_g_l x_ju_ethyl_octanoate_ppm 0.856406 0.856406 5 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_expandida_evaluador x_gcms_esteres_pct x_gcms_aroma_fermentativo_pct 0.999151 0.999151 154 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_expandida_evaluador x_gcfid_4_ethyl_guaiacol_ppm x_gcfid_guaiacol_ppm 0.950986 0.950986 531 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_expandida_evaluador x_gcms_fenolicos_pct x_gcms_aldehidos_pct 0.943722 0.943722 154 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_expandida_evaluador x_gcms_aroma_fermentativo_pct x_gcms_area_valida_pct 0.862421 0.862421 154 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_expandida_evaluador x_gcfid_ethyl_octanoate_ppm x_gcfid_o_cresol_ppm 0.850107 0.850107 531 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_ia_exploratoria x_ju_final_co2_loss_g_l x_ju_ethanol_production_g_l 0.963759 0.963759 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_ia_exploratoria x_ju_final_co2_loss_g_l x_ju_maltose_consumption_g_l 0.953390 0.953390 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_ia_exploratoria x_ju_maltose_consumption_g_l x_ju_ethanol_production_g_l 0.892926 0.892926 18 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_esteres_pct x_gcms_aroma_fermentativo_pct 0.999536 0.999536 8 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_pura x_gcms_fenolicos_pct x_gcms_aldehidos_pct 0.962871 0.962871 8 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_pura x_gcfid_4_ethyl_guaiacol_ppm x_gcfid_guaiacol_ppm 0.913114 0.913114 26 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_aroma_fermentativo_pct x_gcms_area_valida_pct 0.912165 0.912165 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_esteres_pct x_gcms_area_valida_pct 0.905297 0.905297 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_esteres_pct x_gcms_aldehidos_pct -0.888494 0.888494 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_aldehidos_pct x_gcms_aroma_fermentativo_pct -0.874105 0.874105 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcms_esteres_pct x_gcms_fenolicos_pct -0.860194 0.860194 8 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_pura x_gcfid_ethyl_decanoate_ppm x_gcfid_isoamyl_octanoate_ppm 0.858392 0.858392 26 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls
M_quimica x_gcms_esteres_pct x_gcms_aroma_fermentativo_pct 0.998189 0.998189 18 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_quimica x_ju_final_co2_loss_g_l x_ju_ethanol_production_g_l 0.967588 0.967588 21 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_quimica x_ju_final_co2_loss_g_l x_ju_maltose_consumption_g_l 0.957056 0.957056 21 muy_alta colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion
M_quimica x_ju_maltose_consumption_g_l x_ju_ethanol_production_g_l 0.906505 0.906505 21 alta colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls

En M_pura hay 9 pares con correlación alta (|r| ≥ 0.85), de los cuales 2 son muy altas (r ≈ 0.96–1.00): los pares de variables agregadas de GC-MS que se construyen unas a partir de otras (x_gcms_esteres_pct con x_gcms_aroma_fermentativo_pct, y x_gcms_fenolicos_pct con x_gcms_aldehidos_pct), además de pares esperables entre compuestos químicamente emparentados (guaiacol y 4-etil-guaiacol; distintos ésteres de cadena larga). Esta es la razón concreta por la que se prefieren modelos regularizados o PLS en vez de una regresión lineal múltiple simple.

3.5.1 Mapas de calor de colinealidad por escenario

Cada mapa muestra la correlación de Pearson entre los predictores químicos más involucrados en colinealidad (o, si no hay pares con |r| ≥ 0.85, los de mayor variabilidad), agrupados por bloque analítico — GC-FID, GC-MS, JU y Folin no comparten unidades entre sí, así que sus pares cruzados no tienen correlación calculable y se dejan en blanco en vez de rellenarse con gris.

Escenario M_pura

En el escenario principal, la colinealidad relevante se concentra en dos bloques. En GC-FID, los fenoles volátiles guaiacol y 4-etil-guaiacol correlacionan fuerte (r = 0.91) — moléculas químicamente emparentadas que suelen producirse juntas durante el tostado/ahumado — y por otro lado los ésteres ethyl decanoate e isoamyl octanoate (r = 0.86). En GC-MS, varias variables agregadas están construidas unas a partir de otras: ésteres y aroma fermentativo son casi la misma variable (r = 1.00, porque el aroma fermentativo incluye a los ésteres en su cálculo), y fenólicos correlaciona muy fuerte con aldehídos (r = 0.96). El bloque JU no aparece en este escenario porque, al excluir la cata individual, casi no tiene solapamiento suficiente con las 34 unidades de M_pura.

Escenario M_cata_individual

Al agregar la cata individual JU (52 filas), el bloque JU sí alcanza el umbral y aparece con 12 variables — es, por lejos, el bloque más internamente colineal: casi todas las variables fermentativas (producción de etanol, pérdida de CO₂, consumo de maltosa, varios ésteres de cadena larga) se mueven juntas con r > 0.85, coherente con que todas reflejan el mismo proceso de fermentación medido de distintas formas. o-cresol y p-cresol, en cambio, correlacionan negativamente con ese grupo (hasta r = -0.97), y p-cresol en particular con el índice FACI (r = -0.98) — señal de que estos dos compuestos siguen una dinámica distinta al resto de las variables JU. Los bloques GC-FID y GC-MS mantienen el mismo patrón que en M_pura, porque siguen siendo las mismas 34 muestras químicas de base.

Escenario M_expandida_evaluador

Como esta matriz repite las mismas 34 muestras químicas una vez por evaluador (685 filas), el patrón de colinealidad es esencialmente el mismo que en M_pura — se repiten los mismos dos bloques con valores muy similares (guaiacol y 4-etil-guaiacol suben incluso a r = 0.95). Esto confirma que la colinealidad es una propiedad de la química de las muestras, no del número de evaluadores que las calificaron.

Escenario M_ia_exploratoria

En el escenario sintético de IA, solo el bloque JU alcanza el umbral de colinealidad alta, con tres variables fermentativas correlacionadas entre sí (r = 0.89–0.96). Los bloques GC-FID y GC-MS no aparecen porque este escenario tiene menor cobertura química real detrás de las muestras sintéticas, así que ningún par de esas variables llega al mínimo de pares con datos en común necesario para calcular una correlación confiable.

Escenario M_quimica

Esta matriz no tiene target sensorial (es solo diagnóstico de la parte química), y su heatmap muestra el caso más extremo de colinealidad interna: aroma fermentativo y ésteres de GC-MS quedan perfectamente correlacionados (r = 1.00, por construcción), y las tres variables fermentativas de JU repiten el mismo patrón visto en M_ia_exploratoria (r = 0.91–0.97). El bloque GC-FID no alcanza aquí el umbral porque, al no cruzarse con cata real, cambia qué unidades quedan con datos completos.

En conjunto, los cinco mapas muestran que la colinealidad es una propiedad de la química de base (se repite en M_pura, M_cata_individual y M_expandida_evaluador porque comparten las mismas 34 muestras), y que los bloques con menos cobertura real (M_ia_exploratoria, M_quimica) simplemente no alcanzan el mínimo de datos para mostrar todos los bloques a la vez.

3.6 Modelos base (líneas de comparación)

escenario target modelo n_observaciones n_grupos_validacion mae rmse r2 spearman bias mae_media rmse_media mejora_mae_vs_media mejora_rmse_vs_media lectura
M_cata_individual y_fenolico_comun lineal_reducido 52 52 0.744320 0.938074 0.198458 -0.142312 -0.188095 0.886523 1.068334 0.142203 0.130260 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_cata_individual y_fenolico_comun media_entrenamiento 52 52 0.886523 1.068334 -0.039600 -1.000000 0.000000 0.886523 1.068334 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_cata_individual y_frutal_comun lineal_reducido 13 13 0.134360 0.191363 0.532466 0.419053 0.000255 0.247436 0.303189 0.113076 0.111826 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_cata_individual y_frutal_comun media_entrenamiento 13 13 0.247436 0.303189 -0.173611 -1.000000 0.000000 0.247436 0.303189 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_expandida_evaluador y_fenolico_comun lineal_reducido 685 34 0.746432 0.924694 0.127927 0.056495 0.000212 0.815225 1.004024 0.068793 0.079330 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_expandida_evaluador y_fenolico_comun media_entrenamiento 685 34 0.815225 1.004024 -0.028123 -0.501933 -0.001746 0.815225 1.004024 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_expandida_evaluador y_frutal_comun lineal_reducido 118 13 0.501435 0.693917 0.074575 0.186111 0.001152 0.564719 0.731167 0.063284 0.037250 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_expandida_evaluador y_frutal_comun media_entrenamiento 118 13 0.564719 0.731167 -0.027447 -0.407763 -0.000175 0.564719 0.731167 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_ia_exploratoria y_fenolico_comun lineal_reducido 42 42 0.525950 0.658558 0.527750 0.709080 -0.163908 0.815331 0.981688 0.289381 0.323130 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_ia_exploratoria y_fenolico_comun media_entrenamiento 42 42 0.815331 0.981688 -0.049375 -1.000000 0.000000 0.815331 0.981688 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_pura y_fenolico_comun lineal_reducido 34 34 0.269623 0.371464 0.433845 -0.072929 0.001723 0.412330 0.508644 0.142707 0.137180 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_pura y_fenolico_comun media_entrenamiento 34 34 0.412330 0.508644 -0.061524 -1.000000 0.000000 0.412330 0.508644 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error
M_pura y_frutal_comun lineal_reducido 13 13 0.134360 0.191363 0.532466 0.419053 0.000255 0.247436 0.303189 0.113076 0.111826 mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad
M_pura y_frutal_comun media_entrenamiento 13 13 0.247436 0.303189 -0.173611 -1.000000 0.000000 0.247436 0.303189 0.000000 0.000000 linea_base_minima; cualquier_modelo_debe_superar_este_error

Para M_pura con y_fenolico_comun, la regresión lineal reducida logra MAE = 0.270 frente a MAE = 0.412 de la media de entrenamiento — una mejora de ~35% solo con hasta 3 predictores simples. Esto confirma que sí hay señal química aprovechable antes de pasar a los modelos más complejos, y fija la vara mínima que estos deben superar.

** 01_modelo_base_mae_por_escenario **

3.7 Modelos candidatos (small data)

escenario target modelo n_observaciones n_grupos_validacion mae rmse r2 spearman bias mae_lineal_reducido mae_media_entrenamiento rmse_lineal_reducido rmse_media_entrenamiento mejora_mae_vs_media mejora_mae_vs_lineal lectura_comparativa
M_cata_individual y_fenolico_comun random_forest_restringido 52 52 0.276203 0.398734 0.855183 0.739469 0.004268 0.744320 0.886523 0.938074 1.068334 0.610320 0.468117 mejora_frente_a_lineal_reducido
M_cata_individual y_fenolico_comun elastic_net 52 52 0.483807 0.610653 0.660343 0.864929 -0.280378 0.744320 0.886523 0.938074 1.068334 0.402716 0.260513 mejora_frente_a_lineal_reducido
M_cata_individual y_fenolico_comun lasso 52 52 0.505090 0.644056 0.622168 0.769688 -0.259442 0.744320 0.886523 0.938074 1.068334 0.381433 0.239230 mejora_frente_a_lineal_reducido
M_cata_individual y_fenolico_comun pls 52 52 0.520827 0.606727 0.664696 0.812513 -0.301096 0.744320 0.886523 0.938074 1.068334 0.365696 0.223493 mejora_frente_a_lineal_reducido
M_cata_individual y_fenolico_comun ridge 52 52 0.542675 0.669371 0.591882 0.792194 -0.244554 0.744320 0.886523 0.938074 1.068334 0.343848 0.201645 mejora_frente_a_lineal_reducido
M_cata_individual y_fenolico_comun gradient_boosting_restringido 52 52 0.877926 1.058364 -0.020287 -0.418166 -0.008730 0.744320 0.886523 0.938074 1.068334 0.008597 -0.133606 mejora_solo_frente_a_media
M_cata_individual y_frutal_comun lasso 13 13 0.132666 0.187462 0.551334 0.452578 0.003333 0.134360 0.247436 0.191363 0.303189 0.114770 0.001694 mejora_frente_a_lineal_reducido
M_cata_individual y_frutal_comun gradient_boosting_restringido 13 13 0.137946 0.198937 0.494724 0.324068 0.003313 0.134360 0.247436 0.191363 0.303189 0.109490 -0.003586 mejora_solo_frente_a_media
M_cata_individual y_frutal_comun ridge 13 13 0.138785 0.207079 0.452520 0.463752 0.002616 0.134360 0.247436 0.191363 0.303189 0.108651 -0.004425 mejora_solo_frente_a_media
M_cata_individual y_frutal_comun random_forest_restringido 13 13 0.140364 0.200029 0.489161 0.508451 0.026974 0.134360 0.247436 0.191363 0.303189 0.107072 -0.006004 mejora_solo_frente_a_media
M_cata_individual y_frutal_comun elastic_net 13 13 0.144068 0.203553 0.471004 0.446990 -0.011340 0.134360 0.247436 0.191363 0.303189 0.103368 -0.009708 mejora_solo_frente_a_media
M_cata_individual y_frutal_comun pls 13 13 0.164642 0.245968 0.227580 0.363180 0.030429 0.134360 0.247436 0.191363 0.303189 0.082794 -0.030282 mejora_solo_frente_a_media
M_expandida_evaluador y_fenolico_comun ridge 685 34 0.706366 0.863672 0.239229 0.442112 0.005394 0.746432 0.815225 0.924694 1.004024 0.108859 0.040066 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_fenolico_comun pls 685 34 0.709584 0.870196 0.227692 0.441950 -0.014755 0.746432 0.815225 0.924694 1.004024 0.105641 0.036848 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_fenolico_comun elastic_net 685 34 0.714524 0.874032 0.220867 0.439031 0.012271 0.746432 0.815225 0.924694 1.004024 0.100701 0.031908 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_fenolico_comun lasso 685 34 0.716990 0.876550 0.216372 0.436350 0.011745 0.746432 0.815225 0.924694 1.004024 0.098235 0.029442 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_fenolico_comun random_forest_restringido 685 34 0.743622 0.911875 0.151938 0.362854 0.024518 0.746432 0.815225 0.924694 1.004024 0.071603 0.002810 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_fenolico_comun gradient_boosting_restringido 685 34 0.761240 0.926267 0.124958 0.336161 0.019191 0.746432 0.815225 0.924694 1.004024 0.053985 -0.014808 mejora_solo_frente_a_media
M_expandida_evaluador y_frutal_comun gradient_boosting_restringido 118 13 0.497318 0.699722 0.059027 0.151596 0.011507 0.501435 0.564719 0.693917 0.731167 0.067401 0.004117 mejora_frente_a_lineal_reducido
M_expandida_evaluador y_frutal_comun random_forest_restringido 118 13 0.511341 0.701701 0.053698 0.186611 -0.020542 0.501435 0.564719 0.693917 0.731167 0.053378 -0.009906 mejora_solo_frente_a_media
M_expandida_evaluador y_frutal_comun pls 118 13 0.526625 0.722933 -0.004435 0.138915 -0.000076 0.501435 0.564719 0.693917 0.731167 0.038094 -0.025190 mejora_solo_frente_a_media
M_expandida_evaluador y_frutal_comun ridge 118 13 0.536263 0.721964 -0.001745 0.134392 -0.022133 0.501435 0.564719 0.693917 0.731167 0.028456 -0.034828 mejora_solo_frente_a_media
M_expandida_evaluador y_frutal_comun elastic_net 118 13 0.537123 0.718529 0.007765 0.115607 -0.058750 0.501435 0.564719 0.693917 0.731167 0.027596 -0.035688 mejora_solo_frente_a_media
M_expandida_evaluador y_frutal_comun lasso 118 13 0.544930 0.725515 -0.011623 0.036004 -0.052270 0.501435 0.564719 0.693917 0.731167 0.019789 -0.043495 mejora_solo_frente_a_media
M_ia_exploratoria y_fenolico_comun random_forest_restringido 42 42 0.403955 0.483072 0.745898 0.839285 -0.000404 0.525950 0.815331 0.658558 0.981688 0.411376 0.121995 mejora_frente_a_lineal_reducido
M_ia_exploratoria y_fenolico_comun ridge 42 42 0.535328 0.605178 0.601205 0.786756 -0.251386 0.525950 0.815331 0.658558 0.981688 0.280003 -0.009378 mejora_solo_frente_a_media
M_ia_exploratoria y_fenolico_comun elastic_net 42 42 0.536102 0.617044 0.585413 0.778809 -0.242823 0.525950 0.815331 0.658558 0.981688 0.279229 -0.010152 mejora_solo_frente_a_media
M_ia_exploratoria y_fenolico_comun lasso 42 42 0.545120 0.625006 0.574644 0.789576 -0.248546 0.525950 0.815331 0.658558 0.981688 0.270211 -0.019170 mejora_solo_frente_a_media
M_ia_exploratoria y_fenolico_comun pls 42 42 0.550299 0.641611 0.551743 0.810085 -0.268979 0.525950 0.815331 0.658558 0.981688 0.265032 -0.024349 mejora_solo_frente_a_media
M_ia_exploratoria y_fenolico_comun gradient_boosting_restringido 42 42 0.631330 0.715780 0.442118 0.537578 -0.053651 0.525950 0.815331 0.658558 0.981688 0.184001 -0.105380 mejora_solo_frente_a_media
M_pura y_fenolico_comun elastic_net 34 34 0.229887 0.304161 0.620416 0.665958 0.018849 0.269623 0.412330 0.371464 0.508644 0.182443 0.039736 mejora_frente_a_lineal_reducido
M_pura y_fenolico_comun random_forest_restringido 34 34 0.247837 0.321493 0.575923 0.548951 -0.020412 0.269623 0.412330 0.371464 0.508644 0.164493 0.021786 mejora_frente_a_lineal_reducido
M_pura y_fenolico_comun ridge 34 34 0.253465 0.329055 0.555740 0.607608 0.019010 0.269623 0.412330 0.371464 0.508644 0.158865 0.016158 mejora_frente_a_lineal_reducido
M_pura y_fenolico_comun pls 34 34 0.284096 0.357416 0.475857 0.483077 0.056336 0.269623 0.412330 0.371464 0.508644 0.128234 -0.014473 mejora_solo_frente_a_media
M_pura y_fenolico_comun lasso 34 34 0.300059 0.533805 -0.169139 0.631255 0.074862 0.269623 0.412330 0.371464 0.508644 0.112271 -0.030436 mejora_solo_frente_a_media
M_pura y_fenolico_comun gradient_boosting_restringido 34 34 0.328218 0.420700 0.273816 0.500275 0.008678 0.269623 0.412330 0.371464 0.508644 0.084112 -0.058595 mejora_solo_frente_a_media
M_pura y_frutal_comun elastic_net 13 13 0.125110 0.194039 0.519299 0.363180 -0.021830 0.134360 0.247436 0.191363 0.303189 0.122326 0.009250 mejora_frente_a_lineal_reducido
M_pura y_frutal_comun ridge 13 13 0.126793 0.188464 0.546525 0.486102 -0.005554 0.134360 0.247436 0.191363 0.303189 0.120643 0.007567 mejora_frente_a_lineal_reducido
M_pura y_frutal_comun lasso 13 13 0.132623 0.190960 0.534435 0.441403 0.000438 0.134360 0.247436 0.191363 0.303189 0.114813 0.001737 mejora_frente_a_lineal_reducido
M_pura y_frutal_comun random_forest_restringido 13 13 0.140364 0.200029 0.489161 0.508451 0.026974 0.134360 0.247436 0.191363 0.303189 0.107072 -0.006004 mejora_solo_frente_a_media
M_pura y_frutal_comun gradient_boosting_restringido 13 13 0.143959 0.202584 0.476030 0.279369 -0.002999 0.134360 0.247436 0.191363 0.303189 0.103477 -0.009599 mejora_solo_frente_a_media
M_pura y_frutal_comun pls 13 13 0.164642 0.245968 0.227580 0.363180 0.030429 0.134360 0.247436 0.191363 0.303189 0.082794 -0.030282 mejora_solo_frente_a_media

Esta tabla compara los 6 modelos candidatos con una sola pasada de validación cruzada por escenario/target — útil para ver el orden de magnitud y detectar modelos que ni siquiera superan la media de entrenamiento (columna lectura_comparativa), pero todavía sensible a cómo caen las particiones. La comparación que realmente define el modelo recomendado es la del bootstrap agrupado (100 iteraciones), en la siguiente sección.

** 01_modelos_small_data_mae_y_fenolico **

** 02_importancia_variables_y_fenolico_M_pura **

3.8 Validación por bootstrap agrupado

Validación con 100 iteraciones de bootstrap, agrupando por unidad analítica para evitar fuga de información entre entrenamiento y prueba cuando una misma muestra química aparece en más de una fila (por ejemplo, distintos evaluadores en M_expandida_evaluador). En cada iteración se remuestrea con reemplazo a nivel de unidad química completa, se ajustan los 6 modelos candidatos y se promedian sus métricas — así el resultado deja de depender de una sola partición afortunada o desafortunada.

Manejo de datos faltantes: cada predictor con valores faltantes se imputa por su mediana, calculada únicamente con las filas del pliegue de entrenamiento de esa iteración de bootstrap, y esa misma mediana (no una nueva, calculada con datos de prueba) se aplica tanto al pliegue de entrenamiento como al de prueba. Esto evita fuga de información: en ningún caso la imputación de una fila de prueba usa información de esa misma fila u otras filas de prueba. La misma lógica se aplica de forma idéntica en los modelos base y en los modelos candidatos.

escenario target modelo n_bootstrap_exitosos n_fallback_holdout pct_fallback_holdout n_train_promedio n_test_promedio mae_media mae_sd mae_p05 mae_p50 mae_p95 rmse_media rmse_sd rmse_p05 rmse_p50 rmse_p95 r2_media r2_p50 spearman_media spearman_p50 bias_media mae_ic90_ancho estabilidad_error ranking_mae
M_cata_individual y_fenolico_comun random_forest_restringido 100 0 0 52.00 18.68 0.3303534 0.1066919 0.1905647 0.3166207 0.5313743 0.4761227 0.1495136 0.2685408 0.4550537 0.7425903 0.7578598 0.7958520 0.8178249 0.8232379 -0.0252994 0.3408096 media 1
M_cata_individual y_fenolico_comun gradient_boosting_restringido 100 0 0 52.00 18.68 0.4644421 0.1836418 0.2683643 0.4110624 0.8685726 0.6228602 0.2171110 0.3585354 0.5855679 1.0613550 0.5918397 0.6789599 0.7402682 0.7576954 0.0399965 0.6002082 baja 2
M_cata_individual y_fenolico_comun lasso 100 0 0 52.00 18.68 0.5757854 0.1980624 0.3046880 0.5618040 0.8906605 0.7779525 0.2680468 0.4502449 0.7295583 1.2484855 0.3303504 0.4521690 0.6405121 0.7042166 -0.0731095 0.5859725 baja 3
M_cata_individual y_fenolico_comun elastic_net 100 0 0 52.00 18.68 0.5805036 0.1970341 0.2750758 0.5643725 0.8711842 0.7735901 0.2482110 0.4290381 0.7354716 1.1524094 0.3399797 0.4715303 0.6359956 0.6889806 -0.0587476 0.5961084 baja 4
M_cata_individual y_fenolico_comun pls 100 0 0 52.00 18.68 0.6067905 0.1787761 0.3217412 0.6068311 0.8681768 0.7798151 0.2222488 0.4678790 0.7852185 1.0675903 0.3376202 0.4202149 0.5942297 0.6162039 -0.0623191 0.5464356 baja 5
M_cata_individual y_fenolico_comun ridge 100 0 0 52.00 18.68 0.6149173 0.1738361 0.3110348 0.6263940 0.9083222 0.7797428 0.2088690 0.4719568 0.7785036 1.0879836 0.3533016 0.3817498 0.6162034 0.6459808 -0.0729407 0.5972874 baja 6
M_cata_individual y_frutal_comun random_forest_restringido 100 1 1 12.96 4.56 0.1637197 0.0778120 0.0556405 0.1558551 0.3211082 0.2123581 0.0954812 0.0694934 0.2201941 0.3668426 -0.2835604 0.3484974 0.4607827 0.5716295 0.0209690 0.2654677 media 1
M_cata_individual y_frutal_comun gradient_boosting_restringido 100 1 1 12.96 4.56 0.1785823 0.0809076 0.0558318 0.1733230 0.3254363 0.2239772 0.0924160 0.0714428 0.2319620 0.3861918 -0.3204758 -0.0239277 0.3945426 0.5590654 0.0188190 0.2696045 media 2
M_cata_individual y_frutal_comun ridge 100 1 1 12.96 4.56 0.2319271 0.0952294 0.0785172 0.2236324 0.4124071 0.2842466 0.1045732 0.1019999 0.2749973 0.4577097 -1.1262444 -0.2419055 0.2706670 0.3162278 0.0426863 0.3338898 media 3
M_cata_individual y_frutal_comun elastic_net 100 1 1 12.96 4.56 0.2390378 0.1457399 0.0770867 0.2119131 0.5195913 0.2988225 0.1591001 0.1081996 0.2749186 0.6225005 -2.1550969 -0.2118258 0.3406923 0.5000000 0.0195391 0.4425047 media 4
M_cata_individual y_frutal_comun lasso 100 1 1 12.96 4.56 0.2456404 0.2120591 0.0587057 0.1993847 0.5537029 0.3125306 0.2492304 0.0659020 0.2551965 0.6373726 -3.0515061 -0.1111727 0.3637531 0.5000000 0.0258235 0.4949972 media 5
M_cata_individual y_frutal_comun pls 100 1 1 12.96 4.56 0.2507653 0.1691071 0.0789667 0.2143322 0.6225329 0.3147574 0.1969307 0.1019854 0.2683752 0.7550123 -2.6225310 -0.1862122 0.2593582 0.3472513 0.0429940 0.5435662 baja 6
M_expandida_evaluador y_fenolico_comun random_forest_restringido 100 0 0 697.74 244.95 0.7312445 0.0454099 0.6635685 0.7239102 0.8115516 0.8940493 0.0594247 0.8168476 0.8820955 1.0052191 0.1359115 0.1569204 0.3729376 0.3973098 0.0313286 0.1479832 alta 1
M_expandida_evaluador y_fenolico_comun gradient_boosting_restringido 100 0 0 697.74 244.95 0.7456955 0.0543306 0.6778012 0.7386542 0.8483158 0.9128652 0.0700081 0.8264686 0.9026744 1.0413993 0.0986806 0.1196378 0.3469674 0.3687602 0.0090087 0.1705147 alta 2
M_expandida_evaluador y_fenolico_comun ridge 100 0 0 697.74 244.95 0.7488112 0.0841139 0.6603101 0.7225656 0.8707167 0.9261089 0.1162355 0.8100930 0.8836574 1.1281716 0.0618474 0.1247394 0.3448835 0.3655971 0.0501299 0.2104065 alta 3
M_expandida_evaluador y_fenolico_comun pls 100 0 0 697.74 244.95 0.7536980 0.0809223 0.6667705 0.7349049 0.9068485 0.9326380 0.1122312 0.8215453 0.9014437 1.1690914 0.0443436 0.1222950 0.3534745 0.3764483 0.0544327 0.2400779 alta 4
M_expandida_evaluador y_fenolico_comun elastic_net 100 0 0 697.74 244.95 0.8264122 0.1682136 0.6748583 0.7858724 1.1232885 1.0434413 0.2413337 0.8155135 0.9633799 1.5228885 -0.2275033 -0.0051572 0.3014457 0.3539143 0.0548825 0.4484301 media 5
M_expandida_evaluador y_fenolico_comun lasso 100 0 0 697.74 244.95 0.8309666 0.1610197 0.6698736 0.7904745 1.0868547 1.0489980 0.2271559 0.8207692 0.9806970 1.3998487 -0.2427574 -0.0773371 0.2915439 0.3527304 0.0461372 0.4169811 media 6
M_expandida_evaluador y_frutal_comun gradient_boosting_restringido 100 0 0 117.87 42.75 0.5208908 0.0779275 0.3983277 0.5135025 0.6685561 0.7043231 0.0897354 0.5615031 0.7042189 0.8551374 -0.0036265 0.0090167 0.1733018 0.2256021 -0.0072134 0.2702284 media 1
M_expandida_evaluador y_frutal_comun random_forest_restringido 100 0 0 117.87 42.75 0.5212719 0.0846046 0.3985686 0.5219114 0.6782868 0.7010817 0.0962785 0.5522390 0.7029755 0.8596854 0.0074449 0.0248145 0.1920496 0.2349271 -0.0206529 0.2797182 media 2
M_expandida_evaluador y_frutal_comun ridge 100 0 0 117.87 42.75 0.5751158 0.1384899 0.4176893 0.5594029 0.7739454 0.7551309 0.1525027 0.5716310 0.7454791 0.9751314 -0.2021773 -0.0330746 0.0868173 0.1362546 -0.0291262 0.3562560 media 3
M_expandida_evaluador y_frutal_comun pls 100 0 0 117.87 42.75 0.5969022 0.1706502 0.4159402 0.5717053 0.8262212 0.7831742 0.1878107 0.5723372 0.7591473 1.0540772 -0.3367233 -0.0646721 0.0878789 0.1371441 -0.0202565 0.4102811 media 4
M_expandida_evaluador y_frutal_comun lasso 100 0 0 117.87 42.75 0.6127343 0.2223140 0.4084205 0.5544878 0.9651389 0.8039824 0.2511860 0.5605825 0.7410248 1.2982370 -0.4699517 -0.0228126 0.1333192 0.1656933 -0.0117261 0.5567184 baja 5
M_expandida_evaluador y_frutal_comun elastic_net 100 0 0 117.87 42.75 0.6176332 0.2603491 0.4103072 0.5601849 1.0741092 0.8074137 0.2811808 0.5609173 0.7417345 1.3341567 -0.5309837 -0.0338527 0.1096581 0.1449967 -0.0406994 0.6638020 baja 6
M_ia_exploratoria y_fenolico_comun random_forest_restringido 100 0 0 42.00 15.19 0.4127871 0.0730497 0.2992209 0.4046970 0.5224389 0.5084668 0.0765141 0.3819465 0.4991605 0.6327572 0.6644585 0.6760546 0.8299693 0.8501431 0.0169204 0.2232180 alta 1
M_ia_exploratoria y_fenolico_comun gradient_boosting_restringido 100 0 0 42.00 15.19 0.4268843 0.0891734 0.3144640 0.4174937 0.6100948 0.5243469 0.0980543 0.4074535 0.5162438 0.6727281 0.6457362 0.6697737 0.7849005 0.8100690 0.0252485 0.2956308 media 2
M_ia_exploratoria y_fenolico_comun elastic_net 100 0 0 42.00 15.19 0.5113401 0.1475221 0.3064212 0.4989115 0.7413515 0.6550335 0.1935671 0.4257521 0.6255894 0.9708329 0.3823341 0.5383479 0.6542078 0.7530780 -0.0192134 0.4349303 media 3
M_ia_exploratoria y_fenolico_comun ridge 100 0 0 42.00 15.19 0.5132741 0.1399338 0.3093320 0.5058915 0.7305001 0.6382607 0.1556347 0.4165415 0.6267849 0.9114231 0.4390119 0.5038558 0.6379299 0.7288041 -0.0491407 0.4211681 media 4
M_ia_exploratoria y_fenolico_comun lasso 100 0 0 42.00 15.19 0.5166186 0.1494614 0.3030708 0.5041010 0.7609095 0.6648400 0.2032816 0.4255501 0.6236555 1.0253325 0.3639693 0.5466356 0.6649465 0.7379254 -0.0162983 0.4578387 media 5
M_ia_exploratoria y_fenolico_comun pls 100 0 0 42.00 15.19 0.5206100 0.1919401 0.2980159 0.4833262 0.7702096 0.6883231 0.2843315 0.4309950 0.6134722 1.1122368 0.2792148 0.5387802 0.6532637 0.7610977 0.0034544 0.4721937 media 6
M_pura y_fenolico_comun random_forest_restringido 100 0 0 34.00 12.08 0.2709944 0.0722428 0.1720885 0.2569384 0.3930968 0.3592314 0.0966523 0.2191634 0.3501762 0.5376334 0.3002299 0.4252598 0.5527485 0.5787677 -0.0018114 0.2210083 alta 1
M_pura y_fenolico_comun ridge 100 0 0 34.00 12.08 0.2739013 0.1132426 0.1511739 0.2574765 0.4761888 0.3769686 0.1774394 0.1964266 0.3614946 0.5738268 0.0464621 0.4211953 0.5992771 0.6731570 0.0398990 0.3250149 media 2
M_pura y_fenolico_comun pls 100 0 0 34.00 12.08 0.2796573 0.1104709 0.1511765 0.2624431 0.4556578 0.3929386 0.1747131 0.2297052 0.3755720 0.5715087 -0.0487733 0.3750097 0.5901903 0.6383616 0.0403170 0.3044813 media 3
M_pura y_fenolico_comun lasso 100 0 0 34.00 12.08 0.3185317 0.1510612 0.1570703 0.2863925 0.6531088 0.4736936 0.2547238 0.2217064 0.3904685 1.0586940 -0.5721387 0.2397800 0.5510437 0.6282298 0.0312627 0.4960385 media 4
M_pura y_fenolico_comun elastic_net 100 0 0 34.00 12.08 0.3217434 0.1544350 0.1539009 0.2935231 0.6549926 0.4752614 0.2535942 0.2048920 0.3999131 1.0231811 -0.5924173 0.2671688 0.5550431 0.6456679 0.0261392 0.5010917 baja 5
M_pura y_fenolico_comun gradient_boosting_restringido 100 0 0 34.00 12.08 0.3252210 0.0785445 0.1988775 0.3197979 0.4438747 0.4227296 0.0955640 0.2486453 0.4189032 0.5610704 0.0602167 0.1862566 0.4714502 0.5089904 0.0056061 0.2449971 alta 6
M_pura y_frutal_comun random_forest_restringido 100 1 1 12.96 4.47 0.1615510 0.0797755 0.0535898 0.1544892 0.3186306 0.2102873 0.0974749 0.0651291 0.2144834 0.3764715 -0.1301436 0.3414281 0.4608918 0.5642881 0.0168478 0.2650409 media 1
M_pura y_frutal_comun gradient_boosting_restringido 100 1 1 12.96 4.47 0.1725570 0.0914665 0.0499258 0.1661361 0.3720376 0.2178508 0.1042724 0.0589881 0.2185529 0.4208891 -0.1977760 0.2705939 0.3900220 0.5000000 0.0137618 0.3221118 media 2
M_pura y_frutal_comun elastic_net 100 1 1 12.96 4.47 0.1966094 0.0914147 0.0525824 0.1813031 0.3802130 0.2551888 0.1124182 0.0671823 0.2500478 0.4541608 -0.7160905 0.0045679 0.3678019 0.5000000 -0.0189421 0.3276306 media 3
M_pura y_frutal_comun lasso 100 1 1 12.96 4.47 0.1974639 0.1047230 0.0582191 0.1837374 0.4136465 0.2569394 0.1318019 0.0726185 0.2423963 0.4859744 -0.8107918 0.0308127 0.3789974 0.5000000 -0.0130792 0.3554275 media 4
M_pura y_frutal_comun ridge 100 1 1 12.96 4.47 0.1988636 0.0823381 0.0473047 0.2031081 0.3493101 0.2495444 0.0943779 0.0650165 0.2594670 0.3938970 -0.4723755 -0.0393181 0.2586678 0.4103913 0.0086467 0.3020055 media 5
M_pura y_frutal_comun pls 100 1 1 12.96 4.47 0.2251230 0.1065152 0.0953003 0.2105389 0.4476051 0.2895973 0.1279348 0.1018921 0.2743580 0.5509596 -1.2543866 -0.2983241 0.2852901 0.4103913 0.0037574 0.3523048 media 6

Para M_pura con y_fenolico_comun, Random Forest restringido, Ridge y PLS quedan muy cerca en MAE bootstrap (0.271, 0.274 y 0.280 respectivamente): una diferencia de apenas 0.003-0.009, pequeña frente a la desviación estándar del propio bootstrap (0.072 en Random Forest, 0.11-0.11 en Ridge y PLS). Esa diferencia de MAE, por sí sola, no alcanza para preferir un modelo sobre otro. Lo que sí distingue a Random Forest restringido es el R² (0.300, frente a 0.046 en Ridge y -0.049 en PLS) y una estabilidad de error clasificada como alta (media en Ridge y PLS), por lo que se recomienda como modelo principal del escenario por esos dos criterios, no por el MAE (detalle completo de esta comparación y de por qué se eligió en la Parte 4). Ridge y PLS se mantienen como modelos de referencia para la interpretación de variables, ya que su estructura lineal regularizada hace explícito el manejo de la colinealidad entre predictores químicos.

** 01_bootstrap_mae_y_fenolico **

** 02_variables_estables_M_pura_y_fenolico **

3.9 Sensibilidad a valores atípicos químicos

Comparación del desempeño del modelo principal (Random Forest restringido) y del modelo alternativo (Ridge) con y sin las unidades marcadas como atípicas en la etapa exploratoria (Dixon / T²-Q), para evaluar si los resultados dependen de esos puntos.

modelo target version n_bootstrap_exitosos n_fallback_holdout mae_media mae_p05 mae_p50 mae_p95 rmse_media r2_media spearman_media bias_media
random_forest_restringido y_fenolico_comun completo 100 0 0.2746997 0.1738740 0.2782505 0.3873386 0.3565862 0.4140521 0.5971615 -0.0158423
random_forest_restringido y_fenolico_comun sin_outliers_eda 100 0 0.2708032 0.1851390 0.2751198 0.3670530 0.3622975 0.3615784 0.5925369 -0.0263238
random_forest_restringido y_frutal_comun completo 100 1 0.1630743 0.0642320 0.1531304 0.2859661 0.2067446 -0.1328518 0.5298991 0.0580511
random_forest_restringido y_frutal_comun sin_outliers_eda 100 0 0.1666198 0.0469011 0.1653134 0.2966252 0.2164721 -0.3292504 0.4314388 -0.0099049
ridge y_fenolico_comun completo 100 0 0.2594540 0.1573723 0.2539684 0.3823481 0.3550912 0.2869069 0.6283030 0.0321154
ridge y_fenolico_comun sin_outliers_eda 100 0 0.2609778 0.1561235 0.2534040 0.3873083 0.3517569 0.3043814 0.6299918 0.0092467
ridge y_frutal_comun completo 100 1 0.2179235 0.1049252 0.2158147 0.3797200 0.2732786 -1.0142690 0.3526512 0.0648630
ridge y_frutal_comun sin_outliers_eda 100 0 0.2388778 0.1342856 0.2201142 0.3944810 0.3010013 -1.0314849 0.2850201 0.0678066

Ambos modelos mantienen un MAE similar con y sin las unidades marcadas como atípicas (variación de un pocos puntos porcentuales, no un cambio de orden de magnitud), lo que indica que los resultados de M_pura no dependen de un puñado de valores extremos — un modelo frágil mostraría una caída marcada al remover esos puntos.

** 01_comparacion_mae_completo_vs_sin_outliers **

3.10 Sensibilidad a la imputación de variables GC-MS

Dentro de M_pura, las 5 variables GC-MS (x_gcms_esteres_pct, x_gcms_fenolicos_pct, x_gcms_aldehidos_pct, x_gcms_aroma_fermentativo_pct, x_gcms_area_valida_pct) tienen dato real en solo 8 de las 34 unidades (23.5% de cobertura); el resto se completa por la imputación por mediana descrita más arriba. Para verificar que el consenso de importancia de variables no depende críticamente de esos datos mayormente imputados, se repitió el mismo procedimiento de bootstrap agrupado (100 iteraciones, Random Forest restringido y Ridge, M_pura) comparando la versión completa (32 predictores, incluye GC-MS) contra una versión que excluye por completo los 5 predictores GC-MS, sin imputarlos.

modelo target version n_bootstrap_exitosos n_fallback_holdout mae_media mae_p05 mae_p50 mae_p95 rmse_media r2_media spearman_media bias_media
random_forest_restringido y_fenolico_comun completo 100 0 0.2746997 0.1738740 0.2782505 0.3873386 0.3565862 0.4140521 0.5971615 -0.0158423
random_forest_restringido y_fenolico_comun sin_gcms 100 0 0.2789848 0.1658258 0.2658560 0.4311091 0.3804911 0.3330437 0.5834798 -0.0213053
random_forest_restringido y_frutal_comun completo 100 0 0.1639733 0.0693337 0.1617188 0.2848108 0.2133147 -0.3298862 0.4746166 0.0328277
random_forest_restringido y_frutal_comun sin_gcms 99 0 0.1625070 0.0575565 0.1536956 0.2940623 0.2150708 -0.1810089 0.4736512 0.0239322
ridge y_fenolico_comun completo 100 0 0.2594540 0.1573723 0.2539684 0.3823481 0.3550912 0.2869069 0.6283030 0.0321154
ridge y_fenolico_comun sin_gcms 100 0 0.2286707 0.1250348 0.2271307 0.3312843 0.3278012 0.3815380 0.6503890 0.0157361
ridge y_frutal_comun completo 100 0 0.2172038 0.1131995 0.2083207 0.3272852 0.2757330 -1.0233922 0.3401334 0.0030806
ridge y_frutal_comun sin_gcms 100 1 0.2175814 0.0708824 0.2003079 0.4716708 0.2735283 -7.7581644 0.3146474 0.0650945
modelo target mae_media_completo mae_media_sin_gcms rmse_media_completo rmse_media_sin_gcms r2_media_completo r2_media_sin_gcms spearman_media_completo spearman_media_sin_gcms diferencia_mae diferencia_mae_pct diferencia_r2 lectura
random_forest_restringido y_fenolico_comun 0.275 0.279 0.357 0.380 0.414 0.333 0.597 0.583 0.004 1.6 -0.081 robusto: el MAE cambia menos de 10% al quitar las variables GC-MS
random_forest_restringido y_frutal_comun 0.164 0.163 0.213 0.215 -0.330 -0.181 0.475 0.474 -0.001 -0.9 0.149 robusto: el MAE cambia menos de 10% al quitar las variables GC-MS
ridge y_fenolico_comun 0.259 0.229 0.355 0.328 0.287 0.382 0.628 0.650 -0.031 -11.9 0.095 sensibilidad moderada: revisar si GC-MS aporta senal real o solo variabilidad de la imputacion
ridge y_frutal_comun 0.217 0.218 0.276 0.274 -1.023 -7.758 0.340 0.315 0.000 0.2 -6.735 robusto: el MAE cambia menos de 10% al quitar las variables GC-MS

** 01_comparacion_mae_completo_vs_sin_gcms **

Para Random Forest restringido (el modelo principal), el MAE bootstrap cambia menos de un 2% al quitar por completo las variables GC-MS, tanto en y_fenolico_comun como en y_frutal_comun: el resultado del modelo principal es robusto a la imputación de GC-MS. Para Ridge, el MAE de y_fenolico_comun sí cambia de forma moderada (variación de un 11.9%, mejorando al excluir GC-MS), lo que indica que Ridge apoya una parte de su ajuste en la señal de esas variables mayormente imputadas. En conjunto, esto confirma que la conclusión principal de la tesis (Random Forest restringido, fenoles volátiles GC-FID como variables más consistentes) no depende de los datos GC-MS imputados, pero recomienda tratar con cautela cualquier lectura de las variables GC-MS específicamente cuando aparecen en modelos lineales como Ridge, dado su nivel de cobertura real (23.5%).

4 - RESULTADOS FINALES

4.1 Objetivo de esta parte

Esta parte integra los resultados de las etapas anteriores: qué variables explican mejor la calidad sensorial fenólica, cómo se comparan los escenarios de modelamiento entre sí, qué tan robustos son los resultados frente a valores atípicos, y qué conclusiones se pueden sostener con la evidencia disponible.

Un análisis más detallado en formato de guía de defensa (con preguntas anticipadas de comisión) está disponible en outputs/modelamiento/analisis_finales/resultados_finales_y_guia_defensa.pdf.

4.2 Interpretabilidad de variables

Consenso de importancia de variables entre los distintos modelos candidatos, para y_fenolico_comun en el escenario principal (M_pura).

escenario target predictor predictor_limpio tecnica familia_quimica coherencia_target n_modelos_con_variable modelos_que_la_reportan frecuencia_media frecuencia_max importancia_norm_media importancia_norm_max n_bootstrap_total_modelos justificacion_quimica estabilidad_consenso prioridad_tesis ranking_consenso
M_cata_individual y_fenolico_comun x_ju_maltose_consumption_g_l ju maltose consumption g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.9025000 1.00 8.0063783 30.1300872 361 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 1
M_cata_individual y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9000000 0.96 30.2853379 48.0739598 360 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2
M_cata_individual y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8250000 0.95 36.2192044 51.8901376 330 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3
M_cata_individual y_fenolico_comun x_ju_final_co2_loss_g_l ju final co2 loss g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.7600000 1.00 7.9266643 31.2515802 304 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 4
M_cata_individual y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7525000 0.95 3.1781674 4.3415063 301 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5
M_cata_individual y_fenolico_comun x_ju_ethanol_production_g_l ju ethanol production g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.6675000 0.99 7.8559406 27.9905136 267 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. media apoyo_interpretativo 6
M_cata_individual y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6425000 0.80 1.9171889 2.3570225 257 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 7
M_cata_individual y_fenolico_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.4275000 0.68 6.0405734 8.4500423 171 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. baja_media baja_prioridad 8
M_cata_individual y_fenolico_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3800000 0.62 0.9335453 2.0769450 152 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja_media baja_prioridad 9
M_cata_individual y_fenolico_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3650000 0.58 2.6841400 5.1692975 146 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja_media baja_prioridad 10
M_cata_individual y_fenolico_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.3625000 0.61 0.8757130 1.8880273 145 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja_media baja_prioridad 11
M_cata_individual y_fenolico_comun x_ju_ethyl_octanoate_ppm ju ethyl octanoate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3550000 0.52 0.2086841 0.7676894 142 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja_media baja_prioridad 12
M_cata_individual y_fenolico_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3525000 0.60 1.0577372 4.1264966 141 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja_media baja_prioridad 13
M_cata_individual y_fenolico_comun x_ju_o_cresol_ppm ju o cresol ppm JU fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.3500000 0.52 1.7950195 3.1896890 140 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. baja_media baja_prioridad 14
M_cata_individual y_fenolico_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.3475000 0.57 1.4507002 2.5004198 139 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. baja_media baja_prioridad 15
M_cata_individual y_fenolico_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3325000 0.48 2.3249242 5.6525246 133 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja_media baja_prioridad 16
M_cata_individual y_fenolico_comun x_ju_ethyl_hexadecanoate_ppm ju ethyl hexadecanoate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.2925000 0.52 8.7763886 19.0010049 117 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 17
M_cata_individual y_fenolico_comun x_ju_ethyl_decanoate_ppm ju ethyl decanoate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.2600000 0.37 4.8211188 10.0017442 104 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 18
M_cata_individual y_fenolico_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1825000 0.28 0.9703554 3.5215544 73 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 19
M_cata_individual y_fenolico_comun x_ju_isoamyl_octanoate_ppm ju isoamyl octanoate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1700000 0.30 15.0889568 21.1768544 68 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 20
M_cata_individual y_fenolico_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1525000 0.23 0.4312565 0.9588644 61 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 21
M_cata_individual y_fenolico_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1450000 0.23 1.0676826 2.0983835 58 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 22
M_cata_individual y_fenolico_comun x_ju_ethyl_myristate_ppm ju ethyl myristate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1400000 0.25 22.6597863 36.8400347 56 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 23
M_cata_individual y_fenolico_comun x_ju_isoamyl_acetate_ppm ju isoamyl acetate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1325000 0.23 5.8948657 12.5228383 53 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 24
M_cata_individual y_fenolico_comun x_ju_ethyl_dodecanoate_ppm ju ethyl dodecanoate ppm JU esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1300000 0.25 7.8452264 15.1721465 52 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 25
M_cata_individual y_fenolico_comun x_ju_ferulic_acid_conversion_index_faci_percent ju ferulic acid conversion index faci percent JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.1025000 0.14 6.4642188 19.3329610 41 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. baja baja_prioridad 26
M_cata_individual y_fenolico_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.0650000 0.12 8.0333391 9.8171782 26 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja baja_prioridad 27
M_cata_individual y_fenolico_comun x_ju_p_cresol_ppm ju p cresol ppm JU fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.0475000 0.10 7.1974041 10.9075603 19 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. baja baja_prioridad 28
M_cata_individual y_fenolico_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.0375000 0.05 0.2064639 0.5791659 15 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 29
M_cata_individual y_fenolico_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres media_contextual 3 elastic_net; lasso; ridge 0.0333333 0.04 4.5895306 6.4533091 10 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 30
M_cata_individual y_fenolico_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres media_contextual 3 elastic_net; lasso; ridge 0.0333333 0.06 0.1682959 0.2052991 10 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 31
M_cata_individual y_frutal_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8250000 0.99 32.8258928 62.7539356 330 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 1
M_cata_individual y_frutal_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7650000 0.99 3.0515598 10.9268698 306 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 2
M_cata_individual y_frutal_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7325000 0.99 4.7160218 11.8284163 293 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 3
M_cata_individual y_frutal_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.7050000 0.99 9.5198847 18.2132304 282 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta exploratoria_target_secundario 4
M_cata_individual y_frutal_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.5925000 0.99 22.7475498 36.7797778 237 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 5
M_cata_individual y_frutal_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5825000 0.99 3.6477094 11.1174277 233 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 6
M_cata_individual y_frutal_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5800000 0.99 8.6614095 17.2362299 232 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 7
M_cata_individual y_frutal_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5725000 0.99 52.7168977 73.4146112 229 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 8
M_cata_individual y_frutal_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5400000 0.99 4.1815484 9.8920336 216 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 9
M_cata_individual y_frutal_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5350000 0.99 2.4114320 9.2724615 214 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 10
M_cata_individual y_frutal_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.2850000 0.43 5.5531613 15.1978811 114 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 11
M_cata_individual y_frutal_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.2700000 0.43 22.2308714 37.0443960 108 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 12
M_cata_individual y_frutal_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.2650000 0.43 3.4777826 11.0419708 106 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. baja exploratoria_target_secundario 13
M_cata_individual y_frutal_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.2225000 0.43 20.5160793 33.6874617 89 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 14
M_expandida_evaluador y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9200000 0.99 9.1047855 12.5479718 368 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 1
M_expandida_evaluador y_fenolico_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8850000 1.00 14.3614661 15.5194569 354 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2
M_expandida_evaluador y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8725000 1.00 27.2799328 37.5569852 349 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3
M_expandida_evaluador y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8200000 0.99 30.1935124 38.0597555 328 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 4
M_expandida_evaluador y_fenolico_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7975000 0.98 2.6250331 10.1345706 319 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. alta prioritaria 5
M_expandida_evaluador y_fenolico_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7475000 1.00 3.5707393 14.1860356 299 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. alta prioritaria 6
M_expandida_evaluador y_fenolico_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.9200000 0.99 6.4923925 15.9618476 368 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta apoyo_interpretativo 7
M_expandida_evaluador y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.8700000 0.96 3.5483618 7.9074718 348 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta apoyo_interpretativo 8
M_expandida_evaluador y_fenolico_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6875000 0.93 4.5614148 17.8986718 275 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 9
M_expandida_evaluador y_fenolico_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.6825000 0.86 3.8927029 5.9368444 273 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. media apoyo_interpretativo 10
M_expandida_evaluador y_fenolico_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6650000 0.83 5.3905065 15.6869701 266 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 11
M_expandida_evaluador y_fenolico_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.6625000 0.90 1.5924456 4.5590082 265 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 12
M_expandida_evaluador y_fenolico_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6250000 0.92 1.5246321 4.4203235 250 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 13
M_expandida_evaluador y_fenolico_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.6200000 0.93 7.7084680 8.8142065 248 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 14
M_expandida_evaluador y_fenolico_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6050000 0.74 7.2688860 11.1406476 242 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 15
M_expandida_evaluador y_fenolico_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.3500000 0.49 7.9611186 9.1531807 140 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja_media baja_prioridad 16
M_expandida_evaluador y_fenolico_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1575000 0.28 1.6355768 3.6189901 63 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 17
M_expandida_evaluador y_fenolico_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1125000 0.21 5.0272987 20.0772216 45 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 18
M_expandida_evaluador y_frutal_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8400000 1.00 31.9097552 63.7024006 336 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 1
M_expandida_evaluador y_frutal_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7325000 1.00 3.8579737 10.8288738 293 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 2
M_expandida_evaluador y_frutal_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7175000 1.00 5.3070729 12.4131536 287 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 3
M_expandida_evaluador y_frutal_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.7125000 1.00 10.0157417 17.6948470 285 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta exploratoria_target_secundario 4
M_expandida_evaluador y_frutal_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5700000 1.00 6.0399082 10.8431513 228 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 5
M_expandida_evaluador y_frutal_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5675000 1.00 51.7218787 69.1685851 227 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 6
M_expandida_evaluador y_frutal_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.5650000 1.00 19.8055289 30.8754829 226 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 7
M_expandida_evaluador y_frutal_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550000 1.00 2.8785346 11.0671682 222 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 8
M_expandida_evaluador y_frutal_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5175000 0.89 14.6953678 19.9555476 207 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 9
M_expandida_evaluador y_frutal_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5175000 1.00 3.9088899 10.4196345 207 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 10
M_expandida_evaluador y_frutal_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.4800000 0.89 3.1068708 7.8836265 192 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta_en_un_modelo exploratoria_target_secundario 11
M_expandida_evaluador y_frutal_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.4775000 1.00 2.4719345 9.1945814 191 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta_en_un_modelo exploratoria_target_secundario 12
M_expandida_evaluador y_frutal_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.4750000 0.89 17.3088157 30.7047620 190 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta_en_un_modelo exploratoria_target_secundario 13
M_expandida_evaluador y_frutal_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.4725000 0.89 2.4474849 7.6315294 189 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta_en_un_modelo exploratoria_target_secundario 14
M_ia_exploratoria y_fenolico_comun x_folin_fenoles_totales_ug_ag_ml folin fenoles totales ug ag ml Folin fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 1.0000000 1.00 13.5037965 24.8135752 400 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta solo_exploratoria_ia 1
M_ia_exploratoria y_fenolico_comun x_ju_maltose_consumption_g_l ju maltose consumption g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.9850000 1.00 13.8582562 18.2119660 394 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta solo_exploratoria_ia 2
M_ia_exploratoria y_fenolico_comun x_ju_ferulic_acid_conversion_index_faci_percent ju ferulic acid conversion index faci percent JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.9275000 1.00 27.2785003 35.2278431 371 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta solo_exploratoria_ia 3
M_ia_exploratoria y_fenolico_comun x_ju_final_co2_loss_g_l ju final co2 loss g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.8750000 1.00 20.2041663 26.8157618 350 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta solo_exploratoria_ia 4
M_ia_exploratoria y_fenolico_comun x_ju_ethanol_production_g_l ju ethanol production g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.7850000 1.00 41.1315620 51.6717887 314 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta solo_exploratoria_ia 5
M_pura y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9225000 0.99 17.5340225 32.3236383 369 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 1
M_pura y_fenolico_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8450000 1.00 15.6426849 20.4604126 338 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2
M_pura y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7750000 1.00 24.7345254 42.0451875 310 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3
M_pura y_fenolico_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7375000 1.00 2.3193138 9.1723343 295 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. alta prioritaria 4
M_pura y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7275000 0.99 37.0062948 55.0525829 291 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5
M_pura y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7775000 0.86 4.9197582 10.9350468 311 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta apoyo_interpretativo 6
M_pura y_fenolico_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6575000 0.95 3.3869880 13.0310652 263 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 7
M_pura y_fenolico_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.6550000 0.87 4.1632834 6.6607996 262 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. media apoyo_interpretativo 8
M_pura y_fenolico_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6475000 0.87 5.0464690 13.5782129 259 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 9
M_pura y_fenolico_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6375000 0.85 7.5490194 12.7811817 255 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 10
M_pura y_fenolico_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6325000 0.94 5.2282107 12.3535847 253 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 11
M_pura y_fenolico_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5900000 0.88 1.9592020 6.4803100 236 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 12
M_pura y_fenolico_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550000 0.83 2.9518141 11.3393058 222 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 13
M_pura y_fenolico_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550000 0.87 1.9548687 6.6297376 222 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 14
M_pura y_fenolico_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.4800000 0.84 9.9587332 15.2960620 192 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta_en_un_modelo baja_prioridad 15
M_pura y_fenolico_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.2225000 0.42 3.1800679 12.6263690 89 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 16
M_pura y_fenolico_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1650000 0.30 8.3958612 11.3039370 66 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 17
M_pura y_fenolico_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.1375000 0.32 2.1497057 5.2103100 55 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. baja baja_prioridad 18
M_pura y_frutal_comun x_gcfid_isoamyl_octanoate_ppm gcfid isoamyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8600000 0.99 34.3790115 64.4288115 344 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 1
M_pura y_frutal_comun x_gcfid_ethyl_dodecanoate_ppm gcfid ethyl dodecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7900000 0.99 2.8996143 10.9615586 316 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 2
M_pura y_frutal_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7500000 0.99 3.6058937 11.7232052 300 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. alta exploratoria_target_secundario 3
M_pura y_frutal_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.7475000 0.99 11.0732779 21.5483824 299 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta exploratoria_target_secundario 4
M_pura y_frutal_comun x_gcfid_creosol_ppm gcfid creosol ppm GC-FID otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.6050000 0.99 21.3889674 37.6896642 242 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 5
M_pura y_frutal_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5950000 0.99 2.7686076 9.8623587 238 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 6
M_pura y_frutal_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5775000 0.99 49.3413073 70.6515517 231 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media exploratoria_target_secundario 7
M_pura y_frutal_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5450000 0.99 5.5497346 14.0698682 218 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 8
M_pura y_frutal_comun x_gcfid_ethyl_tetradecanoate_ppm gcfid ethyl tetradecanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5150000 0.99 4.9357719 11.0071562 206 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 9
M_pura y_frutal_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.5025000 0.99 2.8499626 9.1172409 201 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. media exploratoria_target_secundario 10
M_pura y_frutal_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles baja_no_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.2450000 0.37 23.6806275 42.2532118 98 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 11
M_pura y_frutal_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.2225000 0.37 3.4111565 9.8344783 89 Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. baja exploratoria_target_secundario 12
M_pura y_frutal_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.2100000 0.37 24.4245377 47.1406059 84 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 13
M_pura y_frutal_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.2100000 0.37 5.8925382 12.1882939 84 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. baja exploratoria_target_secundario 14
escenario target predictor predictor_limpio tecnica familia_quimica coherencia_target n_modelos_con_variable modelos_que_la_reportan frecuencia_media frecuencia_max importancia_norm_media importancia_norm_max n_bootstrap_total_modelos justificacion_quimica estabilidad_consenso prioridad_tesis ranking_consenso
M_cata_individual y_fenolico_comun x_ju_maltose_consumption_g_l ju maltose consumption g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.9025 1.00 8.006378 30.130087 361 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 1
M_cata_individual y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9000 0.96 30.285338 48.073960 360 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2
M_cata_individual y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8250 0.95 36.219204 51.890138 330 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3
M_cata_individual y_fenolico_comun x_ju_final_co2_loss_g_l ju final co2 loss g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.7600 1.00 7.926664 31.251580 304 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 4
M_cata_individual y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7525 0.95 3.178167 4.341506 301 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5
M_cata_individual y_fenolico_comun x_ju_ethanol_production_g_l ju ethanol production g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.6675 0.99 7.855941 27.990514 267 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. media apoyo_interpretativo 6
M_cata_individual y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6425 0.80 1.917189 2.357022 257 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 7
M_pura y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9225 0.99 17.534022 32.323638 369 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 1
M_pura y_fenolico_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8450 1.00 15.642685 20.460413 338 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2
M_pura y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7750 1.00 24.734525 42.045187 310 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3
M_pura y_fenolico_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7375 1.00 2.319314 9.172334 295 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. alta prioritaria 4
M_pura y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7275 0.99 37.006295 55.052583 291 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5
M_pura y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7775 0.86 4.919758 10.935047 311 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta apoyo_interpretativo 6
M_pura y_fenolico_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6575 0.95 3.386988 13.031065 263 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 7
M_pura y_fenolico_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.6550 0.87 4.163283 6.660800 262 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. media apoyo_interpretativo 8
M_pura y_fenolico_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6475 0.87 5.046469 13.578213 259 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 9
M_pura y_fenolico_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6375 0.85 7.549019 12.781182 255 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 10
M_pura y_fenolico_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6325 0.94 5.228211 12.353585 253 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 11
M_pura y_fenolico_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5900 0.88 1.959202 6.480310 236 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 12
M_pura y_fenolico_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550 0.83 2.951814 11.339306 222 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 13
M_pura y_fenolico_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550 0.87 1.954869 6.629738 222 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 14

** 01_consenso_variables_M_pura_y_fenolico **

** 02_familias_quimicas_M_pura_y_fenolico **

** 03_variable_modelo_M_pura_y_fenolico **

** 04_variables_prioritarias_escenarios_reales **

Las variables más consistentes son fenoles volátiles medidos por GC-FID (guaiacol, p-cresol, o-cresol, 4-etil-guaiacol), lo cual es coherente desde el punto de vista químico con el atributo sensorial “fenólico” (asociado a compuestos derivados de la turba/ahumado). Variables fermentativas JU (consumo de maltosa, pérdida de CO₂, producción de etanol) aparecen como señales indirectas de apoyo, no como explicación causal directa.

4.3 Comparación final entre escenarios

escenario tipo_escenario modelo_recomendado mae_bootstrap mae_p05 mae_p95 rmse_bootstrap r2_bootstrap spearman_bootstrap estabilidad_error recomendacion_uso lectura_escenario
M_pura principal_real random_forest_restringido 0.2709944 0.1720885 0.3930968 0.3592314 0.3002299 0.5527485 alta modelo_principal_predictivo Escenario principal con datos quimico-sensoriales reales (sin cata individual JU). Es la base central para conclusiones predictivas.
M_cata_individual sensibilidad_con_ju random_forest_restringido 0.3303534 0.1905647 0.5313743 0.4761227 0.7578598 0.8178249 media comparacion_con_aporte_ju Matriz pura mas la cata individual JU agregada. Permite evaluar el aporte y la heterogeneidad introducida por JU, comparando directamente contra M_pura.
M_expandida_evaluador complementario_evaluador random_forest_restringido 0.7312445 0.6635685 0.8115516 0.8940493 0.1359115 0.3729376 alta complementario_no_principal Escenario complementario para variabilidad entre evaluadores. No debe interpretarse como aumento independiente de muestras quimicas.
M_ia_exploratoria exploratorio_ia random_forest_restringido 0.4127871 0.2992209 0.5224389 0.5084668 0.6644585 0.8299693 alta exploratorio_sintetico_no_real Escenario sintetico exploratorio con imputacion sensorial asistida por IA. No reemplaza cata real.

** 01_modelamiento_mae_bootstrap_y_fenolico **

** 02_modelamiento_mejor_modelo_por_escenario **

** 03_modelamiento_base_vs_mejor_y_fenolico **

** 04_modelamiento_variables_discusion **

escenario target predictor predictor_limpio tecnica familia_quimica coherencia_target n_modelos_con_variable modelos_que_la_reportan frecuencia_media frecuencia_max importancia_norm_media importancia_norm_max n_bootstrap_total_modelos justificacion_quimica estabilidad_consenso prioridad_tesis ranking_consenso orden_escenario lectura_final
M_pura y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9225 0.99 17.534022 32.323638 369 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 1 1 variable_prioritaria_directa
M_pura y_fenolico_comun x_gcfid_p_cresol_ppm gcfid p cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8450 1.00 15.642685 20.460413 338 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2 1 variable_prioritaria_directa
M_pura y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7750 1.00 24.734525 42.045187 310 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3 1 variable_prioritaria_directa
M_pura y_fenolico_comun x_gcfid_ethyl_octanoate_ppm gcfid ethyl octanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7375 1.00 2.319314 9.172334 295 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. alta prioritaria 4 1 variable_prioritaria_indirecta
M_pura y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7275 0.99 37.006295 55.052583 291 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5 1 variable_prioritaria_directa
M_pura y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.7775 0.86 4.919758 10.935047 311 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. alta apoyo_interpretativo 6 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcfid_ethyl_hexadecanoate_ppm gcfid ethyl hexadecanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6575 0.95 3.386988 13.031065 263 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 7 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcms_fenolicos_pct gcms fenolicos pct GC-MS fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.6550 0.87 4.163283 6.660800 262 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. media apoyo_interpretativo 8 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcfid_isoamyl_acetate_ppm gcfid isoamyl acetate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6475 0.87 5.046469 13.578213 259 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 9 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcms_aldehidos_pct gcms aldehidos pct GC-MS aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6375 0.85 7.549019 12.781182 255 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 10 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcfid_furfural_ppm gcfid furfural ppm GC-FID aldehidos_furanicos baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6325 0.94 5.228211 12.353585 253 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 11 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcms_esteres_pct gcms esteres pct GC-MS esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5900 0.88 1.959202 6.480310 236 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 12 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcfid_ethyl_decanoate_ppm gcfid ethyl decanoate ppm GC-FID esteres media_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550 0.83 2.951814 11.339306 222 Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. media apoyo_interpretativo 13 1 apoyo_interpretativo
M_pura y_fenolico_comun x_gcms_aroma_fermentativo_pct gcms aroma fermentativo pct GC-MS otros no_prioritaria 4 elastic_net; lasso; random_forest_restringido; ridge 0.5550 0.87 1.954869 6.629738 222 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 14 1 apoyo_interpretativo
M_cata_individual y_fenolico_comun x_ju_maltose_consumption_g_l ju maltose consumption g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.9025 1.00 8.006378 30.130087 361 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 1 2 variable_prioritaria_indirecta
M_cata_individual y_fenolico_comun x_gcfid_o_cresol_ppm gcfid o cresol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.9000 0.96 30.285338 48.073960 360 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 2 2 variable_prioritaria_directa
M_cata_individual y_fenolico_comun x_gcfid_4_ethyl_guaiacol_ppm gcfid 4 ethyl guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.8250 0.95 36.219204 51.890138 330 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 3 2 variable_prioritaria_directa
M_cata_individual y_fenolico_comun x_ju_final_co2_loss_g_l ju final co2 loss g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.7600 1.00 7.926664 31.251580 304 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. alta prioritaria 4 2 variable_prioritaria_indirecta
M_cata_individual y_fenolico_comun x_gcfid_guaiacol_ppm gcfid guaiacol ppm GC-FID fenoles_volatiles alta_directa 4 elastic_net; lasso; random_forest_restringido; ridge 0.7525 0.95 3.178167 4.341506 301 Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. alta prioritaria 5 2 variable_prioritaria_directa
M_cata_individual y_fenolico_comun x_ju_ethanol_production_g_l ju ethanol production g l JU fermentacion_indirecta media_indirecta 4 elastic_net; lasso; random_forest_restringido; ridge 0.6675 0.99 7.855941 27.990514 267 Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. media apoyo_interpretativo 6 2 apoyo_interpretativo
M_cata_individual y_fenolico_comun x_gcms_area_valida_pct gcms area valida pct GC-MS calidad_senal_analitica baja_contextual 4 elastic_net; lasso; random_forest_restringido; ridge 0.6425 0.80 1.917189 2.357022 257 Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. media apoyo_interpretativo 7 2 apoyo_interpretativo

4.3.1 Sensibilidad a la cata individual JU: ¿cambia el modelo si se agrega?

La Parte 1 (Matriz 5) describió cómo se compone M_cata_individual (la matriz pura más 18 filas de una cata realizada por un solo catador, sin promedio de panel). Esta es la pregunta que esa matriz busca responder: ¿el modelo predice distinto si se agregan esas filas?

Escenario Modelo MAE bootstrap R² bootstrap
M_pura (sin JU) Random Forest restringido 0.271 0.300
M_cata_individual (pura + JU) Random Forest restringido 0.330 0.758

El R² sube de 0.30 a 0.76 al agregar la cata JU — una mejora grande. Pero esto no es evidencia de que la química explique mejor la calidad fenólica: es evidencia de que un solo catador es sistemáticamente más fácil de predecir que el promedio de un panel (menos ruido de agregación, menos variabilidad entre personas). Por eso la matriz pura oficial excluye esta cata — incluirla habría inflado artificialmente el desempeño del modelo sin que la señal química fuera realmente más fuerte. Esta comparación es, en sí misma, la justificación metodológica de por qué M_pura es el escenario principal y M_cata_individual solo un análisis de sensibilidad complementario.

4.4 Robustez de los resultados

indicador valor
escenario_principal M_pura
target_principal y_fenolico_comun
modelo_principal random_forest_restringido
mae_bootstrap_principal 0.271
r2_bootstrap_principal 0.3
spearman_bootstrap_principal 0.553
mae_bootstrap_sin_outliers_eda 0.2708
diferencia_mae_pct_por_exclusion_outliers -1.4%
n_unidades_marcadas_eda_M_pura 6
grados_libertad_aprox_target_secundario -5
r2_bootstrap_target_secundario_completo -0.1329
r2_bootstrap_target_secundario_sin_outliers -0.3293
afirmacion evidencia fuente fortaleza
random_forest_restringido sobre y_fenolico_comun en M_pura es el resultado predictivo principal de la tesis. MAE bootstrap = 0.271; R2 bootstrap = 0.3; Spearman bootstrap = 0.553 (n=100 iteraciones bootstrap agrupado). 19_comparar_escenarios_modelamiento.R (00_resumen_ejecutivo) fuerte
El resultado principal (y_fenolico_comun) es robusto a las unidades quimicamente atipicas detectadas en el EDA. MAE bootstrap completo = 0.275 vs. sin unidades marcadas por T2/Q = 0.271 (diferencia = -1.4%). 16b_sensibilidad_outliers_quimicos.R (02_resumen_comparativo, 03_comparacion_diferencias) fuerte
Las unidades marcadas como atipicas en el EDA no predicen sistematicamente peor con el modelo principal. Residuo absoluto medio en unidades marcadas por el EDA = 0.188 vs. no marcadas = 0.261. 17_residuos_diagnostico.R (09_resumen_cruce_outliers) moderada
y_frutal_comun debe mantenerse como target secundario/exploratorio, no como resultado central. Grados de libertad aproximados = -5 en M_pura (n_filas_modelables - n_predictores_usables, ver script 13); R2 bootstrap del modelo principal para y_frutal_comun es negativo (peor que predecir la media). 13_diagnostico_modelamiento.R (01_viabilidad_escenarios) + 16b fuerte
Las variables quimicas prioritarias son coherentes con la literatura de compuestos fenolicos volatiles. Variables con prioridad_tesis == ‘prioritaria’: x_gcfid_guaiacol_ppm, x_gcfid_p_cresol_ppm, x_gcfid_o_cresol_ppm, x_gcfid_ethyl_octanoate_ppm, x_gcfid_4_ethyl_guaiacol_ppm (script 18, hoja 05_variables_finales_tesis). 18_interpretabilidad_modelos.R (05_variables_finales_tesis) moderada
El VIF global no es aplicable; se uso correlacion pareada y VIF por bloque como alternativa metodologica. Ver colinealidad_modelamiento.xlsx (script 13b) y diagnostico_modelamiento.xlsx (script 13, hoja 01_viabilidad_escenarios). 13b_colinealidad_modelamiento.R fuerte

4.5 Diagnóstico de residuos (modelo principal)

** 01_predicho_vs_observado_M_pura_y_fenolico **

** 02_residuos_vs_predicho_M_pura_y_fenolico **

** 03_qqplot_residuos_M_pura_y_fenolico **

** 04_distribucion_residuos_y_fenolico **

escenario target modelo es_outlier_eda n_predicciones n_atipicos_residual pct_atipicos_residual residuo_abs_medio lectura
M_cata_individual y_fenolico_comun elastic_net TRUE 10 0 0 0.2667 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun elastic_net FALSE 42 0 0 0.5355 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun gradient_boosting_restringido TRUE 10 0 0 0.6428 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun gradient_boosting_restringido FALSE 42 0 0 0.9339 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun lasso TRUE 10 0 0 0.2711 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun lasso FALSE 42 0 0 0.5608 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun lineal_reducido TRUE 10 0 0 0.6122 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun lineal_reducido FALSE 42 0 0 0.7758 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun media_entrenamiento TRUE 10 0 0 0.6749 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun media_entrenamiento FALSE 42 0 0 0.9369 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun pls TRUE 10 10 100 0.3851 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun pls FALSE 42 42 100 0.5531 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun random_forest_restringido TRUE 10 0 0 0.1874 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun random_forest_restringido FALSE 42 0 0 0.2974 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_fenolico_comun ridge TRUE 10 0 0 0.3555 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_fenolico_comun ridge FALSE 42 0 0 0.5872 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun elastic_net TRUE 1 0 0 0.4790 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun elastic_net FALSE 12 0 0 0.1162 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun gradient_boosting_restringido TRUE 1 1 100 0.4431 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun gradient_boosting_restringido FALSE 12 12 100 0.1125 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun lasso TRUE 1 0 0 0.4684 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun lasso FALSE 12 0 0 0.1047 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun lineal_reducido TRUE 1 0 0 0.4710 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun lineal_reducido FALSE 12 0 0 0.1063 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun media_entrenamiento TRUE 1 0 0 0.5278 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun media_entrenamiento FALSE 12 0 0 0.2241 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun pls TRUE 1 0 0 0.4457 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun pls FALSE 12 0 0 0.1412 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun random_forest_restringido TRUE 1 1 100 0.4258 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun random_forest_restringido FALSE 12 12 100 0.1166 Unidades sin marca de atipico en el EDA quimico.
M_cata_individual y_frutal_comun ridge TRUE 1 0 0 0.5005 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_cata_individual y_frutal_comun ridge FALSE 12 0 0 0.1086 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun elastic_net TRUE 115 0 0 0.6401 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun elastic_net FALSE 570 0 0 0.7295 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun gradient_boosting_restringido TRUE 115 0 0 0.7709 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun gradient_boosting_restringido FALSE 570 0 0 0.7593 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun lasso TRUE 115 0 0 0.6409 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun lasso FALSE 570 0 0 0.7323 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun lineal_reducido TRUE 115 0 0 0.6885 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun lineal_reducido FALSE 570 0 0 0.7581 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun media_entrenamiento TRUE 115 0 0 0.7453 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun media_entrenamiento FALSE 570 0 0 0.8293 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun pls TRUE 115 0 0 0.6411 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun pls FALSE 570 0 0 0.7234 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun random_forest_restringido TRUE 115 0 0 0.6943 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun random_forest_restringido FALSE 570 0 0 0.7536 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_fenolico_comun ridge TRUE 115 0 0 0.6416 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_fenolico_comun ridge FALSE 570 0 0 0.7194 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun elastic_net TRUE 10 0 0 0.9458 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun elastic_net FALSE 108 0 0 0.4993 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun gradient_boosting_restringido TRUE 10 0 0 0.8164 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun gradient_boosting_restringido FALSE 108 0 0 0.4678 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun lasso TRUE 10 0 0 0.8477 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun lasso FALSE 108 0 0 0.5169 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun lineal_reducido TRUE 10 0 0 0.8350 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun lineal_reducido FALSE 108 0 0 0.4706 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun media_entrenamiento TRUE 10 0 0 0.8852 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun media_entrenamiento FALSE 108 0 0 0.5350 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun pls TRUE 10 0 0 0.9409 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun pls FALSE 108 0 0 0.4883 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun random_forest_restringido TRUE 10 0 0 0.8774 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun random_forest_restringido FALSE 108 0 0 0.4774 Unidades sin marca de atipico en el EDA quimico.
M_expandida_evaluador y_frutal_comun ridge TRUE 10 0 0 0.9401 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_expandida_evaluador y_frutal_comun ridge FALSE 108 0 0 0.4989 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun elastic_net TRUE 3 0 0 0.3594 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun elastic_net FALSE 39 0 0 0.5497 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun gradient_boosting_restringido TRUE 3 0 0 0.8084 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun gradient_boosting_restringido FALSE 39 0 0 0.6177 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun lasso TRUE 3 0 0 0.5297 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun lasso FALSE 39 0 0 0.5463 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun lineal_reducido TRUE 3 0 0 0.4508 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun lineal_reducido FALSE 39 0 0 0.5317 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun media_entrenamiento TRUE 3 0 0 0.4390 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun media_entrenamiento FALSE 39 0 0 0.8443 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun pls TRUE 3 0 0 0.5309 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun pls FALSE 39 0 0 0.5518 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun random_forest_restringido TRUE 3 0 0 0.5581 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun random_forest_restringido FALSE 39 0 0 0.3921 Unidades sin marca de atipico en el EDA quimico.
M_ia_exploratoria y_fenolico_comun ridge TRUE 3 0 0 0.3502 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_ia_exploratoria y_fenolico_comun ridge FALSE 39 0 0 0.5496 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun elastic_net TRUE 6 0 0 0.1361 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun elastic_net FALSE 28 0 0 0.2500 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun gradient_boosting_restringido TRUE 6 0 0 0.3639 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun gradient_boosting_restringido FALSE 28 0 0 0.3206 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun lasso TRUE 6 0 0 0.1339 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun lasso FALSE 28 0 0 0.3357 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun lineal_reducido TRUE 6 0 0 0.1831 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun lineal_reducido FALSE 28 0 0 0.2882 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun media_entrenamiento TRUE 6 0 0 0.3706 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun media_entrenamiento FALSE 28 0 0 0.4213 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun pls TRUE 6 6 100 0.2460 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun pls FALSE 28 28 100 0.2923 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun random_forest_restringido TRUE 6 0 0 0.1877 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun random_forest_restringido FALSE 28 0 0 0.2607 Unidades sin marca de atipico en el EDA quimico.
M_pura y_fenolico_comun ridge TRUE 6 6 100 0.1944 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_fenolico_comun ridge FALSE 28 28 100 0.2661 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun elastic_net TRUE 1 1 100 0.4771 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun elastic_net FALSE 12 12 100 0.0958 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun gradient_boosting_restringido TRUE 1 1 100 0.4621 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun gradient_boosting_restringido FALSE 12 12 100 0.1174 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun lasso TRUE 1 0 0 0.4690 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun lasso FALSE 12 0 0 0.1046 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun lineal_reducido TRUE 1 0 0 0.4710 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun lineal_reducido FALSE 12 0 0 0.1063 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun media_entrenamiento TRUE 1 0 0 0.5278 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun media_entrenamiento FALSE 12 0 0 0.2241 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun pls TRUE 1 0 0 0.4457 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun pls FALSE 12 0 0 0.1412 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun random_forest_restringido TRUE 1 1 100 0.4258 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun random_forest_restringido FALSE 12 12 100 0.1166 Unidades sin marca de atipico en el EDA quimico.
M_pura y_frutal_comun ridge TRUE 1 0 0 0.4552 Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar.
M_pura y_frutal_comun ridge FALSE 12 0 0 0.0994 Unidades sin marca de atipico en el EDA quimico.

4.6 Conclusión

Con la matriz pura corregida (34 filas, sin cata individual JU), la clasificación por nombre de los compuestos GC-MS de Constanza incorporada al pipeline (ver Parte 1, sección “Clasificación de compuestos GC-MS por familia química”), y una corrección de reproducibilidad en la validación bootstrap, Random Forest restringido es el modelo principal para y_fenolico_comun, por R² (0.30, frente a 0.05 en Ridge) y estabilidad de error (alta, frente a media en Ridge); el MAE bootstrap es prácticamente equivalente entre ambos (0.271 contra 0.274, una diferencia muy por debajo de la desviación estándar del propio bootstrap) y por lo tanto no es, por sí solo, el criterio que decide entre uno y otro modelo. Este resultado se mantuvo estable a través de las tres correcciones metodológicas del pipeline, lo que da confianza adicional en que no es un artefacto de una corrida particular. Ridge y PLS se mantienen como alternativas relevantes por su interpretabilidad y manejo explícito de la colinealidad entre predictores químicos, algo central en un contexto de small data con bloques analíticos no solapados.

Sobre la corrección de reproducibilidad: antes de la corrección, la semilla aleatoria usada para el bootstrap se fijaba una sola vez al inicio del script y se reutilizaba para todos los escenarios y targets en el orden en que el código los recorría, de modo que el resultado de un escenario dependía de cuántos números aleatorios ya se habían consumido en escenarios anteriores dentro de la misma corrida (dos corridas con los escenarios en distinto orden podían dar métricas bootstrap ligeramente distintas para el mismo escenario). La corrección fija una semilla determinística por combinación escenario-target (derivada de sus nombres, no del orden de ejecución), de modo que cada escenario-target produce siempre las mismas 100 muestras de bootstrap sin importar qué otros escenarios se hayan corrido antes. Tras la corrección se verificó que correr el pipeline completo dos veces produce exactamente las mismas métricas de resumen (MAE, RMSE, R², Spearman) para cada escenario-target, confirmando que el pipeline es ahora determinístico de extremo a extremo.

Las variables más coherentes y estables para explicar la calidad fenólica son los fenoles volátiles cuantificados por GC-FID (guaiacol, p-cresol, o-cresol y 4-etil-guaiacol), lo que es consistente con la química conocida del carácter ahumado/fenólico del whisky. El análisis de sensibilidad confirma que estos resultados no dependen críticamente de un pequeño número de observaciones atípicas: el desempeño del modelo se mantiene comparable al excluir las unidades marcadas como atípicas en la etapa exploratoria. Tampoco dependen críticamente de las variables GC-MS, que tienen cobertura real baja (23.5%) dentro de M_pura: excluirlas por completo cambia el MAE bootstrap de Random Forest restringido en menos de un 2%.

La comparación entre escenarios aporta un hallazgo metodológico relevante: al agregar la cata individual JU a la matriz pura (M_cata_individual), el desempeño del modelo sube notoriamente (R² cercano al que se observaba antes de excluir JU por error). Esto confirma que gran parte de la señal “fácil” de versiones anteriores del análisis provenía específicamente de la cata de un solo evaluador, más fácil de predecir que el promedio de un panel — y refuerza que la exclusión de JU de la matriz principal fue la decisión metodológicamente correcta, no una pérdida de información sino una corrección de rigor.

En conjunto, la evidencia respalda que la calidad fenólica del whisky chileno estudiado está asociada de forma identificable y razonablemente estable a un grupo acotado de compuestos fenólicos volátiles, en un contexto donde el tamaño muestral impone límites claros a la magnitud de las conclusiones: este estudio se entiende como exploratorio / prueba de concepto, no como un modelo predictivo listo para uso industrial.

4.7 Escenarios complementarios y su rol

  • M_expandida_evaluador: no mejora sustancialmente el desempeño respecto a la matriz pura promediada; se mantiene como evidencia complementaria, no como reemplazo.
  • M_ia_exploratoria: catas sintéticas de consenso IA (Gemini/Claude/GPT), presentadas siempre como escenario exploratorio, nunca como sustituto de una cata real. Su R² bootstrap (0.66) es notoriamente más alto que el de M_pura (0.30), pero no debe leerse como evidencia de que la IA predice mejor la calidad sensorial que el panel humano: en este escenario el propio target sensorial fue generado por consenso de los mismos modelos de lenguaje a partir de la evidencia química disponible, de modo que el modelo predictivo tiene una tarea más fácil (recuperar la regla interna que usaron los LLM para pasar de química a puntaje) en vez de la tarea real (predecir la percepción de un panel humano, con todo su ruido e idiosincrasia). El R² alto es, en gran parte, una medida de consistencia interna del propio proceso de generación IA, no de validez predictiva real. Con esa salvedad explícita, el escenario abre una línea futura de uso de IA como herramienta exploratoria complementaria en investigación sensorial de small data, no como reemplazo de evidencia sensorial real.