Esta parte documenta la construcción de las matrices de datos que integran la información química (GC-FID, GC-MS, fenoles totales por Folin, variables fermentativas JU) con la información sensorial (catas de panel y catas individuales), a partir de las tablas originales.
El objetivo general de este trabajo es entender qué variables químicas podrían estar relacionadas con la calidad sensorial del whisky chileno. Esto se hace en un contexto de small data, es decir, con pocas muestras que tienen cata sensorial completa, muchas variables químicas disponibles y distintas fuentes de datos que no siempre coinciden entre sí. Por esta razón, no se construyó una única matriz de análisis, sino seis matrices diferentes, cada una con un propósito específico dentro del estudio. Así, cada matriz permite abordar una parte distinta del problema, evitando mezclar datos que no son directamente comparables y manteniendo claro qué información se está usando en cada caso.
| # | Matriz | Escenario de modelamiento | Filas | Rol |
|---|---|---|---|---|
| 1 | Matriz pura | M_pura |
34 | Escenario principal. Cruce estricto química–sensorial de panel, sin la cata individual JU (que tiene un margen de error distinto por ser un solo catador, no un promedio de panel). |
| 2 | Matriz expandida por evaluador | M_expandida_evaluador |
685 | Igual cobertura que la pura, pero sin promediar por evaluador (complementaria). |
| 3 | Química | M_quimica |
— | Solo predictores químicos, sin targets sensoriales. Uso diagnóstico (colinealidad), no para modelar. |
| 4 | Sensorial | M_sensorial |
— | Solo targets sensoriales, sin predictores químicos. Uso diagnóstico exploratorio. |
| 5 | Matriz cata individual | M_cata_individual |
52 | A la matriz pura (34) se le agrega la cata individual (18 filas). Usada como análisis de sensibilidad frente a la matriz principal. |
| 6 | Matriz IA exploratoria | M_ia_exploratoria |
42 | Catas sintéticas generadas por consenso de 3 LLM (Gemini, Claude, GPT) como escenario exploratorio, nunca como reemplazo de cata real. Las 42 filas corresponden a filas químicas (de las 63 de la Matriz 3) que pudieron recibir una estimación IA utilizable; provienen de solo 24 muestras físicas únicas (ver Matriz 6 para el detalle). |
En esta investigación se trabaja con dos tipos de variables: variables de entrada (predictoras), que son mediciones químicas del destilado, y variables de salida (objetivo), que son puntajes sensoriales asignados por un panel de cata. El modelo busca predecir las segundas a partir de las primeras.
Ninguna muestra pasó por las 4 técnicas a la vez — por eso los predictores se agrupan por técnica y no se mezclan libremente entre sí.
| Técnica | N° variables | Qué mide | Unidad |
|---|---|---|---|
| GC-FID (cromatografía de gases, detector de llama) | 13 | Concentración de compuestos puntuales ya conocidos: fenoles volátiles (guaiacol, o-cresol, p-cresol, 4-etil-guaiacol) y ésteres (etil octanoato, etil decanoato, etc.) | ppm |
| GC-MS (cromatografía de gases + espectrometría de masas) | 5 | Composición porcentual del cromatograma agrupada por familia química (% ésteres, % fenólicos, % aldehídos, % aroma fermentativo, % área válida) | % de área |
| JU (variables fermentativas) | 13 | Cinética del proceso de fermentación (consumo de maltosa, producción de etanol, pérdida de CO₂) + algunos compuestos medidos en el mismo ensayo | g/L, ppm, % |
| Folin (Folin-Ciocalteu) | 1 | Fenoles totales del destilado (ensayo colorimétrico, un solo valor agregado, no compuesto a compuesto) | µg ácido gálico/mL |
En el escenario principal (M_pura) solo 18 de
estas 32 variables tienen datos suficientes para usarse como
predictor (mínimo 3 valores no vacíos y variabilidad); el resto casi no
se solapa con las muestras que tienen cata.
El panel evaluó cada muestra con descriptores individuales en escala 1-5 (aroma, sabor, regusto y calidad global: ahumado, medicinal, frutal, vainilla, cereal, terroso, amaderado, etc.). Para el modelamiento, esos descriptores se combinaron por promedio en 4 targets:
| Target | Se construye promediando | Cobertura en M_pura |
|---|---|---|
y_fenolico_comun (principal) |
aroma_ahumado + sabor_ahumado + regusto_ahumado + aroma_medicinal + sabor_medicinal | 34/34 (100%) |
y_ahumado_comun |
aroma_ahumado + sabor_ahumado + regusto_ahumado | 30/34 |
y_medicinal_comun |
aroma_medicinal + sabor_medicinal | 30/34 |
y_frutal_comun (secundario) |
aroma_frutal + sabor_frutal | 13/34 |
y_fenolico_comun combina ahumado + medicinal porque
ambos son las dos caras sensoriales del carácter fenólico del whisky
(turba/humo y notas “yodadas”), y es el único target con cobertura
completa.
Para quien necesite el detalle variable por variable (nombre exacto,
completitud, rango, si se usa o no como predictor) o el resumen por
escenario (filas, unidades, bloques), la tabla completa está disponible
en data/modelamiento/datos_modelamiento.xlsx.
| escenario_id | escenario_nombre | n_filas | n_unidades_analiticas | n_muestras_base | n_bloques | n_predictores_quimicos | n_targets_presentes | targets_con_datos | observacion_metodologica |
|---|---|---|---|---|---|---|---|---|---|
| M_pura | Matriz pura real | 34 | 34 | 12 | 5 | 32 | 4 | y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun | Escenario principal real. No incluye la cata individual JU (ver M_cata_individual). |
| M_expandida_evaluador | Matriz expandida por evaluador | 685 | 34 | 12 | 5 | 32 | 4 | y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun | Usar solo con validación agrupada por muestra para evitar fuga de información. |
| M_cata_individual | Matriz pura + cata individual JU | 52 | 52 | 18 | 6 | 32 | 4 | y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun | Escenario de sensibilidad: matriz pura (M_pura) mas la cata individual JU agregada. Comparar directamente contra M_pura para evaluar el efecto de incluir esa fuente. |
| M_ia_exploratoria | Matriz IA exploratoria | 42 | 42 | 14 | 2 | 32 | 4 | y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun | Escenario sintético exploratorio; no equivale a cata real. |
| M_quimica | Matriz solo química | 63 | 63 | 24 | 4 | 32 | 0 | NA | Sin targets sensoriales (y_*); no apto para modelamiento supervisado. Solo para diagnóstico/colinealidad de predictores químicos (scripts 13 y 13b). |
| M_sensorial | Matriz solo sensorial | 37 | NA | NA | NA | 0 | 4 | y_fenolico_comun; y_frutal_comun; y_ahumado_comun; y_medicinal_comun | Sin predictores químicos (x_*); no apto para modelamiento supervisado. Solo para diagnóstico exploratorio de los targets sensoriales (scripts 13 y 13b). |
M_pura)Cruce entre química y sensorial de panel, sin cata individual. Es la evidencia principal para los resultados de la tesis.
Vista de las primeras filas de la matriz integrada (34 filas en
total; tabla completa en
data/procesamiento/matriz_pura.xlsx, hoja
01_matriz_pura):
| tipo_dato | grupo_matriz | unidad_analitica_id | bloque_id | bloque_sensorial | muestra_base | muestra_cata | identificador_quimico | identificador_sensorial | replica_id | tecnica_quimica | archivo_quimico | hoja_quimica | archivo_sensorial | hoja_sensorial | archivo_sensorial_asociado | muestra_cata_asociada | tiene_cata_confirmada_quimica | tiene_quimica_confirmada_sensorial | n_evaluadores | nivel_quimico | nivel_sensorial | fuente_target | cruce_quimica_sensorial_ok | n_targets_disponibles | observacion_metodologica | y_aroma_ahumado | y_aroma_medicinal | y_aroma_terroso | y_aroma_amaderado | y_aroma_cafe | y_sabor_ahumado | y_sabor_medicinal | y_sabor_terroso | y_sabor_amaderado | y_sabor_cafe | y_regusto_duracion | y_regusto_ahumado | y_regusto_complejidad | y_global_integracion_ahumado | y_global_tomabilidad | y_frutal_comun | y_ahumado_comun | y_medicinal_comun | y_fenolico_comun | y_aroma_frutal | y_aroma_vainilla | y_aroma_cereal | y_sabor_frutal | y_sabor_vainilla | y_sabor_cereal | y_global_armonia | y_sabor_sensacion_boca | y_intensidad | y_floral | y_nuez | y_sulfuroso | y_mantecoso | y_maltoso | y_caramelo | x_gcfid_ethyl_octanoate_ppm | x_gcfid_isoamyl_acetate_ppm | x_gcfid_furfural_ppm | x_gcfid_o_cresol_ppm | x_gcfid_p_cresol_ppm | x_gcfid_4_ethyl_guaiacol_ppm | x_gcfid_creosol_ppm | x_gcfid_guaiacol_ppm | x_gcfid_ethyl_decanoate_ppm | x_gcfid_isoamyl_octanoate_ppm | x_gcfid_ethyl_dodecanoate_ppm | x_gcfid_ethyl_tetradecanoate_ppm | x_gcfid_ethyl_hexadecanoate_ppm | x_ju_final_co2_loss_g_l | x_ju_maltose_consumption_g_l | x_ju_ethanol_production_g_l | x_ju_ferulic_acid_conversion_index_faci_percent | x_ju_o_cresol_ppm | x_ju_p_cresol_ppm | x_ju_isoamyl_acetate_ppm | x_ju_ethyl_decanoate_ppm | x_ju_isoamyl_octanoate_ppm | x_ju_ethyl_dodecanoate_ppm | x_ju_ethyl_myristate_ppm | x_ju_ethyl_hexadecanoate_ppm | x_ju_ethyl_octanoate_ppm | x_folin_fenoles_totales_ug_ag_ml | x_gcms_esteres_pct | x_gcms_fenolicos_pct | x_gcms_aldehidos_pct | x_gcms_aroma_fermentativo_pct | ctrl_gcms_siloxano_pct | n_compuestos_detectados | x_gcms_area_valida_pct |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| puro_agregado | gcms | gcms_constanza_comerciales__c1_r1 | gcms_constanza_comerciales | cata_social_enero_2025 | C1 | Muestra 4 | C1 / Dalwhinnie | C1 / Dalwhinnie | 1 | GC-MS | Resultados GC-MS-Constanza Vidal.zip | CV-01-C1-duplicado_04_Reporte modelo Excel.xls | Cata Social_Enero_2025.xlsx | Respuestas de formulario 1 | Cata Social_Enero_2025.xlsx | Muestra 4 | TRUE | TRUE | 27 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 19 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 2.600000 | 1.461539 | 1.185185 | 2.153846 | 1.259259 | 3.444444 | 2.444444 | 2.407407 | 3.370370 | 1.851852 | 3.370370 | 2.814815 | 2.888889 | 2.962963 | 3.074074 | NA | 2.975309 | 1.981481 | 2.569753 | NA | NA | NA | NA | NA | NA | NA | 3.037037 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 75.53992 | 3.6200952 | 1.5258775 | 77.06580 | 2.543417 | 600 | 97.45658 |
| puro_agregado | gcms | gcms_constanza_comerciales__c1_r2 | gcms_constanza_comerciales | cata_social_enero_2025 | C1 | Muestra 4 | C1 / Dalwhinnie | C1 / Dalwhinnie | 2 | GC-MS | Resultados GC-MS-Constanza Vidal.zip | CV-01-control1_01_Reporte modelo Excel.xls | Cata Social_Enero_2025.xlsx | Respuestas de formulario 1 | Cata Social_Enero_2025.xlsx | Muestra 4 | TRUE | TRUE | 27 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 19 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 2.600000 | 1.461539 | 1.185185 | 2.153846 | 1.259259 | 3.444444 | 2.444444 | 2.407407 | 3.370370 | 1.851852 | 3.370370 | 2.814815 | 2.888889 | 2.962963 | 3.074074 | NA | 2.975309 | 1.981481 | 2.569753 | NA | NA | NA | NA | NA | NA | NA | 3.037037 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 78.16346 | 1.6877813 | 1.2026648 | 79.36613 | 4.007941 | 600 | 95.99206 |
| puro_agregado | gcms | gcms_constanza_comerciales__c2_r1 | gcms_constanza_comerciales | cata_social_enero_2025 | C2 | Muestra 7 | C2 / Caol Ila | C2 / Caol Ila | 1 | GC-MS | Resultados GC-MS-Constanza Vidal.zip | CV-01-C2-duplicado_05_Reporte modelo Excel.xls | Cata Social_Enero_2025.xlsx | Respuestas de formulario 1 | Cata Social_Enero_2025.xlsx | Muestra 7 | TRUE | TRUE | 30 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 19 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 3.482759 | 2.833333 | 2.066667 | 2.233333 | 1.379310 | 4.233333 | 2.866667 | 2.862069 | 3.066667 | 1.900000 | 3.517241 | 3.466667 | 2.620690 | 2.600000 | 2.700000 | NA | 3.738889 | 2.850000 | 3.383333 | NA | NA | NA | NA | NA | NA | NA | 2.533333 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 82.13948 | 2.9337469 | 1.2898238 | 83.42931 | 2.904282 | 600 | 97.09572 |
| puro_agregado | gcms | gcms_constanza_comerciales__c2_r2 | gcms_constanza_comerciales | cata_social_enero_2025 | C2 | Muestra 7 | C2 / Caol Ila | C2 / Caol Ila | 2 | GC-MS | Resultados GC-MS-Constanza Vidal.zip | CV-02-control2_02_Reporte modelo Excel.xls | Cata Social_Enero_2025.xlsx | Respuestas de formulario 1 | Cata Social_Enero_2025.xlsx | Muestra 7 | TRUE | TRUE | 30 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 19 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 3.482759 | 2.833333 | 2.066667 | 2.233333 | 1.379310 | 4.233333 | 2.866667 | 2.862069 | 3.066667 | 1.900000 | 3.517241 | 3.466667 | 2.620690 | 2.600000 | 2.700000 | NA | 3.738889 | 2.850000 | 3.383333 | NA | NA | NA | NA | NA | NA | NA | 2.533333 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 77.60664 | 1.6072317 | 0.7167857 | 78.32343 | 5.173913 | 600 | 94.82609 |
| puro_agregado | gcms | gcms_noviembre__nov_m1_r1 | gcms_noviembre | panel_noviembre | NOV_M1 | Muestra 1 | NOV_M1 | NOV_M1 | 1 | GC-MS | Panel sensorial_06_Noviembre_GC_MS.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Muestra 1 | TRUE | TRUE | 10 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 9 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 2.6 | NA | NA | 1.800000 | NA | NA | NA | NA | NA | NA | NA | NA | 3.7 | 2.5 | 2.1 | 1.1 | 2.1 | 2.8 | 2.2 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 94.80506 | 0.2454962 | 0.2266671 | 95.03173 | 0.000000 | 22 | 100.00000 |
| puro_agregado | gcms | gcms_noviembre__nov_m2_r1 | gcms_noviembre | panel_noviembre | NOV_M2 | Muestra 2 | NOV_M2 | NOV_M2 | 1 | GC-MS | Panel sensorial_06_Noviembre_GC_MS.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Muestra 2 | TRUE | TRUE | 10 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 9 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 3.3 | NA | NA | 2.100000 | NA | NA | NA | NA | NA | NA | NA | NA | 3.4 | 2.0 | 2.7 | 1.2 | 2.0 | 2.1 | 2.4 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 92.88892 | 0.0000000 | 0.1885537 | 93.07747 | 0.000000 | 21 | 100.00000 |
| puro_agregado | gcms | gcms_noviembre__nov_m3_r1 | gcms_noviembre | panel_noviembre | NOV_M3 | Muestra 3 | NOV_M3 | NOV_M3 | 1 | GC-MS | Panel sensorial_06_Noviembre_GC_MS.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Muestra 3 | TRUE | TRUE | 10 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 9 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 2.9 | NA | NA | 2.400000 | NA | NA | NA | NA | NA | NA | NA | NA | 3.1 | 2.3 | 2.2 | 1.1 | 1.8 | 2.5 | 2.4 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 96.26849 | 0.2043085 | 0.2569325 | 96.52542 | 0.000000 | 22 | 100.00000 |
| puro_agregado | gcms | gcms_noviembre__nov_m4_r1 | gcms_noviembre | panel_noviembre | NOV_M4 | Muestra 4 | NOV_M4 | NOV_M4 | 1 | GC-MS | Panel sensorial_06_Noviembre_GC_MS.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Hoja1 | Panel sensorial_06_Noviembre.xlsx | Muestra 4 | TRUE | TRUE | 10 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 9 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 3.1 | NA | NA | 2.600000 | NA | NA | NA | NA | NA | NA | NA | NA | 3.9 | 2.5 | 2.2 | 1.2 | 2.1 | 3.2 | 2.7 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 91.88683 | 0.3384489 | 0.4014629 | 92.28829 | 0.000000 | 23 | 100.00000 |
| puro_agregado | historico_gcfid | alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r1 | alexandra_260603_pilsner_gcfid | cata_alexandra_260603 | Pilsner_H76R1R2 | Muestra 1 | Pilsner sin ahumar H76 | Pilsner sin ahumar H76 | 1 | GC-FID | 260603_Alexandra.xlsx | CVs GC-FID | 260603_Resultados cata_Alexandra.xlsx | Respuestas de formulario 1 | 260603_Resultados cata_Alexandra.xlsx | Muestra 1 | TRUE | TRUE | 9 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 18 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 2.222222 | 1.111111 | 1.666667 | 2.777778 | 2.222222 | 2.555556 | 1.666667 | 2.444444 | 3.111111 | 2.111111 | 3.666667 | 1.888889 | 3.666667 | 4.333333 | 4.333333 | NA | 2.222222 | 1.388889 | 1.888889 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 84.93424 | 2.132395 | NA | 0.0044147 | 0.0294286 | 0.0037554 | 0.0126984 | -0.0580932 | 40.54952 | 0.8474191 | 28.69528 | 6.918760 | 19.02811 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA |
| puro_agregado | historico_gcfid | alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r2 | alexandra_260603_pilsner_gcfid | cata_alexandra_260603 | Pilsner_H76R1R2 | Muestra 1 | Pilsner sin ahumar H76 | Pilsner sin ahumar H76 | 2 | GC-FID | 260603_Alexandra.xlsx | CVs GC-FID | 260603_Resultados cata_Alexandra.xlsx | Respuestas de formulario 1 | 260603_Resultados cata_Alexandra.xlsx | Muestra 1 | TRUE | TRUE | 9 | unidad_analitica | promedio_muestra | cata_real_agregada | TRUE | 18 | Química real cruzada con promedio de cata real. Las réplicas químicas comparten el mismo promedio sensorial de su muestra base. | 2.222222 | 1.111111 | 1.666667 | 2.777778 | 2.222222 | 2.555556 | 1.666667 | 2.444444 | 3.111111 | 2.111111 | 3.666667 | 1.888889 | 3.666667 | 4.333333 | 4.333333 | NA | 2.222222 | 1.388889 | 1.888889 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | 87.21893 | 2.207052 | NA | 0.0037648 | 0.0181587 | 0.0086091 | 0.1100000 | -0.0578633 | 44.54221 | 0.9081365 | 30.56440 | 8.341887 | 20.08032 | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA | NA |
M_expandida_evaluador)Esta matriz toma las mismas 34 unidades químicas de la matriz pura, pero en vez de una fila por unidad (promediando entre evaluadores), deja una fila por cada evaluación individual de cada catador. Por eso tiene 685 filas: no son 685 muestras nuevas, son las mismas 34 muestras químicas repetidas tantas veces como evaluadores las calificaron. Por este motivo no se muestra la tabla completa, sino que se listan solo las primeras filas a modo de ejemplo:
Vista de las primeras filas (tabla completa en
data/procesamiento/matriz_pura_expandida_evaluador.xlsx,
hoja 02_modelamiento):
| unidad_analitica_id | muestra_cata | nombre_catador | categoria_catador | y_fenolico_comun | y_frutal_comun |
|---|---|---|---|---|---|
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Andrea hinojoss | Consumidor General de Destilados | 1.6 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Beatriz solari | Consumidor General de Destilados | 3.6 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Bernardo Morales | Aficionado al whisky | 2.2 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Camila Aguirre | Consumidor General de Destilados | 3.6 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Carlos Reyes | Consumidor General de Destilados | 2.8 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Caro Carriel | Consumidor General de Destilados | 2.6 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Chabi Cadiz | Consumidor General de Destilados | 2.4 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Claudia Ortiz Calderón | Aficionado al whisky | 1.6 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Claudio Martínez | Consumidor General de Destilados | 1.8 | NA |
| gcms_constanza_comerciales__c1_r1 | Muestra 4 | Claudio Perez-Leighton | Aficionado al whisky | 1.6 | NA |
Se usa únicamente con validación agrupada por unidad analítica (para que el mismo grupo de evaluaciones no aparezca a la vez en entrenamiento y en prueba), y sirve para estudiar la variabilidad entre evaluadores sobre una misma muestra, no para aumentar el tamaño muestral real.
M_quimica)Contiene solo predictores químicos, sin evaluación sensorial asociada. No tiene target, por lo tanto no se usa para ajustar modelos y sirve como diagnóstico químico no supervisado (distribución de variables, colinealidad) sobre unidades que no llegaron a tener cata.
| Bloque analítico | Técnica | Unidades | Muestras base |
|---|---|---|---|
| Fenoles totales (malta) | Fenoles totales | 24 | 8 |
| GC-MS comerciales | GC-MS | 8 | 4 |
| GC-MS experimentales | GC-MS | 10 | 5 |
| JU (cepas fermentativas) | Variables fermentativas / química JU | 21 | 7 |
| Total | 63 |
Las 32 variables predictoras son las mismas 4 familias químicas que en la matriz pura (GC-FID, GC-MS, JU, Folin) — lo único que cambia es que estas 63 unidades no tienen cata de panel confirmada, por eso quedan fuera del modelamiento supervisado y solo aportan a diagnóstico exploratorio.
¿Por qué solo aparecen estos bloques aquí?
Igual que en la matriz sensorial, esta tabla no representa toda la química generada — es el residuo de unidades que quedaron sin cata asociada. En total hay 8 bloques químicos en el proyecto:
| Bloque químico | Técnica | Unidades totales | Con cata | Sin cata |
|---|---|---|---|---|
| Fenoles totales (malta) | Fenoles totales | 24 | 0 | 24 |
| GC-FID Constanza (enero) | GC-FID | 15 | 15 | 0 |
| GC-FID Constanza (septiembre) | GC-FID | 9 | 9 | 0 |
| GC-FID Pilsner | GC-FID | 2 | 2 | 0 |
| GC-MS comerciales | GC-MS | 12 | 4 | 8 |
| GC-MS experimentales | GC-MS | 10 | 0 | 10 |
| GC-MS noviembre | GC-MS | 4 | 4 | 0 |
| JU (cepas fermentativas) | Variables fermentativas / química JU | 39 | 18 | 21 |
Cuatro bloques (GC-FID Pilsner, GC-FID Constanza de enero y de
septiembre, GC-MS noviembre) tuvieron el 100% de sus unidades
con cata confirmada — por eso no aportan ninguna fila a esta
matriz: van completas a M_pura. Los otros cuatro (Fenoles
totales, GC-MS comerciales, GC-MS experimentales, JU) tienen una porción
sin cata asociada, y esa porción es la que se muestra en la tabla
anterior.
M_sensorial)Contiene solo evaluaciones sensoriales (targets), sin química asociada confirmada. No tiene predictores, por lo tanto no se usa para ajustar modelos — sirve como análisis sensorial descriptivo.
| Sesión de cata | Muestras | Evaluaciones individuales | Evaluadores |
|---|---|---|---|
| Cata Alexandra | 3 | 27 | 27 |
| Panel noviembre | 1 | 10 | 10 |
| Total | 4 | 37 |
Al agregar por muestra (promedio entre evaluadores) quedan 4
filas — 3 de la cata Alexandra y 1 del panel de noviembre. Hay
hasta 18 targets sensoriales disponibles por evaluación
individual: los 4 targets “comunes” usados en el modelamiento
(y_fenolico_comun, y_frutal_comun,
y_ahumado_comun, y_medicinal_comun) más
descriptores puntuales de aroma, sabor, regusto y calidad global
(ahumado, medicinal, terroso, amaderado, café, entre otros).
¿Por qué solo aparecen 2 sesiones aquí?
Esta matriz no representa todas las catas realizadas es el residuo de muestras que quedaron sin cruce químico dentro de cada sesión. En total hay 5 sesiones de cata en el proyecto:
| Sesión de cata | Muestras | Evaluaciones con química | Evaluaciones sin química |
|---|---|---|---|
| Cata Alexandra (260603) | 4 | 9 | 27 |
| Cata Social Enero 2025 | 5 | 145 | 0 |
| Cata Septiembre 2024 | 3 | 26 | 0 |
| Cata individual JU | 6 | 6 | 0 |
| Panel noviembre | 5 | 40 | 10 |
Tres sesiones (Cata Social Enero 2025, Cata Septiembre 2024 y la cata
individual JU) tuvieron el 100% de sus muestras con química
confirmada, por eso no aportan ninguna fila a esta matriz: van
completas a M_pura (o a M_cata_individual en
el caso de la cata JU). Solo Cata Alexandra (3 de sus 4 muestras sin
química asociada) y Panel noviembre (1 de sus 5 muestras sin GC-MS
asociado) dejan un remanente sin cruce, y ese remanente es exactamente
lo que se muestra en la tabla de arriba.
M_cata_individual)Para qué se usa: responde una pregunta puntual —
¿cambia el resultado del modelo si, además de la cata de panel (varios
catadores promediados), se agrega la cata individual
del bloque JU (un solo catador por muestra, sin promediar)? Por eso
M_cata_individual = M_pura (34 filas)
+ 18 filas nuevas aportadas por esa cata individual. No
reemplaza a la matriz pura, ya que es un escenario aparte para probar
qué tan sensible es el resultado a este tipo de evidencia.
| Componente | Filas | Bloques químicos | Muestras base | Con y_fenolico_comun | Con y_frutal_comun |
|---|---|---|---|---|---|
| Solo lo aportado por la cata JU | 18 | 1 | 6 | 18 | 0 |
| M_pura (sin JU) | 34 | 5 | 12 | 34 | 13 |
| M_cata_individual (pura + JU) | 52 | 6 | 18 | 52 | 13 |
Las 18 filas aportadas por la cata JU corresponden a 6
muestras (cepas de fermentación), cada una con 3
réplicas químicas evaluadas por un único catador. Aportan
cobertura completa al target principal (y_fenolico_comun,
18/18), pero cero al target secundario
(y_frutal_comun) — ese descriptor no se registró en esa
sesión de cata.
| Bloque químico | Filas | Muestras base | Evaluadores promedio |
|---|---|---|---|
| GC-FID Pilsner | 2 | 1 | 9.00 |
| GC-FID Constanza (enero) | 15 | 5 | 29.00 |
| GC-FID Constanza (septiembre) | 9 | 3 | 8.67 |
| GC-MS comerciales | 4 | 2 | 28.50 |
| GC-MS noviembre | 4 | 4 | 10.00 |
| JU (cepas, cata individual) | 18 | 6 | 1.00 |
Nótese la diferencia en “evaluadores promedio”: los 5 bloques de cata
de panel promedian entre 8 y 29 evaluadores por
muestra, mientras que el bloque JU tiene 1 evaluador
por muestra — es justamente esa diferencia de margen de error
la que motiva tratarlo como escenario de sensibilidad y no como parte de
la matriz principal. El efecto real de esto sobre el desempeño del
modelo (¿cambia la predicción al agregar esta cata?) ## Matriz 6 — IA
exploratoria (M_ia_exploratoria)
La Matriz 6 corresponde a un escenario exploratorio construido a partir de la Matriz 3, que contiene información química sin cata sensorial real asociada. Aunque la Matriz 3 posee 63 filas, estas no representan 63 muestras físicas distintas, sino réplicas analíticas de laboratorio correspondientes a 24 muestras físicas únicas. Por ejemplo, una misma muestra, como “Malta 1”, puede haber sido medida químicamente más de una vez, generando varias filas en la matriz, aunque todas correspondan a la misma muestra física.
Por esta razón, no sería metodológicamente adecuado solicitar a un modelo de lenguaje que estime un perfil sensorial distinto para cada réplica de laboratorio, ya que dichas réplicas no representan muestras diferentes. En cambio, la estimación se realiza sobre las 24 muestras físicas únicas, utilizando un consenso entre tres modelos de lenguaje: Gemini, Claude y GPT. Cada modelo estima el perfil sensorial de las muestras a partir de su composición química y de reglas generales reportadas en la literatura sobre relaciones entre familias químicas y percepción sensorial.
El resultado de este procedimiento corresponde a una estimación
sensorial sintética, de carácter exploratorio y complementario. Esta
estimación no reemplaza una cata real, ni debe mezclarse con los datos
sensoriales experimentales sin declarar explícitamente su origen. Una
vez obtenido el consenso para cada una de las 24 muestras físicas
únicas, el valor estimado se intenta asignar a las réplicas analíticas
de la misma muestra dentro de las 63 filas químicas de la Matriz 3, de
modo que las réplicas de una muestra física comparten el mismo puntaje
sintético (mismo criterio que se usa con la cata real). Esa asignación
no siempre es posible: como se detalla en “Qué tan útil resultó el
consenso IA, por bloque químico” más abajo, solo 42 de las 63 filas
químicas (67%) terminan recibiendo una estimación sintética utilizable;
las 21 filas restantes (33%), pertenecientes a bloques químicos sin una
interpretación aromática suficientemente directa, quedan sin estimación
en vez de forzar un valor arbitrario. Por eso
M_ia_exploratoria como matriz final de modelamiento tiene
42 filas, no 24: el número de 24 corresponde a las
muestras físicas únicas sobre las que se generó el consenso IA (un
perfil sensorial sintético por muestra), mientras que el número de 42
corresponde a las filas químicas de la Matriz 3 que efectivamente
heredan una estimación utilizable, una vez que ese perfil por muestra se
propaga a sus réplicas analíticas y se descartan las que caen en bloques
no estimables. Ambos números son correctos, pero miden cosas distintas
(muestras físicas vs. filas químicas modelables) y no deben confundirse
entre sí ni con el tamaño de la matriz de modelamiento.
| Modelo de IA | Filas generadas (3 réplicas × 24 muestras) |
|---|---|
| Claude | 72 |
| Gemini | 72 |
| GPT | 72 |
Cada modelo de lenguaje generó 3 corridas independientes sobre las 24 muestras físicas únicas, dando un total de 72 estimaciones por modelo. Considerando los tres modelos utilizados, el conjunto inicial contiene:
3 modelos × 3 corridas × 24 muestras = 216 estimaciones El consenso se construye en dos etapas. Primero, se consolida internamente cada modelo a partir de sus tres corridas, evitando tratarlas como opiniones completamente independientes. Luego, se calcula un consenso final entre los tres modelos ya consolidados. De esta forma, el resultado final queda reducido a 24 perfiles sensoriales sintéticos, uno por cada muestra física única. Posteriormente, estos perfiles se asignan a las 63 filas químicas según la muestra física correspondiente.
Las 24 muestras con consenso IA se cruzaron con las 63 unidades
químicas sin cata de la Matriz 3. Sin embargo, no todas las unidades
pudieron recibir una estimación sensorial útil. El consenso IA solo se
considera aprovechable cuando existe evidencia química suficiente para
inferir un perfil aromático de manera razonable. Cuando la información
química no permite una interpretación sensorial mínima, la unidad se
clasifica como no_estimable, dejando el target vacío y
evitando asignar un valor arbitrario.
| Bloque químico | Unidades | Modelables con IA | No estimables |
|---|---|---|---|
| Fenoles totales (malta) | 24 | 24 | 0 |
| GC-MS comerciales | 8 | 0 | 8 |
| GC-MS experimentales | 10 | 0 | 10 |
| JU (cepas fermentativas) | 21 | 18 | 3 |
El patrón observado muestra una diferencia clara entre bloques químicos: fenoles totales y JU resultan mayoritariamente modelables, ya que corresponden a variables agregadas y más fáciles de interpretar desde una lógica química-sensorial. En cambio, los bloques de GC-MS comerciales y GC-MS experimentales quedan completamente clasificados como no_estimable, debido a que su información corresponde a composiciones porcentuales de numerosos compuestos por cromatograma, sin una clasificación aromática suficientemente directa para asignar un puntaje sensorial confiable. En total, de las 63 unidades químicas sin cata, 42 unidades (67%) pudieron recibir una estimación sintética mediante consenso IA, mientras que 21 unidades (33%) se mantuvieron sin estimación para evitar asignar valores arbitrarios donde la evidencia química no era suficiente.
Las variables x_gcms_esteres_pct,
x_gcms_fenolicos_pct y x_gcms_aldehidos_pct se
calculan agrupando los compuestos detectados por GC-MS según su familia
química. El archivo de la sesión de noviembre trae esa familia explícita
(columna nature), pero los archivos de Constanza (bloques
gcms_constanza_comerciales y
gcms_constanza_experimentales, 22 unidades) son reportes
crudos de librería NIST/Wiley — solo traen nombre de compuesto, no
familia — por lo que esas tres variables quedaban en 0 exacto para esas
unidades.
Se construyó un clasificador por nombre de compuesto
(scripts/R/procesamiento/02b_clasificar_compuestos_gcms.R,
integrado a 02_extraer_quimica.R), con reglas basadas en
sufijos y patrones de nomenclatura química (tipo IUPAC: ésteres
terminados en “-oato”/“-ato”/“ester”, aldehídos en “-anal”/“-enal”,
fenólicos que contienen “phenol/cresol/guaiacol”, hidrocarburos en
“-ano”/“-eno”, siloxanos como contaminante de columna, etc.), validado
al 100% contra los 24 compuestos de noviembre que sí
tienen familia real. Esta clasificación ya está incorporada al cálculo
real de las variables químicas usadas en el modelamiento. Cabe declarar
explícitamente el tamaño de este conjunto de validación: 24 compuestos
es una muestra pequeña, y el 100% de acierto sobre ella no garantiza el
mismo desempeño sobre los 968 compuestos de Constanza a los que se
aplicó el clasificador (ver más abajo). Por eso las variables GC-MS
derivadas de esta clasificación se tratan, en las conclusiones de la
tesis, con mayor cautela que las variables GC-FID (que provienen de una
cuantificación directa por compuesto, sin este paso de clasificación por
nombre); el análisis de sensibilidad de la sección “Sensibilidad a la
imputación de variables GC-MS” (Parte 4) es, en parte, una respuesta a
esta misma incertidumbre.
Cada compuesto se clasifica evaluando estas reglas en orden, y se asigna a la primera familia que calce con su nombre:
| Orden | Familia | Qué busca en el nombre | Variable final |
|---|---|---|---|
| 1 | Siloxano (contaminante de columna) | Contiene “silox” | Excluido del área válida |
| 2 | Ftalato (contaminante/plastificante) | Contiene “phthalate” o “ftalato” | Descartado (contaminante) |
| 3 | Fenólico | Contiene “phenol”, “cresol”, “guaiacol”, “creosol”, “syringol” o “catechol” | x_gcms_fenolicos_pct |
| 4 | Éster | Contiene “ester”, o termina en “-ato” (ej. “-oato”, “-acetate”) | x_gcms_esteres_pct |
| 5 | Aldehído | Contiene “aldehyde”, o termina en “-anal”/“-enal” | x_gcms_aldehidos_pct |
| 6 | Ácido carboxílico | Contiene “acid” | No usado en el modelo actual |
| 7 | Alcohol | Contiene “alcohol”, o termina en “-anol”/“-enol” | No usado en el modelo actual |
| 8 | Cetona | Contiene “ketone”, o termina en “-anone”/“-enone” | No usado en el modelo actual |
| 9 | Tiol | Contiene “thiol” o “mercaptan” | No usado en el modelo actual |
| 10 | Hidrocarburo aromático | Contiene “benzene”, “toluene”, “styrene”, “naphthalene”, “xylene” o “phenyl” | No usado en el modelo actual |
| 11 | Hidrocarburo (alcano/alqueno) | Termina en “-ano”/“-eno” (ej. “-ane”, “-ene”) | No usado en el modelo actual |
| Indicador | Valor |
|---|---|
| Compuestos con familia real conocida (sesión noviembre) | 24 |
| Compuestos clasificados por nombre (sesión Constanza) | 968 |
| Precisión del clasificador (validado contra la familia real) | 100% |
| Unidades químicas recalculadas con la nueva clasificación | 11 |
| Familias químicas distintas detectadas en total | 11 |
El clasificador se validó comparando sus resultados contra los 24 compuestos de la sesión de noviembre, que sí traían la familia química real asignada por el equipo, acertando en el 100% de los casos. Con esa confianza, pero reconociendo que el conjunto de validación es pequeño (24 compuestos) frente al conjunto donde efectivamente se aplica (968 compuestos de la sesión Constanza), se usó el clasificador para recalcular 11 unidades químicas que antes quedaban sin clasificar. Un 100% de acierto en 24 casos no es lo mismo que un 100% de acierto garantizado en 968: es razonable esperar que la precisión real sobre Constanza sea alta (las reglas son de nomenclatura química general, no ajustadas a los 24 compuestos de validación), pero no hay evidencia directa que la cuantifique con la misma certeza que en el conjunto de noviembre. Esta es la razón por la que las variables GC-MS de Constanza se declaran con mayor incertidumbre que las variables GC-FID en las conclusiones de la tesis.
| fuente | familia_asignada | n_compuestos_unicos |
|---|---|---|
| gcms_constanza (comerciales + experimentales) | Ester | 289 |
| gcms_constanza (comerciales + experimentales) | Sin clasificar | 233 |
| gcms_constanza (comerciales + experimentales) | Hidrocarburo (alcano/alqueno) | 160 |
| gcms_constanza (comerciales + experimentales) | Hidrocarburo aromatico | 97 |
| gcms_constanza (comerciales + experimentales) | Acido carboxilico | 49 |
| gcms_constanza (comerciales + experimentales) | Alcohol | 47 |
| gcms_constanza (comerciales + experimentales) | Aldehido | 27 |
| gcms_constanza (comerciales + experimentales) | Siloxano (contaminante de columna) | 22 |
| gcms_constanza (comerciales + experimentales) | Cetona | 21 |
| gcms_constanza (comerciales + experimentales) | Fenolico (fenoles, cresoles, guaiacoles) | 19 |
| gcms_constanza (comerciales + experimentales) | Tiol | 4 |
| gcms_noviembre | Ester | 16 |
| gcms_noviembre | Hidrocarburo (alcano/alqueno) | 4 |
| gcms_noviembre | Hidrocarburo aromatico | 2 |
| gcms_noviembre | Aldehido | 1 |
| gcms_noviembre | Fenolico (fenoles, cresoles, guaiacoles) | 1 |
Se muestran ejemplos por familia; la tabla completa (~990 compuestos)
está en
data/procesamiento/clasificacion_compuestos_gcms.xlsx, hoja
02_compuestos_clasificados.
| fuente | compound_name | familia_original_nature | familia_asignada | variable_final_propuesta |
|---|---|---|---|---|
| gcms_constanza (comerciales + experimentales) | 1-Methyl-7-azabicyclo[4.1.0]hepta-2,4-diene-7-carboxylic acid, 3,17-diacetoxy-4,4,10,13-tetramethylhexadecahydrocyclopenta[a]phenanthrene | NA | Acido carboxilico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 10,12,14-Nonacosatriynoic acid | NA | Acido carboxilico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 10,12-Tricosadiynoic acid, TMS derivative | NA | Acido carboxilico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (4-Isopropyl-1-methyl-6,7-dimethylenebicyclo[3.2.1]oct-8-yl)methanol | NA | Alcohol | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (t-Butyl-dimethylsilyl)[2-methyl-2-(4-methyl-pent-3-enyl)-cyclopropyl]-methanol | NA | Alcohol | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1,2-Benzenedimethanol | NA | Alcohol | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 10-Octadecenal | NA | Aldehido | x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | 12-Octadecenal | NA | Aldehido | x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | 14-Octadecenal | NA | Aldehido | x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | 1H-2-Indenone,2,4,5,6,7,7a-hexahydro-3-(1-methylethyl)-7a-methyl | NA | Cetona | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 2’-Hydroxybutyrophenone, TMS derivative | NA | Cetona | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 2’-Hydroxypropiophenone, TMS derivative | NA | Cetona | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (-)-1-Methylbutyl decanoate | NA | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | (5á)Pregnane-3,20á-diol, 14à,18à-[4-methyl-3-oxo-(1-oxa-4-azabutane-1,4-diyl)]-, diacetate | NA | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | (E)-9-Octadecenoic acid ethyl ester | NA | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_constanza (comerciales + experimentales) | 2,4-Di-tert-butylphenol | NA | Fenolico (fenoles, cresoles, guaiacoles) | x_gcms_fenolicos_pct |
| gcms_constanza (comerciales + experimentales) | 2,4-Di-tert-butylthiophenol | NA | Fenolico (fenoles, cresoles, guaiacoles) | x_gcms_fenolicos_pct |
| gcms_constanza (comerciales + experimentales) | 4-Isopropylphenol, TMS derivative | NA | Fenolico (fenoles, cresoles, guaiacoles) | x_gcms_fenolicos_pct |
| gcms_constanza (comerciales + experimentales) | (1R,2R,5R,E)-7-Ethylidene-1,2,8,8-tetramethylbicyclo[3.2.1]octane | NA | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | .psi.,.psi.-Carotene, 1,1’,2,2’-tetrahydro-1,1’-dimethoxy- | NA | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1,3,5,7-Cyclooctatetraene | NA | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (4,4-Diphenyl-butyl)-(3-phenyl-piperidin-4-yl)-amine | NA | Hidrocarburo aromatico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (E)-1-(2,3,6-trimethylphenyl)buta-1,3-diene (TPB, 1) | NA | Hidrocarburo aromatico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1, 1, 5-Trimethyl-1, 2-dihydronaphthalene | NA | Hidrocarburo aromatico | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1,1,3,3,5,5,7,7,9,9-Decamethyl-9-(2-methylpropoxy)pentasiloxan-1-ol | NA | Siloxano (contaminante de columna) | ctrl_gcms_siloxano_pct (excluido del area valida) |
| gcms_constanza (comerciales + experimentales) | 1,1,3,3,5,5,7,7-Octamethyl-7-(2-methylpropoxy)tetrasiloxan-1-ol | NA | Siloxano (contaminante de columna) | ctrl_gcms_siloxano_pct (excluido del area valida) |
| gcms_constanza (comerciales + experimentales) | 2-Trimethylsiloxy-6-hexadecenoic acid, methyl ester | NA | Siloxano (contaminante de columna) | ctrl_gcms_siloxano_pct (excluido del area valida) |
| gcms_constanza (comerciales + experimentales) | (1R,7S,E)-7-Isopropyl-4,10-dimethylenecyclodec-5-enol | NA | Sin clasificar | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (1aR,4S,7R,7aS,7bR)-1,1,4,7-Tetramethyl-1a,2,3,4,6,7,7a,7b-octahydro-1H-cyclopropa[e]azulen-4-ol | NA | Sin clasificar | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | (3S,3aR,3bR,4S,7R,7aR)-4-Isopropyl-3,7-dimethyloctahydro-1H-cyclopenta[1,3]cyclopropa[1,2]benzen-3-ol | NA | Sin clasificar | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1,3-Benzenedimethanethiol, 2TMS derivative | NA | Tiol | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 1-Hexanethiol, 2-ethyl- | NA | Tiol | no clasificado en variable final actual |
| gcms_constanza (comerciales + experimentales) | 2-Phenylethanethiol, TMS derivative | NA | Tiol | no clasificado en variable final actual |
| gcms_noviembre | Nonanal | Aldehidos | Aldehido | x_gcms_aldehidos_pct / x_gcms_aroma_fermentativo_pct |
| gcms_noviembre | 2-Methylbutyl octanoate | Esters | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_noviembre | 2-methyl butyl decanoate | Esters | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_noviembre | 3-Methylbutyl octanoate | Esters | Ester | x_gcms_esteres_pct / x_gcms_aroma_fermentativo_pct |
| gcms_noviembre | 2,4-Di-tert-butylphenol | Phenols | Fenolico (fenoles, cresoles, guaiacoles) | x_gcms_fenolicos_pct |
| gcms_noviembre | 2,6,10-Trimethyltridecane | Hydrocarbon | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_noviembre | 2,6-Dimethylundecane | Hydrocarbon | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_noviembre | 4,6-Dimethyldodecane | Hydrocarbon | Hidrocarburo (alcano/alqueno) | no clasificado en variable final actual |
| gcms_noviembre | Benzene, 1,3-bis(1,1-dimethylethyl) | Aromatic hydrocarbon | Hidrocarburo aromatico | no clasificado en variable final actual |
| gcms_noviembre | Styrene | Aromatic hydrocarbon | Hidrocarburo aromatico | no clasificado en variable final actual |
Recalculando x_gcms_esteres_pct,
x_gcms_fenolicos_pct y x_gcms_aldehidos_pct
con la clasificación por nombre, en vez de los ceros anteriores aparece
señal real y sustancial: entre 50% y 87% de área asignable a ésteres, y
hasta 6% a compuestos fenólicos, según la unidad.
| bloque_id | muestra_base | n_compuestos | esteres_pct_actual | esteres_pct_reclasificado | fenolicos_pct_actual | fenolicos_pct_reclasificado | aldehidos_pct_actual | aldehidos_pct_reclasificado | aroma_fermentativo_pct_reclasificado |
|---|---|---|---|---|---|---|---|---|---|
| gcms_constanza_comerciales | C1 | 327 | 0 | 75.54 | 0 | 3.62 | 0 | 1.53 | 77.07 |
| gcms_constanza_comerciales | C2 | 255 | 0 | 82.14 | 0 | 2.93 | 0 | 1.29 | 83.43 |
| gcms_constanza_comerciales | C3 | 309 | 0 | 61.30 | 0 | 6.13 | 0 | 1.66 | 62.96 |
| gcms_constanza_comerciales | C4 | 320 | 0 | 82.38 | 0 | 2.46 | 0 | 0.78 | 83.16 |
| gcms_constanza_comerciales | C5 | 268 | 0 | 87.31 | 0 | 1.29 | 0 | 0.85 | 88.16 |
| gcms_constanza_comerciales | C6 | 297 | 0 | 79.78 | 0 | 2.40 | 0 | 0.73 | 80.51 |
| gcms_constanza_experimentales | XP1 | 268 | 0 | 67.41 | 0 | 0.55 | 0 | 0.25 | 67.66 |
| gcms_constanza_experimentales | XP2 | 331 | 0 | 50.29 | 0 | 0.73 | 0 | 0.50 | 50.80 |
| gcms_constanza_experimentales | XP3 | 218 | 0 | 65.81 | 0 | 0.33 | 0 | 0.15 | 65.95 |
| gcms_constanza_experimentales | XP4 | 262 | 0 | 70.11 | 0 | 0.54 | 0 | 0.16 | 70.27 |
| gcms_constanza_experimentales | XP5 | 265 | 0 | 59.07 | 0 | 0.70 | 0 | 0.30 | 59.37 |
Esta sección documenta la etapa de análisis exploratorio
(EDA), aplicada sobre la matriz pura (M_pura, 34
filas) y sus componentes química y sensorial por separado. Se usó el
marco clásico de 5 etapas de EDA (descriptivo, tipos de variable, datos
ausentes, valores atípicos, correlación), complementado con técnicas
específicas para small data:
| indicador | valor |
|---|---|
| Unidad de analisis quimica | Unidad analitica quimica |
| Unidades analiticas quimicas totales | 115 |
| Unidades con cata confirmada | 52 |
| Unidades sin cata confirmada | 63 |
| Bloques quimicos | 8 |
| Grupos quimicos (tecnica analitica) | 4 |
| Variables quimicas detectadas | 34 |
| Uso de este analisis | Analisis exploratorio de datos (EDA) no supervisado. No usa targets sensoriales. |
Mapa de calor de completitud de variables químicas por bloque analítico
El mapa de completitud confirma que los vacíos de la matriz son principalmente estructurales y no errores de captura. Cada bloque analítico mide un conjunto distinto de variables: los bloques GC-FID concentran información en compuestos cuantificados por FID, los bloques GC-MS en variables derivadas de cromatografía de gases acoplada a espectrometría de masas, el bloque JU en variables fermentativas y el bloque Folin en fenoles totales. Por esta razón, no tendría sentido exigir que todos los bloques tengan datos en todas las columnas. Lo relevante es observar la completitud dentro de cada bloque. En ese sentido, GC-FID y GC-MS presentan alta cobertura en sus propias variables, mientras que JU muestra una cobertura más parcial en algunas variables específicas. Esta estructura justifica que el análisis exploratorio se realice por bloque y no como una matriz química única.
Los histogramas muestran la forma de cada variable (¿se concentra en un rango, o está dispersa? ¿hay más de un grupo de valores?) y los boxplots resumen lo mismo de forma más compacta, marcando como punto aparte cualquier valor que quede fuera de 1.5 veces el rango intercuartílico. Con tamaños de muestra tan chicos por bloque (entre 2 y 39 unidades), es normal que las distribuciones se vean discretas o con “huecos” en vez de curvas suaves — eso no es un error, es la consecuencia directa de trabajar en un contexto de small data.
El histograma de fenoles totales muestra una distribución amplia, con valores concentrados principalmente entre rangos intermedios, pero también con grupos de muestras en valores bajos y altos. Esto indica que las muestras no presentan un nivel homogéneo de fenoles totales, sino que existe variabilidad química relevante entre ellas. La mayor parte de los valores se ubica aproximadamente en la zona media de la distribución, mientras que algunos casos aparecen bastante más bajos o más altos. Esta dispersión es útil para el análisis, ya que los fenoles totales pueden relacionarse con diferencias en carácter fenólico, tostado, amaderado o potencialmente ahumado.
Los histogramas del bloque GC-FID muestran comportamientos distintos entre compuestos. Algunos, como guaiacol, 4-ethyl guaiacol, o-cresol y p-cresol, tienen muchas observaciones concentradas en valores muy bajos y pocos casos con concentraciones más altas, lo que sugiere que estos compuestos no aparecen con la misma intensidad en todas las muestras. En cambio, varios ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl octanoate e isoamyl acetate, presentan rangos más amplios y distribuciones más dispersas. Esto refleja que el bloque GC-FID captura diferencias relevantes entre perfiles químicos, especialmente en compuestos asociados a familias fenólicas y fermentativas.
Los histogramas del bloque GC-MS reflejan una mezcla entre variables químicas interpretables y variables de control del proceso cromatográfico. El área válida se concentra en valores altos, cercanos al 96–100%, lo que sugiere que en la mayoría de los casos gran parte de la señal fue considerada utilizable, mientras que la variable de siloxanos presenta mayor dispersión, con algunos valores altos que podrían indicar ruido instrumental o contaminación de columna. En particular, el número de compuestos detectados muestra una diferencia marcada entre un grupo cercano a 600 y otros casos considerablemente más bajos, lo que refleja diferencias entre las distintas fuentes de datos GC-MS. Las variables de ésteres y aroma fermentativo presentan distribuciones con rangos amplios, mientras que los fenólicos se concentran mayoritariamente en valores bajos, por lo que estas últimas deben interpretarse como señales químicas puntuales dentro del bloque y no como un patrón dominante.
Los histogramas del bloque JU reflejan alta variabilidad entre variables fermentativas. La producción de etanol, la pérdida final de CO₂ y el consumo de maltosa muestran distribuciones amplias, lo que sugiere diferencias importantes entre condiciones experimentales de fermentación. En particular, el consumo de maltosa aparece dividido entre valores bajos y valores cercanos al máximo, lo que podría indicar fermentaciones con distinto grado de avance o eficiencia. Los ésteres del bloque JU presentan distribuciones más discretas y, en algunos casos, con pocos valores disponibles, por lo que deben interpretarse como señales exploratorias del perfil fermentativo y no como patrones concluyentes.
El boxplot de fenoles totales muestra una mediana ubicada en un rango intermedio, con una dispersión considerable entre muestras. La caja concentra la mayor parte de los valores aproximadamente entre niveles medios y altos, mientras que aparece un valor bajo marcado como atípico según la regla IQR. Este punto no debe interpretarse automáticamente como error, ya que puede corresponder a una muestra con menor contenido real de fenoles totales. En este estudio, el valor se documenta como atípico, pero se mantiene en la matriz para no alterar artificialmente la variabilidad química observada.
Los boxplots del bloque GC-FID muestran varios valores atípicos, especialmente en compuestos fenólicos como 4-ethyl guaiacol, guaiacol, o-cresol y p-cresol, además de algunos ésteres como ethyl hexadecanoate, ethyl octanoate e isoamyl octanoate. Esto indica que ciertas muestras tienen concentraciones químicas claramente distintas respecto del grupo central. En algunos compuestos, la mayoría de los valores se concentra cerca de cero y solo unas pocas muestras presentan valores elevados, lo que explica la aparición de atípicos. Dado que son mediciones químicas reales y el tamaño muestral es reducido, estos puntos se conservan y se interpretan como posibles señales diferenciadoras entre muestras, no como datos a eliminar automáticamente.
Los boxplots del bloque GC-MS muestran atípicos en variables de control y resumen, como siloxanos, área válida y número de compuestos detectados. En particular, la variable de siloxanos presenta valores extremos altos y bajos, lo que refuerza su utilidad como indicador de ruido instrumental o contaminación cromatográfica. El número de compuestos detectados también muestra una separación fuerte, probablemente asociada a diferencias entre fuentes de datos GC-MS. Las variables de ésteres y aroma fermentativo presentan rangos amplios, mientras que los fenólicos muestran un valor alto marcado como atípico. En conjunto, estos resultados indican que el bloque GC-MS debe interpretarse con cautela, distinguiendo entre señales químicas de interés y variables asociadas a la calidad del cromatograma.
Los boxplots del bloque JU muestran que varias variables fermentativas tienen rangos amplios, especialmente producción de etanol, pérdida de CO₂, consumo de maltosa y ethyl octanoate. También aparecen valores atípicos puntuales en algunos ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate. Estos casos pueden representar condiciones experimentales específicas donde ciertos compuestos se produjeron en mayor proporción. En lugar de eliminarse, estos valores se mantienen como parte de la variabilidad del proceso fermentativo, ya que podrían ser relevantes para explicar diferencias químicas entre muestras.
Estos gráficos son el primer filtro visual para detectar candidatos a valor atípico, que luego se confirman formalmente con el test de Dixon en la siguiente sección.
| variable_quimica | n_outliers |
|---|---|
| ctrl_gcms_siloxano_pct | 6 |
| x_gcfid_ethyl_hexadecanoate_ppm | 6 |
| x_gcfid_o_cresol_ppm | 6 |
| x_gcfid_p_cresol_ppm | 6 |
| x_gcms_area_valida_pct | 6 |
| x_gcfid_4_ethyl_guaiacol_ppm | 5 |
| x_gcfid_guaiacol_ppm | 5 |
| n_compuestos_detectados | 4 |
| x_gcfid_creosol_ppm | 4 |
| x_folin_fenoles_totales_ug_ag_ml | 3 |
| x_gcfid_ethyl_octanoate_ppm | 3 |
| x_gcfid_isoamyl_octanoate_ppm | 2 |
| x_gcms_fenolicos_pct | 1 |
| x_ju_ethyl_decanoate_ppm | 1 |
| x_ju_ethyl_dodecanoate_ppm | 1 |
| x_ju_ethyl_hexadecanoate_ppm | 1 |
| x_ju_ethyl_myristate_ppm | 1 |
| es_outlier_dixon | n_variables |
|---|---|
| sin_outlier | 17 |
| outlier_detectado | 13 |
Estos mapas de calor muestran la correlación de Pearson entre pares de variables dentro de cada bloque (no existe un mapa único global porque, como se vio en completitud, las variables de distintos bloques casi no comparten unidades para calcular una correlación válida). Sirven para anticipar colinealidad antes de modelar.
El mapa de correlación GC-FID muestra asociaciones importantes entre varios compuestos. Destaca la relación positiva entre 4-ethyl guaiacol y guaiacol, así como entre guaiacol y algunos cresoles, lo que sugiere que ciertos compuestos fenólicos tienden a variar de manera conjunta. También se observan correlaciones positivas entre varios ésteres, como ethyl decanoate, ethyl tetradecanoate e isoamyl octanoate, indicando posibles patrones compartidos dentro de la fracción fermentativa o aromática. Al mismo tiempo, aparecen correlaciones negativas relevantes, por ejemplo entre isoamyl acetate y ethyl dodecanoate, o entre furfural y algunos compuestos fenólicos. Esto confirma que las variables GC-FID no son independientes entre sí y que el modelamiento posterior debe considerar la colinealidad.
El mapa de correlación GC-MS muestra relaciones muy fuertes entre algunas variables, varias de ellas esperables por construcción. Por ejemplo, x_gcms_esteres_pct y x_gcms_aroma_fermentativo_pct presentan correlación perfecta, ya que el aroma fermentativo incluye directamente a los ésteres dentro de su cálculo. También destaca la correlación negativa perfecta entre siloxanos y área válida, lo que indica que cuando aumenta la proporción asociada a siloxanos disminuye la proporción de área considerada útil. Además, aldehídos y fenólicos muestran una correlación positiva alta, mientras que el área válida se relaciona positivamente con ésteres y aroma fermentativo. En conjunto, el bloque GC-MS combina variables químicas con variables de control de calidad de señal, por lo que sus correlaciones deben interpretarse considerando cómo fueron construidas.
El mapa de correlación JU muestra una estructura interna muy marcada. Las variables asociadas a producción de etanol, pérdida de CO₂ y consumo de maltosa presentan correlaciones positivas altas, lo que es coherente con su relación directa dentro del proceso fermentativo. También se observan correlaciones muy fuertes entre varios ésteres de cadena larga, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate, lo que sugiere que estos compuestos tienden a aumentar o disminuir conjuntamente. En contraste, algunos cresoles presentan correlaciones negativas con variables fermentativas y con ciertos ésteres. Esto indica que el bloque JU no contiene variables aisladas, sino grupos de variables que representan procesos químicos conectados, aspecto que debe considerarse en el modelamiento para evitar interpretar señales redundantes como independientes.
Pares con correlación muy alta (por ejemplo, distintos ésteres de una misma familia química que suben y bajan juntos) son la razón por la que en el modelamiento se prefieren métodos regularizados (Ridge, PLS) en vez de una regresión lineal múltiple simple.
| grupo_pca | estado | n_filas | n_variables | pc1_varianza | pc2_varianza | pc1_pc2_varianza | motivo | t2_n_comp | t2_limite | q_limite |
|---|---|---|---|---|---|---|---|---|---|---|
| Fenoles_totales | no_calculado | 24 | 1 | NA | NA | NA | Se requieren al menos 3 filas y 2 variables con variabilidad. | NA | NA | NA |
| GCFID | calculado | 26 | 13 | 0.3632469 | 0.2744804 | 0.6377273 | NA | 2 | 7.089221 | 12.736922 |
| GCMS | calculado | 26 | 7 | 0.6427447 | 0.2291118 | 0.8718565 | NA | 2 | 7.089221 | 2.579909 |
| JU | calculado | 39 | 13 | 0.4468083 | 0.1983791 | 0.6451874 | NA | 2 | 6.679627 | 10.798231 |
La tabla muestra que el PCA no se calculó para el bloque de fenoles totales, ya que este bloque contiene solo una variable útil y el análisis de componentes principales requiere al menos dos variables. En los demás bloques, los dos primeros componentes resumen una proporción importante de la variabilidad: 63,8% en GC-FID, 87,2% en GC-MS y 64,5% en JU. Esto indica que, aunque cada bloque tiene varias variables químicas, una parte relevante de la estructura de los datos puede representarse en un plano bidimensional. Por esta razón, los biplots permiten visualizar de forma resumida qué variables empujan la separación entre muestras y qué unidades quedan más alejadas del grupo principal.
En el biplot del bloque GC-FID, el primer componente principal separa principalmente variables fenólicas ubicadas hacia la izquierda, como guaiacol, 4-ethyl guaiacol y o-cresol, de otras variables ubicadas hacia la derecha, como creosol, furfural y ethyl hexadecanoate. El segundo componente está fuertemente influido por isoamyl acetate, que aparece aislado hacia la parte superior, mientras que varios ésteres de cadena más larga, como ethyl decanoate, ethyl dodecanoate, ethyl tetradecanoate e isoamyl octanoate, se proyectan hacia la zona inferior. Esto sugiere que el bloque GC-FID distingue al menos tres patrones químicos: uno asociado a compuestos fenólicos, otro a ésteres de cadena larga y otro a isoamyl acetate. Las muestras se agrupan en zonas diferenciadas del plano, lo que indica que no todas presentan el mismo perfil químico dentro de este bloque.
En el biplot GC-MS, el primer componente principal explica la mayor
parte de la variabilidad del bloque y separa claramente las variables
asociadas a área válida, ésteres y aroma fermentativo respecto de
variables de control como siloxanos y número de compuestos detectados.
Las variables x_gcms_esteres_pct y
x_gcms_aroma_fermentativo_pct aparecen prácticamente
superpuestas, lo que es esperable porque el aroma fermentativo incluye a
los ésteres dentro de su cálculo. Por otra parte, aldehídos y fenólicos
se proyectan juntos hacia la zona superior, indicando que tienden a
variar en una dirección similar dentro de este bloque. La disposición de
las muestras muestra algunos casos alejados hacia la derecha, asociados
a mayor peso de siloxanos o número de compuestos detectados, por lo que
este PCA refleja tanto diferencias químicas como diferencias en la
calidad o estructura del cromatograma.
En el biplot del bloque JU se observa una separación clara entre grupos de variables fermentativas. Hacia la zona inferior derecha se agrupan variables directamente asociadas al avance de la fermentación, como producción de etanol, pérdida final de CO₂ y consumo de maltosa, lo que confirma que estas variables representan una señal común del proceso fermentativo. Hacia la zona superior derecha se proyectan varios ésteres, como ethyl decanoate, ethyl dodecanoate, ethyl hexadecanoate y ethyl myristate, indicando que estos compuestos tienden a comportarse de forma conjunta. En cambio, o-cresol, p-cresol e isoamyl acetate se ubican hacia la izquierda, sugiriendo un comportamiento distinto respecto del grupo principal de ésteres y variables fermentativas. Este resultado muestra que el bloque JU no solo captura intensidad fermentativa, sino también diferencias internas entre familias de compuestos.
Sobre esos mismos componentes se calcula la distancia T² de Hotelling (qué tan lejos está una unidad del centro, dentro del plano de los componentes usados) y el Q-residual (qué tan mal representada queda esa unidad por esos componentes) — el complemento multivariado al test de Dixon univariado.
En el gráfico T²–Q residual del bloque GC-FID, la mayoría de las unidades queda dentro de los límites multivariados definidos al 95%, lo que indica que son razonablemente representadas por los componentes principales calculados. Sin embargo, las dos réplicas de la muestra Pilsner H76R1R2 aparecen por sobre el límite de Q-residual. Esto significa que no son necesariamente las más lejanas dentro del plano PCA, pero sí quedan mal representadas por los componentes principales usados. En términos prácticos, estas réplicas presentan una estructura química particular que el PCA no logra resumir completamente, por lo que se documentan como candidatas a atípicos multivariados, sin eliminarlas de la matriz.
En el bloque GC-MS, la mayoría de las unidades se mantiene dentro de
los límites de T² de Hotelling y Q-residual. No obstante, la muestra
gcms_constanza_experimentales__xp2_r1 queda fuera de ambos
límites, lo que indica un comportamiento multivariado claramente
distinto al resto. Al superar el límite de T², la muestra se ubica lejos
del centro del espacio PCA; al mismo tiempo, al superar el límite de
Q-residual, también queda mal representada por los componentes
principales retenidos. Por lo tanto, esta unidad debe considerarse un
caso atípico multivariado relevante dentro del bloque GC-MS. Aun así, se
mantiene en la matriz y se documenta para revisión posterior, ya que
puede reflejar una diferencia real de composición o de calidad
cromatográfica.
En el bloque JU se observa una mayor cantidad de unidades fuera de
los límites multivariados. La muestra
ju_260507_quimica_cepas__m1_r1 destaca por superar
ampliamente el límite de T² de Hotelling, lo que indica que se encuentra
muy alejada del centro del espacio PCA, aunque no presenta un Q-residual
elevado. Esto sugiere que es una muestra extrema, pero bien representada
por los componentes principales. En cambio, otras unidades, como
sc476_1e_r1, sc481_3e_r1,
b1_1_r1, 705_1_r1 y 815_3_r1,
superan principalmente el límite de Q-residual, lo que indica que sus
perfiles no quedan bien resumidos por el plano PCA. En conjunto, estos
resultados muestran que el bloque JU tiene una estructura interna más
heterogénea, probablemente asociada a diferencias reales entre cepas o
condiciones fermentativas.
En conjunto, los análisis PCA y T²–Q residual permiten identificar patrones multivariados que no siempre son visibles en los análisis univariados. GC-FID muestra diferencias asociadas principalmente a compuestos fenólicos y ésteres; GC-MS combina señales químicas con variables de control cromatográfico; y JU presenta una estructura marcada por variables fermentativas y producción de ésteres. Los casos que superan los límites de T² o Q-residual se consideran unidades candidatas a revisión, pero no se eliminan automáticamente, ya que en un contexto de small data pueden representar diferencias químicas reales entre muestras. Por lo tanto, estos gráficos se utilizan como evidencia exploratoria para documentar perfiles particulares y orientar la interpretación del modelamiento posterior.
El detalle completo de las unidades que superan estos límites se muestra en la siguiente tabla:
| grupo_pca | unidad_analitica_id | bloque_id | muestra_base | t2_hotelling | excede_t2 | q_residual | excede_q |
|---|---|---|---|---|---|---|---|
| GCFID | alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r2 | alexandra_260603_pilsner_gcfid | Pilsner_H76R1R2 | 2.0242056 | FALSE | 23.647634 | TRUE |
| GCFID | alexandra_260603_pilsner_gcfid__pilsner_h76r1r2_r1 | alexandra_260603_pilsner_gcfid | Pilsner_H76R1R2 | 0.7192313 | FALSE | 22.686269 | TRUE |
| GCMS | gcms_constanza_experimentales__xp2_r1 | gcms_constanza_experimentales | XP2 | 7.7781919 | TRUE | 5.589873 | TRUE |
| JU | ju_260507_quimica_cepas__m1_r1 | ju_260507_quimica_cepas | M1 | 29.4083893 | TRUE | 3.183925 | FALSE |
| JU | ju_260507_quimica_cepas__sc476_1e_r1 | ju_260507_quimica_cepas | SC476_1e | 4.6504401 | FALSE | 31.028108 | TRUE |
| JU | ju_260507_quimica_cepas__705_1_r1 | ju_260507_quimica_cepas | 705.1 | 4.5737151 | FALSE | 21.783158 | TRUE |
| JU | ju_260507_quimica_cepas__b1_1_r1 | ju_260507_quimica_cepas | B1.1 | 3.4151925 | FALSE | 23.056589 | TRUE |
| JU | ju_260507_quimica_cepas__815_3_r1 | ju_260507_quimica_cepas | 815.3 | 2.2894972 | FALSE | 17.107556 | TRUE |
| JU | ju_260507_quimica_cepas__sc481_3e_r1 | ju_260507_quimica_cepas | SC481_3e | 0.8398602 | FALSE | 27.525023 | TRUE |
| indicador | valor |
|---|---|
| Unidad individual sensorial | Evaluacion individual de catador |
| Muestras sensoriales totales | 23 |
| Evaluaciones individuales totales | 263 |
| Evaluaciones con quimica confirmada | 226 |
| Evaluaciones sin quimica confirmada | 37 |
| Bloques sensoriales | 5 |
| Targets sensoriales detectados | 34 |
| Muestras sensoriales agregadas | 23 |
| Uso de este analisis | Analisis exploratorio de datos (EDA), no usa predictores quimicos. |
| Advertencia metodologica | Las evaluaciones individuales son reales, pero no equivalen a muestras quimicas independientes. |
El mapa de completitud muestra que los datos faltantes en el bloque sensorial son principalmente estructurales. Esto ocurre porque cada sesión o formulario de cata evaluó un subconjunto distinto de descriptores, por lo que no todos los atributos están disponibles para todas las muestras. En este sentido, los vacíos no deben interpretarse como errores de registro, sino como diferencias propias del diseño de cada evaluación sensorial. La figura permite identificar qué targets tienen mayor cobertura entre sesiones y cuáles quedan restringidos a bloques específicos, aspecto importante antes de comparar o cruzar estos datos con las variables químicas.
Los histogramas muestran la distribución de los puntajes individuales asignados por los catadores a cada descriptor sensorial. En general, varios atributos se concentran en valores bajos e intermedios, lo que indica que no todas las notas sensoriales aparecen con alta intensidad en las muestras evaluadas. Sin embargo, atributos como ahumado, fenólico, medicinal, amaderado, terroso, regusto ahumado y complejidad presentan mayor dispersión, lo que sugiere diferencias perceptibles entre muestras y catadores. Estas distribuciones permiten identificar qué targets tienen variabilidad suficiente para aportar información en análisis posteriores y cuáles podrían tener menor poder explicativo por estar demasiado concentrados en pocos puntajes.
Los boxplots por bloque sensorial muestran que los puntajes de los atributos principales cambian según la sesión de cata. En variables como ahumado, fenólico, frutal y medicinal se observan diferencias en medianas y dispersión entre bloques, lo que indica que las evaluaciones no son completamente homogéneas entre sesiones. Esto puede deberse a diferencias en las muestras evaluadas, en el formulario utilizado o en el grupo de catadores. Por esta razón, los bloques sensoriales deben analizarse considerando su origen, evitando mezclar directamente sesiones que no midieron exactamente los mismos atributos bajo las mismas condiciones.
A nivel de muestra individual dentro de cada sesión (detalle en
outputs/exploratorio/sensorial/04_boxplots_muestra_*), el
patrón se repite: siempre hay una o dos muestras que se separan del
resto en los atributos ahumado/fenólico/medicinal. El caso más claro es
la cata social de enero 2025, que es también la única
sesión que junta muestras comerciales (C1/Dalwhinnie, C2/Caol Ila) con
las experimentales/locales (B1, C70, H76):
En la cata social de enero de 2025 se observa una mayor variabilidad entre muestras y catadores. La muestra 7 (C2/Caol Ila) destaca por presentar puntajes más altos en ahumado, fenólico y medicinal, lo que sugiere un perfil sensorial más marcado en atributos asociados a humo, compuestos fenólicos o notas medicinales. También se aprecia dispersión amplia en varias muestras, lo que es esperable en una cata social con distintos tipos de catadores. Esta figura muestra que algunas muestras fueron percibidas de forma más intensa y consistente, mientras que otras presentan evaluaciones más variables.
Las demás sesiones siguen el mismo patrón exploratorio con menor
contraste: en cata_alexandra_260603 la percepción fenólica
y de ahumado crece de la muestra 1 a la 4; en
cata_septiembre_2024 la muestra 3 se percibe más intensa en
ahumado, fenólico y frutal; en panel_noviembre la muestra 5
destaca en fenólico y las muestras 2/4/5 en frutal; y en
sensorial_cepas_ju los puntajes son más acotados y con
menor dispersión, por lo que ese bloque se trata como una señal
exploratoria adicional y no como una caracterización sensorial
robusta.
El mapa de correlación muestra que varios targets sensoriales están relacionados entre sí. Destacan asociaciones positivas entre atributos como ahumado, aroma ahumado, sabor ahumado, regusto ahumado, fenólico y medicinal, lo que indica que estos descriptores tienden a aumentar conjuntamente en las evaluaciones. Esto sugiere la presencia de una dimensión sensorial común asociada al carácter ahumado-fenólico del whisky. También se observan correlaciones entre atributos de sabor, aroma y regusto, aunque no todos los descriptores se relacionan con la misma intensidad. La presencia de valores NA se debe a que no todos los atributos fueron evaluados en todas las sesiones, por lo que estas correlaciones deben interpretarse como evidencia exploratoria y no como relaciones definitivas.
Esta sección usa el campo “categoría de catador” (experto/sommelier, aficionado al whisky, consumidor general de destilados), registrado en el cuestionario de cada cata. Se usa para dos cosas: ver si el promedio de puntaje cambia según el tipo de catador, y medir qué tan de acuerdo están entre sí los catadores de una misma categoría.
Perfil por muestra y categoría: para cada muestra,
categoría de catador y target sensorial se calcula el número de
evaluaciones, el promedio y la desviación estándar. Por su tamaño (285
combinaciones muestra–categoría–target), se muestran solo las primeras
filas a modo de ejemplo; el detalle completo está en
data/procesamiento/analisis_sensorial.xlsx, hoja
16_perfil_categoria_catador.
| grupo_sensorial | bloque_sensorial | muestra_cata | identificador_sensorial | categoria_catador | target | n_evaluaciones | media | desviacion_estandar |
|---|---|---|---|---|---|---|---|---|
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Aficionado al whisky | y_ahumado_comun | 7 | 2.1904762 | 1.0157490 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Consumidor General de Destilados | y_ahumado_comun | 20 | 2.0666667 | 0.8207827 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Experto/ Sommelier | y_ahumado_comun | 4 | 0.9166667 | 0.3191424 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Aficionado al whisky | y_aroma_ahumado | 7 | 2.2857143 | 0.9511897 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Consumidor General de Destilados | y_aroma_ahumado | 20 | 2.5000000 | 1.1002392 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Experto/ Sommelier | y_aroma_ahumado | 4 | 1.0000000 | 0.0000000 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Aficionado al whisky | y_aroma_amaderado | 7 | 1.7142857 | 1.4960265 |
| historico_enero | cata_social_enero_2025 | Muestra 1 | C70 | Consumidor General de Destilados | y_aroma_amaderado | 19 | 1.7894737 | 0.9763280 |
Concordancia entre catadores (ICC): para saber si los catadores de una misma categoría puntúan de forma parecida entre sí (y no solo si su promedio es distinto), se calculó el ICC1 (coeficiente de correlación intraclase, modelo de un factor aleatorio) por categoría y target. Valores cercanos a 1 indican alta concordancia dentro del grupo; valores cercanos a 0 indican que incluso catadores de la misma categoría difieren bastante entre sí.
| categoria_catador | target | icc1 | n_muestras | n_observaciones | interpretacion |
|---|---|---|---|---|---|
| Experto/ Sommelier | y_ahumado_comun | 0.6000569 | 5 | 17 | concordancia buena |
| Aficionado al whisky | y_ahumado_comun | 0.3750204 | 5 | 35 | concordancia moderada |
| Consumidor General de Destilados | y_ahumado_comun | 0.2608232 | 5 | 93 | concordancia moderada |
| Experto/ Sommelier | y_fenolico_comun | 0.7505654 | 5 | 17 | concordancia excelente |
| Aficionado al whisky | y_fenolico_comun | 0.3427705 | 5 | 35 | concordancia moderada |
| Consumidor General de Destilados | y_fenolico_comun | 0.2929327 | 5 | 93 | concordancia moderada |
| Experto/ Sommelier | y_medicinal_comun | 0.4543738 | 5 | 17 | concordancia moderada |
| Aficionado al whisky | y_medicinal_comun | 0.1442246 | 5 | 35 | concordancia baja |
| Consumidor General de Destilados | y_medicinal_comun | 0.0993593 | 5 | 93 | concordancia baja |
Los boxplots por categoría de catador muestran que existen diferencias en la forma en que los grupos evaluaron los atributos principales. En ahumado, los consumidores generales de destilados presentan una distribución amplia, mientras que expertos/sommelier y aficionados al whisky muestran también alta variabilidad interna. En fenólico y medicinal se observan diferencias de mediana entre categorías, pero también una dispersión considerable dentro de cada grupo. Esto indica que la categoría del catador puede influir en la evaluación, aunque no permite establecer conclusiones firmes debido al tamaño reducido y al posible desbalance entre categorías. Por ello, esta variable se usa como referencia descriptiva del panel.
Se generó un gráfico de radar por muestra y por dimensión sensorial
(aroma, sabor, regusto final) para cada sesión de cata, automatizando lo
que antes se armaba manualmente en Excel; el set completo está en
outputs/exploratorio/sensorial/ (archivos
07_radar_*). Se muestra aquí la sesión social de
enero 2025, por ser la única que compara directamente muestras
comerciales (C1/Dalwhinnie, C2/Caol Ila) con las experimentales/locales
(B1, C70, H76), lo que la hace la más ilustrativa del conjunto.
El radar de aroma de la cata social de enero de 2025 muestra una separación clara entre las muestras. C2/Caol Ila presenta el perfil aromático más amplio, destacando en intensidad de ahumado, medicinal, terroso, cereal, vainilla, café y amaderado. Esto es coherente con un whisky comercial de perfil más ahumado o intenso. C1/Dalwhinnie también muestra un perfil relativamente alto, aunque menor que C2. En cambio, B1, C70 y H76 presentan perfiles más moderados y cercanos entre sí. Este gráfico permite observar que las muestras comerciales se diferencian con claridad de las experimentales o locales en varios atributos aromáticos.
El radar de sabor de la cata social de enero de 2025 muestra que C2/Caol Ila presenta el perfil más intenso y amplio entre las muestras, especialmente en ahumado, medicinal, terroso, cereal, vainilla, frutal, café y sensación en boca. C1/Dalwhinnie aparece como una segunda muestra de perfil elevado, aunque menos extrema que C2. Las muestras B1, C70 y H76 presentan valores más bajos, con perfiles más compactos. Esto indica que el bloque de sabor permite separar con claridad las muestras comerciales de mayor intensidad sensorial respecto de las demás.
En el radar de regusto final de la cata social de enero de 2025, C2/Caol Ila vuelve a destacar con valores altos en ahumado, complejidad, duración e integración del ahumado. C1/Dalwhinnie también presenta un perfil amplio, aunque algo menor. Las muestras B1, C70 y H76 se ubican en rangos más bajos o intermedios, especialmente en ahumado y complejidad. Este patrón sugiere que las muestras comerciales no solo fueron percibidas como más intensas en aroma, sino también con un regusto más persistente y estructurado.
Las demás sesiones (cata_alexandra_260603,
cata_septiembre_2024, panel_noviembre,
sensorial_cepas_ju) siguen la misma lógica de análisis por
muestra y confirman el mismo patrón general: siempre hay una o dos
muestras que se distinguen del resto en intensidad
ahumada/fenólica/medicinal, mientras que el bloque
sensorial_cepas_ju en particular muestra señales más
acotadas y debe interpretarse como exploratorio por su menor cantidad de
evaluaciones.
De forma análoga, se generó un radar por categoría de catador
(experto/sommelier, consumidor general, aficionado al whisky) para cada
muestra, disponible en outputs/exploratorio/sensorial/
(archivos 08_radar_categoria_*). Se muestra C2/Caol
Ila, donde la diferencia entre categorías es más marcada.
El radar de aroma de C2/Caol Ila muestra que los expertos/sommelier asignan puntajes claramente más altos que el resto de las categorías en casi todos los atributos, especialmente en intensidad de ahumado, medicinal, terroso, cereal, vainilla, frutal y café. Esto es coherente con un perfil comercial más marcado y complejo, probablemente más reconocible para catadores entrenados. Los consumidores generales y aficionados también perciben estas notas, pero con menor intensidad. El promedio queda por debajo del perfil experto, lo que indica que la lectura de C2/Caol Ila varía considerablemente según la experiencia del catador.
El radar de sabor de C2/Caol Ila muestra el perfil más intenso entre las muestras analizadas por categoría. Los expertos/sommelier asignan valores altos en intensidad de ahumado, cereal, vainilla, amaderado, sensación en boca y otros atributos, mostrando una lectura sensorial amplia de la muestra. Los consumidores generales y el promedio también presentan perfiles relativamente altos, aunque menos extremos. Los aficionados al whisky tienden a puntuar más bajo algunos atributos como medicinal, terroso y café. En conjunto, el gráfico confirma que C2/Caol Ila se diferencia por un sabor más intenso, complejo y marcado, especialmente en atributos ahumados y amaderados.
En el radar de regusto final de C2/Caol Ila, los expertos/sommelier vuelven a destacar con los puntajes más altos en duración, ahumado, complejidad, integración del ahumado, armonía y tomabilidad. Las demás categorías presentan perfiles más bajos y cercanos entre sí, aunque mantienen valores relativamente altos en comparación con otras muestras. Esto sugiere que C2/Caol Ila fue percibida como una muestra con regusto persistente y estructurado, especialmente por los catadores expertos. La diferencia entre categorías refuerza que el nivel de experiencia puede influir en la detección de atributos de final sensorial.
En las demás muestras (B1, C1/Dalwhinnie, C70, H76) la categoría de catador también influye, pero con diferencias más moderadas y sin un patrón tan marcado como en C2/Caol Ila: en general los expertos tienden a puntuar con mayor exigencia o detalle en atributos específicos (amaderado en C1/Dalwhinnie, sensación en boca en C70), mientras que consumidores generales y aficionados entregan perfiles más amplios pero menos diferenciados entre sí.
** 09_biplot_pca_sensorial_cata_alexandra_260603 **
** 09_biplot_pca_sensorial_cata_septiembre_2024 **
** 09_biplot_pca_sensorial_cata_social_enero_2025 **
** 09_biplot_pca_sensorial_panel_noviembre **
** 09_biplot_pca_sensorial_sensorial_cepas_ju **
** 10_distancia_t2_q_cata_alexandra_260603 **
** 10_distancia_t2_q_cata_septiembre_2024 **
** 10_distancia_t2_q_cata_social_enero_2025 **
** 10_distancia_t2_q_panel_noviembre **
** 10_distancia_t2_q_sensorial_cepas_ju **
| grupo_pca | muestra_cata | identificador_sensorial | t2_hotelling | excede_t2 | q_residual | excede_q |
|---|---|---|---|---|---|---|
| cata_septiembre_2024 | Muestra 1 | C70 | 1.333333 | FALSE | 0 | TRUE |
| cata_septiembre_2024 | Muestra 2 | B1 | 1.333333 | FALSE | 0 | TRUE |
| cata_septiembre_2024 | Muestra 3 | H76 | 1.333333 | FALSE | 0 | TRUE |
Esta sección cruza, de forma exploratoria y previa al modelamiento
formal, los predictores químicos con los targets sensoriales, usando
correlación de Pearson por pares (pairwise.complete.obs) y
exigiendo al menos 5 pares con dato disponible para reportar un valor.
Se usa el escenario M_pura (34 unidades con química real y
cata real agregada), y no reemplaza el diagnóstico de colinealidad ni
los modelos supervisados de la Parte 3 — es solo una primera mirada a
qué variables podrían estar asociadas antes de entrar a esos análisis
formales.
| indicador | valor |
|---|---|
| Escenario | M_pura (quimica real + cata real agregada, evidencia principal) |
| Unidades analiticas (filas) | 34 |
| Predictores quimicos (x_*) | 32 |
| Targets sensoriales (y_*) | 34 |
| Targets principales | y_frutal_comun, y_fenolico_comun, y_ahumado_comun, y_medicinal_comun |
| Uso de este analisis | Vista exploratoria previa (EDA), no reemplaza el diagnostico de colinealidad ni el modelamiento supervisado. |
| Advertencia metodologica | El VIF global no aplica por baja superposicion entre tecnicas analiticas (ver colinealidad_modelamiento.xlsx); esta hoja usa correlacion pareada simple, con n variable por par segun el bloque quimico disponible. |
La tabla resume el escenario usado, los 32 predictores químicos
evaluados y los 4 targets sensoriales principales considerados
(y_frutal_comun, y_fenolico_comun,
y_ahumado_comun, y_medicinal_comun).
Este heatmap cruza los 32 predictores químicos contra los 4 targets
principales. Las celdas en blanco indican que ese par no alcanzó el
mínimo de 5 observaciones simultáneas para calcular una correlación
confiable. Por eso solo aparecen valores para predictores de
GC-FID (49 pares evaluados) y GC-MS (5
pares); los predictores de JU y Folin
casi no se solapan con las unidades que tienen cata real dentro de
M_pura y por lo tanto no alcanzan ese mínimo. Dentro de lo
que sí se puede leer, destacan los fenoles volátiles de GC-FID —
guaiacol, o-cresol, p-cresol y 4-etil-guaiacol — con correlaciones altas
(r ≈ 0.7–0.9) tanto con y_ahumado_comun como con
y_fenolico_comun, coherente con que estas mismas variables
terminan siendo los predictores prioritarios en el modelamiento (Parte
4).
Como los bloques químicos no comparten unidades analíticas entre sí (ver completitud, sección 2.2.1), conviene además mirar cada bloque por separado en vez de solo el heatmap combinado.
El bloque GC-FID es el que más cobertura aporta a este cruce (todos
sus predictores alcanzan el mínimo de pares frente a los 4 targets
principales). Se confirma el mismo patrón que en el heatmap general: los
fenoles volátiles correlacionan fuerte y positivamente con
ahumado/fenólico/medicinal, mientras que varios ésteres (isoamyl
octanoate, ethyl dodecanoate, ethyl decanoate, furfural) muestran su
correlación más alta con y_frutal_comun en vez de con el
carácter ahumado.
El bloque GC-MS solo alcanza el mínimo de pares frente a
y_fenolico_comun (5 pares), por lo que es el único target
con celda calculada para este bloque. El área válida y los ésteres/aroma
fermentativo correlacionan negativamente con el fenólico (r ≈ -0.6 a
-0.75), mientras que fenólicos y aldehídos correlacionan positivamente
(r ≈ 0.55–0.59). Dado que son solo 5 pares, esta lectura es referencial
y no debe compararse en fuerza con los resultados de GC-FID, que tienen
bastante más respaldo muestral.
El bloque JU no genera un heatmap propio en este
cruce: por definición, M_pura excluye la cata individual JU
(ver Matriz 1 en la Parte 1), así que sus predictores fermentativos casi
no se solapan con unidades que tengan cata real y no llegan al mínimo de
5 pares frente a ningún target. Para ver JU cruzado con sensorial hay
que usar el escenario de sensibilidad M_cata_individual
(Matriz 5, Parte 1), no este cruce exploratorio.
| predictor | target | n_pares | correlacion | abs_correlacion |
|---|---|---|---|---|
| x_gcfid_ethyl_dodecanoate_ppm | y_global_armonia | 9 | 0.9963613 | 0.9963613 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_sabor_cereal | 9 | -0.9927572 | 0.9927572 |
| x_gcfid_ethyl_dodecanoate_ppm | y_aroma_frutal | 9 | 0.9849455 | 0.9849455 |
| x_gcfid_ethyl_decanoate_ppm | y_sabor_frutal | 9 | 0.9832958 | 0.9832958 |
| x_gcfid_furfural_ppm | y_sabor_frutal | 9 | 0.9808440 | 0.9808440 |
| x_gcfid_isoamyl_octanoate_ppm | y_aroma_frutal | 9 | 0.9783320 | 0.9783320 |
| x_gcfid_isoamyl_octanoate_ppm | y_aroma_vainilla | 9 | -0.9766505 | 0.9766505 |
| x_gcfid_isoamyl_octanoate_ppm | y_frutal_comun | 9 | 0.9715324 | 0.9715324 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_sabor_cereal | 9 | -0.9690804 | 0.9690804 |
| x_gcfid_isoamyl_acetate_ppm | y_sabor_cereal | 9 | 0.9679891 | 0.9679891 |
| x_gcfid_isoamyl_octanoate_ppm | y_global_armonia | 9 | 0.9597624 | 0.9597624 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_aroma_cereal | 9 | -0.9540524 | 0.9540524 |
| x_gcfid_ethyl_octanoate_ppm | y_sabor_cereal | 9 | -0.9492496 | 0.9492496 |
| x_gcfid_isoamyl_acetate_ppm | y_global_armonia | 9 | -0.9439342 | 0.9439342 |
| x_gcfid_furfural_ppm | y_sabor_vainilla | 9 | 0.9379441 | 0.9379441 |
| x_gcfid_ethyl_dodecanoate_ppm | y_aroma_vainilla | 9 | -0.9234281 | 0.9234281 |
| x_gcfid_ethyl_decanoate_ppm | y_sabor_vainilla | 9 | 0.9103115 | 0.9103115 |
| x_gcfid_ethyl_decanoate_ppm | y_frutal_comun | 9 | 0.9088917 | 0.9088917 |
| x_gcfid_ethyl_dodecanoate_ppm | y_frutal_comun | 9 | 0.9088533 | 0.9088533 |
| x_gcfid_o_cresol_ppm | y_sabor_ahumado | 26 | 0.9010245 | 0.9010245 |
| x_gcfid_isoamyl_acetate_ppm | y_aroma_frutal | 9 | -0.9007599 | 0.9007599 |
| x_gcfid_ethyl_octanoate_ppm | y_sabor_amaderado | 26 | 0.8967265 | 0.8967265 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_global_armonia | 9 | 0.8952580 | 0.8952580 |
| x_gcfid_ethyl_decanoate_ppm | y_aroma_vainilla | 9 | -0.8943567 | 0.8943567 |
| x_gcfid_guaiacol_ppm | y_fenolico_comun | 26 | 0.8809552 | 0.8809552 |
| x_gcfid_furfural_ppm | y_frutal_comun | 9 | 0.8793002 | 0.8793002 |
| x_gcfid_ethyl_octanoate_ppm | y_global_armonia | 9 | 0.8663784 | 0.8663784 |
| x_gcfid_o_cresol_ppm | y_ahumado_comun | 26 | 0.8641168 | 0.8641168 |
| x_gcfid_furfural_ppm | y_aroma_vainilla | 9 | -0.8622242 | 0.8622242 |
| x_gcfid_ethyl_dodecanoate_ppm | y_sabor_cereal | 9 | -0.8605346 | 0.8605346 |
| x_gcfid_o_cresol_ppm | y_regusto_ahumado | 26 | 0.8602664 | 0.8602664 |
| x_gcfid_isoamyl_octanoate_ppm | y_sabor_frutal | 9 | 0.8484923 | 0.8484923 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_fenolico_comun | 26 | 0.8448986 | 0.8448986 |
| x_gcfid_o_cresol_ppm | y_fenolico_comun | 26 | 0.8423274 | 0.8423274 |
| x_gcfid_p_cresol_ppm | y_global_tomabilidad | 26 | -0.8389385 | 0.8389385 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_aroma_frutal | 9 | 0.8384869 | 0.8384869 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_sabor_ahumado | 26 | 0.8362570 | 0.8362570 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_ahumado_comun | 26 | 0.8258943 | 0.8258943 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_sabor_cafe | 26 | 0.8229627 | 0.8229627 |
| x_gcfid_o_cresol_ppm | y_sabor_medicinal | 26 | 0.8179613 | 0.8179613 |
| x_gcfid_guaiacol_ppm | y_ahumado_comun | 26 | 0.8168512 | 0.8168512 |
| x_gcfid_guaiacol_ppm | y_medicinal_comun | 26 | 0.8152067 | 0.8152067 |
| x_gcfid_ethyl_octanoate_ppm | y_aroma_frutal | 9 | 0.8138715 | 0.8138715 |
| x_gcfid_guaiacol_ppm | y_aroma_ahumado | 26 | 0.8095019 | 0.8095019 |
| x_gcfid_guaiacol_ppm | y_sabor_medicinal | 26 | 0.8033102 | 0.8033102 |
| x_gcfid_guaiacol_ppm | y_sabor_ahumado | 26 | 0.7996949 | 0.7996949 |
| x_gcfid_p_cresol_ppm | y_global_integracion_ahumado | 26 | -0.7941739 | 0.7941739 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_aroma_cereal | 9 | -0.7877052 | 0.7877052 |
| x_gcfid_isoamyl_acetate_ppm | y_aroma_vainilla | 9 | 0.7794642 | 0.7794642 |
| x_gcfid_ethyl_decanoate_ppm | y_aroma_frutal | 9 | 0.7775763 | 0.7775763 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_regusto_ahumado | 26 | 0.7773562 | 0.7773562 |
| x_gcfid_ethyl_octanoate_ppm | y_sabor_ahumado | 26 | 0.7588275 | 0.7588275 |
| x_gcfid_guaiacol_ppm | y_regusto_ahumado | 26 | 0.7570855 | 0.7570855 |
| x_gcfid_isoamyl_acetate_ppm | y_frutal_comun | 9 | -0.7558923 | 0.7558923 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_aroma_ahumado | 26 | 0.7526858 | 0.7526858 |
| x_gcms_area_valida_pct | y_fenolico_comun | 8 | -0.7480740 | 0.7480740 |
| x_gcfid_ethyl_octanoate_ppm | y_aroma_cereal | 9 | -0.7431832 | 0.7431832 |
| x_gcfid_furfural_ppm | y_aroma_frutal | 9 | 0.7307838 | 0.7307838 |
| x_gcfid_o_cresol_ppm | y_sabor_amaderado | 26 | 0.7286389 | 0.7286389 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_sabor_medicinal | 26 | 0.7212464 | 0.7212464 |
| x_gcfid_creosol_ppm | y_sabor_cereal | 9 | -0.7167459 | 0.7167459 |
| x_gcfid_p_cresol_ppm | y_sabor_medicinal | 26 | 0.7127539 | 0.7127539 |
| x_gcfid_ethyl_decanoate_ppm | y_global_armonia | 9 | 0.7033662 | 0.7033662 |
| x_gcfid_isoamyl_acetate_ppm | y_aroma_cereal | 9 | 0.6994710 | 0.6994710 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_medicinal_comun | 26 | 0.6980610 | 0.6980610 |
| x_gcfid_ethyl_dodecanoate_ppm | y_sabor_frutal | 9 | 0.6977666 | 0.6977666 |
| x_gcfid_ethyl_octanoate_ppm | y_ahumado_comun | 26 | 0.6944114 | 0.6944114 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_aroma_vainilla | 9 | -0.6926326 | 0.6926326 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_sabor_terroso | 26 | 0.6916213 | 0.6916213 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_sabor_sensacion_boca | 15 | 0.6914966 | 0.6914966 |
| x_gcfid_isoamyl_octanoate_ppm | y_sabor_cafe | 26 | 0.6908824 | 0.6908824 |
| x_gcfid_isoamyl_octanoate_ppm | y_sabor_cereal | 9 | -0.6893736 | 0.6893736 |
| x_gcfid_ethyl_octanoate_ppm | y_regusto_ahumado | 26 | 0.6880721 | 0.6880721 |
| x_gcfid_isoamyl_acetate_ppm | y_sabor_sensacion_boca | 15 | -0.6825161 | 0.6825161 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_global_armonia | 9 | 0.6822133 | 0.6822133 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_sabor_medicinal | 26 | -0.6780673 | 0.6780673 |
| x_gcfid_ethyl_octanoate_ppm | y_aroma_vainilla | 9 | -0.6774599 | 0.6774599 |
| x_gcfid_isoamyl_acetate_ppm | y_sabor_cafe | 26 | -0.6772284 | 0.6772284 |
| x_gcfid_p_cresol_ppm | y_medicinal_comun | 26 | 0.6752541 | 0.6752541 |
| x_gcfid_guaiacol_ppm | y_aroma_medicinal | 26 | 0.6731422 | 0.6731422 |
| x_gcfid_ethyl_decanoate_ppm | y_sabor_terroso | 26 | 0.6678877 | 0.6678877 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_frutal_comun | 9 | 0.6655018 | 0.6655018 |
| x_gcfid_o_cresol_ppm | y_aroma_ahumado | 26 | 0.6564175 | 0.6564175 |
| x_gcfid_ethyl_octanoate_ppm | y_frutal_comun | 9 | 0.6519383 | 0.6519383 |
| x_gcfid_creosol_ppm | y_global_armonia | 9 | 0.6511872 | 0.6511872 |
| x_gcfid_furfural_ppm | y_global_armonia | 9 | 0.6501236 | 0.6501236 |
| x_gcfid_o_cresol_ppm | y_sabor_terroso | 26 | 0.6492717 | 0.6492717 |
| x_gcms_aroma_fermentativo_pct | y_fenolico_comun | 8 | -0.6447762 | 0.6447762 |
| x_gcms_esteres_pct | y_fenolico_comun | 8 | -0.6436586 | 0.6436586 |
| x_gcfid_guaiacol_ppm | y_global_tomabilidad | 26 | -0.6363397 | 0.6363397 |
| x_gcfid_guaiacol_ppm | y_sabor_sensacion_boca | 15 | -0.6349961 | 0.6349961 |
| x_gcfid_o_cresol_ppm | y_medicinal_comun | 26 | 0.6243595 | 0.6243595 |
| x_gcfid_creosol_ppm | y_sabor_amaderado | 26 | -0.6236295 | 0.6236295 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_sabor_sensacion_boca | 15 | 0.6128577 | 0.6128577 |
| x_gcfid_creosol_ppm | y_aroma_frutal | 9 | 0.6110290 | 0.6110290 |
| x_gcfid_p_cresol_ppm | y_fenolico_comun | 26 | 0.6012165 | 0.6012165 |
| x_gcfid_p_cresol_ppm | y_sabor_sensacion_boca | 15 | -0.5978947 | 0.5978947 |
| x_gcfid_ethyl_decanoate_ppm | y_sabor_amaderado | 26 | 0.5965551 | 0.5965551 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_aroma_frutal | 9 | 0.5939159 | 0.5939159 |
| x_gcfid_ethyl_decanoate_ppm | y_regusto_complejidad | 26 | 0.5923611 | 0.5923611 |
| x_gcms_fenolicos_pct | y_fenolico_comun | 8 | 0.5898832 | 0.5898832 |
| x_gcfid_o_cresol_ppm | y_global_tomabilidad | 26 | -0.5883947 | 0.5883947 |
| x_gcfid_guaiacol_ppm | y_sabor_terroso | 26 | 0.5849326 | 0.5849326 |
| x_gcfid_isoamyl_octanoate_ppm | y_sabor_vainilla | 9 | 0.5806093 | 0.5806093 |
| x_gcfid_ethyl_dodecanoate_ppm | y_sabor_sensacion_boca | 15 | 0.5784098 | 0.5784098 |
| x_gcfid_isoamyl_acetate_ppm | y_sabor_amaderado | 26 | -0.5771608 | 0.5771608 |
| x_gcfid_isoamyl_acetate_ppm | y_aroma_ahumado | 26 | -0.5767469 | 0.5767469 |
| x_gcfid_isoamyl_octanoate_ppm | y_aroma_cafe | 26 | 0.5739225 | 0.5739225 |
| x_gcfid_ethyl_octanoate_ppm | y_fenolico_comun | 26 | 0.5731743 | 0.5731743 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_sabor_cafe | 26 | 0.5711981 | 0.5711981 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_sabor_sensacion_boca | 15 | -0.5676749 | 0.5676749 |
| x_gcfid_ethyl_octanoate_ppm | y_sabor_terroso | 26 | 0.5657614 | 0.5657614 |
| x_gcfid_ethyl_tetradecanoate_ppm | y_sabor_medicinal | 26 | -0.5641450 | 0.5641450 |
| x_gcfid_creosol_ppm | y_aroma_cereal | 9 | -0.5640356 | 0.5640356 |
| x_gcfid_4_ethyl_guaiacol_ppm | y_aroma_medicinal | 26 | 0.5600845 | 0.5600845 |
| x_gcms_aldehidos_pct | y_fenolico_comun | 8 | 0.5505476 | 0.5505476 |
| x_gcfid_isoamyl_acetate_ppm | y_sabor_ahumado | 26 | -0.5490854 | 0.5490854 |
| x_gcfid_p_cresol_ppm | y_aroma_cafe | 26 | -0.5408289 | 0.5408289 |
| x_gcfid_isoamyl_octanoate_ppm | y_regusto_complejidad | 26 | 0.5345286 | 0.5345286 |
| x_gcfid_isoamyl_acetate_ppm | y_ahumado_comun | 26 | -0.5319696 | 0.5319696 |
| x_gcfid_p_cresol_ppm | y_aroma_ahumado | 26 | 0.5308668 | 0.5308668 |
| x_gcfid_furfural_ppm | y_sabor_medicinal | 24 | -0.5285771 | 0.5285771 |
| x_gcfid_ethyl_decanoate_ppm | y_aroma_cafe | 26 | 0.5283003 | 0.5283003 |
| x_gcfid_ethyl_hexadecanoate_ppm | y_medicinal_comun | 26 | -0.5261929 | 0.5261929 |
| x_gcfid_p_cresol_ppm | y_aroma_medicinal | 26 | 0.5185180 | 0.5185180 |
| x_gcfid_furfural_ppm | y_sabor_ahumado | 24 | -0.5178173 | 0.5178173 |
| x_gcfid_ethyl_octanoate_ppm | y_regusto_duracion | 26 | 0.5168992 | 0.5168992 |
| x_gcfid_ethyl_decanoate_ppm | y_sabor_ahumado | 26 | 0.5090973 | 0.5090973 |
| x_gcfid_creosol_ppm | y_aroma_vainilla | 9 | -0.5071497 | 0.5071497 |
Esta tabla lista, ya no solo los 4 targets principales sino los 25
descriptores sensoriales individuales, todos los pares predictor-target
con |r| ≥ 0.5 (129 pares en total, sobre 18 predictores distintos, todos
de GC-FID o GC-MS). Varias de las correlaciones más altas (cercanas a
0.9–0.99) corresponden a pares con solo 8-9 observaciones — típicamente
contra y_frutal_comun, que tiene cobertura baja (13/34
unidades) — por lo que ese valor tan alto es en gran parte un efecto de
tamaño de muestra pequeño y no debe leerse como una relación fuerte y
confiable. Esta tabla es un insumo temprano de exploración, no una lista
de importancia de variables: esa evaluación formal se hace recién en el
modelamiento (Parte 3), con validación cruzada y bootstrap.
Esta parte documenta la etapa de modelamiento
predictivo: diagnóstico de viabilidad y colinealidad de los
predictores, ajuste de modelos candidatos y su validación por bootstrap
agrupado, además del análisis de sensibilidad a valores atípicos
químicos. El target principal es y_fenolico_comun
(cobertura completa, 34/34 en M_pura); se reporta también
y_frutal_comun como target secundario exploratorio, ya que
su baja cobertura (13/34) deja grados de libertad negativos en varios
escenarios y sus resultados no deben leerse con el mismo nivel de
confianza.
Los escenarios evaluados son:
| Escenario | Filas | Rol |
|---|---|---|
M_pura |
34 | Principal — evidencia central de resultados |
M_cata_individual |
52 | Sensibilidad — pura + cata individual JU agregada |
M_expandida_evaluador |
685 | Complementario por evaluador (no independiente) |
M_ia_exploratoria |
42 | Sintético exploratorio (no reemplaza cata real); 42 filas químicas con estimación IA utilizable, provenientes de 24 muestras físicas únicas |
Antes de mostrar los resultados de cada etapa, las siguientes dos secciones explican qué modelos se probaron y cómo se compensa, metodológicamente, tener tan pocas muestras con cata real.
Se prueban dos modelos base (piso mínimo de comparación) y seis modelos candidatos, todos evaluados sobre los mismos escenarios y targets:
Modelos base:
Modelos candidatos (small data):
ranger) y
Gradient Boosting restringido (gbm):
modelos de árboles con su complejidad limitada a propósito (profundidad
y número de árboles reducidos, mtry acotado) — un Random
Forest o Gradient Boosting sin restricciones prácticamente memoriza el
set de entrenamiento cuando hay 30-50 filas, así que se restringen para
que generalicen en vez de sobreajustar.Todos se ajustan con validación cruzada y se comparan primero con una pasada simple (sección “Modelos candidatos”) y luego con el bootstrap agrupado, que es el que finalmente determina el modelo recomendado por escenario.
En este estudio no se usan técnicas de aumento de datos sintéticas tipo SMOTE (pensadas para clasificación desbalanceada, no aplican a un target continuo con 34 muestras). En su lugar, el tamaño de muestra utilizable se maneja con tres estrategias complementarias:
M_expandida_evaluador no promedia los
puntajes de los catadores por muestra, sino que deja una fila por
evaluador (685 filas sobre las mismas 34 muestras químicas);
M_cata_individual agrega las 18 filas de la cata individual
JU a las 34 de la matriz pura. Ambos aportan más señal de entrenamiento,
pero se validan agrupando por unidad química (ver punto 2) para no
contar la misma muestra química varias veces como si fuera evidencia
independiente.Con este marco definido, las siguientes secciones muestran los resultados de cada etapa.
Antes de ajustar cualquier modelo se revisa una heurística de viabilidad — no un cálculo formal de un modelo específico, sino un chequeo rápido de EDA para small data: grados de libertad aproximados = filas modelables (con dato no vacío en el target) − predictores usables (predictores con al menos 3 valores, al menos 2 valores distintos y desviación estándar mayor que cero). Un valor negativo significa que hay más predictores que datos para estimarlos, y el ajuste no es confiable por más regularización que se use; valores por debajo de 15 quedan marcados como “alerta” y por debajo de 5 (u observaciones totales menores a 8) como “crítico”.
| escenario | target | n_filas_totales | n_filas_modelables | n_predictores_usables | grados_libertad_aprox | severidad_small_data | apto_modelamiento_supervisado |
|---|---|---|---|---|---|---|---|
| M_cata_individual | y_ahumado_comun | 52 | 48 | 31 | 17 | aceptable_para_small_data | TRUE |
| M_cata_individual | y_fenolico_comun | 52 | 52 | 31 | 21 | aceptable_para_small_data | TRUE |
| M_cata_individual | y_frutal_comun | 52 | 13 | 31 | -18 | critico_gl_insuficiente | TRUE |
| M_cata_individual | y_medicinal_comun | 52 | 48 | 31 | 17 | aceptable_para_small_data | TRUE |
| M_expandida_evaluador | y_ahumado_comun | 685 | 645 | 18 | 627 | aceptable_para_small_data | TRUE |
| M_expandida_evaluador | y_fenolico_comun | 685 | 685 | 18 | 667 | aceptable_para_small_data | TRUE |
| M_expandida_evaluador | y_frutal_comun | 685 | 118 | 18 | 100 | aceptable_para_small_data | TRUE |
| M_expandida_evaluador | y_medicinal_comun | 685 | 645 | 18 | 627 | aceptable_para_small_data | TRUE |
| M_ia_exploratoria | y_ahumado_comun | 42 | 42 | 5 | 37 | aceptable_para_small_data | TRUE |
| M_ia_exploratoria | y_fenolico_comun | 42 | 42 | 5 | 37 | aceptable_para_small_data | TRUE |
| M_ia_exploratoria | y_frutal_comun | 42 | 6 | 5 | 1 | critico_muy_pocos_datos | TRUE |
| M_ia_exploratoria | y_medicinal_comun | 42 | 39 | 5 | 34 | aceptable_para_small_data | TRUE |
| M_pura | y_ahumado_comun | 34 | 30 | 18 | 12 | alerta_gl_ajustado | TRUE |
| M_pura | y_fenolico_comun | 34 | 34 | 18 | 16 | aceptable_para_small_data | TRUE |
| M_pura | y_frutal_comun | 34 | 13 | 18 | -5 | critico_gl_insuficiente | TRUE |
| M_pura | y_medicinal_comun | 34 | 30 | 18 | 12 | alerta_gl_ajustado | TRUE |
| M_quimica | NA | 63 | NA | 10 | NA | sin_target | FALSE |
| M_sensorial | y_ahumado_comun | 37 | 27 | 0 | 27 | aceptable_para_small_data | FALSE |
| M_sensorial | y_fenolico_comun | 37 | 37 | 0 | 37 | aceptable_para_small_data | FALSE |
| M_sensorial | y_frutal_comun | 37 | 10 | 0 | 10 | alerta_gl_ajustado | FALSE |
| M_sensorial | y_medicinal_comun | 37 | 27 | 0 | 27 | aceptable_para_small_data | FALSE |
** 01_grados_libertad_por_escenario **
Para M_pura con y_fenolico_comun (target
principal) hay 34 filas modelables, 18 predictores usables y 16 grados
de libertad aproximados — viable. Para y_frutal_comun, en
cambio, solo 13 filas quedan modelables (baja cobertura), lo que con los
mismos 18 predictores da grados de libertad negativos (-5) y una marca
de critico_gl_insuficiente: por eso este target se reporta
siempre como secundario/exploratorio y nunca como evidencia central.
Dado que los predictores provienen de técnicas analíticas no solapadas (GC-MS, GC-FID, Folin, JU fermentativo), no se aplica un VIF global; se usa correlación pareada de Pearson como diagnóstico principal, complementado con VIF por bloque y VIF del modelo base reducido.
| escenario | predictor | n_filas | n_no_na | pct_no_na | n_distintos | desviacion_estandar | usable_correlacion | motivo |
|---|---|---|---|---|---|---|---|---|
| M_pura | x_gcfid_ethyl_octanoate_ppm | 34 | 26 | 76.47 | 17 | 27.481312 | TRUE | usable |
| M_pura | x_gcfid_isoamyl_acetate_ppm | 34 | 26 | 76.47 | 17 | 1.091867 | TRUE | usable |
| M_pura | x_gcfid_furfural_ppm | 34 | 24 | 70.59 | 15 | 0.497424 | TRUE | usable |
| M_pura | x_gcfid_o_cresol_ppm | 34 | 26 | 76.47 | 9 | 0.027408 | TRUE | usable |
| M_pura | x_gcfid_p_cresol_ppm | 34 | 26 | 76.47 | 17 | 0.078408 | TRUE | usable |
| M_pura | x_gcfid_4_ethyl_guaiacol_ppm | 34 | 26 | 76.47 | 9 | 0.007786 | TRUE | usable |
| M_pura | x_gcfid_creosol_ppm | 34 | 26 | 76.47 | 17 | 0.052505 | TRUE | usable |
| M_pura | x_gcfid_guaiacol_ppm | 34 | 26 | 76.47 | 6 | 0.124049 | TRUE | usable |
| M_pura | x_gcfid_ethyl_decanoate_ppm | 34 | 26 | 76.47 | 17 | 9.332234 | TRUE | usable |
| M_pura | x_gcfid_isoamyl_octanoate_ppm | 34 | 26 | 76.47 | 17 | 0.149908 | TRUE | usable |
| M_pura | x_gcfid_ethyl_dodecanoate_ppm | 34 | 26 | 76.47 | 17 | 64.814097 | TRUE | usable |
| M_pura | x_gcfid_ethyl_tetradecanoate_ppm | 34 | 26 | 76.47 | 17 | 1.240086 | TRUE | usable |
| M_pura | x_gcfid_ethyl_hexadecanoate_ppm | 34 | 26 | 76.47 | 17 | 13.955919 | TRUE | usable |
| M_pura | x_ju_final_co2_loss_g_l | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_maltose_consumption_g_l | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethanol_production_g_l | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ferulic_acid_conversion_index_faci_percent | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_o_cresol_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_p_cresol_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_isoamyl_acetate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethyl_decanoate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_isoamyl_octanoate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethyl_dodecanoate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethyl_myristate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethyl_hexadecanoate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_ju_ethyl_octanoate_ppm | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_folin_fenoles_totales_ug_ag_ml | 34 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_pura | x_gcms_esteres_pct | 34 | 8 | 23.53 | 8 | 8.627603 | TRUE | usable |
| M_pura | x_gcms_fenolicos_pct | 34 | 8 | 23.53 | 8 | 1.374087 | TRUE | usable |
| M_pura | x_gcms_aldehidos_pct | 34 | 8 | 23.53 | 8 | 0.540968 | TRUE | usable |
| M_pura | x_gcms_aroma_fermentativo_pct | 34 | 8 | 23.53 | 8 | 8.150737 | TRUE | usable |
| M_pura | x_gcms_area_valida_pct | 34 | 8 | 23.53 | 5 | 2.103868 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_ethyl_octanoate_ppm | 685 | 531 | 77.52 | 17 | 29.522705 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_isoamyl_acetate_ppm | 685 | 531 | 77.52 | 17 | 1.053544 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_furfural_ppm | 685 | 513 | 74.89 | 15 | 0.492380 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_o_cresol_ppm | 685 | 531 | 77.52 | 9 | 0.029977 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_p_cresol_ppm | 685 | 531 | 77.52 | 17 | 0.062108 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_4_ethyl_guaiacol_ppm | 685 | 531 | 77.52 | 9 | 0.008850 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_creosol_ppm | 685 | 531 | 77.52 | 17 | 0.052980 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_guaiacol_ppm | 685 | 531 | 77.52 | 6 | 0.141221 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_ethyl_decanoate_ppm | 685 | 531 | 77.52 | 17 | 8.338102 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_isoamyl_octanoate_ppm | 685 | 531 | 77.52 | 17 | 0.129285 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_ethyl_dodecanoate_ppm | 685 | 531 | 77.52 | 17 | 59.698436 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_ethyl_tetradecanoate_ppm | 685 | 531 | 77.52 | 17 | 1.092569 | TRUE | usable |
| M_expandida_evaluador | x_gcfid_ethyl_hexadecanoate_ppm | 685 | 531 | 77.52 | 17 | 13.822933 | TRUE | usable |
| M_expandida_evaluador | x_ju_final_co2_loss_g_l | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_maltose_consumption_g_l | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethanol_production_g_l | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ferulic_acid_conversion_index_faci_percent | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_o_cresol_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_p_cresol_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_isoamyl_acetate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethyl_decanoate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_isoamyl_octanoate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethyl_dodecanoate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethyl_myristate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethyl_hexadecanoate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_ju_ethyl_octanoate_ppm | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_folin_fenoles_totales_ug_ag_ml | 685 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_expandida_evaluador | x_gcms_esteres_pct | 685 | 154 | 22.48 | 8 | 7.189371 | TRUE | usable |
| M_expandida_evaluador | x_gcms_fenolicos_pct | 685 | 154 | 22.48 | 8 | 1.231849 | TRUE | usable |
| M_expandida_evaluador | x_gcms_aldehidos_pct | 685 | 154 | 22.48 | 8 | 0.475530 | TRUE | usable |
| M_expandida_evaluador | x_gcms_aroma_fermentativo_pct | 685 | 154 | 22.48 | 8 | 6.811220 | TRUE | usable |
| M_expandida_evaluador | x_gcms_area_valida_pct | 685 | 154 | 22.48 | 5 | 1.849278 | TRUE | usable |
| M_cata_individual | x_gcfid_ethyl_octanoate_ppm | 52 | 26 | 50.00 | 17 | 27.481312 | TRUE | usable |
| M_cata_individual | x_gcfid_isoamyl_acetate_ppm | 52 | 26 | 50.00 | 17 | 1.091867 | TRUE | usable |
| M_cata_individual | x_gcfid_furfural_ppm | 52 | 24 | 46.15 | 15 | 0.497424 | TRUE | usable |
| M_cata_individual | x_gcfid_o_cresol_ppm | 52 | 26 | 50.00 | 9 | 0.027408 | TRUE | usable |
| M_cata_individual | x_gcfid_p_cresol_ppm | 52 | 26 | 50.00 | 17 | 0.078408 | TRUE | usable |
| M_cata_individual | x_gcfid_4_ethyl_guaiacol_ppm | 52 | 26 | 50.00 | 9 | 0.007786 | TRUE | usable |
| M_cata_individual | x_gcfid_creosol_ppm | 52 | 26 | 50.00 | 17 | 0.052505 | TRUE | usable |
| M_cata_individual | x_gcfid_guaiacol_ppm | 52 | 26 | 50.00 | 6 | 0.124049 | TRUE | usable |
| M_cata_individual | x_gcfid_ethyl_decanoate_ppm | 52 | 26 | 50.00 | 17 | 9.332234 | TRUE | usable |
| M_cata_individual | x_gcfid_isoamyl_octanoate_ppm | 52 | 26 | 50.00 | 17 | 0.149908 | TRUE | usable |
| M_cata_individual | x_gcfid_ethyl_dodecanoate_ppm | 52 | 26 | 50.00 | 17 | 64.814097 | TRUE | usable |
| M_cata_individual | x_gcfid_ethyl_tetradecanoate_ppm | 52 | 26 | 50.00 | 17 | 1.240086 | TRUE | usable |
| M_cata_individual | x_gcfid_ethyl_hexadecanoate_ppm | 52 | 26 | 50.00 | 17 | 13.955919 | TRUE | usable |
| M_cata_individual | x_ju_final_co2_loss_g_l | 52 | 18 | 34.62 | 16 | 20.337762 | TRUE | usable |
| M_cata_individual | x_ju_maltose_consumption_g_l | 52 | 18 | 34.62 | 13 | 47.225011 | TRUE | usable |
| M_cata_individual | x_ju_ethanol_production_g_l | 52 | 18 | 34.62 | 18 | 1.842068 | TRUE | usable |
| M_cata_individual | x_ju_ferulic_acid_conversion_index_faci_percent | 52 | 18 | 34.62 | 18 | 2.930341 | TRUE | usable |
| M_cata_individual | x_ju_o_cresol_ppm | 52 | 5 | 9.62 | 5 | 0.469529 | TRUE | usable |
| M_cata_individual | x_ju_p_cresol_ppm | 52 | 5 | 9.62 | 5 | 0.041766 | TRUE | usable |
| M_cata_individual | x_ju_isoamyl_acetate_ppm | 52 | 5 | 9.62 | 5 | 0.140171 | TRUE | usable |
| M_cata_individual | x_ju_ethyl_decanoate_ppm | 52 | 5 | 9.62 | 5 | 0.211274 | TRUE | usable |
| M_cata_individual | x_ju_isoamyl_octanoate_ppm | 52 | 5 | 9.62 | 5 | 0.018618 | TRUE | usable |
| M_cata_individual | x_ju_ethyl_dodecanoate_ppm | 52 | 5 | 9.62 | 5 | 0.100646 | TRUE | usable |
| M_cata_individual | x_ju_ethyl_myristate_ppm | 52 | 5 | 9.62 | 5 | 0.011093 | TRUE | usable |
| M_cata_individual | x_ju_ethyl_hexadecanoate_ppm | 52 | 5 | 9.62 | 5 | 0.077457 | TRUE | usable |
| M_cata_individual | x_ju_ethyl_octanoate_ppm | 52 | 5 | 9.62 | 5 | 36.032610 | TRUE | usable |
| M_cata_individual | x_folin_fenoles_totales_ug_ag_ml | 52 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_cata_individual | x_gcms_esteres_pct | 52 | 8 | 15.38 | 8 | 8.627603 | TRUE | usable |
| M_cata_individual | x_gcms_fenolicos_pct | 52 | 8 | 15.38 | 8 | 1.374087 | TRUE | usable |
| M_cata_individual | x_gcms_aldehidos_pct | 52 | 8 | 15.38 | 8 | 0.540968 | TRUE | usable |
| M_cata_individual | x_gcms_aroma_fermentativo_pct | 52 | 8 | 15.38 | 8 | 8.150737 | TRUE | usable |
| M_cata_individual | x_gcms_area_valida_pct | 52 | 8 | 15.38 | 5 | 2.103868 | TRUE | usable |
| M_ia_exploratoria | x_gcfid_ethyl_octanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_isoamyl_acetate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_furfural_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_o_cresol_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_p_cresol_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_4_ethyl_guaiacol_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_creosol_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_guaiacol_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_ethyl_decanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_isoamyl_octanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_ethyl_dodecanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_ethyl_tetradecanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcfid_ethyl_hexadecanoate_ppm | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_ju_final_co2_loss_g_l | 42 | 18 | 42.86 | 18 | 20.465654 | TRUE | usable |
| M_ia_exploratoria | x_ju_maltose_consumption_g_l | 42 | 18 | 42.86 | 10 | 48.274170 | TRUE | usable |
| M_ia_exploratoria | x_ju_ethanol_production_g_l | 42 | 18 | 42.86 | 17 | 2.303190 | TRUE | usable |
| M_ia_exploratoria | x_ju_ferulic_acid_conversion_index_faci_percent | 42 | 18 | 42.86 | 18 | 4.415490 | TRUE | usable |
| M_ia_exploratoria | x_ju_o_cresol_ppm | 42 | 2 | 4.76 | 2 | 0.155331 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_p_cresol_ppm | 42 | 2 | 4.76 | 2 | 0.002899 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_isoamyl_acetate_ppm | 42 | 2 | 4.76 | 2 | 0.157284 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_ethyl_decanoate_ppm | 42 | 2 | 4.76 | 2 | 0.718026 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_isoamyl_octanoate_ppm | 42 | 2 | 4.76 | 2 | 0.054317 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_ethyl_dodecanoate_ppm | 42 | 2 | 4.76 | 2 | 7.328001 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_ethyl_myristate_ppm | 42 | 2 | 4.76 | 2 | 0.210325 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_ethyl_hexadecanoate_ppm | 42 | 2 | 4.76 | 2 | 9.822821 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_ju_ethyl_octanoate_ppm | 42 | 2 | 4.76 | 2 | 23.403703 | FALSE | menos_de_3_valores |
| M_ia_exploratoria | x_folin_fenoles_totales_ug_ag_ml | 42 | 24 | 57.14 | 21 | 45.804797 | TRUE | usable |
| M_ia_exploratoria | x_gcms_esteres_pct | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcms_fenolicos_pct | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcms_aldehidos_pct | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcms_aroma_fermentativo_pct | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_ia_exploratoria | x_gcms_area_valida_pct | 42 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_ethyl_octanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_isoamyl_acetate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_furfural_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_o_cresol_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_p_cresol_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_4_ethyl_guaiacol_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_creosol_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_guaiacol_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_ethyl_decanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_isoamyl_octanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_ethyl_dodecanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_ethyl_tetradecanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_gcfid_ethyl_hexadecanoate_ppm | 63 | 0 | 0.00 | 0 | NA | FALSE | sin_datos |
| M_quimica | x_ju_final_co2_loss_g_l | 63 | 21 | 33.33 | 21 | 19.991714 | TRUE | usable |
| M_quimica | x_ju_maltose_consumption_g_l | 63 | 21 | 33.33 | 13 | 48.323460 | TRUE | usable |
| M_quimica | x_ju_ethanol_production_g_l | 63 | 21 | 33.33 | 19 | 2.265067 | TRUE | usable |
| M_quimica | x_ju_ferulic_acid_conversion_index_faci_percent | 63 | 21 | 33.33 | 21 | 4.222090 | TRUE | usable |
| M_quimica | x_ju_o_cresol_ppm | 63 | 2 | 3.17 | 2 | 0.155331 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_p_cresol_ppm | 63 | 2 | 3.17 | 2 | 0.002899 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_isoamyl_acetate_ppm | 63 | 2 | 3.17 | 2 | 0.157284 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_ethyl_decanoate_ppm | 63 | 2 | 3.17 | 2 | 0.718026 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_isoamyl_octanoate_ppm | 63 | 2 | 3.17 | 2 | 0.054317 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_ethyl_dodecanoate_ppm | 63 | 2 | 3.17 | 2 | 7.328001 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_ethyl_myristate_ppm | 63 | 2 | 3.17 | 2 | 0.210325 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_ethyl_hexadecanoate_ppm | 63 | 2 | 3.17 | 2 | 9.822821 | FALSE | menos_de_3_valores |
| M_quimica | x_ju_ethyl_octanoate_ppm | 63 | 2 | 3.17 | 2 | 23.403703 | FALSE | menos_de_3_valores |
| M_quimica | x_folin_fenoles_totales_ug_ag_ml | 63 | 24 | 38.10 | 21 | 45.804797 | TRUE | usable |
| M_quimica | x_gcms_esteres_pct | 63 | 18 | 28.57 | 18 | 11.042743 | TRUE | usable |
| M_quimica | x_gcms_fenolicos_pct | 63 | 18 | 28.57 | 18 | 1.625560 | TRUE | usable |
| M_quimica | x_gcms_aldehidos_pct | 63 | 18 | 28.57 | 18 | 0.665586 | TRUE | usable |
| M_quimica | x_gcms_aroma_fermentativo_pct | 63 | 18 | 28.57 | 18 | 11.063739 | TRUE | usable |
| M_quimica | x_gcms_area_valida_pct | 63 | 18 | 28.57 | 18 | 2.179952 | TRUE | usable |
De las 32 variables químicas, en M_pura quedan
18 usables para correlación; las otras 14 quedan fuera
por sin_datos (todo el bloque JU salvo unos pocos
compuestos, porque casi no se solapa con unidades que tienen cata real)
o por menos_de_3_valores (muy pocos casos con dato para
estimar una correlación mínimamente confiable).
| escenario | predictor_1 | predictor_2 | r_pearson | abs_r | n_comunes | nivel_colinealidad | recomendacion |
|---|---|---|---|---|---|---|---|
| M_cata_individual | x_gcms_esteres_pct | x_gcms_aroma_fermentativo_pct | 0.999536 | 0.999536 | 8 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_final_co2_loss_g_l | x_ju_maltose_consumption_g_l | 0.981612 | 0.981612 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_maltose_consumption_g_l | x_ju_ethanol_production_g_l | 0.979573 | 0.979573 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_ferulic_acid_conversion_index_faci_percent | x_ju_p_cresol_ppm | -0.976759 | 0.976759 | 5 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_isoamyl_acetate_ppm | x_ju_ethyl_myristate_ppm | -0.969596 | 0.969596 | 5 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_ethanol_production_g_l | x_ju_o_cresol_ppm | -0.967134 | 0.967134 | 5 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_final_co2_loss_g_l | x_ju_ethanol_production_g_l | 0.966965 | 0.966965 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_gcms_fenolicos_pct | x_gcms_aldehidos_pct | 0.962871 | 0.962871 | 8 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_final_co2_loss_g_l | x_ju_ethyl_hexadecanoate_ppm | 0.954601 | 0.954601 | 5 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_cata_individual | x_ju_maltose_consumption_g_l | x_ju_o_cresol_ppm | -0.945054 | 0.945054 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_maltose_consumption_g_l | x_ju_ethyl_hexadecanoate_ppm | 0.935886 | 0.935886 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_final_co2_loss_g_l | x_ju_o_cresol_ppm | -0.929634 | 0.929634 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_maltose_consumption_g_l | x_ju_ethyl_octanoate_ppm | 0.921003 | 0.921003 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcfid_4_ethyl_guaiacol_ppm | x_gcfid_guaiacol_ppm | 0.913114 | 0.913114 | 26 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcms_aroma_fermentativo_pct | x_gcms_area_valida_pct | 0.912165 | 0.912165 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_ethanol_production_g_l | x_ju_ethyl_hexadecanoate_ppm | 0.911190 | 0.911190 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcms_esteres_pct | x_gcms_area_valida_pct | 0.905297 | 0.905297 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_ethyl_decanoate_ppm | x_ju_ethyl_octanoate_ppm | 0.904462 | 0.904462 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_p_cresol_ppm | x_ju_ethyl_dodecanoate_ppm | -0.901211 | 0.901211 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_ethanol_production_g_l | x_ju_ethyl_octanoate_ppm | 0.900524 | 0.900524 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcms_esteres_pct | x_gcms_aldehidos_pct | -0.888494 | 0.888494 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_ethyl_hexadecanoate_ppm | x_ju_ethyl_octanoate_ppm | 0.888461 | 0.888461 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcms_aldehidos_pct | x_gcms_aroma_fermentativo_pct | -0.874105 | 0.874105 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_o_cresol_ppm | x_ju_ethyl_hexadecanoate_ppm | -0.873413 | 0.873413 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcms_esteres_pct | x_gcms_fenolicos_pct | -0.860194 | 0.860194 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_gcfid_ethyl_decanoate_ppm | x_gcfid_isoamyl_octanoate_ppm | 0.858392 | 0.858392 | 26 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_cata_individual | x_ju_final_co2_loss_g_l | x_ju_ethyl_octanoate_ppm | 0.856406 | 0.856406 | 5 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_expandida_evaluador | x_gcms_esteres_pct | x_gcms_aroma_fermentativo_pct | 0.999151 | 0.999151 | 154 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_expandida_evaluador | x_gcfid_4_ethyl_guaiacol_ppm | x_gcfid_guaiacol_ppm | 0.950986 | 0.950986 | 531 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_expandida_evaluador | x_gcms_fenolicos_pct | x_gcms_aldehidos_pct | 0.943722 | 0.943722 | 154 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_expandida_evaluador | x_gcms_aroma_fermentativo_pct | x_gcms_area_valida_pct | 0.862421 | 0.862421 | 154 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_expandida_evaluador | x_gcfid_ethyl_octanoate_ppm | x_gcfid_o_cresol_ppm | 0.850107 | 0.850107 | 531 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_ia_exploratoria | x_ju_final_co2_loss_g_l | x_ju_ethanol_production_g_l | 0.963759 | 0.963759 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_ia_exploratoria | x_ju_final_co2_loss_g_l | x_ju_maltose_consumption_g_l | 0.953390 | 0.953390 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_ia_exploratoria | x_ju_maltose_consumption_g_l | x_ju_ethanol_production_g_l | 0.892926 | 0.892926 | 18 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_esteres_pct | x_gcms_aroma_fermentativo_pct | 0.999536 | 0.999536 | 8 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_pura | x_gcms_fenolicos_pct | x_gcms_aldehidos_pct | 0.962871 | 0.962871 | 8 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_pura | x_gcfid_4_ethyl_guaiacol_ppm | x_gcfid_guaiacol_ppm | 0.913114 | 0.913114 | 26 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_aroma_fermentativo_pct | x_gcms_area_valida_pct | 0.912165 | 0.912165 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_esteres_pct | x_gcms_area_valida_pct | 0.905297 | 0.905297 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_esteres_pct | x_gcms_aldehidos_pct | -0.888494 | 0.888494 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_aldehidos_pct | x_gcms_aroma_fermentativo_pct | -0.874105 | 0.874105 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcms_esteres_pct | x_gcms_fenolicos_pct | -0.860194 | 0.860194 | 8 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_pura | x_gcfid_ethyl_decanoate_ppm | x_gcfid_isoamyl_octanoate_ppm | 0.858392 | 0.858392 | 26 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
| M_quimica | x_gcms_esteres_pct | x_gcms_aroma_fermentativo_pct | 0.998189 | 0.998189 | 18 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_quimica | x_ju_final_co2_loss_g_l | x_ju_ethanol_production_g_l | 0.967588 | 0.967588 | 21 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_quimica | x_ju_final_co2_loss_g_l | x_ju_maltose_consumption_g_l | 0.957056 | 0.957056 | 21 | muy_alta | colinealidad_muy_alta; evitar_modelos_lineales_sin_regularizacion |
| M_quimica | x_ju_maltose_consumption_g_l | x_ju_ethanol_production_g_l | 0.906505 | 0.906505 | 21 | alta | colinealidad_alta; preferir_ridge_lasso_elastic_net_o_pls |
En M_pura hay 9 pares con correlación
alta (|r| ≥ 0.85), de los cuales 2 son muy
altas (r ≈ 0.96–1.00): los pares de variables agregadas de
GC-MS que se construyen unas a partir de otras
(x_gcms_esteres_pct con
x_gcms_aroma_fermentativo_pct, y
x_gcms_fenolicos_pct con
x_gcms_aldehidos_pct), además de pares esperables entre
compuestos químicamente emparentados (guaiacol y 4-etil-guaiacol;
distintos ésteres de cadena larga). Esta es la razón concreta por la que
se prefieren modelos regularizados o PLS en vez de una regresión lineal
múltiple simple.
Cada mapa muestra la correlación de Pearson entre los predictores químicos más involucrados en colinealidad (o, si no hay pares con |r| ≥ 0.85, los de mayor variabilidad), agrupados por bloque analítico — GC-FID, GC-MS, JU y Folin no comparten unidades entre sí, así que sus pares cruzados no tienen correlación calculable y se dejan en blanco en vez de rellenarse con gris.
Escenario M_pura
En el escenario principal, la colinealidad relevante se concentra en
dos bloques. En GC-FID, los fenoles volátiles guaiacol y 4-etil-guaiacol
correlacionan fuerte (r = 0.91) — moléculas químicamente emparentadas
que suelen producirse juntas durante el tostado/ahumado — y por otro
lado los ésteres ethyl decanoate e isoamyl octanoate (r = 0.86). En
GC-MS, varias variables agregadas están construidas unas a partir de
otras: ésteres y aroma fermentativo son casi la misma variable (r =
1.00, porque el aroma fermentativo incluye a los ésteres en su cálculo),
y fenólicos correlaciona muy fuerte con aldehídos (r = 0.96). El bloque
JU no aparece en este escenario porque, al excluir la cata individual,
casi no tiene solapamiento suficiente con las 34 unidades de
M_pura.
Escenario M_cata_individual
Al agregar la cata individual JU (52 filas), el bloque JU sí alcanza
el umbral y aparece con 12 variables — es, por lejos, el bloque más
internamente colineal: casi todas las variables fermentativas
(producción de etanol, pérdida de CO₂, consumo de maltosa, varios
ésteres de cadena larga) se mueven juntas con r > 0.85, coherente con
que todas reflejan el mismo proceso de fermentación medido de distintas
formas. o-cresol y p-cresol, en cambio, correlacionan negativamente con
ese grupo (hasta r = -0.97), y p-cresol en particular con el índice FACI
(r = -0.98) — señal de que estos dos compuestos siguen una dinámica
distinta al resto de las variables JU. Los bloques GC-FID y GC-MS
mantienen el mismo patrón que en M_pura, porque siguen
siendo las mismas 34 muestras químicas de base.
Escenario M_expandida_evaluador
Como esta matriz repite las mismas 34 muestras químicas una vez por
evaluador (685 filas), el patrón de colinealidad es esencialmente el
mismo que en M_pura — se repiten los mismos dos bloques con
valores muy similares (guaiacol y 4-etil-guaiacol suben incluso a r =
0.95). Esto confirma que la colinealidad es una propiedad de la química
de las muestras, no del número de evaluadores que las calificaron.
Escenario M_ia_exploratoria
En el escenario sintético de IA, solo el bloque JU alcanza el umbral de colinealidad alta, con tres variables fermentativas correlacionadas entre sí (r = 0.89–0.96). Los bloques GC-FID y GC-MS no aparecen porque este escenario tiene menor cobertura química real detrás de las muestras sintéticas, así que ningún par de esas variables llega al mínimo de pares con datos en común necesario para calcular una correlación confiable.
Escenario M_quimica
Esta matriz no tiene target sensorial (es solo diagnóstico de la
parte química), y su heatmap muestra el caso más extremo de colinealidad
interna: aroma fermentativo y ésteres de GC-MS quedan perfectamente
correlacionados (r = 1.00, por construcción), y las tres variables
fermentativas de JU repiten el mismo patrón visto en
M_ia_exploratoria (r = 0.91–0.97). El bloque GC-FID no
alcanza aquí el umbral porque, al no cruzarse con cata real, cambia qué
unidades quedan con datos completos.
En conjunto, los cinco mapas muestran que la colinealidad es una
propiedad de la química de base (se repite en M_pura,
M_cata_individual y M_expandida_evaluador
porque comparten las mismas 34 muestras), y que los bloques con menos
cobertura real (M_ia_exploratoria, M_quimica)
simplemente no alcanzan el mínimo de datos para mostrar todos los
bloques a la vez.
| escenario | target | modelo | n_observaciones | n_grupos_validacion | mae | rmse | r2 | spearman | bias | mae_media | rmse_media | mejora_mae_vs_media | mejora_rmse_vs_media | lectura |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | lineal_reducido | 52 | 52 | 0.744320 | 0.938074 | 0.198458 | -0.142312 | -0.188095 | 0.886523 | 1.068334 | 0.142203 | 0.130260 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_cata_individual | y_fenolico_comun | media_entrenamiento | 52 | 52 | 0.886523 | 1.068334 | -0.039600 | -1.000000 | 0.000000 | 0.886523 | 1.068334 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_cata_individual | y_frutal_comun | lineal_reducido | 13 | 13 | 0.134360 | 0.191363 | 0.532466 | 0.419053 | 0.000255 | 0.247436 | 0.303189 | 0.113076 | 0.111826 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_cata_individual | y_frutal_comun | media_entrenamiento | 13 | 13 | 0.247436 | 0.303189 | -0.173611 | -1.000000 | 0.000000 | 0.247436 | 0.303189 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_expandida_evaluador | y_fenolico_comun | lineal_reducido | 685 | 34 | 0.746432 | 0.924694 | 0.127927 | 0.056495 | 0.000212 | 0.815225 | 1.004024 | 0.068793 | 0.079330 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_expandida_evaluador | y_fenolico_comun | media_entrenamiento | 685 | 34 | 0.815225 | 1.004024 | -0.028123 | -0.501933 | -0.001746 | 0.815225 | 1.004024 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_expandida_evaluador | y_frutal_comun | lineal_reducido | 118 | 13 | 0.501435 | 0.693917 | 0.074575 | 0.186111 | 0.001152 | 0.564719 | 0.731167 | 0.063284 | 0.037250 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_expandida_evaluador | y_frutal_comun | media_entrenamiento | 118 | 13 | 0.564719 | 0.731167 | -0.027447 | -0.407763 | -0.000175 | 0.564719 | 0.731167 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_ia_exploratoria | y_fenolico_comun | lineal_reducido | 42 | 42 | 0.525950 | 0.658558 | 0.527750 | 0.709080 | -0.163908 | 0.815331 | 0.981688 | 0.289381 | 0.323130 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_ia_exploratoria | y_fenolico_comun | media_entrenamiento | 42 | 42 | 0.815331 | 0.981688 | -0.049375 | -1.000000 | 0.000000 | 0.815331 | 0.981688 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_pura | y_fenolico_comun | lineal_reducido | 34 | 34 | 0.269623 | 0.371464 | 0.433845 | -0.072929 | 0.001723 | 0.412330 | 0.508644 | 0.142707 | 0.137180 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_pura | y_fenolico_comun | media_entrenamiento | 34 | 34 | 0.412330 | 0.508644 | -0.061524 | -1.000000 | 0.000000 | 0.412330 | 0.508644 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
| M_pura | y_frutal_comun | lineal_reducido | 13 | 13 | 0.134360 | 0.191363 | 0.532466 | 0.419053 | 0.000255 | 0.247436 | 0.303189 | 0.113076 | 0.111826 | mejora_frente_a_media; interpretar_con_cautela_por_small_data_y_colinealidad |
| M_pura | y_frutal_comun | media_entrenamiento | 13 | 13 | 0.247436 | 0.303189 | -0.173611 | -1.000000 | 0.000000 | 0.247436 | 0.303189 | 0.000000 | 0.000000 | linea_base_minima; cualquier_modelo_debe_superar_este_error |
Para M_pura con y_fenolico_comun, la
regresión lineal reducida logra MAE = 0.270 frente a MAE = 0.412 de la
media de entrenamiento — una mejora de ~35% solo con hasta 3 predictores
simples. Esto confirma que sí hay señal química aprovechable antes de
pasar a los modelos más complejos, y fija la vara mínima que estos deben
superar.
** 01_modelo_base_mae_por_escenario **
| escenario | target | modelo | n_observaciones | n_grupos_validacion | mae | rmse | r2 | spearman | bias | mae_lineal_reducido | mae_media_entrenamiento | rmse_lineal_reducido | rmse_media_entrenamiento | mejora_mae_vs_media | mejora_mae_vs_lineal | lectura_comparativa |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | random_forest_restringido | 52 | 52 | 0.276203 | 0.398734 | 0.855183 | 0.739469 | 0.004268 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.610320 | 0.468117 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_fenolico_comun | elastic_net | 52 | 52 | 0.483807 | 0.610653 | 0.660343 | 0.864929 | -0.280378 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.402716 | 0.260513 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_fenolico_comun | lasso | 52 | 52 | 0.505090 | 0.644056 | 0.622168 | 0.769688 | -0.259442 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.381433 | 0.239230 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_fenolico_comun | pls | 52 | 52 | 0.520827 | 0.606727 | 0.664696 | 0.812513 | -0.301096 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.365696 | 0.223493 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_fenolico_comun | ridge | 52 | 52 | 0.542675 | 0.669371 | 0.591882 | 0.792194 | -0.244554 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.343848 | 0.201645 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_fenolico_comun | gradient_boosting_restringido | 52 | 52 | 0.877926 | 1.058364 | -0.020287 | -0.418166 | -0.008730 | 0.744320 | 0.886523 | 0.938074 | 1.068334 | 0.008597 | -0.133606 | mejora_solo_frente_a_media |
| M_cata_individual | y_frutal_comun | lasso | 13 | 13 | 0.132666 | 0.187462 | 0.551334 | 0.452578 | 0.003333 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.114770 | 0.001694 | mejora_frente_a_lineal_reducido |
| M_cata_individual | y_frutal_comun | gradient_boosting_restringido | 13 | 13 | 0.137946 | 0.198937 | 0.494724 | 0.324068 | 0.003313 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.109490 | -0.003586 | mejora_solo_frente_a_media |
| M_cata_individual | y_frutal_comun | ridge | 13 | 13 | 0.138785 | 0.207079 | 0.452520 | 0.463752 | 0.002616 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.108651 | -0.004425 | mejora_solo_frente_a_media |
| M_cata_individual | y_frutal_comun | random_forest_restringido | 13 | 13 | 0.140364 | 0.200029 | 0.489161 | 0.508451 | 0.026974 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.107072 | -0.006004 | mejora_solo_frente_a_media |
| M_cata_individual | y_frutal_comun | elastic_net | 13 | 13 | 0.144068 | 0.203553 | 0.471004 | 0.446990 | -0.011340 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.103368 | -0.009708 | mejora_solo_frente_a_media |
| M_cata_individual | y_frutal_comun | pls | 13 | 13 | 0.164642 | 0.245968 | 0.227580 | 0.363180 | 0.030429 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.082794 | -0.030282 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_fenolico_comun | ridge | 685 | 34 | 0.706366 | 0.863672 | 0.239229 | 0.442112 | 0.005394 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.108859 | 0.040066 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_fenolico_comun | pls | 685 | 34 | 0.709584 | 0.870196 | 0.227692 | 0.441950 | -0.014755 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.105641 | 0.036848 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_fenolico_comun | elastic_net | 685 | 34 | 0.714524 | 0.874032 | 0.220867 | 0.439031 | 0.012271 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.100701 | 0.031908 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_fenolico_comun | lasso | 685 | 34 | 0.716990 | 0.876550 | 0.216372 | 0.436350 | 0.011745 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.098235 | 0.029442 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_fenolico_comun | random_forest_restringido | 685 | 34 | 0.743622 | 0.911875 | 0.151938 | 0.362854 | 0.024518 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.071603 | 0.002810 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_fenolico_comun | gradient_boosting_restringido | 685 | 34 | 0.761240 | 0.926267 | 0.124958 | 0.336161 | 0.019191 | 0.746432 | 0.815225 | 0.924694 | 1.004024 | 0.053985 | -0.014808 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_frutal_comun | gradient_boosting_restringido | 118 | 13 | 0.497318 | 0.699722 | 0.059027 | 0.151596 | 0.011507 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.067401 | 0.004117 | mejora_frente_a_lineal_reducido |
| M_expandida_evaluador | y_frutal_comun | random_forest_restringido | 118 | 13 | 0.511341 | 0.701701 | 0.053698 | 0.186611 | -0.020542 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.053378 | -0.009906 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_frutal_comun | pls | 118 | 13 | 0.526625 | 0.722933 | -0.004435 | 0.138915 | -0.000076 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.038094 | -0.025190 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_frutal_comun | ridge | 118 | 13 | 0.536263 | 0.721964 | -0.001745 | 0.134392 | -0.022133 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.028456 | -0.034828 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_frutal_comun | elastic_net | 118 | 13 | 0.537123 | 0.718529 | 0.007765 | 0.115607 | -0.058750 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.027596 | -0.035688 | mejora_solo_frente_a_media |
| M_expandida_evaluador | y_frutal_comun | lasso | 118 | 13 | 0.544930 | 0.725515 | -0.011623 | 0.036004 | -0.052270 | 0.501435 | 0.564719 | 0.693917 | 0.731167 | 0.019789 | -0.043495 | mejora_solo_frente_a_media |
| M_ia_exploratoria | y_fenolico_comun | random_forest_restringido | 42 | 42 | 0.403955 | 0.483072 | 0.745898 | 0.839285 | -0.000404 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.411376 | 0.121995 | mejora_frente_a_lineal_reducido |
| M_ia_exploratoria | y_fenolico_comun | ridge | 42 | 42 | 0.535328 | 0.605178 | 0.601205 | 0.786756 | -0.251386 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.280003 | -0.009378 | mejora_solo_frente_a_media |
| M_ia_exploratoria | y_fenolico_comun | elastic_net | 42 | 42 | 0.536102 | 0.617044 | 0.585413 | 0.778809 | -0.242823 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.279229 | -0.010152 | mejora_solo_frente_a_media |
| M_ia_exploratoria | y_fenolico_comun | lasso | 42 | 42 | 0.545120 | 0.625006 | 0.574644 | 0.789576 | -0.248546 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.270211 | -0.019170 | mejora_solo_frente_a_media |
| M_ia_exploratoria | y_fenolico_comun | pls | 42 | 42 | 0.550299 | 0.641611 | 0.551743 | 0.810085 | -0.268979 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.265032 | -0.024349 | mejora_solo_frente_a_media |
| M_ia_exploratoria | y_fenolico_comun | gradient_boosting_restringido | 42 | 42 | 0.631330 | 0.715780 | 0.442118 | 0.537578 | -0.053651 | 0.525950 | 0.815331 | 0.658558 | 0.981688 | 0.184001 | -0.105380 | mejora_solo_frente_a_media |
| M_pura | y_fenolico_comun | elastic_net | 34 | 34 | 0.229887 | 0.304161 | 0.620416 | 0.665958 | 0.018849 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.182443 | 0.039736 | mejora_frente_a_lineal_reducido |
| M_pura | y_fenolico_comun | random_forest_restringido | 34 | 34 | 0.247837 | 0.321493 | 0.575923 | 0.548951 | -0.020412 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.164493 | 0.021786 | mejora_frente_a_lineal_reducido |
| M_pura | y_fenolico_comun | ridge | 34 | 34 | 0.253465 | 0.329055 | 0.555740 | 0.607608 | 0.019010 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.158865 | 0.016158 | mejora_frente_a_lineal_reducido |
| M_pura | y_fenolico_comun | pls | 34 | 34 | 0.284096 | 0.357416 | 0.475857 | 0.483077 | 0.056336 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.128234 | -0.014473 | mejora_solo_frente_a_media |
| M_pura | y_fenolico_comun | lasso | 34 | 34 | 0.300059 | 0.533805 | -0.169139 | 0.631255 | 0.074862 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.112271 | -0.030436 | mejora_solo_frente_a_media |
| M_pura | y_fenolico_comun | gradient_boosting_restringido | 34 | 34 | 0.328218 | 0.420700 | 0.273816 | 0.500275 | 0.008678 | 0.269623 | 0.412330 | 0.371464 | 0.508644 | 0.084112 | -0.058595 | mejora_solo_frente_a_media |
| M_pura | y_frutal_comun | elastic_net | 13 | 13 | 0.125110 | 0.194039 | 0.519299 | 0.363180 | -0.021830 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.122326 | 0.009250 | mejora_frente_a_lineal_reducido |
| M_pura | y_frutal_comun | ridge | 13 | 13 | 0.126793 | 0.188464 | 0.546525 | 0.486102 | -0.005554 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.120643 | 0.007567 | mejora_frente_a_lineal_reducido |
| M_pura | y_frutal_comun | lasso | 13 | 13 | 0.132623 | 0.190960 | 0.534435 | 0.441403 | 0.000438 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.114813 | 0.001737 | mejora_frente_a_lineal_reducido |
| M_pura | y_frutal_comun | random_forest_restringido | 13 | 13 | 0.140364 | 0.200029 | 0.489161 | 0.508451 | 0.026974 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.107072 | -0.006004 | mejora_solo_frente_a_media |
| M_pura | y_frutal_comun | gradient_boosting_restringido | 13 | 13 | 0.143959 | 0.202584 | 0.476030 | 0.279369 | -0.002999 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.103477 | -0.009599 | mejora_solo_frente_a_media |
| M_pura | y_frutal_comun | pls | 13 | 13 | 0.164642 | 0.245968 | 0.227580 | 0.363180 | 0.030429 | 0.134360 | 0.247436 | 0.191363 | 0.303189 | 0.082794 | -0.030282 | mejora_solo_frente_a_media |
Esta tabla compara los 6 modelos candidatos con una sola pasada de
validación cruzada por escenario/target — útil para ver el orden de
magnitud y detectar modelos que ni siquiera superan la media de
entrenamiento (columna lectura_comparativa), pero todavía
sensible a cómo caen las particiones. La comparación que realmente
define el modelo recomendado es la del bootstrap agrupado (100
iteraciones), en la siguiente sección.
** 01_modelos_small_data_mae_y_fenolico **
** 02_importancia_variables_y_fenolico_M_pura **
Validación con 100 iteraciones de bootstrap, agrupando por unidad
analítica para evitar fuga de información entre entrenamiento y prueba
cuando una misma muestra química aparece en más de una fila (por
ejemplo, distintos evaluadores en M_expandida_evaluador).
En cada iteración se remuestrea con reemplazo a nivel de unidad química
completa, se ajustan los 6 modelos candidatos y se promedian sus
métricas — así el resultado deja de depender de una sola partición
afortunada o desafortunada.
Manejo de datos faltantes: cada predictor con valores faltantes se imputa por su mediana, calculada únicamente con las filas del pliegue de entrenamiento de esa iteración de bootstrap, y esa misma mediana (no una nueva, calculada con datos de prueba) se aplica tanto al pliegue de entrenamiento como al de prueba. Esto evita fuga de información: en ningún caso la imputación de una fila de prueba usa información de esa misma fila u otras filas de prueba. La misma lógica se aplica de forma idéntica en los modelos base y en los modelos candidatos.
| escenario | target | modelo | n_bootstrap_exitosos | n_fallback_holdout | pct_fallback_holdout | n_train_promedio | n_test_promedio | mae_media | mae_sd | mae_p05 | mae_p50 | mae_p95 | rmse_media | rmse_sd | rmse_p05 | rmse_p50 | rmse_p95 | r2_media | r2_p50 | spearman_media | spearman_p50 | bias_media | mae_ic90_ancho | estabilidad_error | ranking_mae |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | random_forest_restringido | 100 | 0 | 0 | 52.00 | 18.68 | 0.3303534 | 0.1066919 | 0.1905647 | 0.3166207 | 0.5313743 | 0.4761227 | 0.1495136 | 0.2685408 | 0.4550537 | 0.7425903 | 0.7578598 | 0.7958520 | 0.8178249 | 0.8232379 | -0.0252994 | 0.3408096 | media | 1 |
| M_cata_individual | y_fenolico_comun | gradient_boosting_restringido | 100 | 0 | 0 | 52.00 | 18.68 | 0.4644421 | 0.1836418 | 0.2683643 | 0.4110624 | 0.8685726 | 0.6228602 | 0.2171110 | 0.3585354 | 0.5855679 | 1.0613550 | 0.5918397 | 0.6789599 | 0.7402682 | 0.7576954 | 0.0399965 | 0.6002082 | baja | 2 |
| M_cata_individual | y_fenolico_comun | lasso | 100 | 0 | 0 | 52.00 | 18.68 | 0.5757854 | 0.1980624 | 0.3046880 | 0.5618040 | 0.8906605 | 0.7779525 | 0.2680468 | 0.4502449 | 0.7295583 | 1.2484855 | 0.3303504 | 0.4521690 | 0.6405121 | 0.7042166 | -0.0731095 | 0.5859725 | baja | 3 |
| M_cata_individual | y_fenolico_comun | elastic_net | 100 | 0 | 0 | 52.00 | 18.68 | 0.5805036 | 0.1970341 | 0.2750758 | 0.5643725 | 0.8711842 | 0.7735901 | 0.2482110 | 0.4290381 | 0.7354716 | 1.1524094 | 0.3399797 | 0.4715303 | 0.6359956 | 0.6889806 | -0.0587476 | 0.5961084 | baja | 4 |
| M_cata_individual | y_fenolico_comun | pls | 100 | 0 | 0 | 52.00 | 18.68 | 0.6067905 | 0.1787761 | 0.3217412 | 0.6068311 | 0.8681768 | 0.7798151 | 0.2222488 | 0.4678790 | 0.7852185 | 1.0675903 | 0.3376202 | 0.4202149 | 0.5942297 | 0.6162039 | -0.0623191 | 0.5464356 | baja | 5 |
| M_cata_individual | y_fenolico_comun | ridge | 100 | 0 | 0 | 52.00 | 18.68 | 0.6149173 | 0.1738361 | 0.3110348 | 0.6263940 | 0.9083222 | 0.7797428 | 0.2088690 | 0.4719568 | 0.7785036 | 1.0879836 | 0.3533016 | 0.3817498 | 0.6162034 | 0.6459808 | -0.0729407 | 0.5972874 | baja | 6 |
| M_cata_individual | y_frutal_comun | random_forest_restringido | 100 | 1 | 1 | 12.96 | 4.56 | 0.1637197 | 0.0778120 | 0.0556405 | 0.1558551 | 0.3211082 | 0.2123581 | 0.0954812 | 0.0694934 | 0.2201941 | 0.3668426 | -0.2835604 | 0.3484974 | 0.4607827 | 0.5716295 | 0.0209690 | 0.2654677 | media | 1 |
| M_cata_individual | y_frutal_comun | gradient_boosting_restringido | 100 | 1 | 1 | 12.96 | 4.56 | 0.1785823 | 0.0809076 | 0.0558318 | 0.1733230 | 0.3254363 | 0.2239772 | 0.0924160 | 0.0714428 | 0.2319620 | 0.3861918 | -0.3204758 | -0.0239277 | 0.3945426 | 0.5590654 | 0.0188190 | 0.2696045 | media | 2 |
| M_cata_individual | y_frutal_comun | ridge | 100 | 1 | 1 | 12.96 | 4.56 | 0.2319271 | 0.0952294 | 0.0785172 | 0.2236324 | 0.4124071 | 0.2842466 | 0.1045732 | 0.1019999 | 0.2749973 | 0.4577097 | -1.1262444 | -0.2419055 | 0.2706670 | 0.3162278 | 0.0426863 | 0.3338898 | media | 3 |
| M_cata_individual | y_frutal_comun | elastic_net | 100 | 1 | 1 | 12.96 | 4.56 | 0.2390378 | 0.1457399 | 0.0770867 | 0.2119131 | 0.5195913 | 0.2988225 | 0.1591001 | 0.1081996 | 0.2749186 | 0.6225005 | -2.1550969 | -0.2118258 | 0.3406923 | 0.5000000 | 0.0195391 | 0.4425047 | media | 4 |
| M_cata_individual | y_frutal_comun | lasso | 100 | 1 | 1 | 12.96 | 4.56 | 0.2456404 | 0.2120591 | 0.0587057 | 0.1993847 | 0.5537029 | 0.3125306 | 0.2492304 | 0.0659020 | 0.2551965 | 0.6373726 | -3.0515061 | -0.1111727 | 0.3637531 | 0.5000000 | 0.0258235 | 0.4949972 | media | 5 |
| M_cata_individual | y_frutal_comun | pls | 100 | 1 | 1 | 12.96 | 4.56 | 0.2507653 | 0.1691071 | 0.0789667 | 0.2143322 | 0.6225329 | 0.3147574 | 0.1969307 | 0.1019854 | 0.2683752 | 0.7550123 | -2.6225310 | -0.1862122 | 0.2593582 | 0.3472513 | 0.0429940 | 0.5435662 | baja | 6 |
| M_expandida_evaluador | y_fenolico_comun | random_forest_restringido | 100 | 0 | 0 | 697.74 | 244.95 | 0.7312445 | 0.0454099 | 0.6635685 | 0.7239102 | 0.8115516 | 0.8940493 | 0.0594247 | 0.8168476 | 0.8820955 | 1.0052191 | 0.1359115 | 0.1569204 | 0.3729376 | 0.3973098 | 0.0313286 | 0.1479832 | alta | 1 |
| M_expandida_evaluador | y_fenolico_comun | gradient_boosting_restringido | 100 | 0 | 0 | 697.74 | 244.95 | 0.7456955 | 0.0543306 | 0.6778012 | 0.7386542 | 0.8483158 | 0.9128652 | 0.0700081 | 0.8264686 | 0.9026744 | 1.0413993 | 0.0986806 | 0.1196378 | 0.3469674 | 0.3687602 | 0.0090087 | 0.1705147 | alta | 2 |
| M_expandida_evaluador | y_fenolico_comun | ridge | 100 | 0 | 0 | 697.74 | 244.95 | 0.7488112 | 0.0841139 | 0.6603101 | 0.7225656 | 0.8707167 | 0.9261089 | 0.1162355 | 0.8100930 | 0.8836574 | 1.1281716 | 0.0618474 | 0.1247394 | 0.3448835 | 0.3655971 | 0.0501299 | 0.2104065 | alta | 3 |
| M_expandida_evaluador | y_fenolico_comun | pls | 100 | 0 | 0 | 697.74 | 244.95 | 0.7536980 | 0.0809223 | 0.6667705 | 0.7349049 | 0.9068485 | 0.9326380 | 0.1122312 | 0.8215453 | 0.9014437 | 1.1690914 | 0.0443436 | 0.1222950 | 0.3534745 | 0.3764483 | 0.0544327 | 0.2400779 | alta | 4 |
| M_expandida_evaluador | y_fenolico_comun | elastic_net | 100 | 0 | 0 | 697.74 | 244.95 | 0.8264122 | 0.1682136 | 0.6748583 | 0.7858724 | 1.1232885 | 1.0434413 | 0.2413337 | 0.8155135 | 0.9633799 | 1.5228885 | -0.2275033 | -0.0051572 | 0.3014457 | 0.3539143 | 0.0548825 | 0.4484301 | media | 5 |
| M_expandida_evaluador | y_fenolico_comun | lasso | 100 | 0 | 0 | 697.74 | 244.95 | 0.8309666 | 0.1610197 | 0.6698736 | 0.7904745 | 1.0868547 | 1.0489980 | 0.2271559 | 0.8207692 | 0.9806970 | 1.3998487 | -0.2427574 | -0.0773371 | 0.2915439 | 0.3527304 | 0.0461372 | 0.4169811 | media | 6 |
| M_expandida_evaluador | y_frutal_comun | gradient_boosting_restringido | 100 | 0 | 0 | 117.87 | 42.75 | 0.5208908 | 0.0779275 | 0.3983277 | 0.5135025 | 0.6685561 | 0.7043231 | 0.0897354 | 0.5615031 | 0.7042189 | 0.8551374 | -0.0036265 | 0.0090167 | 0.1733018 | 0.2256021 | -0.0072134 | 0.2702284 | media | 1 |
| M_expandida_evaluador | y_frutal_comun | random_forest_restringido | 100 | 0 | 0 | 117.87 | 42.75 | 0.5212719 | 0.0846046 | 0.3985686 | 0.5219114 | 0.6782868 | 0.7010817 | 0.0962785 | 0.5522390 | 0.7029755 | 0.8596854 | 0.0074449 | 0.0248145 | 0.1920496 | 0.2349271 | -0.0206529 | 0.2797182 | media | 2 |
| M_expandida_evaluador | y_frutal_comun | ridge | 100 | 0 | 0 | 117.87 | 42.75 | 0.5751158 | 0.1384899 | 0.4176893 | 0.5594029 | 0.7739454 | 0.7551309 | 0.1525027 | 0.5716310 | 0.7454791 | 0.9751314 | -0.2021773 | -0.0330746 | 0.0868173 | 0.1362546 | -0.0291262 | 0.3562560 | media | 3 |
| M_expandida_evaluador | y_frutal_comun | pls | 100 | 0 | 0 | 117.87 | 42.75 | 0.5969022 | 0.1706502 | 0.4159402 | 0.5717053 | 0.8262212 | 0.7831742 | 0.1878107 | 0.5723372 | 0.7591473 | 1.0540772 | -0.3367233 | -0.0646721 | 0.0878789 | 0.1371441 | -0.0202565 | 0.4102811 | media | 4 |
| M_expandida_evaluador | y_frutal_comun | lasso | 100 | 0 | 0 | 117.87 | 42.75 | 0.6127343 | 0.2223140 | 0.4084205 | 0.5544878 | 0.9651389 | 0.8039824 | 0.2511860 | 0.5605825 | 0.7410248 | 1.2982370 | -0.4699517 | -0.0228126 | 0.1333192 | 0.1656933 | -0.0117261 | 0.5567184 | baja | 5 |
| M_expandida_evaluador | y_frutal_comun | elastic_net | 100 | 0 | 0 | 117.87 | 42.75 | 0.6176332 | 0.2603491 | 0.4103072 | 0.5601849 | 1.0741092 | 0.8074137 | 0.2811808 | 0.5609173 | 0.7417345 | 1.3341567 | -0.5309837 | -0.0338527 | 0.1096581 | 0.1449967 | -0.0406994 | 0.6638020 | baja | 6 |
| M_ia_exploratoria | y_fenolico_comun | random_forest_restringido | 100 | 0 | 0 | 42.00 | 15.19 | 0.4127871 | 0.0730497 | 0.2992209 | 0.4046970 | 0.5224389 | 0.5084668 | 0.0765141 | 0.3819465 | 0.4991605 | 0.6327572 | 0.6644585 | 0.6760546 | 0.8299693 | 0.8501431 | 0.0169204 | 0.2232180 | alta | 1 |
| M_ia_exploratoria | y_fenolico_comun | gradient_boosting_restringido | 100 | 0 | 0 | 42.00 | 15.19 | 0.4268843 | 0.0891734 | 0.3144640 | 0.4174937 | 0.6100948 | 0.5243469 | 0.0980543 | 0.4074535 | 0.5162438 | 0.6727281 | 0.6457362 | 0.6697737 | 0.7849005 | 0.8100690 | 0.0252485 | 0.2956308 | media | 2 |
| M_ia_exploratoria | y_fenolico_comun | elastic_net | 100 | 0 | 0 | 42.00 | 15.19 | 0.5113401 | 0.1475221 | 0.3064212 | 0.4989115 | 0.7413515 | 0.6550335 | 0.1935671 | 0.4257521 | 0.6255894 | 0.9708329 | 0.3823341 | 0.5383479 | 0.6542078 | 0.7530780 | -0.0192134 | 0.4349303 | media | 3 |
| M_ia_exploratoria | y_fenolico_comun | ridge | 100 | 0 | 0 | 42.00 | 15.19 | 0.5132741 | 0.1399338 | 0.3093320 | 0.5058915 | 0.7305001 | 0.6382607 | 0.1556347 | 0.4165415 | 0.6267849 | 0.9114231 | 0.4390119 | 0.5038558 | 0.6379299 | 0.7288041 | -0.0491407 | 0.4211681 | media | 4 |
| M_ia_exploratoria | y_fenolico_comun | lasso | 100 | 0 | 0 | 42.00 | 15.19 | 0.5166186 | 0.1494614 | 0.3030708 | 0.5041010 | 0.7609095 | 0.6648400 | 0.2032816 | 0.4255501 | 0.6236555 | 1.0253325 | 0.3639693 | 0.5466356 | 0.6649465 | 0.7379254 | -0.0162983 | 0.4578387 | media | 5 |
| M_ia_exploratoria | y_fenolico_comun | pls | 100 | 0 | 0 | 42.00 | 15.19 | 0.5206100 | 0.1919401 | 0.2980159 | 0.4833262 | 0.7702096 | 0.6883231 | 0.2843315 | 0.4309950 | 0.6134722 | 1.1122368 | 0.2792148 | 0.5387802 | 0.6532637 | 0.7610977 | 0.0034544 | 0.4721937 | media | 6 |
| M_pura | y_fenolico_comun | random_forest_restringido | 100 | 0 | 0 | 34.00 | 12.08 | 0.2709944 | 0.0722428 | 0.1720885 | 0.2569384 | 0.3930968 | 0.3592314 | 0.0966523 | 0.2191634 | 0.3501762 | 0.5376334 | 0.3002299 | 0.4252598 | 0.5527485 | 0.5787677 | -0.0018114 | 0.2210083 | alta | 1 |
| M_pura | y_fenolico_comun | ridge | 100 | 0 | 0 | 34.00 | 12.08 | 0.2739013 | 0.1132426 | 0.1511739 | 0.2574765 | 0.4761888 | 0.3769686 | 0.1774394 | 0.1964266 | 0.3614946 | 0.5738268 | 0.0464621 | 0.4211953 | 0.5992771 | 0.6731570 | 0.0398990 | 0.3250149 | media | 2 |
| M_pura | y_fenolico_comun | pls | 100 | 0 | 0 | 34.00 | 12.08 | 0.2796573 | 0.1104709 | 0.1511765 | 0.2624431 | 0.4556578 | 0.3929386 | 0.1747131 | 0.2297052 | 0.3755720 | 0.5715087 | -0.0487733 | 0.3750097 | 0.5901903 | 0.6383616 | 0.0403170 | 0.3044813 | media | 3 |
| M_pura | y_fenolico_comun | lasso | 100 | 0 | 0 | 34.00 | 12.08 | 0.3185317 | 0.1510612 | 0.1570703 | 0.2863925 | 0.6531088 | 0.4736936 | 0.2547238 | 0.2217064 | 0.3904685 | 1.0586940 | -0.5721387 | 0.2397800 | 0.5510437 | 0.6282298 | 0.0312627 | 0.4960385 | media | 4 |
| M_pura | y_fenolico_comun | elastic_net | 100 | 0 | 0 | 34.00 | 12.08 | 0.3217434 | 0.1544350 | 0.1539009 | 0.2935231 | 0.6549926 | 0.4752614 | 0.2535942 | 0.2048920 | 0.3999131 | 1.0231811 | -0.5924173 | 0.2671688 | 0.5550431 | 0.6456679 | 0.0261392 | 0.5010917 | baja | 5 |
| M_pura | y_fenolico_comun | gradient_boosting_restringido | 100 | 0 | 0 | 34.00 | 12.08 | 0.3252210 | 0.0785445 | 0.1988775 | 0.3197979 | 0.4438747 | 0.4227296 | 0.0955640 | 0.2486453 | 0.4189032 | 0.5610704 | 0.0602167 | 0.1862566 | 0.4714502 | 0.5089904 | 0.0056061 | 0.2449971 | alta | 6 |
| M_pura | y_frutal_comun | random_forest_restringido | 100 | 1 | 1 | 12.96 | 4.47 | 0.1615510 | 0.0797755 | 0.0535898 | 0.1544892 | 0.3186306 | 0.2102873 | 0.0974749 | 0.0651291 | 0.2144834 | 0.3764715 | -0.1301436 | 0.3414281 | 0.4608918 | 0.5642881 | 0.0168478 | 0.2650409 | media | 1 |
| M_pura | y_frutal_comun | gradient_boosting_restringido | 100 | 1 | 1 | 12.96 | 4.47 | 0.1725570 | 0.0914665 | 0.0499258 | 0.1661361 | 0.3720376 | 0.2178508 | 0.1042724 | 0.0589881 | 0.2185529 | 0.4208891 | -0.1977760 | 0.2705939 | 0.3900220 | 0.5000000 | 0.0137618 | 0.3221118 | media | 2 |
| M_pura | y_frutal_comun | elastic_net | 100 | 1 | 1 | 12.96 | 4.47 | 0.1966094 | 0.0914147 | 0.0525824 | 0.1813031 | 0.3802130 | 0.2551888 | 0.1124182 | 0.0671823 | 0.2500478 | 0.4541608 | -0.7160905 | 0.0045679 | 0.3678019 | 0.5000000 | -0.0189421 | 0.3276306 | media | 3 |
| M_pura | y_frutal_comun | lasso | 100 | 1 | 1 | 12.96 | 4.47 | 0.1974639 | 0.1047230 | 0.0582191 | 0.1837374 | 0.4136465 | 0.2569394 | 0.1318019 | 0.0726185 | 0.2423963 | 0.4859744 | -0.8107918 | 0.0308127 | 0.3789974 | 0.5000000 | -0.0130792 | 0.3554275 | media | 4 |
| M_pura | y_frutal_comun | ridge | 100 | 1 | 1 | 12.96 | 4.47 | 0.1988636 | 0.0823381 | 0.0473047 | 0.2031081 | 0.3493101 | 0.2495444 | 0.0943779 | 0.0650165 | 0.2594670 | 0.3938970 | -0.4723755 | -0.0393181 | 0.2586678 | 0.4103913 | 0.0086467 | 0.3020055 | media | 5 |
| M_pura | y_frutal_comun | pls | 100 | 1 | 1 | 12.96 | 4.47 | 0.2251230 | 0.1065152 | 0.0953003 | 0.2105389 | 0.4476051 | 0.2895973 | 0.1279348 | 0.1018921 | 0.2743580 | 0.5509596 | -1.2543866 | -0.2983241 | 0.2852901 | 0.4103913 | 0.0037574 | 0.3523048 | media | 6 |
Para M_pura con y_fenolico_comun, Random
Forest restringido, Ridge y PLS quedan muy cerca en MAE bootstrap
(0.271, 0.274 y 0.280 respectivamente): una diferencia de apenas
0.003-0.009, pequeña frente a la desviación estándar del propio
bootstrap (0.072 en Random Forest, 0.11-0.11 en Ridge y PLS). Esa
diferencia de MAE, por sí sola, no alcanza para preferir un modelo sobre
otro. Lo que sí distingue a Random Forest restringido es el R² (0.300,
frente a 0.046 en Ridge y -0.049 en PLS) y una estabilidad de error
clasificada como alta (media en Ridge y PLS), por lo que se recomienda
como modelo principal del escenario por esos dos criterios, no por el
MAE (detalle completo de esta comparación y de por qué se eligió en la
Parte 4). Ridge y PLS se mantienen como modelos de referencia para la
interpretación de variables, ya que su estructura lineal regularizada
hace explícito el manejo de la colinealidad entre predictores
químicos.
** 01_bootstrap_mae_y_fenolico **
** 02_variables_estables_M_pura_y_fenolico **
Comparación del desempeño del modelo principal (Random Forest restringido) y del modelo alternativo (Ridge) con y sin las unidades marcadas como atípicas en la etapa exploratoria (Dixon / T²-Q), para evaluar si los resultados dependen de esos puntos.
| modelo | target | version | n_bootstrap_exitosos | n_fallback_holdout | mae_media | mae_p05 | mae_p50 | mae_p95 | rmse_media | r2_media | spearman_media | bias_media |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| random_forest_restringido | y_fenolico_comun | completo | 100 | 0 | 0.2746997 | 0.1738740 | 0.2782505 | 0.3873386 | 0.3565862 | 0.4140521 | 0.5971615 | -0.0158423 |
| random_forest_restringido | y_fenolico_comun | sin_outliers_eda | 100 | 0 | 0.2708032 | 0.1851390 | 0.2751198 | 0.3670530 | 0.3622975 | 0.3615784 | 0.5925369 | -0.0263238 |
| random_forest_restringido | y_frutal_comun | completo | 100 | 1 | 0.1630743 | 0.0642320 | 0.1531304 | 0.2859661 | 0.2067446 | -0.1328518 | 0.5298991 | 0.0580511 |
| random_forest_restringido | y_frutal_comun | sin_outliers_eda | 100 | 0 | 0.1666198 | 0.0469011 | 0.1653134 | 0.2966252 | 0.2164721 | -0.3292504 | 0.4314388 | -0.0099049 |
| ridge | y_fenolico_comun | completo | 100 | 0 | 0.2594540 | 0.1573723 | 0.2539684 | 0.3823481 | 0.3550912 | 0.2869069 | 0.6283030 | 0.0321154 |
| ridge | y_fenolico_comun | sin_outliers_eda | 100 | 0 | 0.2609778 | 0.1561235 | 0.2534040 | 0.3873083 | 0.3517569 | 0.3043814 | 0.6299918 | 0.0092467 |
| ridge | y_frutal_comun | completo | 100 | 1 | 0.2179235 | 0.1049252 | 0.2158147 | 0.3797200 | 0.2732786 | -1.0142690 | 0.3526512 | 0.0648630 |
| ridge | y_frutal_comun | sin_outliers_eda | 100 | 0 | 0.2388778 | 0.1342856 | 0.2201142 | 0.3944810 | 0.3010013 | -1.0314849 | 0.2850201 | 0.0678066 |
Ambos modelos mantienen un MAE similar con y sin las unidades
marcadas como atípicas (variación de un pocos puntos porcentuales, no un
cambio de orden de magnitud), lo que indica que los resultados de
M_pura no dependen de un puñado de valores extremos — un
modelo frágil mostraría una caída marcada al remover esos puntos.
** 01_comparacion_mae_completo_vs_sin_outliers **
Dentro de M_pura, las 5 variables GC-MS
(x_gcms_esteres_pct, x_gcms_fenolicos_pct,
x_gcms_aldehidos_pct,
x_gcms_aroma_fermentativo_pct,
x_gcms_area_valida_pct) tienen dato real en solo 8 de las
34 unidades (23.5% de cobertura); el resto se completa por la imputación
por mediana descrita más arriba. Para verificar que el consenso de
importancia de variables no depende críticamente de esos datos
mayormente imputados, se repitió el mismo procedimiento de bootstrap
agrupado (100 iteraciones, Random Forest restringido y Ridge,
M_pura) comparando la versión completa (32 predictores,
incluye GC-MS) contra una versión que excluye por completo los 5
predictores GC-MS, sin imputarlos.
| modelo | target | version | n_bootstrap_exitosos | n_fallback_holdout | mae_media | mae_p05 | mae_p50 | mae_p95 | rmse_media | r2_media | spearman_media | bias_media |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| random_forest_restringido | y_fenolico_comun | completo | 100 | 0 | 0.2746997 | 0.1738740 | 0.2782505 | 0.3873386 | 0.3565862 | 0.4140521 | 0.5971615 | -0.0158423 |
| random_forest_restringido | y_fenolico_comun | sin_gcms | 100 | 0 | 0.2789848 | 0.1658258 | 0.2658560 | 0.4311091 | 0.3804911 | 0.3330437 | 0.5834798 | -0.0213053 |
| random_forest_restringido | y_frutal_comun | completo | 100 | 0 | 0.1639733 | 0.0693337 | 0.1617188 | 0.2848108 | 0.2133147 | -0.3298862 | 0.4746166 | 0.0328277 |
| random_forest_restringido | y_frutal_comun | sin_gcms | 99 | 0 | 0.1625070 | 0.0575565 | 0.1536956 | 0.2940623 | 0.2150708 | -0.1810089 | 0.4736512 | 0.0239322 |
| ridge | y_fenolico_comun | completo | 100 | 0 | 0.2594540 | 0.1573723 | 0.2539684 | 0.3823481 | 0.3550912 | 0.2869069 | 0.6283030 | 0.0321154 |
| ridge | y_fenolico_comun | sin_gcms | 100 | 0 | 0.2286707 | 0.1250348 | 0.2271307 | 0.3312843 | 0.3278012 | 0.3815380 | 0.6503890 | 0.0157361 |
| ridge | y_frutal_comun | completo | 100 | 0 | 0.2172038 | 0.1131995 | 0.2083207 | 0.3272852 | 0.2757330 | -1.0233922 | 0.3401334 | 0.0030806 |
| ridge | y_frutal_comun | sin_gcms | 100 | 1 | 0.2175814 | 0.0708824 | 0.2003079 | 0.4716708 | 0.2735283 | -7.7581644 | 0.3146474 | 0.0650945 |
| modelo | target | mae_media_completo | mae_media_sin_gcms | rmse_media_completo | rmse_media_sin_gcms | r2_media_completo | r2_media_sin_gcms | spearman_media_completo | spearman_media_sin_gcms | diferencia_mae | diferencia_mae_pct | diferencia_r2 | lectura |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| random_forest_restringido | y_fenolico_comun | 0.275 | 0.279 | 0.357 | 0.380 | 0.414 | 0.333 | 0.597 | 0.583 | 0.004 | 1.6 | -0.081 | robusto: el MAE cambia menos de 10% al quitar las variables GC-MS |
| random_forest_restringido | y_frutal_comun | 0.164 | 0.163 | 0.213 | 0.215 | -0.330 | -0.181 | 0.475 | 0.474 | -0.001 | -0.9 | 0.149 | robusto: el MAE cambia menos de 10% al quitar las variables GC-MS |
| ridge | y_fenolico_comun | 0.259 | 0.229 | 0.355 | 0.328 | 0.287 | 0.382 | 0.628 | 0.650 | -0.031 | -11.9 | 0.095 | sensibilidad moderada: revisar si GC-MS aporta senal real o solo variabilidad de la imputacion |
| ridge | y_frutal_comun | 0.217 | 0.218 | 0.276 | 0.274 | -1.023 | -7.758 | 0.340 | 0.315 | 0.000 | 0.2 | -6.735 | robusto: el MAE cambia menos de 10% al quitar las variables GC-MS |
** 01_comparacion_mae_completo_vs_sin_gcms **
Para Random Forest restringido (el modelo
principal), el MAE bootstrap cambia menos de un 2% al quitar por
completo las variables GC-MS, tanto en y_fenolico_comun
como en y_frutal_comun: el resultado del modelo principal
es robusto a la imputación de GC-MS. Para Ridge, el MAE
de y_fenolico_comun sí cambia de forma moderada (variación
de un 11.9%, mejorando al excluir GC-MS), lo que indica que Ridge apoya
una parte de su ajuste en la señal de esas variables mayormente
imputadas. En conjunto, esto confirma que la conclusión principal de la
tesis (Random Forest restringido, fenoles volátiles GC-FID como
variables más consistentes) no depende de los datos GC-MS imputados,
pero recomienda tratar con cautela cualquier lectura de las variables
GC-MS específicamente cuando aparecen en modelos lineales como Ridge,
dado su nivel de cobertura real (23.5%).
Esta parte integra los resultados de las etapas anteriores: qué variables explican mejor la calidad sensorial fenólica, cómo se comparan los escenarios de modelamiento entre sí, qué tan robustos son los resultados frente a valores atípicos, y qué conclusiones se pueden sostener con la evidencia disponible.
Un análisis más detallado en formato de guía de defensa (con
preguntas anticipadas de comisión) está disponible en
outputs/modelamiento/analisis_finales/resultados_finales_y_guia_defensa.pdf.
Consenso de importancia de variables entre los distintos modelos
candidatos, para y_fenolico_comun en el escenario principal
(M_pura).
| escenario | target | predictor | predictor_limpio | tecnica | familia_quimica | coherencia_target | n_modelos_con_variable | modelos_que_la_reportan | frecuencia_media | frecuencia_max | importancia_norm_media | importancia_norm_max | n_bootstrap_total_modelos | justificacion_quimica | estabilidad_consenso | prioridad_tesis | ranking_consenso |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | x_ju_maltose_consumption_g_l | ju maltose consumption g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9025000 | 1.00 | 8.0063783 | 30.1300872 | 361 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 1 |
| M_cata_individual | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9000000 | 0.96 | 30.2853379 | 48.0739598 | 360 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 |
| M_cata_individual | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8250000 | 0.95 | 36.2192044 | 51.8901376 | 330 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 |
| M_cata_individual | y_fenolico_comun | x_ju_final_co2_loss_g_l | ju final co2 loss g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7600000 | 1.00 | 7.9266643 | 31.2515802 | 304 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 4 |
| M_cata_individual | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7525000 | 0.95 | 3.1781674 | 4.3415063 | 301 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 |
| M_cata_individual | y_fenolico_comun | x_ju_ethanol_production_g_l | ju ethanol production g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6675000 | 0.99 | 7.8559406 | 27.9905136 | 267 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | media | apoyo_interpretativo | 6 |
| M_cata_individual | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6425000 | 0.80 | 1.9171889 | 2.3570225 | 257 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 7 |
| M_cata_individual | y_fenolico_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4275000 | 0.68 | 6.0405734 | 8.4500423 | 171 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | baja_media | baja_prioridad | 8 |
| M_cata_individual | y_fenolico_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3800000 | 0.62 | 0.9335453 | 2.0769450 | 152 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja_media | baja_prioridad | 9 |
| M_cata_individual | y_fenolico_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3650000 | 0.58 | 2.6841400 | 5.1692975 | 146 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja_media | baja_prioridad | 10 |
| M_cata_individual | y_fenolico_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3625000 | 0.61 | 0.8757130 | 1.8880273 | 145 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja_media | baja_prioridad | 11 |
| M_cata_individual | y_fenolico_comun | x_ju_ethyl_octanoate_ppm | ju ethyl octanoate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3550000 | 0.52 | 0.2086841 | 0.7676894 | 142 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja_media | baja_prioridad | 12 |
| M_cata_individual | y_fenolico_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3525000 | 0.60 | 1.0577372 | 4.1264966 | 141 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja_media | baja_prioridad | 13 |
| M_cata_individual | y_fenolico_comun | x_ju_o_cresol_ppm | ju o cresol ppm | JU | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3500000 | 0.52 | 1.7950195 | 3.1896890 | 140 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | baja_media | baja_prioridad | 14 |
| M_cata_individual | y_fenolico_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3475000 | 0.57 | 1.4507002 | 2.5004198 | 139 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | baja_media | baja_prioridad | 15 |
| M_cata_individual | y_fenolico_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3325000 | 0.48 | 2.3249242 | 5.6525246 | 133 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja_media | baja_prioridad | 16 |
| M_cata_individual | y_fenolico_comun | x_ju_ethyl_hexadecanoate_ppm | ju ethyl hexadecanoate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2925000 | 0.52 | 8.7763886 | 19.0010049 | 117 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 17 |
| M_cata_individual | y_fenolico_comun | x_ju_ethyl_decanoate_ppm | ju ethyl decanoate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2600000 | 0.37 | 4.8211188 | 10.0017442 | 104 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 18 |
| M_cata_individual | y_fenolico_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1825000 | 0.28 | 0.9703554 | 3.5215544 | 73 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 19 |
| M_cata_individual | y_fenolico_comun | x_ju_isoamyl_octanoate_ppm | ju isoamyl octanoate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1700000 | 0.30 | 15.0889568 | 21.1768544 | 68 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 20 |
| M_cata_individual | y_fenolico_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1525000 | 0.23 | 0.4312565 | 0.9588644 | 61 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 21 |
| M_cata_individual | y_fenolico_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1450000 | 0.23 | 1.0676826 | 2.0983835 | 58 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 22 |
| M_cata_individual | y_fenolico_comun | x_ju_ethyl_myristate_ppm | ju ethyl myristate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1400000 | 0.25 | 22.6597863 | 36.8400347 | 56 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 23 |
| M_cata_individual | y_fenolico_comun | x_ju_isoamyl_acetate_ppm | ju isoamyl acetate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1325000 | 0.23 | 5.8948657 | 12.5228383 | 53 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 24 |
| M_cata_individual | y_fenolico_comun | x_ju_ethyl_dodecanoate_ppm | ju ethyl dodecanoate ppm | JU | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1300000 | 0.25 | 7.8452264 | 15.1721465 | 52 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 25 |
| M_cata_individual | y_fenolico_comun | x_ju_ferulic_acid_conversion_index_faci_percent | ju ferulic acid conversion index faci percent | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1025000 | 0.14 | 6.4642188 | 19.3329610 | 41 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | baja | baja_prioridad | 26 |
| M_cata_individual | y_fenolico_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.0650000 | 0.12 | 8.0333391 | 9.8171782 | 26 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | baja_prioridad | 27 |
| M_cata_individual | y_fenolico_comun | x_ju_p_cresol_ppm | ju p cresol ppm | JU | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.0475000 | 0.10 | 7.1974041 | 10.9075603 | 19 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | baja | baja_prioridad | 28 |
| M_cata_individual | y_fenolico_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.0375000 | 0.05 | 0.2064639 | 0.5791659 | 15 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 29 |
| M_cata_individual | y_fenolico_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | media_contextual | 3 | elastic_net; lasso; ridge | 0.0333333 | 0.04 | 4.5895306 | 6.4533091 | 10 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 30 |
| M_cata_individual | y_fenolico_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | media_contextual | 3 | elastic_net; lasso; ridge | 0.0333333 | 0.06 | 0.1682959 | 0.2052991 | 10 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 31 |
| M_cata_individual | y_frutal_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8250000 | 0.99 | 32.8258928 | 62.7539356 | 330 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 1 |
| M_cata_individual | y_frutal_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7650000 | 0.99 | 3.0515598 | 10.9268698 | 306 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 2 |
| M_cata_individual | y_frutal_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7325000 | 0.99 | 4.7160218 | 11.8284163 | 293 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 3 |
| M_cata_individual | y_frutal_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7050000 | 0.99 | 9.5198847 | 18.2132304 | 282 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | exploratoria_target_secundario | 4 |
| M_cata_individual | y_frutal_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5925000 | 0.99 | 22.7475498 | 36.7797778 | 237 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 5 |
| M_cata_individual | y_frutal_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5825000 | 0.99 | 3.6477094 | 11.1174277 | 233 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 6 |
| M_cata_individual | y_frutal_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5800000 | 0.99 | 8.6614095 | 17.2362299 | 232 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 7 |
| M_cata_individual | y_frutal_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5725000 | 0.99 | 52.7168977 | 73.4146112 | 229 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 8 |
| M_cata_individual | y_frutal_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5400000 | 0.99 | 4.1815484 | 9.8920336 | 216 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 9 |
| M_cata_individual | y_frutal_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5350000 | 0.99 | 2.4114320 | 9.2724615 | 214 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 10 |
| M_cata_individual | y_frutal_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2850000 | 0.43 | 5.5531613 | 15.1978811 | 114 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 11 |
| M_cata_individual | y_frutal_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2700000 | 0.43 | 22.2308714 | 37.0443960 | 108 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 12 |
| M_cata_individual | y_frutal_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2650000 | 0.43 | 3.4777826 | 11.0419708 | 106 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | baja | exploratoria_target_secundario | 13 |
| M_cata_individual | y_frutal_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2225000 | 0.43 | 20.5160793 | 33.6874617 | 89 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 14 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9200000 | 0.99 | 9.1047855 | 12.5479718 | 368 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 1 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8850000 | 1.00 | 14.3614661 | 15.5194569 | 354 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8725000 | 1.00 | 27.2799328 | 37.5569852 | 349 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8200000 | 0.99 | 30.1935124 | 38.0597555 | 328 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 4 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7975000 | 0.98 | 2.6250331 | 10.1345706 | 319 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | alta | prioritaria | 5 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7475000 | 1.00 | 3.5707393 | 14.1860356 | 299 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | alta | prioritaria | 6 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9200000 | 0.99 | 6.4923925 | 15.9618476 | 368 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | apoyo_interpretativo | 7 |
| M_expandida_evaluador | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8700000 | 0.96 | 3.5483618 | 7.9074718 | 348 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | apoyo_interpretativo | 8 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6875000 | 0.93 | 4.5614148 | 17.8986718 | 275 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 9 |
| M_expandida_evaluador | y_fenolico_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6825000 | 0.86 | 3.8927029 | 5.9368444 | 273 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | media | apoyo_interpretativo | 10 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6650000 | 0.83 | 5.3905065 | 15.6869701 | 266 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 11 |
| M_expandida_evaluador | y_fenolico_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6625000 | 0.90 | 1.5924456 | 4.5590082 | 265 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 12 |
| M_expandida_evaluador | y_fenolico_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6250000 | 0.92 | 1.5246321 | 4.4203235 | 250 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 13 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6200000 | 0.93 | 7.7084680 | 8.8142065 | 248 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 14 |
| M_expandida_evaluador | y_fenolico_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6050000 | 0.74 | 7.2688860 | 11.1406476 | 242 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 15 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.3500000 | 0.49 | 7.9611186 | 9.1531807 | 140 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja_media | baja_prioridad | 16 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1575000 | 0.28 | 1.6355768 | 3.6189901 | 63 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 17 |
| M_expandida_evaluador | y_fenolico_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1125000 | 0.21 | 5.0272987 | 20.0772216 | 45 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 18 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8400000 | 1.00 | 31.9097552 | 63.7024006 | 336 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 1 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7325000 | 1.00 | 3.8579737 | 10.8288738 | 293 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 2 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7175000 | 1.00 | 5.3070729 | 12.4131536 | 287 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 3 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7125000 | 1.00 | 10.0157417 | 17.6948470 | 285 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | exploratoria_target_secundario | 4 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5700000 | 1.00 | 6.0399082 | 10.8431513 | 228 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 5 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5675000 | 1.00 | 51.7218787 | 69.1685851 | 227 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 6 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5650000 | 1.00 | 19.8055289 | 30.8754829 | 226 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 7 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550000 | 1.00 | 2.8785346 | 11.0671682 | 222 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 8 |
| M_expandida_evaluador | y_frutal_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5175000 | 0.89 | 14.6953678 | 19.9555476 | 207 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 9 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5175000 | 1.00 | 3.9088899 | 10.4196345 | 207 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 10 |
| M_expandida_evaluador | y_frutal_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4800000 | 0.89 | 3.1068708 | 7.8836265 | 192 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta_en_un_modelo | exploratoria_target_secundario | 11 |
| M_expandida_evaluador | y_frutal_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4775000 | 1.00 | 2.4719345 | 9.1945814 | 191 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta_en_un_modelo | exploratoria_target_secundario | 12 |
| M_expandida_evaluador | y_frutal_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4750000 | 0.89 | 17.3088157 | 30.7047620 | 190 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta_en_un_modelo | exploratoria_target_secundario | 13 |
| M_expandida_evaluador | y_frutal_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4725000 | 0.89 | 2.4474849 | 7.6315294 | 189 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta_en_un_modelo | exploratoria_target_secundario | 14 |
| M_ia_exploratoria | y_fenolico_comun | x_folin_fenoles_totales_ug_ag_ml | folin fenoles totales ug ag ml | Folin | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 1.0000000 | 1.00 | 13.5037965 | 24.8135752 | 400 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | solo_exploratoria_ia | 1 |
| M_ia_exploratoria | y_fenolico_comun | x_ju_maltose_consumption_g_l | ju maltose consumption g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9850000 | 1.00 | 13.8582562 | 18.2119660 | 394 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | solo_exploratoria_ia | 2 |
| M_ia_exploratoria | y_fenolico_comun | x_ju_ferulic_acid_conversion_index_faci_percent | ju ferulic acid conversion index faci percent | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9275000 | 1.00 | 27.2785003 | 35.2278431 | 371 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | solo_exploratoria_ia | 3 |
| M_ia_exploratoria | y_fenolico_comun | x_ju_final_co2_loss_g_l | ju final co2 loss g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8750000 | 1.00 | 20.2041663 | 26.8157618 | 350 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | solo_exploratoria_ia | 4 |
| M_ia_exploratoria | y_fenolico_comun | x_ju_ethanol_production_g_l | ju ethanol production g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7850000 | 1.00 | 41.1315620 | 51.6717887 | 314 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | solo_exploratoria_ia | 5 |
| M_pura | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9225000 | 0.99 | 17.5340225 | 32.3236383 | 369 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 1 |
| M_pura | y_fenolico_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8450000 | 1.00 | 15.6426849 | 20.4604126 | 338 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 |
| M_pura | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7750000 | 1.00 | 24.7345254 | 42.0451875 | 310 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7375000 | 1.00 | 2.3193138 | 9.1723343 | 295 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | alta | prioritaria | 4 |
| M_pura | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7275000 | 0.99 | 37.0062948 | 55.0525829 | 291 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 |
| M_pura | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7775000 | 0.86 | 4.9197582 | 10.9350468 | 311 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | apoyo_interpretativo | 6 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6575000 | 0.95 | 3.3869880 | 13.0310652 | 263 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 7 |
| M_pura | y_fenolico_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6550000 | 0.87 | 4.1632834 | 6.6607996 | 262 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | media | apoyo_interpretativo | 8 |
| M_pura | y_fenolico_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6475000 | 0.87 | 5.0464690 | 13.5782129 | 259 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 9 |
| M_pura | y_fenolico_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6375000 | 0.85 | 7.5490194 | 12.7811817 | 255 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 10 |
| M_pura | y_fenolico_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6325000 | 0.94 | 5.2282107 | 12.3535847 | 253 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 11 |
| M_pura | y_fenolico_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5900000 | 0.88 | 1.9592020 | 6.4803100 | 236 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 12 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550000 | 0.83 | 2.9518141 | 11.3393058 | 222 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 13 |
| M_pura | y_fenolico_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550000 | 0.87 | 1.9548687 | 6.6297376 | 222 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 14 |
| M_pura | y_fenolico_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.4800000 | 0.84 | 9.9587332 | 15.2960620 | 192 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta_en_un_modelo | baja_prioridad | 15 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2225000 | 0.42 | 3.1800679 | 12.6263690 | 89 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 16 |
| M_pura | y_fenolico_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1650000 | 0.30 | 8.3958612 | 11.3039370 | 66 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 17 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.1375000 | 0.32 | 2.1497057 | 5.2103100 | 55 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | baja | baja_prioridad | 18 |
| M_pura | y_frutal_comun | x_gcfid_isoamyl_octanoate_ppm | gcfid isoamyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8600000 | 0.99 | 34.3790115 | 64.4288115 | 344 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 1 |
| M_pura | y_frutal_comun | x_gcfid_ethyl_dodecanoate_ppm | gcfid ethyl dodecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7900000 | 0.99 | 2.8996143 | 10.9615586 | 316 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 2 |
| M_pura | y_frutal_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7500000 | 0.99 | 3.6058937 | 11.7232052 | 300 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | alta | exploratoria_target_secundario | 3 |
| M_pura | y_frutal_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7475000 | 0.99 | 11.0732779 | 21.5483824 | 299 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | exploratoria_target_secundario | 4 |
| M_pura | y_frutal_comun | x_gcfid_creosol_ppm | gcfid creosol ppm | GC-FID | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6050000 | 0.99 | 21.3889674 | 37.6896642 | 242 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 5 |
| M_pura | y_frutal_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5950000 | 0.99 | 2.7686076 | 9.8623587 | 238 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 6 |
| M_pura | y_frutal_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5775000 | 0.99 | 49.3413073 | 70.6515517 | 231 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | exploratoria_target_secundario | 7 |
| M_pura | y_frutal_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5450000 | 0.99 | 5.5497346 | 14.0698682 | 218 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 8 |
| M_pura | y_frutal_comun | x_gcfid_ethyl_tetradecanoate_ppm | gcfid ethyl tetradecanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5150000 | 0.99 | 4.9357719 | 11.0071562 | 206 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 9 |
| M_pura | y_frutal_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5025000 | 0.99 | 2.8499626 | 9.1172409 | 201 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | media | exploratoria_target_secundario | 10 |
| M_pura | y_frutal_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | baja_no_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2450000 | 0.37 | 23.6806275 | 42.2532118 | 98 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 11 |
| M_pura | y_frutal_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2225000 | 0.37 | 3.4111565 | 9.8344783 | 89 | Coherente: los esteres suelen asociarse a notas frutales, florales y fermentativas. | baja | exploratoria_target_secundario | 12 |
| M_pura | y_frutal_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2100000 | 0.37 | 24.4245377 | 47.1406059 | 84 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 13 |
| M_pura | y_frutal_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.2100000 | 0.37 | 5.8925382 | 12.1882939 | 84 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | baja | exploratoria_target_secundario | 14 |
| escenario | target | predictor | predictor_limpio | tecnica | familia_quimica | coherencia_target | n_modelos_con_variable | modelos_que_la_reportan | frecuencia_media | frecuencia_max | importancia_norm_media | importancia_norm_max | n_bootstrap_total_modelos | justificacion_quimica | estabilidad_consenso | prioridad_tesis | ranking_consenso |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | x_ju_maltose_consumption_g_l | ju maltose consumption g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9025 | 1.00 | 8.006378 | 30.130087 | 361 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 1 |
| M_cata_individual | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9000 | 0.96 | 30.285338 | 48.073960 | 360 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 |
| M_cata_individual | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8250 | 0.95 | 36.219204 | 51.890138 | 330 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 |
| M_cata_individual | y_fenolico_comun | x_ju_final_co2_loss_g_l | ju final co2 loss g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7600 | 1.00 | 7.926664 | 31.251580 | 304 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 4 |
| M_cata_individual | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7525 | 0.95 | 3.178167 | 4.341506 | 301 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 |
| M_cata_individual | y_fenolico_comun | x_ju_ethanol_production_g_l | ju ethanol production g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6675 | 0.99 | 7.855941 | 27.990514 | 267 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | media | apoyo_interpretativo | 6 |
| M_cata_individual | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6425 | 0.80 | 1.917189 | 2.357022 | 257 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 7 |
| M_pura | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9225 | 0.99 | 17.534022 | 32.323638 | 369 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 1 |
| M_pura | y_fenolico_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8450 | 1.00 | 15.642685 | 20.460413 | 338 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 |
| M_pura | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7750 | 1.00 | 24.734525 | 42.045187 | 310 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7375 | 1.00 | 2.319314 | 9.172334 | 295 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | alta | prioritaria | 4 |
| M_pura | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7275 | 0.99 | 37.006295 | 55.052583 | 291 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 |
| M_pura | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7775 | 0.86 | 4.919758 | 10.935047 | 311 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | apoyo_interpretativo | 6 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6575 | 0.95 | 3.386988 | 13.031065 | 263 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 7 |
| M_pura | y_fenolico_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6550 | 0.87 | 4.163283 | 6.660800 | 262 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | media | apoyo_interpretativo | 8 |
| M_pura | y_fenolico_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6475 | 0.87 | 5.046469 | 13.578213 | 259 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 9 |
| M_pura | y_fenolico_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6375 | 0.85 | 7.549019 | 12.781182 | 255 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 10 |
| M_pura | y_fenolico_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6325 | 0.94 | 5.228211 | 12.353585 | 253 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 11 |
| M_pura | y_fenolico_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5900 | 0.88 | 1.959202 | 6.480310 | 236 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 12 |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550 | 0.83 | 2.951814 | 11.339306 | 222 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 13 |
| M_pura | y_fenolico_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550 | 0.87 | 1.954869 | 6.629738 | 222 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 14 |
** 01_consenso_variables_M_pura_y_fenolico **
** 02_familias_quimicas_M_pura_y_fenolico **
** 03_variable_modelo_M_pura_y_fenolico **
** 04_variables_prioritarias_escenarios_reales **
Las variables más consistentes son fenoles volátiles medidos por GC-FID (guaiacol, p-cresol, o-cresol, 4-etil-guaiacol), lo cual es coherente desde el punto de vista químico con el atributo sensorial “fenólico” (asociado a compuestos derivados de la turba/ahumado). Variables fermentativas JU (consumo de maltosa, pérdida de CO₂, producción de etanol) aparecen como señales indirectas de apoyo, no como explicación causal directa.
| escenario | tipo_escenario | modelo_recomendado | mae_bootstrap | mae_p05 | mae_p95 | rmse_bootstrap | r2_bootstrap | spearman_bootstrap | estabilidad_error | recomendacion_uso | lectura_escenario |
|---|---|---|---|---|---|---|---|---|---|---|---|
| M_pura | principal_real | random_forest_restringido | 0.2709944 | 0.1720885 | 0.3930968 | 0.3592314 | 0.3002299 | 0.5527485 | alta | modelo_principal_predictivo | Escenario principal con datos quimico-sensoriales reales (sin cata individual JU). Es la base central para conclusiones predictivas. |
| M_cata_individual | sensibilidad_con_ju | random_forest_restringido | 0.3303534 | 0.1905647 | 0.5313743 | 0.4761227 | 0.7578598 | 0.8178249 | media | comparacion_con_aporte_ju | Matriz pura mas la cata individual JU agregada. Permite evaluar el aporte y la heterogeneidad introducida por JU, comparando directamente contra M_pura. |
| M_expandida_evaluador | complementario_evaluador | random_forest_restringido | 0.7312445 | 0.6635685 | 0.8115516 | 0.8940493 | 0.1359115 | 0.3729376 | alta | complementario_no_principal | Escenario complementario para variabilidad entre evaluadores. No debe interpretarse como aumento independiente de muestras quimicas. |
| M_ia_exploratoria | exploratorio_ia | random_forest_restringido | 0.4127871 | 0.2992209 | 0.5224389 | 0.5084668 | 0.6644585 | 0.8299693 | alta | exploratorio_sintetico_no_real | Escenario sintetico exploratorio con imputacion sensorial asistida por IA. No reemplaza cata real. |
** 01_modelamiento_mae_bootstrap_y_fenolico **
** 02_modelamiento_mejor_modelo_por_escenario **
** 03_modelamiento_base_vs_mejor_y_fenolico **
** 04_modelamiento_variables_discusion **
| escenario | target | predictor | predictor_limpio | tecnica | familia_quimica | coherencia_target | n_modelos_con_variable | modelos_que_la_reportan | frecuencia_media | frecuencia_max | importancia_norm_media | importancia_norm_max | n_bootstrap_total_modelos | justificacion_quimica | estabilidad_consenso | prioridad_tesis | ranking_consenso | orden_escenario | lectura_final |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| M_pura | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9225 | 0.99 | 17.534022 | 32.323638 | 369 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 1 | 1 | variable_prioritaria_directa |
| M_pura | y_fenolico_comun | x_gcfid_p_cresol_ppm | gcfid p cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8450 | 1.00 | 15.642685 | 20.460413 | 338 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 | 1 | variable_prioritaria_directa |
| M_pura | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7750 | 1.00 | 24.734525 | 42.045187 | 310 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 | 1 | variable_prioritaria_directa |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_octanoate_ppm | gcfid ethyl octanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7375 | 1.00 | 2.319314 | 9.172334 | 295 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | alta | prioritaria | 4 | 1 | variable_prioritaria_indirecta |
| M_pura | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7275 | 0.99 | 37.006295 | 55.052583 | 291 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 | 1 | variable_prioritaria_directa |
| M_pura | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7775 | 0.86 | 4.919758 | 10.935047 | 311 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | alta | apoyo_interpretativo | 6 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_hexadecanoate_ppm | gcfid ethyl hexadecanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6575 | 0.95 | 3.386988 | 13.031065 | 263 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 7 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcms_fenolicos_pct | gcms fenolicos pct | GC-MS | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6550 | 0.87 | 4.163283 | 6.660800 | 262 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | media | apoyo_interpretativo | 8 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcfid_isoamyl_acetate_ppm | gcfid isoamyl acetate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6475 | 0.87 | 5.046469 | 13.578213 | 259 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 9 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcms_aldehidos_pct | gcms aldehidos pct | GC-MS | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6375 | 0.85 | 7.549019 | 12.781182 | 255 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 10 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcfid_furfural_ppm | gcfid furfural ppm | GC-FID | aldehidos_furanicos | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6325 | 0.94 | 5.228211 | 12.353585 | 253 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 11 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcms_esteres_pct | gcms esteres pct | GC-MS | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5900 | 0.88 | 1.959202 | 6.480310 | 236 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 12 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcfid_ethyl_decanoate_ppm | gcfid ethyl decanoate ppm | GC-FID | esteres | media_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550 | 0.83 | 2.951814 | 11.339306 | 222 | Interpretacion contextual: los esteres pueden separar perfiles de muestra, pero no son evidencia fenolica directa. | media | apoyo_interpretativo | 13 | 1 | apoyo_interpretativo |
| M_pura | y_fenolico_comun | x_gcms_aroma_fermentativo_pct | gcms aroma fermentativo pct | GC-MS | otros | no_prioritaria | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.5550 | 0.87 | 1.954869 | 6.629738 | 222 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 14 | 1 | apoyo_interpretativo |
| M_cata_individual | y_fenolico_comun | x_ju_maltose_consumption_g_l | ju maltose consumption g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9025 | 1.00 | 8.006378 | 30.130087 | 361 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 1 | 2 | variable_prioritaria_indirecta |
| M_cata_individual | y_fenolico_comun | x_gcfid_o_cresol_ppm | gcfid o cresol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.9000 | 0.96 | 30.285338 | 48.073960 | 360 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 2 | 2 | variable_prioritaria_directa |
| M_cata_individual | y_fenolico_comun | x_gcfid_4_ethyl_guaiacol_ppm | gcfid 4 ethyl guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.8250 | 0.95 | 36.219204 | 51.890138 | 330 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 3 | 2 | variable_prioritaria_directa |
| M_cata_individual | y_fenolico_comun | x_ju_final_co2_loss_g_l | ju final co2 loss g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7600 | 1.00 | 7.926664 | 31.251580 | 304 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | alta | prioritaria | 4 | 2 | variable_prioritaria_indirecta |
| M_cata_individual | y_fenolico_comun | x_gcfid_guaiacol_ppm | gcfid guaiacol ppm | GC-FID | fenoles_volatiles | alta_directa | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.7525 | 0.95 | 3.178167 | 4.341506 | 301 | Coherente: cresoles, guaiacol u otros fenoles volatiles se relacionan directamente con notas fenolicas/ahumadas. | alta | prioritaria | 5 | 2 | variable_prioritaria_directa |
| M_cata_individual | y_fenolico_comun | x_ju_ethanol_production_g_l | ju ethanol production g l | JU | fermentacion_indirecta | media_indirecta | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6675 | 0.99 | 7.855941 | 27.990514 | 267 | Interpretacion indirecta: puede capturar diferencias de fermentacion o bloque analitico, no causalidad fenolica directa. | media | apoyo_interpretativo | 6 | 2 | apoyo_interpretativo |
| M_cata_individual | y_fenolico_comun | x_gcms_area_valida_pct | gcms area valida pct | GC-MS | calidad_senal_analitica | baja_contextual | 4 | elastic_net; lasso; random_forest_restringido; ridge | 0.6425 | 0.80 | 1.917189 | 2.357022 | 257 | Debe interpretarse como asociacion estadistica exploratoria y contrastarse con literatura/criterio experto. | media | apoyo_interpretativo | 7 | 2 | apoyo_interpretativo |
La Parte 1 (Matriz 5) describió cómo se compone
M_cata_individual (la matriz pura más 18 filas de una cata
realizada por un solo catador, sin promedio de panel). Esta es la
pregunta que esa matriz busca responder: ¿el modelo predice distinto si
se agregan esas filas?
| Escenario | Modelo | MAE bootstrap | R² bootstrap |
|---|---|---|---|
M_pura (sin JU) |
Random Forest restringido | 0.271 | 0.300 |
M_cata_individual (pura + JU) |
Random Forest restringido | 0.330 | 0.758 |
El R² sube de 0.30 a 0.76 al agregar la cata JU — una mejora grande.
Pero esto no es evidencia de que la química explique mejor la
calidad fenólica: es evidencia de que un solo catador
es sistemáticamente más fácil de predecir que el promedio de un
panel (menos ruido de agregación, menos variabilidad entre
personas). Por eso la matriz pura oficial excluye esta cata — incluirla
habría inflado artificialmente el desempeño del modelo sin que la señal
química fuera realmente más fuerte. Esta comparación es, en sí misma, la
justificación metodológica de por qué M_pura es el
escenario principal y M_cata_individual solo un análisis de
sensibilidad complementario.
| indicador | valor |
|---|---|
| escenario_principal | M_pura |
| target_principal | y_fenolico_comun |
| modelo_principal | random_forest_restringido |
| mae_bootstrap_principal | 0.271 |
| r2_bootstrap_principal | 0.3 |
| spearman_bootstrap_principal | 0.553 |
| mae_bootstrap_sin_outliers_eda | 0.2708 |
| diferencia_mae_pct_por_exclusion_outliers | -1.4% |
| n_unidades_marcadas_eda_M_pura | 6 |
| grados_libertad_aprox_target_secundario | -5 |
| r2_bootstrap_target_secundario_completo | -0.1329 |
| r2_bootstrap_target_secundario_sin_outliers | -0.3293 |
| afirmacion | evidencia | fuente | fortaleza |
|---|---|---|---|
| random_forest_restringido sobre y_fenolico_comun en M_pura es el resultado predictivo principal de la tesis. | MAE bootstrap = 0.271; R2 bootstrap = 0.3; Spearman bootstrap = 0.553 (n=100 iteraciones bootstrap agrupado). | 19_comparar_escenarios_modelamiento.R (00_resumen_ejecutivo) | fuerte |
| El resultado principal (y_fenolico_comun) es robusto a las unidades quimicamente atipicas detectadas en el EDA. | MAE bootstrap completo = 0.275 vs. sin unidades marcadas por T2/Q = 0.271 (diferencia = -1.4%). | 16b_sensibilidad_outliers_quimicos.R (02_resumen_comparativo, 03_comparacion_diferencias) | fuerte |
| Las unidades marcadas como atipicas en el EDA no predicen sistematicamente peor con el modelo principal. | Residuo absoluto medio en unidades marcadas por el EDA = 0.188 vs. no marcadas = 0.261. | 17_residuos_diagnostico.R (09_resumen_cruce_outliers) | moderada |
| y_frutal_comun debe mantenerse como target secundario/exploratorio, no como resultado central. | Grados de libertad aproximados = -5 en M_pura (n_filas_modelables - n_predictores_usables, ver script 13); R2 bootstrap del modelo principal para y_frutal_comun es negativo (peor que predecir la media). | 13_diagnostico_modelamiento.R (01_viabilidad_escenarios) + 16b | fuerte |
| Las variables quimicas prioritarias son coherentes con la literatura de compuestos fenolicos volatiles. | Variables con prioridad_tesis == ‘prioritaria’: x_gcfid_guaiacol_ppm, x_gcfid_p_cresol_ppm, x_gcfid_o_cresol_ppm, x_gcfid_ethyl_octanoate_ppm, x_gcfid_4_ethyl_guaiacol_ppm (script 18, hoja 05_variables_finales_tesis). | 18_interpretabilidad_modelos.R (05_variables_finales_tesis) | moderada |
| El VIF global no es aplicable; se uso correlacion pareada y VIF por bloque como alternativa metodologica. | Ver colinealidad_modelamiento.xlsx (script 13b) y diagnostico_modelamiento.xlsx (script 13, hoja 01_viabilidad_escenarios). | 13b_colinealidad_modelamiento.R | fuerte |
** 01_predicho_vs_observado_M_pura_y_fenolico **
** 02_residuos_vs_predicho_M_pura_y_fenolico **
** 03_qqplot_residuos_M_pura_y_fenolico **
** 04_distribucion_residuos_y_fenolico **
| escenario | target | modelo | es_outlier_eda | n_predicciones | n_atipicos_residual | pct_atipicos_residual | residuo_abs_medio | lectura |
|---|---|---|---|---|---|---|---|---|
| M_cata_individual | y_fenolico_comun | elastic_net | TRUE | 10 | 0 | 0 | 0.2667 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | elastic_net | FALSE | 42 | 0 | 0 | 0.5355 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | gradient_boosting_restringido | TRUE | 10 | 0 | 0 | 0.6428 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | gradient_boosting_restringido | FALSE | 42 | 0 | 0 | 0.9339 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | lasso | TRUE | 10 | 0 | 0 | 0.2711 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | lasso | FALSE | 42 | 0 | 0 | 0.5608 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | lineal_reducido | TRUE | 10 | 0 | 0 | 0.6122 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | lineal_reducido | FALSE | 42 | 0 | 0 | 0.7758 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | media_entrenamiento | TRUE | 10 | 0 | 0 | 0.6749 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | media_entrenamiento | FALSE | 42 | 0 | 0 | 0.9369 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | pls | TRUE | 10 | 10 | 100 | 0.3851 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | pls | FALSE | 42 | 42 | 100 | 0.5531 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | random_forest_restringido | TRUE | 10 | 0 | 0 | 0.1874 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | random_forest_restringido | FALSE | 42 | 0 | 0 | 0.2974 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_fenolico_comun | ridge | TRUE | 10 | 0 | 0 | 0.3555 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_fenolico_comun | ridge | FALSE | 42 | 0 | 0 | 0.5872 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | elastic_net | TRUE | 1 | 0 | 0 | 0.4790 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | elastic_net | FALSE | 12 | 0 | 0 | 0.1162 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | gradient_boosting_restringido | TRUE | 1 | 1 | 100 | 0.4431 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | gradient_boosting_restringido | FALSE | 12 | 12 | 100 | 0.1125 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | lasso | TRUE | 1 | 0 | 0 | 0.4684 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | lasso | FALSE | 12 | 0 | 0 | 0.1047 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | lineal_reducido | TRUE | 1 | 0 | 0 | 0.4710 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | lineal_reducido | FALSE | 12 | 0 | 0 | 0.1063 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | media_entrenamiento | TRUE | 1 | 0 | 0 | 0.5278 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | media_entrenamiento | FALSE | 12 | 0 | 0 | 0.2241 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | pls | TRUE | 1 | 0 | 0 | 0.4457 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | pls | FALSE | 12 | 0 | 0 | 0.1412 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | random_forest_restringido | TRUE | 1 | 1 | 100 | 0.4258 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | random_forest_restringido | FALSE | 12 | 12 | 100 | 0.1166 | Unidades sin marca de atipico en el EDA quimico. |
| M_cata_individual | y_frutal_comun | ridge | TRUE | 1 | 0 | 0 | 0.5005 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_cata_individual | y_frutal_comun | ridge | FALSE | 12 | 0 | 0 | 0.1086 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | elastic_net | TRUE | 115 | 0 | 0 | 0.6401 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | elastic_net | FALSE | 570 | 0 | 0 | 0.7295 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | gradient_boosting_restringido | TRUE | 115 | 0 | 0 | 0.7709 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | gradient_boosting_restringido | FALSE | 570 | 0 | 0 | 0.7593 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | lasso | TRUE | 115 | 0 | 0 | 0.6409 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | lasso | FALSE | 570 | 0 | 0 | 0.7323 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | lineal_reducido | TRUE | 115 | 0 | 0 | 0.6885 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | lineal_reducido | FALSE | 570 | 0 | 0 | 0.7581 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | media_entrenamiento | TRUE | 115 | 0 | 0 | 0.7453 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | media_entrenamiento | FALSE | 570 | 0 | 0 | 0.8293 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | pls | TRUE | 115 | 0 | 0 | 0.6411 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | pls | FALSE | 570 | 0 | 0 | 0.7234 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | random_forest_restringido | TRUE | 115 | 0 | 0 | 0.6943 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | random_forest_restringido | FALSE | 570 | 0 | 0 | 0.7536 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_fenolico_comun | ridge | TRUE | 115 | 0 | 0 | 0.6416 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_fenolico_comun | ridge | FALSE | 570 | 0 | 0 | 0.7194 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | elastic_net | TRUE | 10 | 0 | 0 | 0.9458 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | elastic_net | FALSE | 108 | 0 | 0 | 0.4993 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | gradient_boosting_restringido | TRUE | 10 | 0 | 0 | 0.8164 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | gradient_boosting_restringido | FALSE | 108 | 0 | 0 | 0.4678 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | lasso | TRUE | 10 | 0 | 0 | 0.8477 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | lasso | FALSE | 108 | 0 | 0 | 0.5169 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | lineal_reducido | TRUE | 10 | 0 | 0 | 0.8350 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | lineal_reducido | FALSE | 108 | 0 | 0 | 0.4706 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | media_entrenamiento | TRUE | 10 | 0 | 0 | 0.8852 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | media_entrenamiento | FALSE | 108 | 0 | 0 | 0.5350 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | pls | TRUE | 10 | 0 | 0 | 0.9409 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | pls | FALSE | 108 | 0 | 0 | 0.4883 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | random_forest_restringido | TRUE | 10 | 0 | 0 | 0.8774 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | random_forest_restringido | FALSE | 108 | 0 | 0 | 0.4774 | Unidades sin marca de atipico en el EDA quimico. |
| M_expandida_evaluador | y_frutal_comun | ridge | TRUE | 10 | 0 | 0 | 0.9401 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_expandida_evaluador | y_frutal_comun | ridge | FALSE | 108 | 0 | 0 | 0.4989 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | elastic_net | TRUE | 3 | 0 | 0 | 0.3594 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | elastic_net | FALSE | 39 | 0 | 0 | 0.5497 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | gradient_boosting_restringido | TRUE | 3 | 0 | 0 | 0.8084 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | gradient_boosting_restringido | FALSE | 39 | 0 | 0 | 0.6177 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | lasso | TRUE | 3 | 0 | 0 | 0.5297 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | lasso | FALSE | 39 | 0 | 0 | 0.5463 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | lineal_reducido | TRUE | 3 | 0 | 0 | 0.4508 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | lineal_reducido | FALSE | 39 | 0 | 0 | 0.5317 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | media_entrenamiento | TRUE | 3 | 0 | 0 | 0.4390 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | media_entrenamiento | FALSE | 39 | 0 | 0 | 0.8443 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | pls | TRUE | 3 | 0 | 0 | 0.5309 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | pls | FALSE | 39 | 0 | 0 | 0.5518 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | random_forest_restringido | TRUE | 3 | 0 | 0 | 0.5581 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | random_forest_restringido | FALSE | 39 | 0 | 0 | 0.3921 | Unidades sin marca de atipico en el EDA quimico. |
| M_ia_exploratoria | y_fenolico_comun | ridge | TRUE | 3 | 0 | 0 | 0.3502 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_ia_exploratoria | y_fenolico_comun | ridge | FALSE | 39 | 0 | 0 | 0.5496 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | elastic_net | TRUE | 6 | 0 | 0 | 0.1361 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | elastic_net | FALSE | 28 | 0 | 0 | 0.2500 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | gradient_boosting_restringido | TRUE | 6 | 0 | 0 | 0.3639 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | gradient_boosting_restringido | FALSE | 28 | 0 | 0 | 0.3206 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | lasso | TRUE | 6 | 0 | 0 | 0.1339 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | lasso | FALSE | 28 | 0 | 0 | 0.3357 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | lineal_reducido | TRUE | 6 | 0 | 0 | 0.1831 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | lineal_reducido | FALSE | 28 | 0 | 0 | 0.2882 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | media_entrenamiento | TRUE | 6 | 0 | 0 | 0.3706 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | media_entrenamiento | FALSE | 28 | 0 | 0 | 0.4213 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | pls | TRUE | 6 | 6 | 100 | 0.2460 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | pls | FALSE | 28 | 28 | 100 | 0.2923 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | random_forest_restringido | TRUE | 6 | 0 | 0 | 0.1877 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | random_forest_restringido | FALSE | 28 | 0 | 0 | 0.2607 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_fenolico_comun | ridge | TRUE | 6 | 6 | 100 | 0.1944 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_fenolico_comun | ridge | FALSE | 28 | 28 | 100 | 0.2661 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | elastic_net | TRUE | 1 | 1 | 100 | 0.4771 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | elastic_net | FALSE | 12 | 12 | 100 | 0.0958 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | gradient_boosting_restringido | TRUE | 1 | 1 | 100 | 0.4621 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | gradient_boosting_restringido | FALSE | 12 | 12 | 100 | 0.1174 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | lasso | TRUE | 1 | 0 | 0 | 0.4690 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | lasso | FALSE | 12 | 0 | 0 | 0.1046 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | lineal_reducido | TRUE | 1 | 0 | 0 | 0.4710 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | lineal_reducido | FALSE | 12 | 0 | 0 | 0.1063 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | media_entrenamiento | TRUE | 1 | 0 | 0 | 0.5278 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | media_entrenamiento | FALSE | 12 | 0 | 0 | 0.2241 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | pls | TRUE | 1 | 0 | 0 | 0.4457 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | pls | FALSE | 12 | 0 | 0 | 0.1412 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | random_forest_restringido | TRUE | 1 | 1 | 100 | 0.4258 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | random_forest_restringido | FALSE | 12 | 12 | 100 | 0.1166 | Unidades sin marca de atipico en el EDA quimico. |
| M_pura | y_frutal_comun | ridge | TRUE | 1 | 0 | 0 | 0.4552 | Unidades ya marcadas como atipicas en el EDA quimico (T2/Q/Dixon) antes de modelar. |
| M_pura | y_frutal_comun | ridge | FALSE | 12 | 0 | 0 | 0.0994 | Unidades sin marca de atipico en el EDA quimico. |
Con la matriz pura corregida (34 filas, sin cata individual JU), la
clasificación por nombre de los compuestos GC-MS de Constanza
incorporada al pipeline (ver Parte 1, sección “Clasificación de
compuestos GC-MS por familia química”), y una corrección de
reproducibilidad en la validación bootstrap, Random Forest
restringido es el modelo principal para
y_fenolico_comun, por R² (0.30, frente a 0.05 en Ridge) y
estabilidad de error (alta, frente a media en Ridge); el MAE bootstrap
es prácticamente equivalente entre ambos (0.271 contra 0.274, una
diferencia muy por debajo de la desviación estándar del propio
bootstrap) y por lo tanto no es, por sí solo, el criterio que decide
entre uno y otro modelo. Este resultado se mantuvo estable a través de
las tres correcciones metodológicas del pipeline, lo que da confianza
adicional en que no es un artefacto de una corrida particular. Ridge y
PLS se mantienen como alternativas relevantes por su interpretabilidad y
manejo explícito de la colinealidad entre predictores químicos, algo
central en un contexto de small data con bloques analíticos no
solapados.
Sobre la corrección de reproducibilidad: antes de la corrección, la semilla aleatoria usada para el bootstrap se fijaba una sola vez al inicio del script y se reutilizaba para todos los escenarios y targets en el orden en que el código los recorría, de modo que el resultado de un escenario dependía de cuántos números aleatorios ya se habían consumido en escenarios anteriores dentro de la misma corrida (dos corridas con los escenarios en distinto orden podían dar métricas bootstrap ligeramente distintas para el mismo escenario). La corrección fija una semilla determinística por combinación escenario-target (derivada de sus nombres, no del orden de ejecución), de modo que cada escenario-target produce siempre las mismas 100 muestras de bootstrap sin importar qué otros escenarios se hayan corrido antes. Tras la corrección se verificó que correr el pipeline completo dos veces produce exactamente las mismas métricas de resumen (MAE, RMSE, R², Spearman) para cada escenario-target, confirmando que el pipeline es ahora determinístico de extremo a extremo.
Las variables más coherentes y estables para explicar la calidad
fenólica son los fenoles volátiles cuantificados por GC-FID (guaiacol,
p-cresol, o-cresol y 4-etil-guaiacol), lo que es consistente con la
química conocida del carácter ahumado/fenólico del whisky. El análisis
de sensibilidad confirma que estos resultados no dependen críticamente
de un pequeño número de observaciones atípicas: el desempeño del modelo
se mantiene comparable al excluir las unidades marcadas como atípicas en
la etapa exploratoria. Tampoco dependen críticamente de las variables
GC-MS, que tienen cobertura real baja (23.5%) dentro de
M_pura: excluirlas por completo cambia el MAE bootstrap de
Random Forest restringido en menos de un 2%.
La comparación entre escenarios aporta un hallazgo metodológico
relevante: al agregar la cata individual JU a la matriz pura
(M_cata_individual), el desempeño del modelo sube
notoriamente (R² cercano al que se observaba antes de excluir JU por
error). Esto confirma que gran parte de la señal “fácil” de versiones
anteriores del análisis provenía específicamente de la cata de un solo
evaluador, más fácil de predecir que el promedio de un panel — y
refuerza que la exclusión de JU de la matriz principal fue la decisión
metodológicamente correcta, no una pérdida de información sino una
corrección de rigor.
En conjunto, la evidencia respalda que la calidad fenólica del whisky chileno estudiado está asociada de forma identificable y razonablemente estable a un grupo acotado de compuestos fenólicos volátiles, en un contexto donde el tamaño muestral impone límites claros a la magnitud de las conclusiones: este estudio se entiende como exploratorio / prueba de concepto, no como un modelo predictivo listo para uso industrial.
M_expandida_evaluador: no mejora
sustancialmente el desempeño respecto a la matriz pura promediada; se
mantiene como evidencia complementaria, no como reemplazo.M_ia_exploratoria: catas sintéticas de
consenso IA (Gemini/Claude/GPT), presentadas siempre como escenario
exploratorio, nunca como sustituto de una cata real. Su R² bootstrap
(0.66) es notoriamente más alto que el de M_pura (0.30),
pero no debe leerse como evidencia de que la IA predice mejor la
calidad sensorial que el panel humano: en este escenario el
propio target sensorial fue generado por consenso de los mismos modelos
de lenguaje a partir de la evidencia química disponible, de modo que el
modelo predictivo tiene una tarea más fácil (recuperar la regla interna
que usaron los LLM para pasar de química a puntaje) en vez de la tarea
real (predecir la percepción de un panel humano, con todo su ruido e
idiosincrasia). El R² alto es, en gran parte, una medida de consistencia
interna del propio proceso de generación IA, no de validez predictiva
real. Con esa salvedad explícita, el escenario abre una línea futura de
uso de IA como herramienta exploratoria complementaria en investigación
sensorial de small data, no como reemplazo de evidencia sensorial
real.