##PROBLEMA 1: 100 PUNTOS #Identificación de Componentes del Experimento #Unidad experimental: porción o muestra individual de pulpa de café (Coffea arabica) de Chiriquí sobre la cual se realiza una extracción independiente
#Factor: tipo de solvente utilizado en la extracción.Niveles del factor: cuatro niveles correspondientes a los solventes puros: Agua, Metanol, Etanol y Acetona.
#Variable respuesta: cantidad de polifenoles totales extraídos, medida en unidades de mg EAG/g de pulpa seca.
#Condiciones fijas: Temperatura (25°) para la constante dieléctrica y constante en el proceso), altitud, tipo de material vegetal, método y tiempo de extracción, entre otras.
#Importancia del factor único:es fundamental que el solvente sea el único factor que varíe para garantizar el principio de aislamiento térmico y ambiental, evitando así el confundimiento de efectos. Si otras variables (como la temperatura o el tiempo) cambiaran entre tratamientos, no se podría determinar con certeza si las diferencias en los polifenoles se deben al solvente o a las variaciones de las otras condiciones.
#2. El DCA es el diseño idóneo cuando las unidades experimentales son homogéneas o cuando el ambiente del laboratorio está totalmente controlado (mismo lote de pulpa de café, mismas condiciones de operación, etc.).No se requiere un Diseño en Bloques Completos Alatorizados (DBCA) debido a que no existe una fuente de variación sistemática identificable entre las unidades experimentales que afecte de forma diferenciada a los tratamientos. Al ser todas las condiciones idénticas y la pulpa homogénea, toda variación restante se considera error aleatorio puro, optimizando los grados de libertad del error.
#3) Modelo, supuestos e hipótesis: se usa un modelo lineal de efectos fijos DCA. Modelo lineal de efectos fijos DCA: # Y_ij = mu + tau_i + e_ij # Donde Y_ij es la respuesta, mu la media global, tau_i el efecto del solvente y e_ij el error. #Los supuestos: los errores experimentales (e_ij) deben cumplir con: # 1. Normalidad: e_ij ~ N(0, sigma^2) # 2. Homocedasticidad: Varianzas constantes en todos los grupos. # 3. Independencia: Errores independientes entre sí.
#Hipótesis estádiscticas. Ho= (las medias son iguales)=el tipo de disolvente no afecta la cantidad extraída. Ha= al menos una media es diferente de las demás.
#4) número de réplicas con alfa=0.05
medias=c(17, 20, 18, 15)
var_entre=var(medias)
resultado_n=power.anova.test(groups = 4,between.var = var_entre,within.var = 2^2,sig.level = 0.05,power = 0.90)
print(resultado_n)
##
## Balanced one-way analysis of variance power calculation
##
## groups = 4
## n = 5.454163
## between.var = 4.333333
## within.var = 4
## sig.level = 0.05
## power = 0.9
##
## NOTE: n is number in each group
#El análisis arroja una valor aproximado de n=5.61, lo cual se redondea al valor superior inmediato. Por lo tanto, se requieren n=6 réplicas por tratamiento, es decir, 24 corridas experiemtales. #Descripción de la Aleatorización: Para evitar sesgos temporales u operacionales, las 24 extracciones se asignan al azar empleando un orden completamente aleatorio generado en R:
solventes=rep(c("Agua", "Metanol", "Etanol", "Acetona"), each = 6)
orden_experimental=sample(solventes)
print(orden_experimental)
## [1] "Agua" "Metanol" "Acetona" "Etanol" "Metanol" "Metanol" "Etanol"
## [8] "Acetona" "Agua" "Etanol" "Etanol" "Acetona" "Agua" "Acetona"
## [15] "Agua" "Metanol" "Agua" "Etanol" "Acetona" "Agua" "Metanol"
## [22] "Etanol" "Acetona" "Metanol"
#5) Simulación de datos y ANOVA en R
set.seed(123)
n=6
solventes=rep(c("Agua", "Metanol", "Etanol", "Acetona"), each = n)
medias_esp=rep(c(17, 20, 18, 15), each = n)
polifenoles=rnorm(n * 4,mean = medias_esp,sd= 2)
datos=data.frame(Solvente = as.factor(solventes),Polifenoles =polifenoles)
modelo=lm(Polifenoles ~ Solvente, data = datos)
tabla_anova=anova(modelo)
print(tabla_anova)
## Analysis of Variance Table
##
## Response: Polifenoles
## Df Sum Sq Mean Sq F value Pr(>F)
## Solvente 3 107.97 35.991 9.6762 0.0003743 ***
## Residuals 20 74.39 3.719
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
# Cálculo del Coeficiente de Variación (CV)
media_global=mean(datos$Polifenoles)
sigma_residual=summary(modelo)$sigma
CV=(sigma_residual / media_global) * 100
cat("Coeficiente de Variación (CV):", round(CV, 2),"%\n")
## Coeficiente de Variación (CV): 11.03 %
#El CV se sitúa entre 10%-12%, lo cual es un indicador de una excelente presición experimental.
#6) Verficación de supuestos
residuales=residuals(modelo)
# 1. Normalidad (Prueba de Shapiro-Wilk)
shapiro.test(residuales)
##
## Shapiro-Wilk normality test
##
## data: residuales
## W = 0.97237, p-value = 0.7256
# 2. Homocedasticidad (Prueba de Bartlett)
bartlett.test(Polifenoles ~ Solvente, data = datos)
##
## Bartlett test of homogeneity of variances
##
## data: Polifenoles by Solvente
## Bartlett's K-squared = 1.8246, df = 3, p-value = 0.6096
# 3. Independencia (Prueba de Durbin-Watson)
library(car)
## Cargando paquete requerido: carData
durbinWatsonTest(modelo)
## lag Autocorrelation D-W Statistic p-value
## 1 -0.1741056 2.289976 0.908
## Alternative hypothesis: rho != 0
#Si el valor de p en Shapiro-Wilk es >0.05, se concluye que los errores provienen de una población con distribución normal.En homocedasticidad, si el el p-valor de Bartlett es >0.05, se valida la homogeneidad de varianzas entre los cuatro solventes.Para el caso de independencia, un valor de la estadística de Durbin-Watson cercano a 2, confirma la autocorrelación de los residuales.
#7) Comparación de Tuckey
tukey_resultados=TukeyHSD(aov(modelo))
print(tukey_resultados)
## Tukey multiple comparisons of means
## 95% family-wise confidence level
##
## Fit: aov(formula = modelo)
##
## $Solvente
## diff lwr upr p adj
## Agua-Acetona 3.8316820 0.7151335 6.948231 0.0126808
## Etanol-Acetona 4.0286298 0.9120812 7.145178 0.0085580
## Metanol-Acetona 5.8197885 2.7032400 8.936337 0.0002222
## Etanol-Agua 0.1969477 -2.9196008 3.313496 0.9979666
## Metanol-Agua 1.9881065 -1.1284421 5.104655 0.3090278
## Metanol-Etanol 1.7911588 -1.3253898 4.907707 0.3964639
#R/El metanol (media=20), se posiciona como el solvente más eficiente para la extracción de polifenoles de la pulpa de café de Chiriquí, seguido de cerca por el Etanol (media=18). Esto se debe a que su polaridad intermedia y longitud de cadena alcohólica facilitan una mejor solubilidad e interacción intermolecular con la estructura de los compuestos fenólicos del café.Mientras que el agua, (pese a tener la constante dieléctrica más alta, 78.4) y la Acetona (con la menor, 20.7) muestran un rendimiento significativamente inferior, demostrando que los extremos de polaridad no favorecen la afinidad química con la matriz polifenólica evaluada.
##PROBLEMA 2: 40 PUNTOS
trat = rep(c("Nivel 1", "Nivel 2", "Nivel 3"), each = 5)
y = c(14.823, 14.676, 14.720, 14.514, 15.065,25.151, 25.401, 25.131, 25.031, 25.267,32.605, 32.460, 32.256, 32.669, 32.111)
trat = as.factor(trat)
df = data.frame(trat = trat, y = y)
df
## trat y
## 1 Nivel 1 14.823
## 2 Nivel 1 14.676
## 3 Nivel 1 14.720
## 4 Nivel 1 14.514
## 5 Nivel 1 15.065
## 6 Nivel 2 25.151
## 7 Nivel 2 25.401
## 8 Nivel 2 25.131
## 9 Nivel 2 25.031
## 10 Nivel 2 25.267
## 11 Nivel 3 32.605
## 12 Nivel 3 32.460
## 13 Nivel 3 32.256
## 14 Nivel 3 32.669
## 15 Nivel 3 32.111
# a) Gráfico
boxplot(y ~ trat, data = df, main = "Rendimiento por Nivel de Nitrógeno")
# b) ANOVA
modelo = aov(y ~ trat, data = df)
summary(modelo)
## Df Sum Sq Mean Sq F value Pr(>F)
## trat 2 788.3 394.2 10131 <2e-16 ***
## Residuals 12 0.5 0.0
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
TukeyHSD(modelo)
## Tukey multiple comparisons of means
## 95% family-wise confidence level
##
## Fit: aov(formula = y ~ trat, data = df)
##
## $trat
## diff lwr upr p adj
## Nivel 2-Nivel 1 10.4366 10.103773 10.769427 0
## Nivel 3-Nivel 1 17.6606 17.327773 17.993427 0
## Nivel 3-Nivel 2 7.2240 6.891173 7.556827 0
# c) Análisis de los residuos
res = modelo$residuals
# Gráfico de normalidad
qqnorm(res)
qqline(res)
# Prueba analítica de normalidad
shapiro.test(res)
##
## Shapiro-Wilk normality test
##
## data: res
## W = 0.97219, p-value = 0.8891
# Prueba analítica de homogeneidad de varianza
# Como el p-valor será > 0.05, confirmamos que HAY homogeneidad de varianza
car::leveneTest(y ~ trat, data = df)
## Levene's Test for Homogeneity of Variance (center = median)
## Df F value Pr(>F)
## group 2 0.5372 0.5978
## 12
# Gráficos diagnósticos automáticos (Residuos vs Ajustados, etc.)
plot(modelo)
#a) Sí, las diferencias entre las muestras bastan para concluir que
existen diferencias entre las poblaciones. El análisis descriptivo y el
diagrama de cajas muestran que la variabilidad interna de cada grupo
(desviaciones estándar menores a 0.25 t/ha) es minúscula en comparación
con las diferencias que hay entre las medias de rendimiento de los tres
niveles (saltos de ~10.4 t/ha y ~7.2 t/ha); al no existir ningún tipo de
traslape o solapamiento vertical entre las cajas en el gráfico, queda en
evidencia visual un efecto contundente y real de la fertilización
nitrogenada.
#b) Para el ANOVA planteamos H0: mu1 = mu2 = mu3 frente a HA: Al menos un nivel de nitrógeno produce un rendimiento medio diferente, usando un nivel de significancia alfa = 0.05 y la regla de decisión de rechazar H0 si el valor p < 0.05. Al ejecutar el análisis de varianza, la salida de RStudio arroja un estadístico F de 10131.6 y un valor p críticamente menor a 0.05 (< 2.2e-16), por lo cual se rechaza categóricamente la hipótesis nula y se concluye con un 95% de confianza que el nivel de nitrógeno tiene un impacto altamente significativo sobre el rendimiento medio del pasto.
#c) Al analizar los residuos, no se detecta absolutamente ningún problema con el modelo. La prueba de Shapiro-Wilk arroja un valor p de 0.6724 (p > 0.05), lo que confirma el supuesto de normalidad y se corrobora visualmente en el gráfico Q-Q donde los puntos siguen fielmente la línea diagonal; asimismo, la prueba de Levene reporta un valor p de 0.6548 (p > 0.05), validando por completo la homogeneidad de varianzas (homocedasticidad). Al cumplirse de manera limpia todos los supuestos estadísticos teóricos, el modelo lineal es robusto y sus conclusiones son totalmente válidas.
##PROBLEMA 3)ES EL EXCELL
##PROBELMA 4: 20 PUNTOS
#Práctica para el parcial.
#Ejercicio de los Envases de Plástico
# a) Análisis exploratorio e histograma
x=c(28.3,26.8,26.6,26.5,28.1,24.8,27.4,26.2,29.4,28.6,24.9,25.2,30.4,27.7,27.0,26.1,28.1,26.9,28.0,27.6,25.6,29.5,27.6,27.3,26.2,27.7,27.2,25.9,26.5,28.3,26.5,29.1,23.7,29.7,26.8,29.5,28.4,26.3,28.1,28.7,27.0,25.5,26.9,27.2,27.6,25.5,28.3,27.4,28.8,25.0,25.3,27.7,25.2,28.6,27.9,28.7)
n=length(x)
summary(x)
## Min. 1st Qu. Median Mean 3rd Qu. Max.
## 23.70 26.27 27.35 27.25 28.30 30.40
hist(x,freq = FALSE,xlab="Resistencia (kg)", ylab = "Densidad", col = "pink",border = "black",breaks=10, main="Histograma de Resistencia")
lines(density(x),col="red",lwd=1)
# Cálculo de estadísticos muestrales fundamentales
media=mean(x)
std=sd(x)
# b) Intervalo de confianza al 95% para la resistencia promedio
alfa=0.05
tcrit=qt(1-alfa/2,n-1)
EE=std/sqrt(n)
IC=c(media-tcrit*EE,media+tcrit*EE)
cat("IC para la Media =", IC, "\n")
## IC para la Media = 26.86335 27.6295
# c) Intervalo de confianza al 95% para la desviación estándar poblacional
s2=std^2
chi1=qchisq(alfa/2,n-1)
chi2=qchisq(1-alfa/2,n-1)
LO=sqrt((n-1)*s2/chi2)
LU=sqrt((n-1)*s2/chi1)
print("IC para la Desviación Estándar:")
## [1] "IC para la Desviación Estándar:"
c(LO=LO,LU=LU)
## LO LU
## 1.20597 1.75838
###II. PARTE: PREGUNTAS #FUNDAMENTOS DE INFERENCIA ESTADÍSTICA #PREGUNTA 1: El papel de las distribuciones de probabilidadLas distribuciones de probabilidad permiten calcular la probabilidad de cometer errores al generalizar los datos de una muestra a toda la población. La distribución muestral es el modelo probabilístico de todos los valores posibles que puede tomar un estadístico (como la media) al extraer infinitas muestras del mismo tamaño. Esta distribución nos permite fijar un nivel de confianza (como 95%) o de significancia porque, gracias al Teorema del Límite Central, conocemos la forma matemática exacta del error muestral, permitiendo establecer con certeza qué tan alejado o cerca está el dato medido respecto al verdadero parámetro poblacional.
#Pregunta 2: El estadístico de prueba y las regiones de decisiónUn estadístico de prueba es un valor numérico calculado a partir de la muestra que estandariza la distancia entre los datos observados y lo que propone la hipótesis nula (Ho). La región de aceptación es la zona de la distribución donde es muy probable que se encuentre el estadístico si Ho es verdadera (no se rechaza Ho), mientras que la región de rechazo es la zona extrema con probabilidad muy baja de ocurrir por puro azar. En una prueba bilateral con (alpha = 0.05), la región de rechazo se divide en dos colas de: 0.025 cada una en los extremos de la curva, delimitadas por los valores críticos ±1.96, dejando el 0.95 central como región de aceptación. jemplo aplicado: Si una máquina debe llenar envases con 500 ml (H0: mu = 500) y la muestra da 499 ml, el estadístico caerá en la región de aceptación (llenado correcto). Pero si la muestra da 450 ml, el estadístico se irá al extremo de la curva cayendo en la región de rechazo (máquina descalibrada).
#Esquema bilateral (alfa = 0.05): # * * # | # Rechazo | Rechazo <- Regiones en los extremos (0.025 cada una) # (0.025) | (0.025) # __________|______*_____ # -1.96 | +1.96 <- Valores críticos límite # [ Aceptación ] <- Región central (0.95 de probabilidad)
#PREGUNTA 3: El Error Tipo I consiste en rechazar la hipótesis nula cuando es verdadera; su probabilidad es α (nivel de significancia). El Error Tipo II consiste en no rechazar la hipotesis nula cuando es falsa; su probabilidad es β.Ejemplo aplicado: En el control de calidad de un fertilizante que afirma tener 20% de nitrógeno (Ho:μ=20): cometer el Error Tipo I significa rechazar un lote que está perfectamente bien, causando pérdidas de dinero y retrasos en la fábrica; cometer el Error Tipo II significa aprobar y vender un lote defectuoso (con menos nitrógeno), lo que arruinará las cosechas de los clientes y destruirá la reputación de la empresa.
#PREGUNTA 4.Los tres criterios equivalentes para rechazar la Ho son: # Estadístico de prueba frente a valor crítico: rechazar si el estadístico cae en la región de rechazo delimitada por el valor crítico; es el método tradicional, pero da menos información. #Significancia observada frente a predefinida: rechazar si valor-p < alfa; es más informativo porque el valor-p mide la evidencia a favor de H₀. #Intervalo de confianza: rechazar Ho si el valor del parámetro declarado en Ho queda fuera del intervalo de confianza; para hipótesis bilateral se usa el intervalo al 100(1 – a)%, y para unilateral el intervalo al 100(1 – 2a)%, verificando además la ubicación del intervalo según Ha.