Análisis de Componentes Principales por ligas

Contexto

Tenemos los siguientes datos:

3. Confusión de variables: El artículo no distingue adecuadamente entre los efectos de la liga frente a los efectos de la nacionalidad. Los jugadores brasileños en la Ligue 1 pueden exhibir patrones ofensivos no por su nacionalidad, sino porque la Ligue 1 atrae a delanteros brasileños. Análisis de regresión con términos de interacción habrían aclarado este punto.” (se modifico el enfoque a ligas)

Para las ligas tenemos la siguiente distribución:


    Chi-squared test for given probabilities

data:  tablechi
X-squared = 2382.2, df = 9, p-value < 2.2e-16

Se realizó la prueba chi-cuadrado para verificar diferencias significativas en las frecuencias de las ligas, con un valor p menor que 0,05, lo que indica que existen diferencias.

2. Sesgo de selección no abordado: Los jugadores con tiempo de juego reducido pueden tener métricas distorsionadas si no se ajustan por los minutos jugados. Este ajuste fortalecería el análisis.

  1. Usar solo observaciones entre jugadores que jugaron el partido completo (“Cada observación correspondió a una aparición de partido completo por un jugador…”) puede distorsionar seriamente las características de las ligas.”

Para evitar el sesgo de selección no abordado, observamos el comportamiento de los partidos jugados

   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
   1.00    5.00   13.00   11.83   18.00   23.00 

Dado que el Q1 está en 5 partidos, se establece un umbral mínimo absoluto, por lo que se eliminan del análisis los jugadores con menos de 5 partidos.

Jugadores totales en la muestra: 2689 
Jugadores después del filtro (>=  5  partidos): 2066 
Porcentaje de jugadores descartados por bajo numero de partidos: 23.17 % 

--- Resumen de Partidos ANTES del filtro ---
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
   1.00    5.00   13.00   11.83   18.00   23.00 

--- Resumen de Partidos DESPUÉS del filtro ---
   Min. 1st Qu.  Median    Mean 3rd Qu.    Max. 
   5.00   11.00   16.00   14.75   19.00   23.00 

Tratamiento de datos

1. Falta de claridad en la limpieza de datos: Aunque se menciona, no hay detalles sobre los criterios de exclusión, el tratamiento de valores atípicos (outliers) o la imputación de datos faltantes. Esto debe ser explícito.

Tenemos las siguientes categorias de variables

Table 3. Variable groups.

Analizamos las variables según su grupo. Como ejemplo, tenemos PartidosPartidos con las variables indicadas en la tabla 3.

Realizamos la prueba de normalidad. Aquellas que cumplen el supuesto se analizan por medio de la correlación de Spearman, y las que no, mediante la correlación de Kendall. Las variables con alta correlación son excluidas, ya que en la gráfica mostrarían superposiciones al generar vectores linealmente dependientes.

       Variable      P_Valor Cumple_Normalidad
Age         Age 6.144820e-14         No Cumple
MP           MP 9.725529e-27         No Cumple
Starts   Starts 3.112544e-24         No Cumple
Min         Min 1.381510e-21         No Cumple
90s         90s 1.334049e-21         No Cumple

El umbral de correlacion 0.9 o mayores, se elige a partir del criterio del investigador y de distintas pruebas con varios valores que generaron distinto tipos de graficas no aptas para interpretacion a causa de superposiciones. Para este caso, las variables de alta correlacion son “Min”, “90s” y “Starts”, por tanto tomamos las variables restantes como representantes de ese grupo, el proceso se repite para todos los grupos, generando asi una depuracion 118 variables a 66.

Luego a estas 66 variables se volvio a practicar pruebas de normalidad, ninguna cumplio, se realizo entonces correlacion de kendall

8.2. No está del todo claro qué métricas se consideran defensivas y cuáles ofensivas en el estudio. Claramente hay algo mal con la Tabla 1.

La métrica “Cor_Sum” presentada en la Tabla 1 necesita aclararse: qué significa y cómo se calculó. ¿Suma las correlaciones de una variable dada con las demás (para evaluar redundancia), o mide la relación con la afiliación a la liga? Esta información debe ser inequívoca.

3.Además, ¿por qué se eligieron exactamente 10 métricas? ¿Cambiaría el resultado del estudio si se eligiera un número diferente de métricas (15 o 20, por ejemplo)?

7.Hay una columna etiquetada como “Cor_Sum”. Por favor, especifique qué significa este término en la descripción de la tabla. ”

Evaluacion de redundancia(Cor_num)

Se calculo a partir de la la suma de los valores absolutos de los coeficientes de correlación de Kendall de una variable *i* con el resto de las variables *j* incluidas en la matriz de correlación

cor_sums <- rowSums(abs(matriz_cor_f), na.rm = TRUE)

Los grupos de variables, a su vez, pertenecen a tres grandes categorías, definidas a criterio del investigador: las que miden acciones de defensa, las que miden acciones de ataque y las mixtas. Separamos entonces las obtenidas en estas tres categorías y luego tomamos las 10 con las redundancias más bajas de cada categoría. Tomar un número diferente de variables agregaría más vectores a las gráficas, que podrían generar ruido al momento de las interpretaciones.

Table 4. Mixed Variables.
Table 5. Defensive Variables.
Table 6. Attack Variables.

Análisis de Componentes principales Defensa

“4. Interpretación superficial del ACP: La asociación entre la Ligue 1 y la orientación ofensiva es descriptiva, no causal. Se necesitarían análisis de varianza (ANOVA) o modelos multinivel para probar la significancia estadística.”

Realizamos entonces un análisis para las variables de defensivas por liga, primero correlacion entre sus cruces y luego por ligas:

Realizamos el análisis de componentes principales

Rotacional

Se muestra a continuación la matriz de rotación, que indica cuánto contribuye cada variable original a cada componente principal. Los valores (cargas) oscilan entre -1 y 1; cuanto mayor sea su valor absoluto, mayor será la contribución de la variable al componente.

En el caso de la dimensión 1, observamos que las cargas más altas son todas positivas y corresponden a Tkl+Int (0,51), Tkl (0,44), Int (0,43), TklDriAtt (0,40), Clr (0,30) y BlkSh (0,28). Esto implica que los valores elevados en este componente se asocian a un mayor volumen de acciones defensivas de interrupción y despeje, por lo que lo denominaremos “volumen e intensidad defensiva directa”.

En cuanto a la dimensión 2, las cargas positivas más altas corresponden a Clr (0,44), BlkSh (0,41) y AerWon (0,40), mientras que las negativas más destacadas son ToTkl (-0,43), TklDriAtt (-0,30) y Tkl (-0,27). Por lo tanto, los valores positivos de esta dimensión reflejan un perfil defensivo basado en acciones aéreas y bloqueos, mientras que los valores negativos reflejan un perfil basado en duelos en el suelo y presión directa, lo denominaremos Calidad/Estilo del trabajo defensivo.

                  PC1         PC2
AerWon     0.07707036  0.40474463
AerLost   -0.01505455  0.18772886
Age       -0.08406872  0.24694898
MP        -0.08966885  0.01737303
ToTkl     -0.07235159 -0.43004050
Clr        0.29745303  0.43550767
Tkl+Int    0.51152488 -0.15706240
Tkl        0.44479789 -0.27077888
Int        0.43445139  0.08160001
BlkSh      0.28187930  0.41430653
TklDriAtt  0.39661770 -0.29791610
Table 7. PCA Rotational.

Varianza

El componente principal 1 (PC1) explica el 31,27 % de la varianza total del conjunto de variables defensivas, mientras que el componente 2 (PC2) explica el 19,66 %. En conjunto, las dos primeras dimensiones retienen el 50,93 % de la varianza total, esto se debe a una alta variabilidad en los datos y conteos de acciones con distribuciones asimétricas, se puede decir centrarse en las dos primeras dimensiones permite una interpretación que no pierde una cantidad sustancial de información, facilitando la discusión de los perfiles defensivos en términos de “volumen” (PC1) y “estilo” (PC2).

La grafica de proporcion de varianza nos muestra, a partir del tercer componente, esta cae por debajo del 15 % (PC3 = 14,96 %), y el resto de componentes aportan cada vez menos información relevante (PC4 = 8,9 %, PC5 = 7,9 %…).

                            PC1      PC2
Standard deviation     1.854776 1.470419
Proportion of Variance 0.312750 0.196560
Cumulative Proportion  0.312750 0.509300

Graficas PCA

Análisis por jugador

En el análisis de componentes principales sobre variables defensivas no se observa un comportamiento marcado de alguno de los conjuntos de puntos, es decir no hay una separación clara entre los jugadores de las cinco grandes ligas europeas. Los centroides de las ligas se agrupan en una región reducida del plano (PC1 entre –0.20 y 0.31; PC2 entre –0.32 y 0.12), y las nubes de puntos individuales se superponen. Podemos decir entonces que las variables de defensa aumenten o disminuyan, no dependerán de la liga en la que se esté compitiendo. Solo se observa una ligera tendencia de la Ligue 1 hacia un mayor volumen de acciones defensivas y un menor énfasis en el juego aéreo, aunque esta diferencia es pequeña.

# A tibble: 5 × 3
  Comp            PC1_mean PC2_mean
  <fct>              <dbl>    <dbl>
1 Bundesliga     -0.000665   0.118 
2 La Liga        -0.203      0.109 
3 Ligue 1         0.309     -0.323 
4 Premier League  0.0212     0.0570
5 Serie A        -0.121      0.0554

Análisis por ligas

Vemos que ciertas variables se acercan a ciertas ligas, es decir, que en esas ligas, sus medias son altas tenemos: Ligue 1 se ubicará hacia la derecha del biplot, en la dirección de las flechas de Tkl, Int, Tkl+Int y probablemente ToTkl (regates defensivos intentados). Esto confirma que, en promedio, la Ligue 1 es la liga más intensa en recuperación de balón y duelos en el suelo.

La Liga y Serie A se ubicarán hacia la zona donde apuntan las flechas de AerWon (duelos aéreos ganados) y Clr (despejes), y quizás Age (mayor edad defensiva), indicando un perfil más posicional y aéreo.

Bundesliga y Premier League quedaron en una posición intermedia, sin un sesgo claro hacia ningún extremo, confirmando que sus promedios defensivos son muy similares a las demás ligas.

par(mar=c(1,1,1,1))
biplot(brand.mu.pc , main="Lagues vs defensive variables" , cex=c(0.55 , 0.55))

Análisis de cosenos cuadrados

Este gráfico nos indica para cuáles variables tienen mayor peso las interpretaciones alcanzadas, en función de su contribución a la explicación de la varianza en las dimensiones determinadas. A mayor valor del coseno cuadrado, mayor relevancia tendrá esa variable en la discusión de los resultados.

Las variables con los cosenos cuadrados más altos fueron Tkl+Int (0,286), Clr (0,278), Tkl (0,271), BlkSh (0,251) y TklDriAtt (0,246), lo que señala que estas cinco variables describen adecuadamente la estructura subyacente de las acciones defensivas.

Por el contrario, los valores más bajos de cos2 corresponden a MP (0,008), AerLost (0,035) y Age (0,068). En consecuencia, las interpretaciones de sus posiciones en el biplot no deben considerarse representativas, ya que su variabilidad no queda explicada satisfactoriamente por los componentes principales aquí generados.

Table 8. PCA Cos^2.

Análisis anova

Para contrastar si las diferencias observadas en las puntuaciones de los componentes principales entre las cinco grandes ligas europeas alcanzan significancia estadística, se presentan los resultados de los análisis de varianza (ANOVA) realizados a la dos primeras dimensiones.

Table 9. PCA Anova.

Para PC1 y PC2 se encontraron diferencias significativas entre ligas. Sin embargo, el tamaño del efecto, medido mediante eta cuadrado, fue de 0,0091 para PC1 y de 0,0128 para PC2. Según los criterios de Cohen, estos valores se consideran muy pequeños o pequeños, lo que indica que la pertenencia a una liga explica menos del 1,3 % de la varianza total en ambos componentes. En consecuencia, la variabilidad defensiva está determinada fundamentalmente por factores individuales o tácticos internos a cada competición, y no por la pertenencia a una liga específica, las interpretaciones obtenidas deben considerarse como descriptivas y no inferenciales.

Análisis post-hoc

“10.Presentación y Análisis de Resultados – Prueba de Hipótesis: En su forma actual, los resultados se basan principalmente en la interpretación descriptiva de los gráficos ACP (distribución de observaciones y cargas de variables). Para aumentar la fuerza probatoria del trabajo, se recomienda complementar los resultados con pruebas estadísticas o métricas que confirmen las diferencias entre grupos. Por ejemplo, después de realizar el ACP, se puede probar si las ligas individuales o los grupos de nacionalidad difieren significativamente en sus valores de componentes principales (PC1, PC2) – por ejemplo, usando ANOVA o pruebas post-hoc – y proporcionar tamaños del efecto. Actualmente, el lector debe confiar en la evaluación subjetiva de los gráficos, lo que puede plantear dudas sobre la significancia de las diferencias observadas. También es aconsejable proporcionar valores numéricos específicos que ilustren las diferencias (por ejemplo,”los jugadores de la Ligue 1 realizan en promedio un X% más de acciones ofensivas que los jugadores de la Premier League en nuestro conjunto de datos”, si se hicieron tales comparaciones). Esto hará que las conclusiones sean más específicas y convincentes. Si la hipótesis del estudio era la existencia de diferencias técnicas y tácticas medibles dependiendo de la liga y la nacionalidad (como implica el objetivo del estudio), los resultados deben probar directamente esta hipótesis o refutarla claramente. Es importante asegurarse de que la narrativa de los resultados aborde la pregunta de investigación y no simplemente presente una imagen general de los datos.”

Las medias de las puntuaciones en los componentes principales para cada liga nos dicen que la Ligue 1 presentó la media más alta en, mientras que La Liga mostró la más baja. Las pruebas post‑hoc de Tukey revelaron que la Ligue 1 difiere significativamente de La Liga y de la Serie A en PC1, con diferencias medias de 0.512 y 0.430 unidades, respectivamente, esto se interpeta como que los jugadores de la Ligue 1 presentan, en promedio, un 25 % más de acciones defensivas de recuperación (entradas + intercepciones + despejes) que los de La Liga. En PC2, la Ligue 1 también se diferenció significativamente de la Bundesliga y de la Premier League , con una media más negativa, lo que indica un perfil defensivo menos aéreo y más orientado a duelos en el suelo en comparación con esas ligas. El tamaño del efecto global confirma que estas diferencias, pueden llegar a ser estadísticamente significativas, pero explican una proporción muy reducida de la varianza total.

Table 10.Mean and SD PCA.
Table 11.Post Hoc.

Análisis de Componentes principales ataque

Realizamos el análisis para variables de ataque, primero mostramos la correlacion entre sus cruces y luego por ligas:

Realizamos el análisis de componentes principales

Rotacional

Se muestra a continuación la matriz de rotación del análisis de componentes principales para las variables ofensivas. En la dimensión 1, observamos que todas las cargas son negativas y de magnitud muy similar, oscilando entre -0,32 (Car3rd) y -0,42 (RecProg). Las cargas más altas en valor absoluto corresponden a RecProg (-0,42), TouAtt3rd (-0,40), ToAtt (-0,38) y TouAttPen (-0,38). Dado que todas las variables contribuyen con el mismo signo y una intensidad comparable, este componente no separa distintos tipos de ataque, sino que mide el volumen global de participación ofensiva se denomina “volumen de implicación ofensiva”. La dimensión 2, presenta un marcado carácter bipolar que diferencia dos estilos ofensivos claramente opuestos. Las cargas positivas más altas corresponden a Car3rd (0,72), TouAtt3rd (0,20) y ToAtt (0,19). Por su parte, las cargas negativas más destacadas son TouAttPen (-0,48), CarMis (-0,38), CPA (-0,13) y RecProg (-0,04). En consecuencia, los valores positivos de esta dimensión reflejan un perfil ofensivo basado en la progresión y presencia en el último tercio, acciones que alcanzan el tercio ofensiv, sin llegar al área. Los valores negativos, muestran acciones de penetración y finalización en el área rival, se denomina “estilo ofensivo: progresión fuera del área vs dentro del área”.

                 PC1         PC2
TouAtt3rd -0.3962821  0.10620568
RecProg   -0.4215129 -0.06179368
ToAtt     -0.3802549  0.22952362
CarMis    -0.3663332 -0.43673495
CPA       -0.3565874 -0.04217691
Car3rd    -0.3276646  0.74010743
TouAttPen -0.3898394 -0.43811583
Table 12. PCA attack rotational.

Varianza

La componente principal 1 (PC1) explica el 69,10 % de la varianza total del conjunto de variables ofensivas, mientras que la componente 2 (PC2) explica el 11,38 %. En conjunto, las dos primeras dimensiones retienen el 80,48 % de la varianza total.

                            PC1       PC2
Standard deviation     2.186426 0.8656792
Proportion of Variance 0.682920 0.1070600
Cumulative Proportion  0.682920 0.7899800

Graficas PCA

Análisis por jugador

En el análisis de componentes principales sobre las variables ofensivas, no se observa un comportamiento marcado de alguno de los conjuntos de puntos, es decir no hay una separación clara entre los jugadores de las cinco grandes ligas europeas.

# A tibble: 5 × 3
  Comp           PC1_mean PC2_mean
  <fct>             <dbl>    <dbl>
1 Bundesliga      0.00518  -0.241 
2 La Liga         0.145     0.0584
3 Ligue 1        -0.184     0.188 
4 Premier League -0.0659   -0.0244
5 Serie A         0.0941   -0.0130

Análisis por ligas

Vemos que ciertas variables ofensivas se asocian a ligas concretas, lo que indica que en esas competiciones las medias de dichas variables son más elevadas. La Ligue 1 se proyecta hacia el extremo negativo de PC1, en la dirección de las flechas de TouAttPen (toques en el área penal) y CarMis (pérdidas de balón en conducción). Esto indica que, en promedio, la Ligue 1 es la liga con mayor volumen de penetración en el área rival, aunque con una mayor frecuencia de pérdidas en las conducciones ofensivas.

La Bundesliga se sitúa en el extremo positivo de PC2, en la dirección de Car3rd (conducciones en el último tercio) y, en menor medida, ToAtt (regates intentados), lo que refleja un perfil ofensivo basado en la progresión externa y la conducción sin llegar a penetrar masivamente en el área penal.

La Liga y Serie A se posicionan en el lado opuesto de la Ligue 1 en el eje de volumen ofensivo (PC1), lo que sugiere que presentan los menores volúmenes de acciones ofensivas entre las cinco ligas, con una menor frecuencia de toques en el área y recepciones progresivas.

La Premier League ocupa una posición intermedia en ambos ejes, sin un sesgo claro hacia ningún extremo, lo que indica que su perfil ofensivo promedio se asemeja al conjunto global de las ligas analizadas.

Análisis de cosenos cuadrados

Para la explicación de contribución de varianza en el análisis de variables de ataque los más altos fueron Car3rd (0,629), TouAttPen (0,377), CarMis (0,276), TouAtt3rd (0,203) y ToAtt (0,183), lo que indica que estas variables describen adecuadamente las acciones ofensivas, se destaca Car3rd, cuyo cos2 de 0,629 indica que más del 60 % de su variabilidad queda explicada. RecProg (0,179) y CPA (0,154) presentan los valores más bajos de cos2, esto nos dice que todas las variables ofensivas incluidas cuentan con una representación aceptable en el plano PC1–PC2.

Table 13. PCA attack Cos^2.

Análisis Anova

                                         Componente gl SS_factor SS_residual
1                            PC1 (Volumen ofensivo)  4    34.000    9955.000
2 PC2 (Estilo ofensivo: progresión vs. penetración)  4    57.188    4407.615
      F p_formateado eta_cuadrado    interpretacion_eta
1 1.740        0.138       0.0034  Muy pequeño (< 0.01)
2 6.685      < 0.001       0.0128 Pequeño (0.01 - 0.05)
Table 14.PCA attack - ANOVA.

En el componente PC1 (Volumen ofensivo) **no se encontraron diferencias significativas entre ligas, con un tamaño del efecto muy pequeño. Esto indica que el volumen global de acciones ofensivas (toques en el último tercio, recepciones progresivas, regates, etc.) no difiere de manera estadísticamente significativa entre las cinco grandes ligas, y que las ligeras diferencias observadas en los gráficos son descriptivas y no infieren variabilidad interna de cada competición.

En el componente PC2 (Estilo ofensivo: progresión externa vs. penetración interna), sí se encontraron diferencias significativas entre ligas, con un tamaño del efecto pequeño, según los criterios de Cohen, lo que indica que la pertenencia a una liga explica solo el 1,28 % de la varianza total en este componente, mientras que el 98,72 % restante corresponde a factores individuales o tácticos internos a cada equipo.

Análisis Post-hoc

Las medias de las puntuaciones en el componente principal PC2 (Estilo ofensivo: progresión externa vs. penetración interna) para cada liga muestran que la Bundesliga presentó la media más negativa (PC2 = -0,241), lo que indica un perfil ofensivo orientado a la penetración en el área rival (mayores toques en el área penal, pases al área tras conducción y pérdidas en conducción). La Ligue 1 mostró la media más positiva (PC2 = 0,178), reflejando un estilo basado en la progresión externa y conducciones en el último tercio, con menor presencia en el área penal. La Liga (0,071), Premier League (-0,032) y Serie A (-0,008) ocuparon posiciones intermedias.

Las pruebas post-hoc de Tukey revelaron que, en el componente PC2, todas las ligas difieren significativamente de la Bundesliga. En concreto:

  • La Liga presenta una diferencia media de 0,311 unidades (p < 0,001), lo que indica un perfil significativamente más orientado a la progresión externa que la Bundesliga.
  • Ligue 1 presenta una diferencia de 0,419 (p < 0,001), confirmando su marcado estilo de conducción en el último tercio frente a la penetración en área de la Bundesliga.
  • Premier League presenta una diferencia de 0,209 (p = 0,009), también con mayor progresión externa.
  • Serie A presenta una diferencia de 0,233 (p = 0,002), con el mismo patrón.

Además, se observan diferencias significativas entre la Ligue 1 y la Premier League (diferencia = -0,210, p = 0,006), y entre la Ligue 1 y la Serie A (diferencia = -0,185, p = 0,018). En ambos casos, la Ligue 1 presenta un perfil de progresión externa significativamente mayor que la Premier League y la Serie A, que se sitúan más cerca del polo de penetración en área.

Estos resultados indican que la Bundesliga es la liga con un estilo ofensivo más orientado a la penetración en el área penal, mientras que la Ligue 1 destaca por su juego de conducción y progresión externa en el último tercio. Sin embargo, el tamaño del efecto global ((^2 = 0,0128)) confirma que, aunque estas diferencias son estadísticamente significativas, explican una proporción muy reducida de la varianza total (solo el 1,28 %), por lo que la variabilidad dentro de cada liga sigue siendo predominante.

Table 15.Mean and SD PCA.
Table 16.Post Hoc.

Ficha tecnica

” 6.Todos los análisis estadísticos se realizaron utilizando RStudio (versión 4.1.0; RStudio, Inc., Boston, MA, EE. UU.), con un nivel de significancia establecido en p < 0.05”. Sin embargo, el análisis principal del estudio (ACP) es una técnica exploratoria no inferencial y no proporciona pruebas de significancia. Por lo tanto, el nivel de significancia reportado (p < 0.05) no se aplica a los resultados basados en el ACP y no puede respaldar las afirmaciones inferenciales hechas en la sección de Resultados.

Todos los análisis estadísticos se realizaron utilizando RStudio (versión 4.6.0; RStudio, Inc., Boston, MA, EE. UU.). El análisis de componentes principales (ACP) se empleó como técnica exploratoria de reducción de dimensionalidad y visualización de patrones, por lo que no se le aplicaron pruebas de significancia. Para contrastar si las diferencias observadas en las puntuaciones de los componentes entre ligas eran estadísticamente significativas, se realizaron análisis de varianza (ANOVA) complementarios, con un nivel de significancia establecido en p < 0.05. Las diferencias post-hoc se evaluaron mediante la prueba HSD de Tukey.