В последние годы в образовательных исследованиях все большее внимание уделяется изучению факторов, влияющих на академическую успеваемость учащихся. Одним из ключевых аспектов, оказывающих значительное воздействие на образовательные достижения, является социально-экономический статус семьи. В рамках данного исследования мы стремимся оценить влияние экономического статуса семьи на академическую успеваемость учащихся, используя данные международной программы оценки учащихся (PISA) 2022 года. Программа PISA, координируемая Организацией экономического сотрудничества и развития, представляет собой крупномасштабное исследование, направленное на оценку образовательных систем во всем мире путем тестирования навыков и знаний учащихся в возрасте 15 лет. Социально-экономический статус включает в себя такие параметры, как доход семьи, образование и профессиональное положение родителей. Основываясь на данных анкетирования и академических оценках, данное исследование стремится выявить, как различные аспекты социально-экономического статуса влияют на успеваемость учащихся в школьных предметах, таких как математика и социальные науки. Можно сформулировать основную цель исследования — определить, какие факторы социально-экономического статуса оказывают наибольшее воздействие на учебные достижения. Это может служить основой для разработки образовательных программ и стратегий. Объектом исследования является взаимосвязь социально-экономического статуса семей и академической успеваемости учащихся. Предмет исследования охватывает анализ как прямых, так и косвенных факторов, таких как доход семей учащихся, образование родителей, а также более широкие социальные показатели, такие как уровень занятости родителей.
Настоящее исследование также предусматривает использование таких статистических и эконометрических методов, как ANOVA, корреляционный анализ, линейная множественная регрессия и кластерный анализ, для группировки учащихся с целью выявления образовательных и социальных характеристик.
В современном образовательном дискурсе вопросы социальной справедливости и равенства доступа к качественному образованию занимают центральное место. Многие исследования подчеркивают значительное влияние социально-экономического статуса на образовательные достижения учащихся. Например, исследование равенства образовательных возможностей (Coleman, 1966), также известное как «Исследование Коулмана», было проведено по заказу Министерства здравоохранения, образования и социального обеспечения США в 1966 году для оценки доступности равных образовательных возможностей для детей разной расы, цвета кожи, религии и национального происхождения. Это исследование было проведено в ответ на положения Закона о гражданских правах 1964 года и служит примером использования социального опроса в качестве инструмента разработки национальной политики. В некоторых исследованиях анализируются механизмы, через которые социально-экономические различия транслируются в академические результаты (Reardon, 2011; Sirin, 2005). В отличие от многих исследований, фокусирующихся на оценке прямого влияния дохода на образование, данное исследование применяет комплексный подход, объединяющий как количественные, так и качественные методы для оценки широкого спектра социально-экономических факторов. Особенностью является использование аналитических методов (например, кластерный анализ) для группировки учащихся и выявления скрытых характеристик (Bradley & Corwyn, 2002; McLoyd, 1998). Это позволяет более глубоко понять динамику образовательных результатов и предлагает новые подходы к образовательной политики (Jensen, 2009; Bourdieu & Passeron, 1990).
library(haven)
data <- read_sav("CY08MSP_SCH_QQQ.SAV")
Для исследования влияния экономического статуса семьи на академическую успеваемость учащихся будем использовать данные PISA 2022. Для начала определим перечень переменных. Экономический статус и социальный контекст учащихся лучше всего позволят проанализировать следующие переменные:
library(dplyr)
##
## Attaching package: 'dplyr'
## The following objects are masked from 'package:stats':
##
## filter, lag
## The following objects are masked from 'package:base':
##
## intersect, setdiff, setequal, union
selected_data <- data %>%
select(SC013Q01TA, SC178Q01JA, SC178Q02JA, SC177Q01JA, SC177Q02JA, STRATIO,
SC011Q01TA, SC002Q01TA, TOTMATH, PROPMATH, SC185Q01WA, SC185Q02WA) %>%
na.omit() %>%
mutate(
SC013Q01TA = as.factor(SC013Q01TA),
SC177Q01JA = as.factor(SC177Q01JA),
SC177Q02JA = as.factor(SC177Q02JA),
SC011Q01TA = as.factor(SC011Q01TA),
SC002Q01TA = as.numeric(SC002Q01TA),
SC178Q01JA = as.numeric(SC178Q01JA),
SC178Q02JA = as.numeric(SC178Q02JA),
STRATIO = as.numeric(STRATIO),
TOTMATH = as.numeric(TOTMATH),
PROPMATH = as.numeric(PROPMATH),
SC185Q01WA = as.numeric(SC185Q01WA),
SC185Q02WA = as.numeric(SC185Q02WA)
)
str(selected_data)
## tibble [14,820 × 12] (S3: tbl_df/tbl/data.frame)
## $ SC013Q01TA: Factor w/ 2 levels "1","2": 1 1 2 1 1 1 1 1 1 1 ...
## $ SC178Q01JA: num [1:14820] 95 90 90 84 100 73 80 97 90 95 ...
## $ SC178Q02JA: num [1:14820] 5 10 10 16 0 27 20 3 10 5 ...
## $ SC177Q01JA: Factor w/ 4 levels "1","2","3","4": 3 1 3 3 3 4 1 3 4 4 ...
## $ SC177Q02JA: Factor w/ 4 levels "1","2","3","4": 4 3 3 3 3 4 4 3 4 4 ...
## $ STRATIO : num [1:14820] 16.94 11.44 7.12 16.91 11.74 ...
## $ SC011Q01TA: Factor w/ 3 levels "1","2","3": 3 2 1 1 1 2 3 1 3 1 ...
## $ SC002Q01TA: num [1:14820] 303 88 74 583 166 249 153 177 177 123 ...
## $ TOTMATH : num [1:14820] 5 3 2 8 2 4 3 6 4 2 ...
## $ PROPMATH : num [1:14820] 0.1299 0.1875 0.1176 0.126 0.0741 ...
## $ SC185Q01WA: num [1:14820] 2 1 2 2 1 2 1 1 1 1 ...
## $ SC185Q02WA: num [1:14820] 1 1 1 1 1 1 2 1 1 1 ...
## - attr(*, "na.action")= 'omit' Named int [1:6809] 11 16 25 40 41 56 60 78 90 98 ...
## ..- attr(*, "names")= chr [1:6809] "11" "16" "25" "40" ...
SC013Q01TA - тип школы – государственная (1) и частная (2). SC178Q01JA - процент учащихся, получивших отметки по математике на уровне проходной балл или выше. SC178Q02JA - процент учащихся, получивших отметки по математике на уровне проходной балл или ниже SC177Q01JA - уровень образования матери по ISCED SC177Q02JA - уровень образования отца по ISCED STRATIO - соотношение учеников и учителей (Более низкое соотношение часто указывает на лучшее внимание к каждому ученику, что может быть связано с лучшими учебными результатами и может зависеть от социально-экономического статуса). SC011Q01TA - занятость матери (Может быть важным показателем социально-экономического статуса). SC002Q01TA - доход семьи (Прямой показатель социально-экономического статуса, отражающий финансовое состояние семьи). TOTMATH - средний балл по математике в школе (Поможет понять общие академические результаты школы по математике). PROPMATH - доля учащихся школы, достигших базового уровня владения математикой (Напрямую связана с академическими результатами и может быть подвержена влиянию социально-экономических факторов). SC185Q01WA - процент учащихся, получивших отметки по социальным наукам на уровне проходного балла или выше. SC185Q02WA - процент учащихся, получивших отметки по социальным наукам на уровне проходного балла или ниже.
Теперь подготовим данные к анализу. Для этого удалим пропущенные значения и убедимся, что каждая переменная имеет правильный тип данных. В нашем случае, некоторые переменные, как тип школы (SC013Q01TA) или уровень образования родителей (SC177Q01JA и SC177Q02JA), должны быть преобразованы в факторы, если они представляют категориальные данные. Числовые переменные, такие как проценты успеваемости и соотношение учеников к учителям, должны быть в формате числового типа.
Посмотрим на описательную статистику переменных.
summary(selected_data)
## SC013Q01TA SC178Q01JA SC178Q02JA SC177Q01JA SC177Q02JA
## 1:11900 Min. : 0.00 Min. : 0.00 1:1947 1:1037
## 2: 2920 1st Qu.: 64.00 1st Qu.: 3.00 2: 962 2: 527
## Median : 80.00 Median : 20.00 3:4794 3:6554
## Mean : 76.54 Mean : 23.15 4:7117 4:6702
## 3rd Qu.: 97.00 3rd Qu.: 35.00
## Max. :100.00 Max. :100.00
## STRATIO SC011Q01TA SC002Q01TA TOTMATH
## Min. : 1.000 1:9206 Min. : 0.0 Min. : 0.500
## 1st Qu.: 9.323 2:2245 1st Qu.: 134.0 1st Qu.: 3.000
## Median : 12.619 3:3369 Median : 287.5 Median : 5.000
## Mean : 14.285 Mean : 398.4 Mean : 6.556
## 3rd Qu.: 16.992 3rd Qu.: 520.0 3rd Qu.: 8.000
## Max. :100.000 Max. :9473.0 Max. :100.000
## PROPMATH SC185Q01WA SC185Q02WA
## Min. :0.0057 Min. :1.000 Min. :1.000
## 1st Qu.:0.0775 1st Qu.:1.000 1st Qu.:1.000
## Median :0.1078 Median :1.000 Median :1.000
## Mean :0.1279 Mean :1.281 Mean :1.219
## 3rd Qu.:0.1456 3rd Qu.:1.000 3rd Qu.:1.000
## Max. :1.0000 Max. :3.000 Max. :3.000
Большинство учащихся (11900 из 14820) учатся в государственных школах. Это указывает на то, что данные представляют в основном государственное образование. Средний процент учащихся, получивших отметки по математике на уровне проходного балла или выше, составляет 76.54%, что указывает на относительно хорошую успеваемость по этому предмету. Медиана (80%) немного выше среднего, что может указывать на то, что большинство учащихся достигают хороших результатов. Средний процент учащихся, получивших отметки ниже проходного уровня, составляет 23.15%. Это отражает тенденцию обратную предыдущей переменной. Большинство родителей (матери и отцы) имеют образование уровня 4 (самый высокий), что указывает на высокий уровень образовательной подготовки в семьях учащихся. Среднее значение соотношения составляет 14.285, что свидетельствует о сравнительно небольшом количестве учеников на одного учителя, что может способствовать более качественному обучению. Большинство матерей (9206 из 14820) работают (уровень 1), что может указывать на высокий уровень занятости среди матерей учащихся. Средний доход семьи составляет 398.4 единиц, с максимальным значением до 9473, что может указывать на значительное разнообразие экономических условий среди семей учащихся. У переменной успеваемость по социальным наукам средние значения близки к 1, что указывает на то, что большинство учащихся достигают или превышают проходной балл по социальным наукам, с небольшим количеством учащихся, показывающих результаты ниже проходного.
Перед тем как провести корелляционный анализ, проверим распределение переменных (с помощью теста Андерсона-Дарлинга).
library(nortest)
numeric_data <- selected_data %>%
select(SC178Q01JA, SC178Q02JA, STRATIO, SC002Q01TA, TOTMATH, PROPMATH, SC185Q01WA, SC185Q02WA)
ad_results <- lapply(numeric_data, ad.test)
ad_results
## $SC178Q01JA
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 524.31, p-value < 2.2e-16
##
##
## $SC178Q02JA
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 522.4, p-value < 2.2e-16
##
##
## $STRATIO
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 528.21, p-value < 2.2e-16
##
##
## $SC002Q01TA
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 839.63, p-value < 2.2e-16
##
##
## $TOTMATH
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 902.04, p-value < 2.2e-16
##
##
## $PROPMATH
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 1143.8, p-value < 2.2e-16
##
##
## $SC185Q01WA
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 3113.6, p-value < 2.2e-16
##
##
## $SC185Q02WA
##
## Anderson-Darling normality test
##
## data: X[[i]]
## A = 3647.1, p-value < 2.2e-16
Результаты теста Андерсона-Дарлинга показывают, что распределение всех проверенных переменных значительно отличается от нормального. Все p-значения настолько малы (меньше 2.2e-16), что мы можем уверенно отвергнуть нулевую гипотезу о нормальности распределения для каждой из этих переменных.
Для создания корреляционной матрицы и визуализации её в виде тепловой карты, мы применим метод Спирмена (так как распределение переменных отличается от нормального). Мы пропустим факторные переменные, так как корреляционный анализ применим только к количественным данным.
library(dplyr)
library(corrplot)
## corrplot 0.92 loaded
numeric_data <- selected_data %>%
select(SC178Q01JA, SC178Q02JA, STRATIO, SC002Q01TA, TOTMATH, PROPMATH, SC185Q01WA, SC185Q02WA) %>%
rename("Math Above Pass" = SC178Q01JA,
"Math Below Pass" = SC178Q02JA,
"Student-Teacher Ratio" = STRATIO,
"Family Income" = SC002Q01TA,
"Average Math Score" = TOTMATH,
"Proportion at Math Baseline" = PROPMATH,
"Social Above Pass" = SC185Q01WA,
"Social Below Pass" = SC185Q02WA)
cor_matrix <- cor(numeric_data, method = "spearman")
cor_matrix
## Math Above Pass Math Below Pass
## Math Above Pass 1.00000000 -0.98914968
## Math Below Pass -0.98914968 1.00000000
## Student-Teacher Ratio -0.05347469 0.05578102
## Family Income -0.06389958 0.07179752
## Average Math Score -0.07226486 0.07993715
## Proportion at Math Baseline -0.05847283 0.05789558
## Social Above Pass -0.02033992 0.02000340
## Social Below Pass -0.02546283 0.02561189
## Student-Teacher Ratio Family Income
## Math Above Pass -0.05347469 -0.06389958
## Math Below Pass 0.05578102 0.07179752
## Student-Teacher Ratio 1.00000000 0.42125256
## Family Income 0.42125256 1.00000000
## Average Math Score 0.10672514 0.64493351
## Proportion at Math Baseline 0.25366590 -0.06221675
## Social Above Pass -0.02130857 0.04517005
## Social Below Pass 0.05652331 0.02054132
## Average Math Score Proportion at Math Baseline
## Math Above Pass -0.07226486 -0.058472833
## Math Below Pass 0.07993715 0.057895580
## Student-Teacher Ratio 0.10672514 0.253665897
## Family Income 0.64493351 -0.062216746
## Average Math Score 1.00000000 0.368484083
## Proportion at Math Baseline 0.36848408 1.000000000
## Social Above Pass 0.04946138 -0.011170130
## Social Below Pass -0.01754667 -0.009270932
## Social Above Pass Social Below Pass
## Math Above Pass -0.02033992 -0.025462834
## Math Below Pass 0.02000340 0.025611894
## Student-Teacher Ratio -0.02130857 0.056523307
## Family Income 0.04517005 0.020541319
## Average Math Score 0.04946138 -0.017546668
## Proportion at Math Baseline -0.01117013 -0.009270932
## Social Above Pass 1.00000000 0.237214157
## Social Below Pass 0.23721416 1.000000000
corrplot(cor_matrix, method = "color", type = "upper", order = "hclust",
tl.col = "black", tl.srt = 45,
addCoef.col = "black",
diag = FALSE)
Из корреляционной матрицы, построенной с использованием метода Спирмена, становится понятно, что взаимосвязь между процентами учащихся, получивших отметки по математике выше и ниже проходного балла, очень сильная и отрицательная (-0.989), что логично, так как эти показатели являются дополнительными друг к другу. Корреляция между математикой и социальными науками (как выше, так и ниже проходного) незначительна, что указывает на отсутствие прямой зависимости между успехами в этих предметах. Присутствует умеренно положительная корреляция (0.421) между соотношением учеников и учителей и доходом семьи, что может указывать на то, что в школах с лучшим финансированием или в более обеспеченных районах меньше учеников приходится на одного учителя. Доход семьи сильно коррелирует (0.645) со средним баллом по математике в школе, что может свидетельствовать о том, что в более обеспеченных семьях дети могут иметь лучшие образовательные результаты, возможно, из-за лучшего доступа к ресурсам и образовательным услугам. Существует умеренно положительная корреляция (0.369) между средним баллом по математике и долей учащихся, достигших базового уровня по математике, что предполагает, что уровень знаний в школах с высоким средним баллом в целом лучше. Также есть умеренная корреляция (0.254) между соотношением учеников и учителей и долей учащихся, достигших базового уровня по математике, указывая на то, что меньшее количество учеников на учителя может способствовать лучшему обучению и пониманию математики.
Исследовательный вопрос №1: влияет ли уровень дохода семьи на успеваемость учащихся по математике, социальным наукам? Проверим, есть ли значительные различия в средних значениях успеваемости учащихся между различными группами по экономическому статусу семьи (например, низкий, средний, высокий доход) Для проведения анализа ANOVA, который проверит, есть ли статистически значимые различия в успеваемости учащихся по математике и социальным наукам между разными группами доходов семей, вам нужно сначала сгруппировать данные по доходу семей. Зависимо от того, как распределены данные о доходах, вы можете рассмотреть разделение их на категории (например, низкий, средний, высокий доход). Сначала определим, как лучше всего категоризировать доход, для этого можно посмотреть на распределение доходов с помощью гистограммы.
library(ggplot2)
ggplot(numeric_data, aes(x = `Family Income`)) +
geom_histogram(bins = 30, fill = "blue", color = "black") +
labs(title = "Распределение дохода семей", x = "Доход семей", y = "Частота")
Гистограмма показывает, что большинство семей имеет доход в диапазоне от 0 до примерно 2500, с наибольшим количеством наблюдений в пределах первых двух столбцов. Основываясь на этом распределении, можно предложить разделение дохода на три категории: низкий доход (от 0 до 1000), средний доход (от 1000 до 3000), высокий доход (более 3000). Это разделение позволит категоризировать доходы таким образом, чтобы каждая группа имела достаточно данных для анализа, и при этом отразить различия в доходах, видимые на гистограмме.
numeric_data$Income_Category <- cut(numeric_data$`Family Income`,
breaks = c(0, 1000, 3000, Inf),
labels = c("Low", "Medium", "High"),
right = FALSE)
Теперь, когда у нас есть категории доходов, проведем ANOVA.
library(stats)
# ANOVA для математики
anova_math <- aov(`Average Math Score` ~ Income_Category, data = numeric_data)
summary(anova_math)
## Df Sum Sq Mean Sq F value Pr(>F)
## Income_Category 2 111982 55991 1711 <2e-16 ***
## Residuals 14817 484782 33
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
# ANOVA для социальных наук
anova_social <- aov(`Social Above Pass` ~ Income_Category, data = numeric_data)
summary(anova_social)
## Df Sum Sq Mean Sq F value Pr(>F)
## Income_Category 2 3 1.5267 5.787 0.00307 **
## Residuals 14817 3909 0.2638
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Экономический статус семьи оказывает влияние на академическую успеваемость учащихся, особенно заметно это влияние по предмету математики. Различия в средних баллах по математике и социальным наукам между группами доходов являются статистически значимыми (p-value < 0.05), что подвтерждает важность экономических условий в образовательных достижениях.
Исследовательский вопрос №2: Какую долю вариации в успеваемости учащихся можно объяснить экономическим статусом семьи и другими социально-экономическими факторами? Какие социально-экономические факторы (доход семьи, уровень образования родителей и т.д.) наиболее сильно влияют на академическую успеваемость учащихся?
numeric_data$Mother_Education <- as.numeric(as.factor(selected_data$SC177Q01JA))
numeric_data$Father_Education <- as.numeric(as.factor(selected_data$SC177Q02JA))
numeric_data$Mother_Occupation <- as.numeric(selected_data$SC011Q01TA)
model <- lm(`Average Math Score` ~ `Family Income` + Mother_Education + Father_Education +
Mother_Occupation, data = numeric_data)
summary(model)
##
## Call:
## lm(formula = `Average Math Score` ~ `Family Income` + Mother_Education +
## Father_Education + Mother_Occupation, data = numeric_data)
##
## Residuals:
## Min 1Q Median 3Q Max
## -46.221 -2.513 -1.151 1.173 97.190
##
## Coefficients:
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 4.813e+00 2.013e-01 23.913 <2e-16 ***
## `Family Income` 8.340e-03 9.996e-05 83.433 <2e-16 ***
## Mother_Education -1.158e-01 5.132e-02 -2.256 0.0241 *
## Father_Education -1.458e-01 6.298e-02 -2.314 0.0207 *
## Mother_Occupation -4.592e-01 5.150e-02 -8.916 <2e-16 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
##
## Residual standard error: 5.17 on 14815 degrees of freedom
## Multiple R-squared: 0.3365, Adjusted R-squared: 0.3364
## F-statistic: 1879 on 4 and 14815 DF, p-value: < 2.2e-16
Проверим качество модели с помощью распределения остатков и теста на гомескедастичность (используем Тест Бреуша-Пагана).
library(lmtest)
## Loading required package: zoo
##
## Attaching package: 'zoo'
## The following objects are masked from 'package:base':
##
## as.Date, as.Date.numeric
library(car)
## Loading required package: carData
##
## Attaching package: 'car'
## The following object is masked from 'package:dplyr':
##
## recode
# Гистограмма остатков
hist(model$residuals, breaks = 30, main = "Распределение остатков", xlab = "Остатки")
# Тест Бреуша-Пагана
bptest(model)
##
## studentized Breusch-Pagan test
##
## data: model
## BP = 171.34, df = 4, p-value < 2.2e-16
Результаты теста Бреуша-Пагана указывают на значительную гетероскедастичность в остатках модели. Значение p меньше 2.2e-16, что значительно ниже общепринятого уровня значимости 0.05. Это означает, что нулевая гипотеза о гомоскедастичности (постоянстве дисперсии остатков) отвергается, и, следовательно, остатки модели имеют неравномерную дисперсию. Гетероскедастичность может исказить стандартные ошибки оценок коэффициентов, что ведёт к неверным выводам о статистической значимости переменных. Использование робастных стандартных ошибок поможет скорректировать оценки стандартных ошибок коэффициентов в присутствии гетероскедастичности.
library(sandwich)
library(lmtest)
robust_se <- coeftest(model, vcov = vcovHC(model, type = "HC1"))
print(robust_se)
##
## t test of coefficients:
##
## Estimate Std. Error t value Pr(>|t|)
## (Intercept) 4.81344467 0.20548743 23.4245 < 2e-16 ***
## `Family Income` 0.00833973 0.00020807 40.0810 < 2e-16 ***
## Mother_Education -0.11576758 0.04767740 -2.4281 0.01519 *
## Father_Education -0.14575203 0.05867263 -2.4842 0.01300 *
## Mother_Occupation -0.45915451 0.04801525 -9.5627 < 2e-16 ***
## ---
## Signif. codes: 0 '***' 0.001 '**' 0.01 '*' 0.05 '.' 0.1 ' ' 1
Коэффициент переменной Доход семьи составляет 0.00834, что означает, что с каждым увеличением дохода на одну единицу, средний балл по математике увеличивается на 0.00834 балла. Это значимо на уровне p < 0.001. Коэффициент переменной Образование матери равен -0.1158, указывая на то, что с увеличением уровня образования матери средний балл по математике уменьшается на 0.1158. Это может быть связано с различными факторами, например, большим количеством времени, которое матери с высшим образованием проводят на работе, и меньшим — с детьми. Схожий с материнским образованием, коэффициент переменной Образование отца равен -0.1458, что также указывает на отрицательное влияние уровня образования отца на успеваемость по математике. Коэффициент переменной Занятость матери равен -0.4592. Это означает, что уровень занятости матери отрицательно коррелирует с успеваемостью по математике. Это может указывать на то, что чем больше матери заняты работой, тем меньше времени и внимания они могут уделять образованию детей. Коэффициент детерминации R-squared = 0.3365. Это показывает нам, что около 33.65% вариации в средних баллах по математике можно объяснить с помощью включенных в модель независимых переменных. Модель хорошо объясняет данные.
Чтобы глубже изучить структуру данных и взаимосвязи между переменными, применим кластерный анализ. Исследовательский вопрос №3: можно ли сгруппировать учащихся по их успеваемости и социально-экономическим показателям в несколько кластеров? Какие характеристики отличают эти кластеры?
library(stats)
library(factoextra)
## Welcome! Want to learn more? See two factoextra-related books at https://goo.gl/ve3WBa
data_for_clustering <- numeric_data[, c("Family Income", "Mother_Education", "Father_Education", "Mother_Occupation", "Average Math Score", "Social Above Pass")]
data_for_clustering <- scale(data_for_clustering)
Определим оптимальное количество кластеров с помощью метода силуэта, который оценивает качество кластеризации на основе того, насколько хорошо каждый объект сгруппирован с объектами своего кластера по сравнению с объектами соседних кластеров.
library(cluster)
sil_width <- function(k) {
km_res <- kmeans(data_for_clustering, centers = k, nstart = 25)
silhouette <- silhouette(km_res$cluster, dist(data_for_clustering))
mean(silhouette[, "sil_width"])
}
k_values <- 2:10
sil_scores <- sapply(k_values, sil_width)
plot(k_values, sil_scores, type = "b", pch = 19, frame = FALSE,
xlab = "Количество кластеров", ylab = "Среднее значение силуэта",
main = "Метод силуэта для определения количества кластеров")
На основании графика, оптимальное количество кластеров для анализа равно 6. При 6 кластерах значение силуэта достигает одного из максимумов, что указывает на хорошее разделение между кластерами. Хотя 4 кластера также показывают высокий показатель силуэта, выбор 6 кластеров может предложить более детальное разделение данных и может быть полезно для более тонкого понимания групп.
set.seed(123)
kmeans_result <- kmeans(data_for_clustering, centers = 6, nstart = 25)
kmeans_result$centers
## Family Income Mother_Education Father_Education Mother_Occupation
## 1 -0.008662159 -1.8652319 0.05167164 -0.15952515
## 2 2.419178330 -0.1191689 -0.05153138 -0.31841917
## 3 -0.323709342 0.4528665 0.33424421 1.28961622
## 4 -0.063707460 -1.4207344 -2.41245863 -0.04562375
## 5 -0.072999018 0.2872319 0.24255186 -0.43772690
## 6 -0.137934781 0.4353534 0.27558947 -0.71563776
## Average Math Score Social Above Pass
## 1 -0.02886228 -0.210723988
## 2 2.47385457 -0.102164447
## 3 -0.32212879 -0.311483905
## 4 -0.02800595 0.005448991
## 5 -0.09943032 1.724579171
## 6 -0.14045139 -0.546752360
На основе кластерного анализа можно сгруппировать учащихся в несколько категорий, это сделано на основе их успеваемости и социально-экономических показателей. Результаты показывают, что данные успешно разделились на 6 кластеров. Существует 6 различных групп учащихся с уникальными характеристиками. Процент объяснённой вариации (between_SS / total_SS = 55.1%) подтверждает, что разделение на кластеры достаточно информативно.
fviz_cluster(kmeans_result, data = data_for_clustering)
Опишем основные характеристики каждого кластера и сформулируем названия для них. Кластер 1 “Стабильное среднее состояние” (1367 учащихся). Этот кластер характеризуется относительно близким к среднему доходом и низким уровнем образования матери. Успеваемость по математике и социальным наукам близка к среднему. Кластер 2 “Преуспевающие” (915 учащихся). Кластер отличается высоким семейным доходом и выше среднего результатами по математике. Уровень образования родителей около среднего. Кластер 3 “Занятые родители” (3938 учащихся). Эта группа характеризуется тем, что включает семьи с низким доходом, матери имеют высокий уровень образования. Занятость матери высокая, что может влиять на меньшее внимание к учебе детей. Кластер 4 “Демографический разрыв” (1350 учащихся). Очень низкий уровень образования отца, средние показатели по другим критериям. Это может указывать на специфическую демографическую группу. Кластер 5 “Академические лидеры” (2450 учащихся). Нейтральные по доходу, с выше среднего уровнем образования родителей и очень высокими показателями по социальным наукам. Кластер 6 “Социально уязвимые” (4800 учащихся). Большая группа с доходом ниже среднего уровня и образованием родителей, с низкой занятостью матери. Эта группа показывает низкие результаты по всем изучаемым параметрам.
Определим основные выводы по нашему исследованию.
Исследовательский вопрос 1: Влияет ли уровень дохода семьи на успеваемость учащихся по математике и социальным наукам? Для ответа на этот вопрос был проведен анализ дисперсии (ANOVA), чтобы определить, существуют ли значительные различия в средних значениях успеваемости учащихся между различными группами по экономическому статусу семьи. Результаты ANOVA показали, что уровень дохода семьи оказывает значительное влияние на успеваемость учащихся по математике. P-значение < 2e-16 указывает на то, что различия между группами с низким, средним и высоким доходом являются статистически значимыми. Успеваемость по социальным наукам также зависит от уровня дохода семьи, хотя эффект не столь выражен, как по математике. P-значение 0.00307 свидетельствует о статистически значимых различиях между группами дохода, но влияние менее выражено по сравнению с математикой. Таким образом, результаты ANOVA подтверждают, что экономический статус семьи, выраженный через уровень дохода, имеет существенное влияние на академические результаты учащихся, особенно по математике.
Исследовательский вопрос 2: Какие социально-экономические факторы наиболее сильно влияют на академическую успеваемость учащихся? Для выявления основных социально-экономических факторов, влияющих на успеваемость учащихся, была использована линейная множественная регрессия. Включенные переменные включали доход семьи, уровень образования родителей, занятость матери и другие релевантные показатели. Результаты регрессии показали, что доход семьи является наиболее значимым фактором, оказывающим положительное влияние на успеваемость учащихся по математике. Уровень образования родителей, как матери, так и отца, имел негативное влияние на успеваемость, что может быть связано с различными социально-экономическими контекстами и специфическими семейными динамиками. Занятость матери также оказала значительное негативное влияние на академические результаты, что может свидетельствовать о меньшем времени, проводимом с детьми, и недостаточной поддержке в учебе. Коэффициент детерминации (R-squared) модели показал, что 33.65% вариации в успеваемости учащихся можно объяснить включенными социально-экономическими факторами, что подтверждает их важность в контексте образовательных достижений. Исследовательский вопрос 3: Можно ли сгруппировать учащихся по их успеваемости и социально-экономическим показателям в несколько кластеров? Какие характеристики отличают эти кластеры? Для ответа на этот вопрос был проведен кластерный анализ методом k-средних. Оптимальное количество кластеров было определено с помощью метода силуэта, который показал, что 6 кластеров являются оптимальным решением. Характеристики каждого кластера были подробно описаны. В целом, исследование подтвердило значительное влияние социально-экономического статуса семьи на академическую успеваемость учащихся. Результаты анализа дисперсии ANOVA, множественной регрессии и кластерного анализа подчеркивают важность комплексного подхода к пониманию образовательных достижений, что позволяет разрабатывать более эффективные и целенаправленные образовательные стратегии (Bourdieu, P., & Passeron, J. C.).