张昱城 (教授 博导)
课程大纲:https://my.feishu.cn/wiki/S5MWw7UBfi10j5kKuFgcV3vMnGe?from=from_copylink
这一章利用一项研究数据来介绍OLS回归分析的原理,包括估计过程,模型的拟合度,线性回归结果的解释,以及统计推断的基本原理。
研究问题:人们对于政府在减轻全球性危机潜在影响中的角色的看法,与他们对这种危机的情绪反应之间的相关程度有多大?
为了回答这个问题,利用美国815名居民(417名女性,398名男性)的调查数据来进行分析(数据集名为GLBWARM)。
Y(GOVACT):多大程度上支持美国政府缓解全球气候变化威胁的各项政策或行动。由 5个问题构成;回答选项(1=“强烈反对”;7=“强烈支持”)。
X(NEGEMOT):参与者对气候变化前景的负面情绪反应。回 答想到全球变暖时感受到的关切、担忧和恐慌;回答选项(1=“根本不”;6=“很多”)。
图1 关于气候变化的负面情绪(X)与支持缓解气候变化的政府行动(Y)之间关系的散点图
图1呈现了一种趋势,即那些对于气候变化表现出相对强烈负面情绪的人,也相对更支持政府采取行动来帮助缓解气候变化。
接下来量化关联:皮尔逊相关系数r(Person’s r)
图2 SPSS输出显示对气候变化的负面情绪(X)和对政府行动的支持(Y)的皮尔逊相关
## Pearson's r and 95% confidence intervals:
## ─────────────────────────────────────────
## r [95% CI] p N
## ─────────────────────────────────────────
## Y-X2 0.04 [-0.03, 0.11] .220 815
## Y-X1 0.58 [ 0.53, 0.62] <.001 *** 815
## Y-X3 -0.42 [-0.47, -0.36] <.001 *** 815
## Y-X5 -0.10 [-0.16, -0.03] .006 ** 815
## Y-X4 -0.10 [-0.17, -0.03] .005 ** 815
## Y-X6 -0.36 [-0.42, -0.30] <.001 *** 815
## X2-X1 0.13 [ 0.06, 0.19] <.001 *** 815
## X2-X3 -0.03 [-0.10, 0.04] .402 815
## X2-X5 0.04 [-0.03, 0.11] .227 815
## X2-X4 0.07 [ 0.01, 0.14] .034 * 815
## X2-X6 -0.04 [-0.10, 0.03] .308 815
## X1-X3 -0.35 [-0.41, -0.29] <.001 *** 815
## X1-X5 -0.06 [-0.13, 0.01] .105 815
## X1-X4 -0.12 [-0.18, -0.05] <.001 *** 815
## X1-X6 -0.32 [-0.38, -0.26] <.001 *** 815
## X3-X5 0.21 [ 0.15, 0.28] <.001 *** 815
## X3-X4 0.13 [ 0.06, 0.20] <.001 *** 815
## X3-X6 0.62 [ 0.58, 0.66] <.001 *** 815
## X5-X4 0.17 [ 0.10, 0.23] <.001 *** 815
## X5-X6 0.15 [ 0.09, 0.22] <.001 *** 815
## X4-X6 0.11 [ 0.04, 0.18] .002 ** 815
## ─────────────────────────────────────────
如图2显示: r=0.578,表明研究中对气候变化的负面情绪相对较强的人也相对更支持政府的行动。
*解读r三种符号的:
显著+:r的符号对应了X和Y之间线性关系的方向,如果X相对较高的值与Y相对较高的值对应,相对较低的X值倾向于与Y相对较低的值对应,那么皮尔逊系数r是正的;
显著-:如果X相对较高的值趋向于与Y相对较低的值对应,相对较低的X趋向于与相对较高的Y对应,则皮尔逊系数,为负。
不显著:当X和Y的值的配对没有明显的顺序,或者当关联更加非线性时,皮尔逊系数r将接近于零(因为皮尔逊系数r是线性关联的度量,而不是任何关联类型的度量)
*解读r:提供了一个估计值,即对于一个个案,已知它的X值距离样本均值多少个标准差,它的Y值距离样本均值的多少个标准差。即
\[ \ \hat { Z }_{Y_i}=r_{XY}Z_{X_i} \]
实例1:一个人的负面情绪(X1)处于均值之上0.5个标准差(Zx=0.5),那么可以估算出他对政府行动的支持度离均值Zx=0.578*0.5=0.289个标准差。Z y的符号为正,意味着这个人在样本均值之上(比平均水平更加支持)。
实例2:负面情绪在均值之下2个标准差的人(Zx=-2),被估算出对政府行为支持度离均值Zy=0.578*(-2)=-1.156个标准差。在 这种情况下,Zy为负,意思是估计出这个人对政府行动的支持度是低于样本均值的(即支持度低于平均水平)
相关和预测是密切相关的概念。如果两个变量是相互关联的,那么就应该能够使用一个变量上配对的X、Y的值的信息,以某种精确度来估计对应的另一个变量的值,如果想要从解释的角度出发提供更多的解释信息就要用更加复杂的建模方法。
线性回归模型是通过利用输入和输出之间的关联信息将一个或多个输入变量(预测变量、自变量、解释变量或前因变量)连接到输出变量(结果变量、准则变量或因变量)的方程。
进行线性回归分析时的目标:估计回归模型的各种参数,使产生的方程从一个或多个前因变量得到结果变量的估计值(parameters)。
\[ Y_j=\underbrace{i_Y+b X_j}_{\hat Y}+e_j \]
变量:Yj和Xj分别表示个案j的结果和前因变量的度量
系数:b是前因变量X的回归系数
截距:iY是回归常数
残差:ej是从个案j的X值估计样本j的Y值产生的误差,也被称为残差。
估计回归模型的过程称为Y在X上的回归。
回归的原理:通过最小二乘法使得残差最小(公式推导:罗胜强和姜嬿,2014,7.1.3),过程如下:
\[ \ SS_{residual}=\sum_{j=1}^{n}(Y_j-\hat Y_j)^2=\sum e_j^2 \]
\[ \ SS_{total}=\sum_{j=1}^{n}(Y_j-\bar Y_j)^2 \]
\[ \ SS_{regression}= SS_{total}- SS_{residual}\\ \sum_{j=1}^{n}(\hat Y_j-\bar Y_j)^2=\sum_{j=1}^{n}(Y_j-\bar Y_j)^2-\sum_{j=1}^{n}(Y_j-\hat Y_j)^2 \]
使用以下R语言命令生成的气候变化负面情绪(X)估计对政府减缓气候变化行动的支持(Y)的简单回归代码是:
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(1, 813) = 407.34, p = 1e-73 ***
## R² = 0.33379 (Adjusted R² = 0.33297)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ──────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ──────────────────────────────────────────────────────────────
## (Intercept) 2.757 (0.099) 27.948 <.001 *** [2.564, 2.951]
## X1 0.514 (0.025) 20.183 <.001 *** [0.464, 0.564]
## ──────────────────────────────────────────────────────────────
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ────────────────────────────────────────────────────────────────────
## X1 0.578 (0.029) 20.183 <.001 *** [0.522, 0.634] 0.578 0.578
## ────────────────────────────────────────────────────────────────────
因此,最佳拟合OLS回归模型是:
\[ \hat{Y}_j=2.757+0.514 X_j \]
这个简单回归方程可以用二维平面图上的一条直线形式表示出来。
图4 关于气候变化负面情绪(X)对政府行动的支持度(Y)的估计的最小二乘回归方程(虚线)图示
\[ b=[\hat{Y}_j|(X=x)]-[\hat{Y}_j|(X=x-1)] \]
截距:在概念上等同于直线方程中的y轴截距。它 表示当X=0时Y的估计值。
标准化回归模型:通常是在模型预估之前将所有的变量首先进行标准化,即通过使用距离样本均值几个标准差来表述每个测量值。
\[ \hat{Z}_{Y_j}=\tilde{b} Z_{X_j} \]
这里ZY和ZX是标准化版本的X和Y,b~是X的标准化回归系数。
系数:标准化回归系数可以解释为两个个案在X上相差1个标准差,估计它们在Y上相差多少个标准差。因 此,两个在气候变化负面情绪上有1个标准差区别的人,估计在政府行动支持度方面相差b=0.578个标准差。进 行OLS回归的大多数统计软件包会在输出部分提供标准化回归模型。例 如,在本例中,标准化回归系数可以在”标准化系数”一栏下找到。
截距:标准化回归模型并不包含截距(因为标准化后,截距项一般为0)。
理论含义:系数为正意味着对气候变化有更多负面情绪的人估计会更加强烈地支持政府减轻气候变化的行动。
标准化回归系数与X和Y与的皮尔逊相关系数:几乎完全相等。这 在只有一个前因变量的任何同归模型中是成立的,但并不能推广到具有多个前因变量的模。
在线性回归方程中,前因变量可以是定量维度或二分变量,比如性别(男性/女性)。
为了更好的说明,使用一个线性回归分析来估计男性和女性(X)在政府行动支持度(Y)上的差异;男(编码1,51.2%的参与者)或女(编码0,48.8%的参与者,即为X4的均值)。
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(1, 813) = 7.98, p = 0.005 **
## R² = 0.00973 (Adjusted R² = 0.00851)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ─────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ─────────────────────────────────────────────────────────────────
## (Intercept) 4.718 (0.066) 71.122 <.001 *** [ 4.588, 4.848]
## X4 -0.268 (0.095) -2.826 .005 ** [-0.455, -0.082]
## ─────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ───────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────────
## X4 -0.099 (0.035) -2.826 .005 ** [-0.167, -0.030] -0.099 -0.099
## ───────────────────────────────────────────────────────────────────────
因此,得到:
\[ \hat{Y}_j=4.718-0.268 X_j \]
截距(0组值):当X=0时,回归常数iY仍然是Y的估计值。这 种情况下,女性被编码为X=0,所以Y=4.718。这 是女性对政府行为支持度的估计值,它对应于女性的样本均值:iY=Y女性=4.718。
回归系数(与0组相比的差值):即两个在X上相差1个单位的个案在Y的估计值上的差异,而负号告诉我们,个案在X上值越大估计出的Y值越低。这 与之前报告的均值是一致的。男 性在编码时比女性编码高一个单位值,而普遍呈现比女性对政府行为支持度更低。再 者,要注意到均值之间的差值正好是这个度量的0.268个单位(即Y男性-Y女性=4.450-4.718=-0.268)。因 此回归系数量化了两组均值之间的差异。
通过带入理解该结果:对于女性X=0,根据模型估计女性的均值为y=4.718-0.268*0=4.718,对于男性,X=1,估计男性的均值为Y=4.718-0.268*1=4.450。
## [1] 4.718
## [1] 4.45
##
## Independent-Samples t-test
##
## Hypothesis: two-sided (μ2 - μ1 ≠ 0)
##
## Descriptives:
## ──────────────────────────────────────
## Variable Factor Level N Mean (S.D.)
## ──────────────────────────────────────
## Y X4 0 417 4.72 (1.16)
## Y X4 1 398 4.45 (1.53)
## ──────────────────────────────────────
##
## Levene’s test for homogeneity of variance:
## ───────────────────────────────────────────
## Levene’s F df1 df2 p
## ───────────────────────────────────────────
## Y: X4 (1 - 0) 27.09 1 813 <.001 ***
## ───────────────────────────────────────────
## Note: H0 = equal variance (homoscedasticity).
## If significant (violation of the assumption),
## then you should better set `var.equal=FALSE`.
##
## Results of t-test:
## ────────────────────────────────────────────────────────────────────────────
## t df p Difference [95% CI] Cohen’s d [95% CI]
## ────────────────────────────────────────────────────────────────────────────
## Y: X4 (1 - 0) -2.83 813 .005 ** -0.27 [-0.45, -0.08] -0.20 [-0.34, -0.06]
## ────────────────────────────────────────────────────────────────────────────
相关并不意味着因果关系:如果变量X和Y是相关的,这并不意味着X会导致Y,或者Y导致X,最终能否推断因果甚至不是一件统计上的事。相 反,它关乎一个人的研究设计,他所使用的数据收集程序,以及理论的合理性,这将更加直接地影响一个因果论断是否成立以及可信程度,而不仅仅是相关关系的统计系数的大小或方向。
使用回归的逻辑(控制变量):多层回归为研究者提供了一种借助于数学化辅助的反事实推理方法,即在同归模型中,在另一个前因变量没有差异的情况下估计X和Y之间的相关程度。它 通过将人(或者任意分析的单位)在这些变量上的”数学上等同”来实现这一点。这 种等同过程也称为从X和Y的相关中”分离”出其他变量,或”统计性地控制”那些变量。这 些其他的变量在线性模型的术语中被称为协变量,但在实践中,它们和X一样,只是Y的山归模型中的前因变量
回归与因果的关系
定义:回归模型中包括多个前因变量,允许研究者同时检验对一个结果变量有多个影响的作用。多 层回归模型的另一个重要的好处是,它从统计上排除某些替代性解释,提供了部分相关的各种测量方法,即,它量化了一个前因和一个结果之间的关联关系的组成部分,这与模型中的其他前因变量相比是唯一的。
一般而言,一个具有k个前因变量的多层线性回归模型采用以下形式:
\[ Y_j=i_Y+b_1 X_{1 j}+b_2 X_{2 j}+\ldots+b_k X_{k j}+e_j \]
其中Xij是个案j的前因变量i的值,bi是前因变量Xi的回归系数,其他所有项定义如前。
举例:使用对气候变化的负面情绪(X1)、对气候变化的积极情绪(X2)、政治意识形态(X3)、性别(X4)和年龄(X5)同时对政府行为的支持度(Y)进行回归。
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(5, 809) = 102.72, p = 7e-84 ***
## R² = 0.38832 (Adjusted R² = 0.38454)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ───────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ───────────────────────────────────────────────────────────────────
## (Intercept) 4.064 (0.205) 19.791 <.001 *** [ 3.661, 4.467]
## X1 0.441 (0.026) 16.676 <.001 *** [ 0.389, 0.493] 1.166
## X2 -0.027 (0.028) -0.951 .342 [-0.082, 0.028] 1.026
## X3 -0.218 (0.027) -8.071 <.001 *** [-0.271, -0.165] 1.194
## X4 -0.010 (0.077) -0.131 .896 [-0.161, 0.141] 1.053
## X5 -0.001 (0.002) -0.552 .581 [-0.006, 0.003] 1.071
## ───────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ───────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────────
## X1 0.495 (0.030) 16.676 <.001 *** [ 0.437, 0.554] 0.506 0.459
## X2 -0.027 (0.028) -0.951 .342 [-0.081, 0.028] -0.033 -0.026
## X3 -0.243 (0.030) -8.071 <.001 *** [-0.302, -0.184] -0.273 -0.222
## X4 -0.004 (0.028) -0.131 .896 [-0.059, 0.052] -0.005 -0.004
## X5 -0.016 (0.028) -0.552 .581 [-0.072, 0.040] -0.019 -0.015
## ───────────────────────────────────────────────────────────────────────
## ──────────────────────────────────────────────
## Estimate S.E. t p
## ──────────────────────────────────────────────
## (Intercept) 0.000 (0.027) 0.000 1.000
## scale(X1) 0.495 (0.030) 16.676 <.001 ***
## scale(X2) -0.027 (0.028) -0.951 .342
## scale(X3) -0.243 (0.030) -8.071 <.001 ***
## scale(X4) -0.004 (0.028) -0.131 .896
## scale(X5) -0.016 (0.028) -0.552 .581
## ──────────────────────────────────────────────
## ──────────────────────────
## 2.5 % 97.5 %
## ──────────────────────────
## (Intercept) 3.661 4.467
## X1 0.389 0.493
## X2 -0.082 0.028
## X3 -0.271 -0.165
## X4 -0.161 0.141
## X5 -0.006 0.003
## ──────────────────────────
由此得到:
\[ \hat{Y}=4.064+0.441 X_1-0.027 X_2-0.218 X_3-0.010 X_4-0.001 X_5 \]
截距:多层回归模型中的回归常数是模型中某一案的所有前因变量的测量值为0时的值。在 这个例子中,iy=4.064,但是这个估计值Y根本没有什么实质意义,因为0值超过了情绪测量量表(积极的和负面的情绪下限是1)、意识形态(1-7)以及年龄的刻度范围。
回归系数:如果其他回归系数是固定的,那么在Xk上相差1个单位的两个个案,Y的估计值将有bk个单位的差异。本 例中,从多层回归分析中,两个有着同样对气候变化的积极情绪(X2)、政治意识形态(X3)、性别(X4)和年龄(X5),但在负面情绪中相差1个单位的个体,他们对政府行动的支持度有0.441个单位差异。数 学上将其定为:
\[ b_i=[\hat{Y}_j|(X_{is}=x); X]-[\hat{Y}_j|(X_{it}=x-1; X)] \]
解读标准化后结果:
截距:是0
回归系数:两个个案Y值的标准差的估计差异,这两个个案在变量X,上有1个标准差的不同,但在模型中其他前因变量上都相等。本 例中,b1=0.495,所以我们可以说两个人在负面情绪变量(X1)上相差1个标准差,但在积极情绪、意识形态、性别和年龄上得分都相同,他们在政府行动支持度上的估计值相差0.495个标准差,即负面情绪越强烈的人对政府行动的支持度越大
手动计公式:
\[ \tilde b_i=b_i (\frac{SD_X}{SD_Y}) \]
## [1] "0.495"
解读部分标准化后结果(前因变量为分类变量):不应计算标准化后结果(如,性别),当模型中分类变量和连续变量共存时,只选择连续变量进行标准化,而不是选择将所有变量标准化。这 必须在模型估计之前完成。一 旦这么做了并且生成模型,就需要解释非标准化的回归系数而不是标准化的回归系数。对 于那些之前进行了手动标准化的前因变量,非标准系数会变成标准化形式。
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(5, 809) = 102.72, p = 7e-84 ***
## R² = 0.38832 (Adjusted R² = 0.38454)
##
## Unstandardized Coefficients:
## Outcome Variable: scale(Y)
## N = 815
## ───────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ───────────────────────────────────────────────────────────────────
## (Intercept) 0.004 (0.039) 0.093 .926 [-0.073, 0.080]
## scale(X1) 0.495 (0.030) 16.676 <.001 *** [ 0.437, 0.554] 1.166
## scale(X2) -0.027 (0.028) -0.951 .342 [-0.081, 0.028] 1.026
## scale(X3) -0.243 (0.030) -8.071 <.001 *** [-0.302, -0.184] 1.194
## X4 -0.007 (0.056) -0.131 .896 [-0.118, 0.103] 1.053
## scale(X5) -0.016 (0.028) -0.552 .581 [-0.072, 0.040] 1.071
## ───────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: scale(Y)
## N = 815
## ──────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ──────────────────────────────────────────────────────────────────────────────
## scale(X1) 0.495 (0.030) 16.676 <.001 *** [ 0.437, 0.554] 0.506 0.459
## scale(X2) -0.027 (0.028) -0.951 .342 [-0.081, 0.028] -0.033 -0.026
## scale(X3) -0.243 (0.030) -8.071 <.001 *** [-0.302, -0.184] -0.273 -0.222
## X4 -0.004 (0.028) -0.131 .896 [-0.059, 0.052] -0.005 -0.004
## scale(X5) -0.016 (0.028) -0.552 .581 [-0.072, 0.040] -0.019 -0.015
## ──────────────────────────────────────────────────────────────────────────────
4个指标可以衡量模型拟合:每一个指标对的都是对前一个指标的改进,使得拟合指数更好理解
最直观指标SSresidual的缺陷:尽管SSresidual是最直观的衡量模型拟合度,但是其严重受到样本量的影响,随着n增大,SSresidual也增大。两 种变形
修正样本量的MSresidual(Mean square of residual):当SSresidual除以自由度后,其受样本量影响的缺点即可被解决,自由度为样本量-预测变量数-1(n-k-1)其公式为:
\[ M S_{residual }=\frac{S S_{\text {residual }}}{n-k-1} \]
\[ SSE=\sqrt {M S_{residual }} \]
最常用的R2通常被解释为模型可解释的Y值的变化的比例:R可以被看作Y和Y(估计值)之间的皮尔逊相关。这 一诠释清楚地说明了R和R2如何被看作模型拟合度的一种指标。在 一个好的拟合模型中,模型估计出的Y值与数据中n个个案的实际观测值Y之间的相关性应该很大。如 果这种相关性小,那么很难认为这个模型在解释Y值的个体差异方面做的特别好。
R2的最大优势:前三种方法由于无法排除测量使用量尺不同带来的影响,导致其结果很难比较。只 要样本量不是很小,都可以直接比较基于不同样本大小的两个模型的R2
*解读R2:在气候变化模型中,R2=0.388。那 么负面情绪和积极情绪、年龄、性别和政治意识形态共同解释了人们对政府行动支持度的0.388×100%=38.8%的变化。
\[ R^2=1-\frac{S S_{\text {residual }}}{S S_{\text {total }}}=\frac{S S_{\text {regresion }}}{S S_{\text {total }}} \]
## ───────────────────────────────────────────────────────────────────────
## n k ss_total A.SS_residual B.MS_residual C.SSE D.R_squared
## ───────────────────────────────────────────────────────────────────────
## 1 815.000 5.000 1506.542 921.523 1.139 1.067 0.388
## ───────────────────────────────────────────────────────────────────────
假设情况
前提:GLBWARM数据文件中的815个人代表了地球上的人口普查。如 果地球上没有其他人了,那么GLBWARM数据集就是全体人口的数据集。
针对总体的估计:如果我们要从负面情绪、积极情绪、政治意识形态、性别和年龄等因素来估计对减轻气候变化影响的政府行动支持度,那么可以得到这个将残差平方和降到最低的总体回归模型。模 型里T表示回归系数的”真值”或总体值。
\[ \hat{Y}={ }_T i_Y+{ }_T b_1 X_1+{ }_T b_2 X_2+{ }_T b_3 X_3+{ }_T b_4 X_4+{ }_T b_5 X_5 \]
基于样本推断总体:现在假设,不是人口普查,我们只研究了815个居民中的50人,而且是从815个居民的人口中随机抽取了这50个居民。用 这50个样本,用五个前因变量对政府行动支持度进行回归。
图2.7
抽样方式:从GLBWARM数据的815个人中随机抽取50人
b1:图7描述了重复10000次该过程得到的b1值的直方图。
b1的范围:注意到Tb1的10000个估计值变化很大,从0.02的低点到0.85的高点,大部分估计值在0.30~0.60。这 就是抽样方差。
b1的估计:研究者们希望这个估计值b1接近真正的值,但不可能确切地知道它有多接近,因为我们只观察了基于可用数据的真值的单个样本估计值。从 815人中抽取出的不同随机样本会产生不同的Tb1估计值,因为只要当样本量小于总体时,b1就取决于抽样方差。
\[ \begin{array}{ll} H_0: & { }_T b_i=0 \\ H_a: & { }_T b_i \neq 0 \end{array} \]
为了在零假设和备择假设之间做出判断,必须推导出Xi和Y之间相关的概率,这个概率就是所得结果中的p值。如 果p值不大于检验中的显著性水平(一般来说,显著性水平或α-level为0.05),那么拒绝零假设而选择备择假设。
另一种推断方法是区间估计,也称为构建Tbi的置信区间。
点估计:在任何单一样本中,bi是我们对Tbi值的最佳猜测,它是一个Tbi的点估计。然 而,bi几乎肯定不等于Tbi。
置 信区间将这种不确定性确认为:Tbi可能处于一个由特定的置信度所决定的范围之内。
通常使用95%置信区间,c%置信区间的公式是:
\[ b_1-t_c \%{s e}_{b_1} \leq{ }_T b_1 \leq b_1+t_{c \%} s e_{b_1} \]
*解读本例的区间结果:
\[ 0.441-1.92*0.026 \leq{ }_T b_1 \leq 0.441+1.92*0.026 \]
多重回归也可用于检验模型中包含一组前因变量的假设。例 如,把情绪视作一组(即积极情绪和负面情绪),都是对气候变化的情绪反应,控制常量、意识形态、性别和年龄,来看一下情绪与政府行动支持度的相关的问题。
在我们的回归模型中,负面情绪和积极情绪分别为X1和X2,这个问题可以用以下的零假设和备择假设来描述:
\[ H_0:{ }_T b_1 \text { and }{ }_T b_2=0 \] \[ H_a:{ }_T b_1 \text { or }{ }_T b_2 \text { or both } \neq 0 \]
通过将多重相关系数的平方差值转换成F比,并找到对应于这个F值的p值。
\[ F\left(m, d f_{\text {residual }_2}\right)=\frac{d f_{\text {residual }_2}\left(R_2^2-R_1^2\right)}{m\left(1-R_2^2\right)}=139.632, p<.001 \]
*解读F值
拒绝零假设角度:控制政治意识形态(X3)、性别(X4)和年龄(X5)为常量后,对气候变化的情绪反应(X1和X2)与对政府行动的支持度(Y)有关
模型拟合角度:该检验也可以解释为检验模型2中包含m个其余变量的这个模型是否优于排除它们的模塑(模型1)。在 这个例子中,我们可以得出结论,包括积极情绪和负面情绪的模型(5个预测变量的模型)比不包括这两个变量的模型(3个预测变量的模型)拟合度更好(即,对Y的估计更为准确)
##
## Model Summary
##
## ─────────────────────────────────────
## (1) Y (2) Y
## ─────────────────────────────────────
## (Intercept) 6.169 *** 4.064 ***
## (0.166) (0.205)
## X3 -0.371 *** -0.218 ***
## (0.029) (0.027)
## X4 -0.118 -0.010
## (0.088) (0.077)
## X5 -0.000 -0.001
## (0.003) (0.002)
## X1 0.441 ***
## (0.026)
## X2 -0.027
## (0.028)
## ─────────────────────────────────────
## R^2 0.177 0.388
## Adj. R^2 0.174 0.385
## Num. obs. 815 815
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
## Significance test for multiple predictors (X1 and X2) based on F-value
## ──────────────────────────────────────────
## Model DF_Residual R_Squared F_Value
## ──────────────────────────────────────────
## 1 Model 3Xs 811.000 0.177
## 2 Model 5Xs 809.000 0.388 139.822
## ──────────────────────────────────────────
SPSS等回归模型常做:拟合模型与空模型(仅含截距项不含有任何预测变量)比较,在图2.6中,F(5, 809)=102.717,p < 0.0005,所以可以拒绝零假设。
类别大于2的分类变量:为了在回归模型中包含一个拥有g组的多分类前因变量,它必须用多种编码系统中的一种来表示g-1个变量。一 个通用的组编码系统是指示符编码(indicator coding),也称为虚拟编码(dummy coding)。本 例中类别为3.
## ─────────────────────
## X6 d1 d2
## ─────────────────────
## 1 2.000 1.000 0.000
## 2 2.000 1.000 0.000
## 3 2.000 1.000 0.000
## 4 1.000 0.000 0.000
## 5 1.000 0.000 0.000
## 6 3.000 0.000 1.000
## 7 1.000 0.000 0.000
## 8 1.000 0.000 0.000
## 9 2.000 1.000 0.000
## 10 2.000 1.000 0.000
## ─────────────────────
在GLBWARM数据中,PARTYID的变量,用于编码一个人是否被定义为民主党(d1)、独立党(d2)或共和党(d3)。以 下这个编码构建了两个指示符,一个是民主党,一个是共和党,而独立党(d2)作为参照类别,所以估计模型为:
\[ \hat{Y}=b_0+b_1 D_1+b_2 D_2 \]
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 812) = 61.24, p = 2e-25 ***
## R² = 0.13107 (Adjusted R² = 0.12893)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────────
## (Intercept) 5.064 (0.067) 75.569 <.001 *** [ 4.933, 5.196]
## d1 -0.459 (0.114) -4.042 <.001 *** [-0.682, -0.236] 1.173
## d2 -1.139 (0.103) -11.065 <.001 *** [-1.341, -0.937] 1.173
## ────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ────────────────────────────────────────────────────────────────────────
## d1 -0.143 (0.035) -4.042 <.001 *** [-0.213, -0.074] -0.140 -0.132
## d2 -0.392 (0.035) -11.065 <.001 *** [-0.462, -0.323] -0.362 -0.362
## ────────────────────────────────────────────────────────────────────────
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 812) = 61.24, p = 2e-25 ***
## R² = 0.13107 (Adjusted R² = 0.12893)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ──────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ──────────────────────────────────────────────────────────────────
## (Intercept) 5.064 (0.067) 75.569 <.001 *** [ 4.933, 5.196]
## factor(X6)2 -0.459 (0.114) -4.042 <.001 *** [-0.682, -0.236]
## factor(X6)3 -1.139 (0.103) -11.065 <.001 *** [-1.341, -0.937]
## ──────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ─────────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ─────────────────────────────────────────────────────────────────────────────────
## factor(X6)2 -0.143 (0.035) -4.042 <.001 *** [-0.213, -0.074] -0.140 -0.132
## factor(X6)3 -0.392 (0.035) -11.065 <.001 *** [-0.462, -0.323] -0.362 -0.362
## ─────────────────────────────────────────────────────────────────────────────────
回归方程的结果是:
\[ \hat{Y}=4.605+0.459 D_1-0.680 D_2 \]
截距:在该方程中,b0=4.605对应于参照组的Y,在该示例中为独立党人。我 们能够拒绝零假设,并得出结论:民主党、独立党和共和党人在他们对减轻全球气候变化影响的政府行动支持度平均值上存在差异。
回归系数
D1的回归系数为b1=0.459,这是民主党人和独立党人在对政府行动支持度方面的平均差异(5.064-4.605=0.459)。
D2的回归系数b2= -0.680,是共和党人和独立党人在政府行动支持度上的平均差异(3.925-4.605=-0.680)。
拟合指标:对于该模型,R2=0.131,模型拟合度检验(参见第2.6节)得到F(2,812)=61.243,p<0.0005。这 相当于来自三个均值的单因素方差分析得到的F比。
可得结论:民主党、独立党和共和党人在他们对减轻全球气候变化影响的政府行动支持度平均值上存在差异。
统计模型是我们用来辅助理解我们的数据的工具,它们给予我们的仅仅是接近于现实的见解。问 题不在于我们是否违背假设,而是当我们解释结果并对其进行推断时,这么做有多大程度会让我们误入歧途。
线性
残差正态
方差齐性
独立性
回答”何时”(when)或”对谁”(whom)的问题属于调节作用分析的范畴,关于“如何”这一类的问题才属于中介作用的范畴,这也是本章的重点。
## [1] "id" "X" "C1" "Y" "W"
## [1] "Y" "C1" "X" "C2" "W2" "W1" "C3"
一些社会现象,可能对于某一类型的人具有正面影响,而对另一类型的人具有负面影响;或者对于某一种刺激来说没有影响,而对另一种刺激却有。
例如性别:一个效应可能对女性有较大影响,但对男性的影响却微乎其微
模型化:当研究者试图确定某一变量是否影响或与某个变量对另一变量的影响的大小有关时,调节分析是恰当的分析方法。
定义调节: 如果变量W可以决定或预测自变量X对因变量Y的影响的大小、符号或强度, 那么可以说自变量X对某个因变量Y的影响受到变量W的调节。在 这种情况下,W被称为X对Y的影响的调节变量(moderator),或者说W和X的交互(interact)影响Y。
调节作用与中介作用的区别
调节作用在很多社会科学理论中的重要作用
内容:根据涵化理论,频纂接触电视,人们就会以电视中描绘的那样来感知现实世界
例如,有人认为,电视新闻和大众电视所描绘的世界是一个敌对和危险的地方。因 此,根据涵化理论,一个人越多地接触电视媒体中所描绘的敌对和危险世界,他就越认为现实世界也是一样的残忍和敌对。电 视观看频率(W)调节某些个体差异(X),如性别和种族,对个体各种态度和看法的影响(Y),如人们所感知到的现实世界的危险和暴力程度.
一个多元回归模型,以两个前因变量X和W估计因变量Y。表 7.1给出了X和W不同组合情况下的\(\hat{Y}\)值 \[Y=i_Y+b_1X+b_2W+e_Y \tag{7.1}\]
## ────────────────────────────────────────────────────────
## X W Y = 4 + 1X + 2W Y = 4 + 1X + 2W + 1.5XW
## ────────────────────────────────────────────────────────
## 1 -1.000 0.000 3.000 3.000
## 2 0.000 0.000 4.000 4.000
## 3 1.000 0.000 5.000 5.000
## 4 2.000 0.000 6.000 6.000
## 5 -1.000 1.000 5.000 3.500
## 6 0.000 1.000 6.000 6.000
## 7 1.000 1.000 7.000 8.500
## 8 2.000 1.000 8.000 11.000
## 9 -1.000 2.000 7.000 4.000
## 10 0.000 2.000 8.000 8.000
## 11 1.000 2.000 9.000 12.000
## 12 2.000 2.000 10.000 16.000
## ────────────────────────────────────────────────────────
## ────────────────────────────────────────────────────────
## X W Y = 4 + 1X + 2W Y = 4 + 1X + 2W + 1.5XW
## ────────────────────────────────────────────────────────
## 1 -1.000 0.000 3.000 3.000
## 2 -1.000 1.000 5.000 3.500
## 3 -1.000 2.000 7.000 4.000
## 4 0.000 0.000 4.000 4.000
## 5 0.000 1.000 6.000 6.000
## 6 0.000 2.000 8.000 8.000
## 7 1.000 0.000 5.000 5.000
## 8 1.000 1.000 7.000 8.500
## 9 1.000 2.000 9.000 12.000
## 10 2.000 0.000 6.000 6.000
## 11 2.000 1.000 8.000 11.000
## 12 2.000 2.000 10.000 16.000
## ────────────────────────────────────────────────────────
\[ b_1=[\hat{Y}\mid(X=x,W=w)]-[\hat{Y}\mid(X=x-1,W=w)] \]
\[ b_2=[\hat{Y}\mid(W=w,X=x)]-[\hat{Y}\mid(W=w-1,X=x)] \]
b1:X每增加1个单位对Y的影响并不依赖于W。无 论W的值是多少,1个单位X的变化将会转化为\(b_1\)个单位Y的变化。1 个单位X的变化对的影响在W上是无条件的,在此意义上,它并不依赖于W。
b2:1个单位W的变化对Y的影响在X上是无条件的,它并不依于X。
结论:这种形式的回归模型不太适合用于检验调节作用。事 实上,与调节作用的概念相反。如 果X对Y的影响是受到这个模中其他变量的调节,这就意味着它的影响依赖于那个变量。
解决这一限制:意味着X的影响依赖于W,即W取不同值的时候,X对Y的影响也不一样的。一 般来说,这样一个模型可以写成: \[Y=i_y+f(W)X+b_2W+e_Y\]
f(W):其中\(f(W)\)是\(W\)的任意函数。比 如一个简单的函数\(f(W)=b_1+b_3W\)。W 的这个函数看起来像是一个简单线性回归模型,其中\(b_1\)是常数,\(b_2\)是W的回归系数,除了不是从\(W\)估计某个结果变量之外,它就是一个关于X对Y的影响的模型,将\(f(W)=b_1+b_3W\)带入方程
\[Y=i_y+(b_1+b_3W)X+b_2W+e_Y\] \[Y=i_y+b_1X+b_2W+b_3XW+e_Y \tag{7.2}\]
模型:其中\(XW\)是由\(X\)和\(W\)的乘积所构造的一个变量。图 7.1是对该模型的概念性描绘,图7.3是模型的统计图形式
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
具体例子:(为观察X和W的乘积作为前因变量时会产生什么样的影响) 假设\(i_y=4,b_1=1,b_2=2,b_3=1.5\),那么: \[ Y=4+1X+2W+1.5XW \] f(W):表7.1显示了\(x\)和\(W\)的不同组合所产生的\(\hat{Y}\)值,图7.2中面板B直观地描绘了这个模型。 \[θ_{X\rightarrow Y}= b_1+ b_3W \tag{7.3}\]
解读:总的来说,方程7.2所呈现的模型中,1个单位\(X\)的变化引起的\(\hat{Y}\)变化可以通过如下函数来表达。 其中\(θ_{x\rightarrow y}\)是\(X\)对\(Y\)的条件效应,它被定义为两个个案在X上相差1个单位时,它们的Y的估计值相差的数量。
实例:从表7.2可以看到,不同的\(W\)对应\(θ_{x\rightarrow y}\)的值。当 \(W\)增加1个单位时,两个个案在\(X\)上相差1.5个单位,将导致 \(\hat{Y}\) 相差\(b_3\)个单位。
## ───────────────────────────────────
## W b1+b3W f(W)|W X b2+b3X f(X)|X
## ───────────────────────────────────
## 1 0 b1 1 -1 b2-b3 0.5
## 2 1 b1+b3 2.5 0 b2 2
## 3 2 b1+2b3 4 1 b2+b3 3.5
## 4 3 b1+3b3 5.5 2 b2+2b3 5
## ───────────────────────────────────
图7.2显著说明了限定X与Y的关系是无条件的模型和允许X与Y的影响依赖于W的模型之间的差异。
在面板A中,X对的影响被限定为独立于W,所以,连接X与的每条直线都平行(即斜率都相同)。从 面板A对应的表7.1中的数据,可以看出b1和b2互不影响:
b1与Y的变化:对于W=0,W=1,W=2,任意一种情况,1个单位X的变化将会转化为\(b_1\)个单位Y的变化。即 这三种情况下,都是X增加/降低1,Y也增加/降低1
b2与Y的变化:对于X=0,X=0,X=1,X=2,任意一种情况,1个单位W的变化将会转化为\(b_2\)个单位Y的变化。即 这四种情况下,都是W增加/降低1,Y也增加/降低2
在面板B中,\(X\)对Y的影响依赖于\(W\),它表现在不同的\(W\)值连接\(X\)与的直线的斜率不同,所以,这些直线不平行。
b1与Y的变化:取决于W,W每增加一个单位,X对Y的影响就增加1.5(b3)个单位
b1与Y的变化相等的情况:当W=0,X变化1个单位,Y也变化1个单位,即b1+b3=1+0X1.5
Y的变化比b1多1.5(=b3W=1.5X1)倍:但当W=1,X变化1个单位,Y变化了2.5个单位,即b1+b3=1+1X1.5
Y的变化比b1多3(=b3W=1.5X2)倍:当W=2,X变化1个单位,Y变化了4个单位,即b1+b3W=1+2X1.5
Y的变化比b1多4.5(=b3W=1.5X3)倍:当W=3,X变化1个单位,Y变化了5.5个单位,即b1+b3W=1+3X1.5
Y的变化与b2,情况与b1同理
面板A与B的对比:可以看出面板A中其实就是添加了b3=0的限制,即
\[ Y=4+1X+2W+0XW=4+1X+2W \]
b3的解读
b3反应依赖程度:在调节作用的概念图中,直线的不平行程度取决于\(b_3\)的值
具体实例:其中\(b_3\)是当\(W\)增加1个单位时,连接\(X\)与\(\hat{Y}\)直线的斜率变化。$ $ b_3$的绝对值越大,直线斜率就越从平行发散开来
\[Y=i_y+(b_1+b_3W)X+b_2W+e_Y \tag{7.4}\] \[Y=i_y+θ_{X\rightarrow Y}X+b_2W+e_Y \tag{7.5}\]方程7.4和7.5很清楚了地反映了X对Y的影是如何依赖于W。但 是,这个方程可以表示W对Y的影响受到X的调节: \[Y=i_y+b_1X+(b_2+b_3X)W+e_Y \tag{7.6}\] \[Y=i_y+b_1X+θ_{W\rightarrow Y}W+e_Y \tag{7.7}\] 其中\(θ_{W\rightarrow Y}\)是W对Y的条件效应即\(b_2+b_3X\)。
\(b_1\):方程7.3清晰地解释了b1的意义。假 设W为0,那么方程7.3可以简化为f(W)=b1因此,b1是当W=0时,X对Y的条件效应。也 就是说,b1量化了当W=0时,两个个案在X上相差1个单位,它们在Y上的差异。
b2:当X=0时,f(X)=b2。因 此,b2是当X=0时W对Y的条件作用。
\(b_3\)的解释:对于W的不同值,X对Y的条件效应值可以在表7.2中看到,W增加1个单位,X对Y的条件作用也变化\(b_3\)个单位。
当W被视为X与Y之间关系的调节变量时:那么\(b_3\)就表示当W变化1个单位时,两个在X上相差1个单位的个案,它们的Y的差异值。
当X被定义为W与Y之间关系的调节变量时:那么\(b_3\)就表示当X变化1个单位时,两个在W上相差1个单位的个案,在Y上的差异值。
\[b_3=<[\hat{Y}\mid(X=x;W=w)]-[\hat{Y}\mid(X=x-1;W=w)]>\\-<{[\hat{Y}\mid(X=x;W=w-1)]-[\hat{Y}\mid(X=x-1;W=w-1)]} >\tag{7.8}\]
注意
\(b_1\)与\(b_2\)的解释与当XW不作为前因变量的解释十分不同。
当 XW作为一个前因变量与X和W都在Y的模型中:那么\(b_1\)与\(b_2\)就是条件作用
但是如果在模型中XW不作为一个前因变量:那么\(b_1\)与\(b_2\)就是无条件的。
讨论调节作用时\(b_3\)的重要性
简单调节模型允许X对Y的影响是W的线性函数:然而,如果W不能线性地调节X的影响,关于\(b_3\)的t统计检验可最终确定X的影响是否真的取决于W,或者确定所获得的\(b_3\)是否只是因巧合而在研究者们所期望的范围内。
判断标准:研究者都同意需要\(b_3\)显著不为零的证据(通过假设检验或者置信间)来判定W可以作为X的影响的线性调节变量。如 果证据不能支持该论断,一个更简洁的模型可以将X对Y的影响修正为在W上是无条件的。即 :如果XW在模型中,\(b_1\)和\(b_2\)就是条件作用,但是并没有证据表明X的影响受W调节,\(b_1\)和\(b_2\)则作为偏效应而不是作为条件作用的估计值。
Y:参与者被问及他们是否支持联邦政府为减轻气候变化而采取的各种政策和行动。
X:负面情绪的任何影响都与模型中的其他变量无关。
W年龄:是一个17~87岁之间的连续变量
模型:我们想要知道年龄(W)和负面情绪(X)对支持政府行动(Y)的影响之间是否存在线性关系。控 制变量(C)为政治意识形态、性别和积极情绪。图 8.4的面板A是这个模型的概念图,它显示了负面情绪是焦点预测变量X,年龄是调节变量W。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
该模型的线性回归方程式是: \[ Y=i_Y+b_1 X+b_2 W+b_3X W+b_4C_1+b_5C_2+b_6C_3+e_Y(8.4) \]
面板B:图7.5中的面板B显示了该模型的统计图,研究者们所感兴趣的是通过推断检验来估计\(b_3\)的值。
b3不显著:如果\(b_3\)的值不是显著地不为零(通过假设检验或者\(Tb_3\)的置信区间包含0),这就意味着X与Y之间的关系不依赖于W(至少不是线性地)。
\(b_3\)的值显著地不为零:那么我们可以得出结论,即X与Y之间的关系依赖于W。估 计这个模型无须特殊的建模软件。简 单地构造X和W的乘积项XW,并将它作为一个前因变量,和X、W一起纳人Y的OLS回归模型中。
总结:其中X是对全球气候变化的负面情绪,W是年龄,C1、C2、C3分别是积极情绪、政治意识形态和性别。如 果\(b_3\)显著不为零,就证明负面情绪对政府行动支持度的影响受年龄调节。
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(6, 808) = 90.08, p = 2e-86 ***
## R² = 0.40081 (Adjusted R² = 0.39636)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────────
## (Intercept) 5.174 (0.338) 15.287 <.001 *** [ 4.510, 5.838]
## C1 -0.021 (0.028) -0.768 .443 [-0.076, 0.033] 1.029
## C2 -0.212 (0.027) -7.883 <.001 *** [-0.264, -0.159] 1.199
## C3 -0.011 (0.076) -0.147 .883 [-0.160, 0.138] 1.053
## X 0.120 (0.083) 1.449 .148 [-0.042, 0.282] 11.595
## W -0.024 (0.006) -3.993 <.001 *** [-0.036, -0.012] 6.949
## X:W 0.006 (0.002) 4.104 <.001 *** [ 0.003, 0.009] 16.455
## ────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ────────────────────────────────────────────────────────────────────────
## C1 -0.021 (0.028) -0.768 .443 [-0.075, 0.033] -0.027 -0.021
## C2 -0.235 (0.030) -7.883 <.001 *** [-0.294, -0.177] -0.267 -0.215
## C3 -0.004 (0.028) -0.147 .883 [-0.059, 0.051] -0.005 -0.004
## X 0.134 (0.093) 1.449 .148 [-0.048, 0.316] 0.051 0.039
## W -0.287 (0.072) -3.993 <.001 *** [-0.428, -0.146] -0.139 -0.109
## X:W 0.453 (0.110) 4.104 <.001 *** [ 0.236, 0.670] 0.143 0.112
## ────────────────────────────────────────────────────────────────────────
\[ Y=5.174+0.120X-0.024W+0.006X W-0.021C_1-0.212C_2-0.011C_3 \]
b3:我们的关注点是年龄和负面情绪乘积项的回归系数,它为正并且是著的,\(b_3\) =0.006, t(808)=4.104, p<0.001,而且解释了支持政府动中1.25%的方差。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 1
## Model Type : Simple Moderation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : -
## - Moderators (W) : W
## - Covariates (C) : C1, C2, C3
## - HLM Clusters : -
##
## Formula of Outcome:
## - Y ~ C1 + C2 + C3 + X*W
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ─────────────────────────────────────
## (1) Y (2) Y
## ─────────────────────────────────────
## (Intercept) 4.016 *** 5.174 ***
## (0.187) (0.338)
## C1 -0.027 -0.021
## (0.028) (0.028)
## C2 -0.221 *** -0.212 ***
## (0.027) (0.027)
## C3 -0.016 -0.011
## (0.076) (0.076)
## X 0.440 *** 0.120
## (0.026) (0.083)
## W -0.024 ***
## (0.006)
## X:W 0.006 ***
## (0.002)
## ─────────────────────────────────────
## R^2 0.388 0.401
## Adj. R^2 0.385 0.396
## Num. obs. 815 815
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘interactions’ (v1.2.0)
## Effect Type : Simple Moderation (Model 1)
## Sample Size : 815
## Random Seed : -
## Simulations : -
##
## Interaction Effect on "Y" (Y)
## ──────────────────────────────
## F df1 df2 p
## ──────────────────────────────
## X * W 16.84 1 808 <.001 ***
## ──────────────────────────────
##
## Simple Slopes: "X" (X) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ─────────────────────────────────────────────────────────────
## 33.205 (- SD) 0.330 (0.038) 8.762 <.001 *** [0.256, 0.404]
## 49.536 (Mean) 0.433 (0.026) 16.507 <.001 *** [0.382, 0.485]
## 65.867 (+ SD) 0.537 (0.035) 15.298 <.001 *** [0.468, 0.605]
## ─────────────────────────────────────────────────────────────
调节模型:因此我们所感兴趣的是,干旱原因表述(X)对拒绝提供援助的理由强度的影响(Y)是否依赖于气候变化怀疑态度(W)。
理论模型的含义:为了检验X对Y的影响受到W的调节,另外一项允许X的效应是W的函数,纳入从X和W对Y的回归模型中。
对应的公式:这里,我们估计回归模型的系数,其中干早原因对拒绝援助的理由的影响允许随着气候变化怀疑态度呈线性变化,通过将X和W的乘积纳入X和W对Y的回归模型中作为一个前因变量: \[Y=i_Y+b_1X+b_2W+b_3XW+e_Y\]
为何要可视化调节效应
辅助解读:一个具有两个自变量的乘积项的回归模型是数据的抽象数学表达,比没有乘积项的模型更难解释。
b1和b2的解读困难:正如之前所描述的,X和W的系数是可能没有实质意义的条件效应,XW的系数解释为差异之间的差异,当没有其他更多的信息的时候,这种差异很难解释。
b3的解读困难:虽然\(b_3\)的系数具有明确的数学意义,即使系数的符号与预计的方向一致,这并不意味着结果与研究者的预测一致。当 试图理解一个具有前因变量所组成的乘积项的回归模型时描绘模型可以成为重要的解释性辅助手段。为 了得到模型的直观呈现,建议使用回归模型从X和W的不同组合得出一系列Y的估计值,然后将绘制为X和W的函数。这 可以通过使用您觉得方便的任何图形程序来完成。
精确说明:有人说一张图胜过说千言万语,但需要千言万语来使人相信。
就算有证据表明X对Y的影响受到W的调节,但这并不意味着X对Y的影响只对在W较高的人中才成立,而对在W较低的人却不成立。
W取值的任意性:对于一个人所选择的W的任一值,估计出的X对Y的影响值都存在概率成分。
为了应对这种不确定性,通常在检验过交互效应之后,再增加一组额外的推断检验,以确定在调节变量的分布中,什么情况下X对Y的影响是显著的,什么情况下是不显著的。这 个做法一般被称为”探测”交互作用,就像人们在杂货店摸一下鳄梨或者忙果以评估它的成熟度,是为了确定在调节变量的分布中,哪些情况下X和Y相关,哪些情况下不相关,以便更好地区分交互效应的实质性解释。
在本节,我将介绍探测交互作用的两种方法,一种较为常用,另一种不太常用,但是因计算机使其更容易实现,它也变得越来越受欢迎。
选点法(Pck-a-Point Approach)(Rogosa,1980;Bauer & Cuman,2005):有时也称作简单斜率分析或焦点分析,它可能是目前探测交互效应最为流行的方法,并且在多重交互回归的许多讨论中也多有描述。在 此过程中,涉及选择调节变量W的一个或多个值,计算当W等于这个或这些值时,X对Y条件作用\(\theta_{X\rightarrow Y}\),然后进行推断检验或者产生一个置信区间。
SE:这么做的话对于选定的W值,需要得到X的条件作用的标准误估计值: \[se\theta_{X\rightarrow Y}=\sqrt{se_{b_{1}}^2+(2W)COVb_1b_3+W^2se_{b_{3}}^2} \tag{7.13}\]
其中\(se_{b_{1}}^2\)和\(se_{b_{3}}^2\)分别是\(b_1\)和\(b_3\)的标准误平方
W是调节变量的任一选定值
\(COVb_1b_3\)是重复采样中\(b_1\)和\(b_3\)的协方差:除 了\(b_1\)和\(b_3\)的协方差所有值在OLS回归程序的标准输出中可得,\(COVb_1b_3\)是可选输出项W的特定值与其标准误之比\(\theta_{X\rightarrow Y}\)服从当取W值时\(_T\theta_{X\rightarrow Y}=0\)这零假设的(\(df_{residual}\))分布。可 以从t值表中获取这个比率的p值,或者使用方程2.16,将\(\theta_{X\rightarrow Y}\)替换为\(b\),将\(se \theta_{X\rightarrow Y}\),誉换为\(se\theta\),从而生成一个置倍区间。
计算机自动计算
不建议不用手工进行这些计算:因为出现错误的可能性非常大,除非您可以精确到小数点后许多位,并且您对做这些感到非常舒服且信心十足。
多个步骤自动化:如果使用计算机进行以下要介绍的回归中心化法,这种方法实现起可以非常轻易地做到高精确度。而 且,如果您熟练掌握PROCESS的话,回归中心化都不必使用了,因为PROCESS中可以实现选点法。关 于选点法手动计算实例可参考Aiken和West(1991)以及Cohen等(2003)。
两种选点法
+/-SD选点:正如在气候变化研究中,当W是一个定量变量,那么在探测交互作用时,一种常见策略是佔计当W等于其均值、均值之下一个标准差、均值之上一个标准差时X对Y的条件效应。这 就允许您确定在那些处于调节变量的”相对较低”(\(\bar{W}-SD_W\))、“中等”(\(\bar{W}\))和”相对较高”(\(\bar{W}+SD_W\))值的人中,X是否与Y相关。
三分位选点:但是我建议如果您准备采用选点法,并且没有其他的方式来选择W值,那么采用W分布中的第16分位、50分位和84分位的值来对相对较低、中等和相对较高进行操作化。
推荐三分位法的原因:正如7.3节中讨论的,如果W偏度较大的话,均值的上下一个标准差可能会高于数据中的最大值或低于最小值,或是可能甚至超出变景的尺度范围。您 不可能想去使用超过调节变量观测范围的值去探测交互效应。
三分位法的优势:但是无论W的分布形状如何,第16分位数和84分位数总是会在观测数据范围内,并且W分布的中位数(第50百分位数)一直是对于中心较为明智的描述,如果W是有偏的,均值可能就未必了。虽 然使用百分位数有些奇怪(例如,为什么不使用第25分位、50分位和75分位这些比较好看的数字呢),但是如果W是完全正态分布的话,那么第16分位、50分位和84分位就分别对应着均值减去1个标准差、均值和均值加上1个标准差。
如果您的模型中包含协变量:那么您在计算包含X和W的项所组成的\(\hat{Y}\)值时不能忽略协变量。
系数处理:在回归模型中,每一个协变量都会有一个回归系数。当 计算\(\hat{Y}\)值进行绘图时,这些回归系数应该和它们所对应的均值一起使用。
例如,假设气候变化包含\(C_1\)和\(C_2\)这两个协变量。作 为X和W的函数的Y将是那些在\(C_1\)和\(C_2\)取平均值的人的估计值。虽 然看似奇怪,但是使用协变量的均值是可取的
二分变量的协变量:并且用两个任意数字编码。只 需要使用这两个任意数值的均值。
协变量是具有g个类别的多分类变量:也可以这样处理。只 需使用表示模型中的组别的\(g-1\)个代码中每个的均值。
选点法的缺陷:请记住,使用W分布的百分位数来表示调节变量的低、中和高水平是比较武断的。而 且,这些只是针对具体样本的操作化。如 果他/她的样本在\(W\)的平均水平都较低,那么您称之为低的调节变量,可能在他们那里称之为高。当 然,如果您像别的研究者一样使用均值减去一个标准差,均值和均值加上一个标准差,这样做也是对的。如 果您使用的调节变量是您所在的领域内所广泛使用的变量,并且对低、中、高的定义存在既有规则达成了一致看法,那么使用这些值而不是选择调节变量在特定样本中的分布的值可能会更合乎情理。
使用第7.3节中描述的相同的过程可以生成交互效应的直观图形:W是一个连续变量,因此使用了W分布的第16分位数、50分位数和84分位数。
但由于该模型包含协变量,因此需要额外的步骤
在此例中,C1、C2和C3的平均值分别为3.132、4.083和0.488。因 此,当协变量的值以均值代入时,Y的方程是: \[ \hat{Y}=5.174+0.120X-0.024W+0.006XW-0.021(3.132)-0.212(4.083)-0.011(0.488) \] 该方程可以简化为: \[ \hat{Y}=4.237+0.120X-0.024W+0.006XW \]
性别(SEX)作为二分的协变量的样本均值:如果二分变量被编码为0和1,那么均值就是编码为1的组内的个案所占的比例。但 是无论组别是如何编码的,使用均值都能起作用,即使这些均值本身没有意义
画图工具介绍
SPSS的PROCESS免去了这个过程的很多麻烦。在 使用plot选项时,PROCESS会将所有协变量设置为样本均值,然后生成一个焦点预测变量和调节变量不同组合时的Y的估计值的图表。这 个图表中的结果可以导人您所喜欢的图形程序中,以生成图表。S PSS版本的PROCESS甚至可以编写出必要的代码,然后您可以将PROCESS的输出结果剪切并粘贴到语法窗口,然后执行命令生成图表。
SPSS的PROCESS宏可以帮助您编写一个SPSS序,该程序可以从输出结果中剪切,然后粘贴到语法窗口执行运算。您 以在PROCESS命令中设定plot=1,诸求PROCESS生成绘图。这 样做可得到图7.6底部的结果
散点图:当您执行此SPSS代码时,其中包含六个点(X和W的每个组合对应1个点),两个条件组的颜色不同。您 可以在SPSS中对此进行编辑,以生成图7.7那样,大多数是在SPSS中生成的,然后将其导入到更精细的图形编辑程序中进行微调。
SAS版本中的PROCESS具有类似的功能,但它不会编写生成图形的整个程序。相 反,它仅可以为您生成表7.5中的数据,然后围绕生成的数据编写一个程序。
R是一种统计运算平台,因为它具有出色的绘图能力,近年来大受迎。以 的R程序可以使用刚才述的程序中产生的数据,来绘制干旱灾害原因表述和气候变化怀疑态度间的交互作用图。如 果对R稍有了解的话,该程序可以稍微改写以改变线条的颜色、直线的样式等。
总体:图8.6可以看出,无论年龄,全球气候变化的负面情绪对支持政府减缓气候变化行动的景响都是正向的。
高组:但是,在那些年纪较大的人中,负面情绪和支持距府行为的直线的斜率更陡一些。也 就是说,负面情绪的影响在年龄相对较大(在这个图中,70岁)的群体中比年龄相对较小(这里是30岁)的人中要大。
斜率角度的解读:图8.6中直线的斜率是当W取任意值时\(\theta_{X \rightarrow Y}\)的值。X 的条件效应有的被称为”简单斜率”,它可以被正式量化,并且使用选点法进行推断检验正如第7章中所描述的,回归模型是: \[ Y=i_Y+b_1 X+b_2 W+b_3X W+b_4C_1+b_5C_2+b_6C_3+e_Y \]
或者 \[ Y=i_Y+\theta_{X \rightarrow Y} X+b_2 W+b_4C_1+b_5C_2+b_6C_3+e_Y \]其中\(\theta_{X \rightarrow Y}=b_1+b_3 W\)。从 模型的回归系数来看,\(\theta_{X \rightarrow Y}=0.120 + 0.006W\)。代 入不同的W值,可以得到X在那些W值上的条件效应。无 论选择什么值,一旦为这些值生成\(\theta_{X \rightarrow Y}\),使用方程7.3就可以得到标准差,以及可以基于 \(t\left(d f_{\text {residual }}\right)\)分布计算p值。
选点随意性:选点法存在一个重大的问题,它要求通过选样W值来估计X对Y的条件作用。不 同的选择可能会导致不同的结论,而这些选择常常是比较随意的。
惯例做法:选择均值,均值加减1个标准差,或者可能选择使用分布的各种百分位数来表示调节变量的低、中、高水平,都完全是随意的。虽 然这种依据惯例选择W值的做法在探测交互作用的书籍和期刊文献中广泛讨论及推荐(例如,Aiken & West,1991;Cohen et al.,2003),但这并未使这些值的随意性有所减少。
缺点:正如之前所讨论的,这种指定是针对具体样本的。一 个样本中相对较低的值可能在另一个样本中是中等或相对较高的值,这就可能会导致文献中关于同一主题的研究出现虚假的不一致。
JN图克服选点随意性:您可以通过使用詹森-内曼技术(The Johnson-Ncyman Technique)解决选择的W值的随意性,这种方法也被Spiller等(2013)称为探照灯分析(floodlight analysis)。
来源:最初是发明来解决当在协方差分析中回归假设的方差齐性违背时,检验两组之间的均值差异(Johnson & Neyman,1936;Johnaon & Fey,1950;Rogosa,1980)。
发展:随后出Bauer和Curranto 将其扩展到更为广泛的回归模型。它 逐渐流行起来。詹 森-内曼技术探测交互效应的应用实例可以参见Beach等(2012);Coronel和Federmeier(2016);Keng等(2016);Prinzie等(2012);Simons等(2012);Waldet等(2014)。
JN的原理
使用前提:詹森-内曼技术,仅当W是连续变量的时候才可以使用
本质:实质上是选点法的反向应用。
使用选点法,可以计算在已知W值的情况下:X对Y的条件效应与它的标准误的比值。使 用t分布,可以得到这个比值的p值,然后基于p值进行推断。无 须得到既定t值的p值
詹森-内曼技术可推导出W值:这样一来条件效应及其标准误的比值正好等于\(t_{crit}\),即与\(p=a\)相关联的\(t\)的临界值,其中a是为推断选择的显著性水平。方 程如下: \[t_{crit}=\frac{\theta_{X\rightarrow Y}\mid{W}}{se_{\theta_{X\rightarrow Y}\mid{W}}}\] 或者,在\(\hat{Y}=i_y+b_1X+b_2W+b_3XW\)的模型中: \[t_{crit}=\frac{b_1+b_3W}{\sqrt{se_{b_{1}}^2+(2W)COVb_1b_3+W^2se_{b_{3}}^2}}\] 詹森-内曼技术可以得到当W被分离出来时二次方程的根,该方程式的根将是条件效应与其标准误之比正好为\(t_crit\)的W值,也就是p=a。具 体的计算过程参见Bauer和Curran(2005)或Hayes和Matthes(2009)。
本例中的JN图
黑色实线:图8.7会使上述解释更加清楚。在 该图中,黑色实线是X的条件效应\(\theta_{X \rightarrow Y}\),它被定义为函数\(b_1+b_3 W\),或在此分析中为0.120+0.006W。
虚线:\(\theta_{X \rightarrow Y} \mid W\)的95%置信区间的上限和下限(使用方程7.13中估计的标准误,这里大约是\(\theta_{X \rightarrow Y}\)加减两个标准误估计值)。
与图 7.9的对比来解读图8.7:图7.9中,对于调节变量的某些值,置信区间包含0而另外一些则没有。而 图8.7中,置信区间却总是高于0。换 句话说,当您选择任意年龄值时,负面情绪的条件效应的置信区间在所有年龄值上都大于0,所以负面情绪的条件效应是显著为正的。因 此,X的显著区域即是W的整个分布。
JN图的三种可能性:二次方程包含两个根,意味着詹森-内曼技术会产生2个W的解,我在下面的分析中使用\(JN_{w_1}\)和\(JN_{w_2}\)来讨论,并且\(JN_{w_1}\)<\(JN_{w_2}\)。W 的这些值將W的连续轴划分为许多点,在显著性水平为a的条件下,正是在这条轴上,X对Y的条件作用在显著与不显著之间转换。因 此,通过这种方式可以确定X对Y影响的”显著区域”。在 实践中,通常这些值中的一个或两个可能在W的测量范围之外,或者在虚数域内。这 樣的\(JN_{w_1}\)和\(JN_{w_2}\)值应该被忽略,因为他们并不存在。考 虑到这个告诫,当使用詹森-内曼技术,这里会出现三种可能的结果。
第一个可能的结果是,詹森-内曼技术会产生调节变量测度内的一个解,称这个值为\(JN_{W_1}\)。当 产生这个单一值时,就意味著,当为\(W\geq{JN_{W_1}}\)或当\(W\leq{JN_{W_1}}\)时,而不是同时在两个区间上,X对Y的条件作用在α水平上是显著的。这 就是当\(W\geq{JN_{W_1}}\)或\(W\leq{JN_{W_1}}\)当作X对Y的条件作用的显著性区域。
第二个可能的结果是,管森-内曼技术产生了在调节变量的测量范围内的两个解。当 这种情況发生时,X对Y的条件作用的显著区域是\(JN_{W_1}\leq{W}\leq{JN_{W_2}}\),或者是\({W}\leq{JN_{W_1}}\)和\(W\geq{JN_{W_2}}\)。前 者意味着当W在\(W在{JN_{W_1}}\)和\({JN_{W_1}}\)之间,X对Y的条件作用是显著的。后 者意味着当\({W}\leq{JN_{W_1}}\)时,以及当\({W}\geq{JN_{W_2}}\),X对Y的条件作用是显著的。
最后一种可能是在调节变量取值范用内没有解。这 意味着可能出现以下两种解释之一
一种解释是,X对Y的条件作用在调节变量的整个范围内是显著的,这意味着在W的连续轴上不存在条件作用在显著与不显著之间转换的点
第二种解释是,在观察到的调节变量的分布中,X对Y的条件作用并不显著,这也意味不存在某些点可以使得条件作用在显着与不显著之间转换。在 前一种情况下,X着对Y的条件作用在整个W测量范围区域内都显著;在后面一种情况下,不存在显著区域。
JN图的总结:
JN图的优势:相对于更传统的图8.6来说,图8.7所示的调节效应的图形描绘是一个方便的选择。图 8.7不仅提供了您所选择的调节变量任意值所对应\(\theta_{X \rightarrow Y}\)的点估计值,还以置信区间的形式为您所选择的值提供推断检验,从而比图8.6传达更多的信息
与调节图一致的结论
根据使用詹森-内曼技术的PROCESS输出结果:在这些数据中,年龄分布中并没有点使得负面情绪对政府行动支持度的条件效应在统计显著与不显著之间转换(显著水平α=0.05)。
结论:对于数据中的任何年龄值,负面情绪的条件效应都是显著正向的。S PSS的PROCESS输出结果,它告诉您并没有识别出转换区域。
检验差异:探测调节效应涉及确定当W取特定值的时候,X对Y的条件效应是否与0有显著差异(如果使用选点法)。或 者探测在W的分布中,哪里可以实现X对y的条件作用显著与不显著的过渡(如果使用詹森-内曼技术)。
本质:詹森-内曼技术相比选点法来说可以提供更多的信息,但是它们分析的基本目标是一样的,即W分布中的哪个区域X对Y产生影响,哪个区城X对Y没有影响。
选点法:正如Aiken和West(1991)所讨论的那样,结果证明,检验线性调节模型中X对Y的影响取决于W,等同于在检验模型中X对Y的任意两个效应值是否有差异,无论\(W_{w_1}\)和\(W_{w_2}\)取何值。在 \(W_{w_1}\)和\(W_{w_2}\)两种条件下X的两个条件效应值的差异是: \[(b_1+b_3w_2)-(b_1+b_3w_1)= b_3(w_2-w_1)\]
变量范围及对回归系数的可解释性的影响:正如已经讨论过的,对\(b_1\)和\(b_2\)的解释要务必小心,并且要考虑到X和W的取值范围,因为如果超出变量的范围,这些系数和它们的显著性检可能没有实质性意义。但 是,通常可以在分析之前重新对X及(或)进行范围设置,以使得\(b_1\),和\(b_2\)可以被解释。
中心化:一个方便的转化就是变量中心化(centering),将数据中变量的每一值都减去一个常数。如 果在构造X和W的乘积项之前将它们中心化,那\(b_1\)和\(b_2\)仍然表示条件作用。
常规操作:如果一个模型中包含X和W的乘积项作为前因变量,那么需要将X和W进行均值中心化。
数学上
传统认为错误:\(Y=i_Y+b_1X+b_2W+b_3XW+e_Y\)
传统认为正确: \[Y=i_Y+b_1(X-\bar{X})+b_2(X-\bar{W})+b_3(X-\bar{X})(W-\bar{W})+e_Y\] 也写做:\[Y=i_Y+b_1X'+b_2W'+b_3X'W'+e_Y\]其中\(X'=X-\bar{X}\),\(W'=W-\bar{W}\),一个有着均值中心化的前因变量和调节变量的回归模型可以被看作一个普通的调节模型,但是需要在计算X和W的乘积之前从X和W减去样本均值。
代码上:
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 1
## Model Type : Simple Moderation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : -
## - Moderators (W) : W2
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Outcome:
## - Y ~ X*W2
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ─────────────────────────────────────
## (1) Y (2) Y
## ─────────────────────────────────────
## (Intercept) 2.757 *** 4.335 ***
## (0.099) (0.330)
## X 0.514 *** 0.147
## (0.025) (0.085)
## W2 -0.031 ***
## (0.006)
## X:W2 0.007 ***
## (0.002)
## ─────────────────────────────────────
## R^2 0.334 0.354
## Adj. R^2 0.333 0.352
## Num. obs. 815 815
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘interactions’ (v1.2.0)
## Effect Type : Simple Moderation (Model 1)
## Sample Size : 815
## Random Seed : -
## Simulations : -
##
## Interaction Effect on "Y" (Y)
## ───────────────────────────────
## F df1 df2 p
## ───────────────────────────────
## X * W2 20.03 1 811 <.001 ***
## ───────────────────────────────
##
## Simple Slopes: "X" (X) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## "W2" Effect S.E. t p [95% CI]
## ─────────────────────────────────────────────────────────────
## 33.205 (- SD) 0.384 (0.038) 10.132 <.001 *** [0.310, 0.458]
## 49.536 (Mean) 0.501 (0.025) 19.810 <.001 *** [0.451, 0.550]
## 65.867 (+ SD) 0.617 (0.035) 17.846 <.001 *** [0.549, 0.685]
## ─────────────────────────────────────────────────────────────
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 1
## Model Type : Simple Moderation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : -
## - Moderators (W) : W2
## - Covariates (C) : -
## - HLM Clusters : -
##
## All numeric predictors have been grand-mean centered.
## (For details, please see the help page of PROCESS.)
##
## Formula of Outcome:
## - Y ~ X*W2
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ─────────────────────────────────────
## (1) Y (2) Y
## ─────────────────────────────────────
## (Intercept) 4.587 *** 4.597 ***
## (0.039) (0.038)
## X 0.514 *** 0.501 ***
## (0.025) (0.025)
## W2 -0.005 *
## (0.002)
## X:W2 0.007 ***
## (0.002)
## ─────────────────────────────────────
## R^2 0.334 0.354
## Adj. R^2 0.333 0.352
## Num. obs. 815 815
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘interactions’ (v1.2.0)
## Effect Type : Simple Moderation (Model 1)
## Sample Size : 815
## Random Seed : -
## Simulations : -
##
## Interaction Effect on "Y" (Y)
## ───────────────────────────────
## F df1 df2 p
## ───────────────────────────────
## X * W2 20.03 1 811 <.001 ***
## ───────────────────────────────
##
## Simple Slopes: "X" (X) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## "W2" Effect S.E. t p [95% CI]
## ─────────────────────────────────────────────────────────────
## 33.205 (- SD) 0.384 (0.038) 10.132 <.001 *** [0.310, 0.458]
## 49.536 (Mean) 0.501 (0.025) 19.810 <.001 *** [0.451, 0.550]
## 65.867 (+ SD) 0.617 (0.035) 17.846 <.001 *** [0.549, 0.685]
## ─────────────────────────────────────────────────────────────
##
## Model Summary
##
## ─────────────────────────────────────────────
## M1. No center M2. Mean-Centered
## ─────────────────────────────────────────────
## (Intercept) 4.335 *** 4.597 ***
## (0.330) (0.038)
## X 0.147 0.501 ***
## (0.085) (0.025)
## W2 -0.031 *** -0.005 *
## (0.006) (0.002)
## X:W2 0.007 *** 0.007 ***
## (0.002) (0.002)
## ─────────────────────────────────────────────
## R^2 0.354 0.354
## Adj. R^2 0.352 0.352
## Num. obs. 815 815
## ─────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
系数解读的前提:在估计形式为\(\hat{Y}=i_Y+b_1X+ b_2W+b_3XW\)的模型时,无论是否进行了中心化,\(b_1\)、\(b_2\)和\(b_3\),都是以X、W 和Y的测量尺度解释(例如,以非标准化形式)。
两种常用的标准化的方法一对一错:标准化原始数据可以得到被解释为标准化回归系数的。但 是其中一个一定不要用或解释。在 本节中,我将讨论这两种变体
在标准化的第一种变体:将X和W标准化后产生\(Z_x\)和\(Z_w\),然后将这种标准化的X和W相乘得到\(Z_xZ_w\)。
\(Z_Y=i_{Z_Y}+b_1Z_x+b_2Z_w+b_3Z_xZ_w+e_{Z_Y}\)
谬误:和均值中心化一样,必须标准化X是一个谬论,而且该结果在软件中可直接获得
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 811) = 148.07, p = 2e-76 ***
## R² = 0.35389 (Adjusted R² = 0.35150)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────────
## (Intercept) 4.335 (0.330) 13.154 <.001 *** [ 3.688, 4.981]
## X 0.147 (0.085) 1.729 .084 . [-0.020, 0.314] 11.473
## W2 -0.031 (0.006) -5.009 <.001 *** [-0.043, -0.019] 6.776
## X:W2 0.007 (0.002) 4.476 <.001 *** [ 0.004, 0.010] 16.357
## ────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ─────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ─────────────────────────────────────────────────────────────────────────
## X 0.165 (0.096) 1.729 .084 . [-0.022, 0.353] 0.061 0.049
## W2 -0.368 (0.073) -5.009 <.001 *** [-0.512, -0.224] -0.173 -0.141
## X:W2 0.511 (0.114) 4.476 <.001 *** [ 0.287, 0.735] 0.155 0.126
## ─────────────────────────────────────────────────────────────────────────
例子:年龄(W)对气候变化的负面情绪反应(X)与支持政府减缓气候变化的行为(Y)之间关系的调节效应的R命令是:
Model 3. Standardized Variant 1
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 811) = 148.07, p = 2e-76 ***
## R² = 0.35389 (Adjusted R² = 0.35150)
##
## Unstandardized Coefficients:
## Outcome Variable: I(scale(Y))
## N = 815
## ────────────────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────────────────────
## (Intercept) 0.007 (0.028) 0.263 .792 [-0.048, 0.063]
## I(scale(X)) 0.562 (0.028) 19.810 <.001 *** [ 0.507, 0.618] 1.012
## I(scale(W2)) -0.063 (0.028) -2.237 .026 * [-0.119, -0.008] 1.003
## I(scale(X)):I(scale(W2)) 0.131 (0.029) 4.476 <.001 *** [ 0.074, 0.188] 1.009
## ────────────────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: I(scale(Y))
## N = 815
## ─────────────────────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ─────────────────────────────────────────────────────────────────────────────────────────────
## I(scale(X)) 0.562 (0.028) 19.810 <.001 *** [ 0.507, 0.618] 0.571 0.559
## I(scale(W2)) -0.063 (0.028) -2.237 .026 * [-0.119, -0.008] -0.078 -0.063
## I(scale(X)):I(scale(W2)) 0.127 (0.028) 4.476 <.001 *** [ 0.071, 0.183] 0.155 0.126
## ─────────────────────────────────────────────────────────────────────────────────────────────
| M1. No center | M2. Mean-Centered | M3. Z-Score | ||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Predictors | Estimates | S.E. | t-value | p | Estimates | S.E. | t-value | p | Estimates | S.E. | t-value | p |
| (Intercept) | 4.33 | 0.33 | 13.15 | <0.001 | 4.60 | 0.04 | 119.59 | <0.001 | 0.01 | 0.03 | 0.26 | 0.792 |
| X | 0.15 | 0.09 | 1.73 | 0.084 | 0.50 | 0.03 | 19.81 | <0.001 | ||||
| W 2 | -0.03 | 0.01 | -5.01 | <0.001 | -0.01 | 0.00 | -2.24 | 0.026 | ||||
| X:W2 | 0.01 | 0.00 | 4.48 | <0.001 | 0.01 | 0.00 | 4.48 | <0.001 | ||||
| I(scale(X)) | 0.56 | 0.03 | 19.81 | <0.001 | ||||||||
| I(scale(W2)) | -0.06 | 0.03 | -2.24 | 0.026 | ||||||||
| I(scale(X)):I(scale(W2)) | 0.13 | 0.03 | 4.48 | <0.001 | ||||||||
| Observations | 815 | 815 | 815 | |||||||||
| R2 / R2 adjusted | 0.354 / 0.352 | 0.354 / 0.352 | 0.354 / 0.352 | |||||||||
模型之间的相同点
上表中M1. No center和M2. Mean-Centered完全相同的地方是交乘项的所有值,包括:Estimate=0.01, SE=0.00, t=4.48, p=0.001
上表中M2. Mean-Centered和M3. Z-Score完全相同的地方是所有回归系数的t和p,包括
b1:t=19.81, p=0.001
b2:t=-2.24, p=0.026
所有三个模型都相同的
b3:t=4.48, p=0.001。M 1、M2和M3的b3的t统计量和p值都一样。因 此,标准化X和W对检验交互效应没有影响,这与检验调节假设必须进行标准化的谬论相反。
拟合指数:R2
模型之间的不同点
M1. No center和M2. Mean-Centered的不同点:均值中心化使得M2. Mean-Centered的针对b1和b2的解读结果比M1. No center容易
不中心化的情况:公式为Y=iy+b1X+b2W+b3XW的型
b1:当W=0时两个在X上相差一个单位的个案在Y上的差异
b2:估计的是当X=0时两个在W上相差一个单位的个案,在Y上的差异
在管理学中b1和b2通常无意义:
-原因:b1和b2取决于X和Y是如何测量的
-以W=0时的b1为例:若在测量系统里没有意义(问卷研究中量表一般是从1开始,如1-5或1-7),那么b1和它的显著性检验也是没有意义的,且也没有实质性的解释。但 是如果W=0是有意义的(若使用的问卷是0-4或者0-6),那么b1和它的显著性检验也是有意义的。b 2也是如此。
中心化的情况:均值中心化使得X和W的b1和b2更富有意义。尽 管它不是在所有情况下都是真的,但是一般情况下确实是的,所以这并不是谬论。
b1:估计的是当W处于平均水平时(即W=0时),两个在X上相差1个单位的个案在Y上的差异
b2:估计了当X处于平均水平时(即X=0时),两个在W上相差一个单位的个案在Y上的差异。
好处:这些都总是估计出在数据范围内的X对Y的条件影响,并且总是可以解释的
M3.Z-Score和M1和M2在系数上完全不同的原因:这是因为标准化改变了X、W和Y的度量。
M2. Mean-Centered:b1和b2估计的是当变量X和W中的一个取均值时,另一个原始变量对原始Y的条件效应。
M3. Z-Score:在标准化之后,X和W变化的度量从一个单位变成了一个标准差。
b1:当Zw=0(即,为均值),两个在Zx上相差1个标准差的个案,在Zy上相差几个标准差。
b2:估计的是当Zx=0(即,X取均值时),两个个案在Zw上相差1个标准差,它们在Zy上相差几个标准差。
尽管b3的回归系数与使用原始数据或中心化数据的模型中的回归系数有所不同,但是与b1和b2一样,标准化改变了X和Y的差值的度量
| Coefficient | M1.NoCenter | M2.MeanCentered | M3.Zscore |
|---|---|---|---|
| b1 | 当W=0时两个在X上相同一个单位的个案在Y上的差异 | 估计的是当W处于平均水平时(即W=0时),两个个案在X上相差一个单位的个案在Y上的差异 | 当Zw=0(即,平均值)时,两个X上相差1个标准差的个案,在Y上相差几个标准差。Zw=0是W为均值是由于b1估计的是Zw=0时Zx对Zy的效应这个事实。当W为均值时,Zw= 0 |
| b2 | 仅在X=0时两个在W上相同一个单位的个案在Y上的差异 | 估计了当X处于平均水平时(即X=0时),两个个案在W上相差一个单位的个案在Y上的差异 | 估计的是Zx=0(即,Zx均值时),两个个案在W上相差1个标准差,它们在Zy上相差几个标准差。 |
| b3 | 当年龄(W)增加1个单位时,两个在负面情绪反应(X)中相差1个单位的个案,他们在政府行为支持(Y)上的差值 | 与M1.NoCenter的b3解读完全相同 | 当年龄(Zw)增加1个标准差时,两个在负面情绪反应(Zx)中相差1个标准差的个案,他们在政府行为支持(Zy)上的标准差的差值 |
谬误来源:交乘项X*W和其构成变量X及W相关系数及p值的变化
## Pearson's r and 95% confidence intervals:
## ─────────────────────────────────────────
## r [95% CI] p N
## ─────────────────────────────────────────
## X-W2 -0.06 [-0.13, 0.01] .105 815
## X-XW2 0.77 [ 0.74, 0.79] <.001 *** 815
## W2-XW2 0.55 [ 0.50, 0.59] <.001 *** 815
## ─────────────────────────────────────────
## Pearson's r and 95% confidence intervals:
## ───────────────────────────────────────────────────────────
## r [95% CI] p N
## ───────────────────────────────────────────────────────────
## X_centered-W2_centered -0.06 [-0.13, 0.01] .105 815
## X_centered-XW2_centered 0.09 [ 0.02, 0.16] .008 ** 815
## W2_centered-XW2_centered -0.02 [-0.08, 0.05] .669 815
## ───────────────────────────────────────────────────────────
在估计结果变量Y的多元回归模型中,模型中前因变量j的标准误是:
\[se_{b_j}=\sqrt{\frac{MS_{residual}}{df_{residual}(s^2_j)}}\]
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 812) = 207.23, p = 2e-73 ***
## R² = 0.33793 (Adjusted R² = 0.33630)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 815
## ───────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ───────────────────────────────────────────────────────────────────
## (Intercept) 3.035 (0.158) 19.250 <.001 *** [ 2.726, 3.344]
## X 0.511 (0.025) 20.072 <.001 *** [ 0.461, 0.561] 1.003
## W2 -0.005 (0.002) -2.254 .024 * [-0.010, -0.001] 1.003
## ───────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 815
## ───────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────────
## X 0.574 (0.029) 20.072 <.001 *** [ 0.518, 0.630] 0.576 0.573
## W2 -0.064 (0.029) -2.254 .024 * [-0.121, -0.008] -0.079 -0.064
## ───────────────────────────────────────────────────────────────────────
## [1] "0.02546"
\(S^2\)是前因变量j的方差
\(MS_{residual}\)和\(df_{residual}(s^2_j)\)分别是模型Y的均方残差和残差自由度。
在R中SE的计算流程
## [1] "0.02545"
Hayes推荐的
\[se_{b_j}=\sqrt{\frac{1}{1-R^2_j}}\sqrt{\frac{MS_{residual}}{df_{residual}(s^2_j)}}\]
\[VIF=\sqrt{\frac{1}{1-R^2_j}}\]
## [1] "0.02557"
方差膨胀因子(Variance Inflation Factor, VIF)
标准误的计算公式
均值中心化的作用:均值中心化是在分析中常用的技术,特别是在处理高共线性问题时。它 指的是从每个变量的值中减去其平均值。这 样做的目的通常是为了减少变量之间的多重共线性,从而减少 VIF 值,进而降低标准误。
本例中:在您的例子中,均值中心化虽然显著降低了 \(XW\) 的 VIF(从 16.357 降到 1.009),但 \(XW\) 的方差同样按相同的比例降低(从 9489.221 降到 585.166)。因 此,尽管处理了共线性,标准误实际上并未改变。
## Results based on uncentered data
## ──────────────────────────────
## Term Variance VIF VIF/S2
## ──────────────────────────────
## 1 X:W2 9489.221 16.357 0.002
## ──────────────────────────────
## Results based on centered data
## ──────────────────────────────────────
## Term Variance VIF VIF/S2
## ──────────────────────────────────────
## 1 X:W2 Centered 585.165 1.009 0.002
## ──────────────────────────────────────
这说明在包含交互项的模型中,即使进行均值中心化来处理共线性问题,它对于减少或控制标准误的计算并没有直接影响。
所有三个模型都相同的b3的t和p:t=4.48, p=0.001。M 1、M2和M3的b3的t统计量和p值都一样。因 此,标准化X和W对检验交互效应没有影响,这与检验调节假设必须进行标准化的谬论相反。
结论:仅仅依赖均值中心化来改善模型的统计属性可能不够,我们可能还需要考虑其他方法来处理共线性问题。
模型1(原始数据)和模型2(均值中心化处理后)中\(b_1\)和\(b_2\)以及它们的标准误的差异与当X和W均值中心化后引起的共线性减小之间没有关系。
非中心化和中心化结果不同的原因:它们之所以不同是因为它们估计的是不同的效应
非中心化:b1是W在那些处于零的人中,X对Y的效应(若W的测量不包含0,如1-5或1-7,则b1无解读意义);b2同理
中心化后:b1是W在那些变量平均水平上的人中,X对Y的效应而;b2同理
结论:显然,因为它们估计不同的效应,所以它们的标准误和p值是不同的。
用W均值带入非中心化公式可得中心化回归系数同样b1结果:研究者们基于未中心化的数据的模型的系数来估计当\(W=\bar{W}\)时X的条件效应。只
需使用未中心化标准的模型中的\(b\)和\(b\),即有: \[θ_{{X}\rightarrow{Y}}|(W=\bar{W})=b_1+b_3\bar{W}=0.147+0.007(49.536)=0.501\]
使用方程7.13可以得到中心化模型中的b1的标准误,估计出的的标准误\(θ_{{X}\rightarrow{Y}}|(W=\bar{W})\)是: \[\begin{equation}\begin{split} se_{θ_{{X}\rightarrow{Y}}|(W=\bar{W})} =& \sqrt{se^2_{b_1}+(2\bar{W})COV_{b1,b3}+\bar{W}^2se^2_{b_3}}\\ =& \sqrt{0.085^2}+(2)(49.536)(0.000003)+(49.536^2)(0.002^2)\\ =&0.025 \end{split}\end{equation} \]
结论:均值中心化处理后的标准误,并没有比使用原始数据中未标准化的X和W所估计出的模型产生的结果更为准确或更不准确。 总而言之,\(b_1\)、\(b_2\)可能是没有必要的。
变体2首先将XW相乘产生乘积项,然后再进行标准化产生Zxw。
\[ Z_Y = i_{Z_Y} + b_1 Z_x + b_2 Z_w + b_3 Z_{xw} + e_{Z_Y} \]
Model 4. Standardized Variant 2
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 811) = 148.07, p = 2e-76 ***
## R² = 0.35389 (Adjusted R² = 0.35150)
##
## Unstandardized Coefficients:
## Outcome Variable: I(scale(Y))
## N = 815
## ──────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ──────────────────────────────────────────────────────────────────────
## (Intercept) 0.000 (0.028) 0.000 1.000 [-0.055, 0.055]
## I(scale(X)) 0.165 (0.096) 1.729 .084 . [-0.022, 0.353] 11.473
## I(scale(W2)) -0.368 (0.073) -5.009 <.001 *** [-0.512, -0.224] 6.776
## I(scale(XW2)) 0.511 (0.114) 4.476 <.001 *** [ 0.287, 0.735] 16.357
## ──────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: I(scale(Y))
## N = 815
## ──────────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ──────────────────────────────────────────────────────────────────────────────────
## I(scale(X)) 0.165 (0.096) 1.729 .084 . [-0.022, 0.353] 0.061 0.049
## I(scale(W2)) -0.368 (0.073) -5.009 <.001 *** [-0.512, -0.224] -0.173 -0.141
## I(scale(XW2)) 0.511 (0.114) 4.476 <.001 *** [ 0.287, 0.735] 0.155 0.126
## ──────────────────────────────────────────────────────────────────────────────────
用原始值在SPSS运行后的标准化结果也是错的:因为方程9.6中的回归系数和使用OLS程序估计\(Y=i_Y+b_1X+b_2W+b_3XW\)时自动生成的标准回归系数是相等的,这意味对于OIS回归程序所产生的标准回归系数,不应该解释,也不应该报告您也不应该用这些回归系数去探测交互效应。
原因:使用变体1的M3. Z-Score的公式可以将其写成与M1. No center及M2. Mean-Centered的等价公式,但是变体2不行
当标准化X和W,然后将它们相乘生成ZxZw,变体1的模型可以改写为: \[Z_Y=i_Y+(b_1+b_3Z_W)Z_X+b_2Z_W+e_Z\]
在这种形式中,很明显X的影响取决于W,则有: \[θ_{{Z_X}\rightarrow{Z_Y}}=b_1+b_3Z_W\]
第4种调节分析的结论
谬误:在计算X和W的乘积项之前必须将二者中心化标准化是一谬论。
针对变体2的结论:变体2是错误的
模型设定:最后当包含预测变量的乘积项在模型中时,不要使用变体2
结果回报:也不要报告和解释由SPSS的回归分析程序自动产生以标准化形式列出的回归数,因为其结果是基于变体2的公式。R 语言基于lm()的简写lm(I(scale(Y))~I(scale(X))+I(scale(W2)))是可以的。
有缺失值的情况下手动处理(程序自动中心化不需要,比如bruceR::PROCESS)中心化和标准化的做法
处理前:确保您使用的是那些在计程序中已经删除了在任何变量上有缺失值
做处理:用保留下来的个案去标准化或中心化
做分析:最后做分析
原因:因为大多数回归程序默认选择列表删除法(listwise deletion)来处理缺失,若不删除直接做处理,程序做分析的数据的均值和标准差不像最初标准化时一样等于0和1。
常见的错误做法:使用均值或中位数拆分数据
做法:使用均值或者中位数拆分数据,连续型变量的均值或中位数以下的数据被划入”低分组”,其余的则为”高分组”。继 续检验由一个二分变量W所定义的一个组中X与Y的关系是否与另一个组中的不同,通过进行2×2的因素方差分析,或是两个独立样本t检验。
拆分数据的缺点和反对意见
选点的任意性:在分析之前人为地将连续变量分组很难使人信服,因为分割点通常是任意决定的,在这种情况下产生的分组没有心理测量学意义(例如,为什么是均值或者中位数,而不是其他的数字?)
这种做法将那些近似到难以区分的人(例如,那些比较接近平均值和中位数的人)处理为好像他们在测量维度上存在很大差异,这有些混淆视听。
低统计效力:这种做法降低了检验的统计功效,即发现真正效应的能力,因为它忽略了连续型变量中包含的信息,并且增加了误差。
高一类错误:这种做法在某些情况下还可能增加第一类错误的概率,即错误地拒绝原假设的风险,因为它可能导致自变量和因变量之间的关系被高估或低估。
因此不要这样做,更多的反对这样做的观点可以参见以下研究:Bissomnette等(1990);Cohen(1983);Hayes(2005);Humphreya和Fleishman(1974);Hunter和Schmidt(1990);Hutchinson(2003);Irwin和McClelland (2002); MacCallum等(2002); Maxwell和Delaney (1993);Newsom等(2003);Preacher等(2005);Royston、Altman和Sauerbrei(2006);Rucker、MoShane和Preacher(2015);Sedney(1981);Streiner(2002);Vargha、Rudas和Maxwell(2011)。
不恰当的替代方案:亚组分析
程序:亚组分析是指根据连续型变量的水平将数据分为两组或多组,然后在每个亚组中检验自变量对因变量的影响,以比较不同亚组之间是否存在差异。
缺点:这种方法看似可以解决连续型变量的问题,但实际上无法检验调节效应假设,即自变量对因变量的影响是否为另一个变量的函数。
以气候变化与人道主义的例子为案例,展示这种方法的结果和问题。假 设根据W分为”高分组”(high)和”低分组”(low)是合理的,因此允许我们量化\(\theta_{X\rightarrow Y}\mid{W=high}\)和\(\theta_{X\rightarrow Y}\mid{W=low}\)。对 于这种模式是否显著,两个t检验可能会有四种结果:
亚组分析的局限性和误解
这些模式实际上没有一个可以提供证据证明是否\(_T\theta_{X\rightarrow Y}\mid{W=high}=_T\theta_{X\rightarrow Y}\mid{W=low}\),即两组中自变量对因变量的影响是否存在差异。一 组显著,而另一组不显著,这并不意味着两组有差异。而 且,两组都显著或都不显著也不意味着两组没有差异(查阅Gelman & Stern,2006)。
无正式检验:如果你的问题是关于调节效应的,那么你需要对差值之间的差异进行一个正式的检验。亚 组分析并不能做到这一点。它 只能给出一个粗略的估计,而且可能会产生误导和混淆。
亚组分析还有其他的缺点,例如它忽略了连续型变量中包含的信息,它依赖于任意选择的分割点,它可能导致样本量不平衡和统计功效下降等。
主效应:如果将关注点转向气候变化怀疑态度如何影响人们为受害者提供报助的意愿呢?这 个问题通过一个简单回归分析就能轻易解答。
X:受访者还同答了一组问题以反映他们是否相信气候变化是一种真实现象。气 候变化怀疑态度这个测量在数据中被命名为SKEPTIC,受访者得分越高,就表示他/她越怀疑气候变化的真实性.
Y:在阅读完这则报道后,受访者被询问了一组问题,用以评估他们对于拒绝向受害者提供援助的各种理由的同意与不同意程度,例如他们不值得帮助,受害著应该为他们所处的境况负责,捐赠不会奏效等。对 这些问题的回答被汇总并被保存为一个名为JUSTIFY的变量,该变量表示受访者对拒绝给子援助的理由的强度。所 以,JUSTIFY的分数越高,受访者越强烈地认为帮助受害者是不合理的。
估计:估计从气候变化怀疑(X)对拒绝提供援助理由(Y)的影响的最佳拟合OLS回归模型为\(\hat{Y}=2.186+0.201 X\)。
解读:因此,两个在对气候变化怀疑程度上相差一个单位的人,他们在拒绝为处于饥荒中的受害者提供援助的理由强度上相差0.201个单位。这 个关系在统计上是显著的。
做调节的理论原因:但是这个分析忽视了有一半的受访者被告知干旱是由气候变化而引起的,而另一半没有被告知这个信息(W)。研 究者指出,一个事件被视作出气候变化引起的,可能会导致气候变化怀疑论者怀疑援助受害者的价值。换 句话说,与没有提供原因相比,这种归因使得人们准备好了以一种更加与自己态度一致的方式来回应受害者的需求。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
图8.1的数学原理:这种推理预测了气候变化怀疑程度和拒绝提供援助理由的关系在那些知道灾害是由气候变化引起和不知道这一信息的受访者之间是不一样的。
将气候变化怀疑称为X,灾害原因表述称为W(0为自然原因条件,1为气候变化条件),可以像第7章中一样估计一个使得X对Y的影响取于W的简单调节模型。
这个过程以概念图形式展示在图8.1的面板A。且 将其转换成一个以X、W和XW为前因变量的统计模型,如图8.1的面板B所示。该 模型方程式为: \[ Y=i_Y+b_1 X+b_2 W+b_3 X W+e_Y \]
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 207) = 22.54, p = 1e-12 ***
## R² = 0.24626 (Adjusted R² = 0.23533)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 211
## ───────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ───────────────────────────────────────────────────────────────────
## (Intercept) 2.452 (0.149) 16.449 <.001 *** [ 2.158, 2.745]
## W -0.562 (0.218) -2.581 .011 * [-0.992, -0.133] 3.784
## X 0.105 (0.038) 2.756 .006 ** [ 0.030, 0.180] 1.909
## W:X 0.201 (0.055) 3.640 <.001 *** [ 0.092, 0.310] 4.756
## ───────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 211
## ────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ────────────────────────────────────────────────────────────────────────
## W -0.303 (0.117) -2.581 .011 * [-0.534, -0.072] -0.177 -0.156
## X 0.230 (0.083) 2.756 .006 ** [ 0.065, 0.394] 0.188 0.166
## W:X 0.479 (0.132) 3.640 <.001 *** [ 0.220, 0.738] 0.245 0.220
## ────────────────────────────────────────────────────────────────────────
与RrMp7.6唯一的区别:将实验条件(FRAME)和气候变化怀疑(SKEPTIC)的角色反过来。其 中焦点预测变量是一个连续的个体差异变量(X),调节变量是一个实验操作形式的二分变量(W)。P ROCESS结果如下
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 1
## Model Type : Simple Moderation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : -
## - Moderators (W) : W
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Outcome:
## - Y ~ X*W
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ─────────────────────────────────────
## (1) Y (2) Y
## ─────────────────────────────────────
## (Intercept) 2.186 *** 2.452 ***
## (0.112) (0.149)
## X 0.201 *** 0.105 **
## (0.028) (0.038)
## W -0.562 *
## (0.218)
## X:W 0.201 ***
## (0.055)
## ─────────────────────────────────────
## R^2 0.194 0.246
## Adj. R^2 0.190 0.235
## Num. obs. 211 211
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘interactions’ (v1.2.0)
## Effect Type : Simple Moderation (Model 1)
## Sample Size : 211
## Random Seed : -
## Simulations : -
##
## Interaction Effect on "Y" (Y)
## ──────────────────────────────
## F df1 df2 p
## ──────────────────────────────
## X * W 13.25 1 207 <.001 ***
## ──────────────────────────────
##
## Simple Slopes: "X" (X) ==> "Y" (Y)
## ────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ────────────────────────────────────────────────────
## 0.000 0.105 (0.038) 2.756 .006 ** [0.030, 0.180]
## 1.000 0.306 (0.040) 7.655 <.001 *** [0.227, 0.385]
## ────────────────────────────────────────────────────
图8.2显示了PROCESS的输出结果,表8.1是模型的总结。最 佳拟合的OLS回归模型是: \[ Y=2.452+0.105 X-0.562W+0.201X W \]
XW的回归系数:\(b_3=0.201\)并显著不为零,t (207)=3.640, p < 0.001。因 此,气候变化怀疑(X)对拒绝提供援助理由强度(Y)的影响取决于是将干旱灾害归因(W)。
X的回归系数b1:当调节变量是二分变景时,通过将其中一组设为W=0,X的回归系数估计了在编码为0的组中X对Y的条件效应,分析结果也提供了在那些没有得知干旱原因的受访者中,气候变化怀疑对拒绝提供援助的条件效应,也就是\(b_1\),它是显著不为零。
W的回归系数b2:分析也得到了在气候变化怀疑得分为0的受访者中,干旱原因所致的条件效应,也就是\(b_2\),虽然它是显著的,但是实质上它并没有意义,因为0并不在X所测量的范围内。
与第7.1节中介绍的交互作用的对称性:对比7.4和8.1这两个小节的模型的解读结果,数学上这两个小节的模型是完全一样的,但是解读方式很不一样。在 以方程8.1形式呈现的回归模型中,\(b_3\)估计了W对X与Y关系的调节效应,也估计了X对W与Y关系的调节效应。
拒绝\(_T b_3=0\)的零假设使得这两种论断都成立,至于这个结论如何得来以及交互作用如何实质性地解释取决于哪个变量被看作焦点预测变量,哪个被看作调节变量
两个分析之间唯一区别是如何表述相应的问题即哪个变量被视为焦点预测变量,哪个被定义为调节变量,以及这些变如何符号性地标记为X和M。
在第7章的分析中,焦点预测变量是一个1灾害原因表述编码的二分变量(标记为X,但现在是W),面在这个分补中,焦点预测变量是一个连续变量,将每个人置于气候变化怀影的连续上(标记为W,但现在是X),同时,调节变量是一个编码实验条件的:
因为这个模型与第7章中估计的模型完全相同,所以第7.3节中描述的过程可用于生成该模型的直观图形。自 然地,既然模型是一样的,那么它们的图形表示也是一样的(见图8.3)。
总体上:连接气候变化怀疑和拒绝提供援助理由的直线的斜率在两组中都是正的,意味着无论如何归因,那些对气候变化怀疑越高,拒绝为受害者提供援的理由越强。然 而,被告知归因于气候变化的人的直线斜率比没有被告其体原因的人的直线斜率要更陡一些。
简单斜率:这些直线的斜率可以通过正式的探测交互作用得以量化。当 调节变量是二分变量时,使用选点法,可以估计调节变量W分取两个值时,焦点预测变量X对结果变量Y的条件作用。使 用与第7.1中相同的数学运算,方程8.1可以改写为:
\[ \begin{aligned} &Y=i_Y+\theta_{X \rightarrow Y} X+b_2 W+e_Y\\ 其中&\theta_{X \rightarrow Y}=b_1+b_3 W \end{aligned} \]
W=0:将表示实验条件的W的两个值代入方程8.3,得到X的两个条件效应。也 就是在那些未被告知干旱发生原因的受访者中(W=0),则有:
\[ \theta_{X \rightarrow Y} \mid(W=0)=b_1+b_3(0)=b_1=0.105 \]
W=0的简单斜率解读:对于两个未被告知灾害发生原因的受访者,如果他们对气候变化的怀疑态度相差1个单位,那么气候变化怀疑较高的人会比气候变化疑较低的人拒绝提供援助的理由强0.105个单位。
PROCESS输出的简单斜率分析结果中p=0.006:因为W=0对应着没有被告知引起干旱的原因的那一组,可以得出结论,在没有被告知干旱引起的原因的受访者中,气候变化怀疑态度和拒绝提供援助理由强度之间的关系是正相关的,并且这种相关显著不为零。
W=1:在被告知干早是由气候变化引起的受访者中(W=1),则有: \[ \theta_{X \rightarrow Y} \mid(W=1)=b_1+b_3(1)=b_1+b_3=0.105+0.201=0.306 \]
W=1的简单斜率解读:对两个被告干早是由气候变化引起的受访者,气候变化怀疑高1个单位的人拒绝提供援助的理由要强0.306个单位。这 两个条件效应与图8.3中两直线的斜率相对应。
调节变量的反向编码:但是将气候变化原因组编码为W=1,将自然原因组编码为W=0的决定完全是随意的。通 过对两个组重新编码,即将气候变化原因组编码为0,自然原因组编码为1,那么方程8.1中的b,估计在被告知干旱灾害是由气候变化引起的受访者中气候变化怀疑态度的条件效应。
反向编码的解读结果:b1是当W=0时X对Y的影响,但是这对应着当W=1时X对Y的影响,因为W’=0对应原始编码中的W=1。注 意b1=0.306,这是当W=时,X对Y的条件效应,和之前于工计算的一样
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 207) = 22.54, p = 1e-12 ***
## R² = 0.24626 (Adjusted R² = 0.23533)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 211
## ───────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ───────────────────────────────────────────────────────────────────
## (Intercept) 1.889 (0.159) 11.882 <.001 *** [ 1.576, 2.202]
## X 0.306 (0.040) 7.655 <.001 *** [ 0.227, 0.385] 2.102
## I(1 - W) 0.562 (0.218) 2.581 .011 * [ 0.133, 0.992] 3.784
## X:I(1 - W) -0.201 (0.055) -3.640 <.001 *** [-0.310, -0.092] 4.814
## ───────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 211
## ───────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────────────────
## X 0.670 (0.087) 7.655 <.001 *** [ 0.497, 0.842] 0.470 0.462
## I(1 - W) 0.303 (0.117) 2.581 .011 * [ 0.072, 0.534] 0.177 0.156
## X:I(1 - W) -0.482 (0.132) -3.640 <.001 *** [-0.743, -0.221] -0.245 -0.220
## ───────────────────────────────────────────────────────────────────────────────
简单斜率差异分析的无必要性:W对X和Y的关系的调节效应检验,等同于W分别取两个值时对应的X对Y的两个条件效应的差异的检验。因 此可以说这两个条件效应是有显著差异的,因为X和W交互影响。
当 W=0时,\(\theta_{X \rightarrow Y}=0.105\)。当 W增加一个单位时,\(\theta_{X \rightarrow Y}=0.306\)
当W增加一个单位时,X对Y的影响增加0.201个单位。
正确地检验调节效应:因素方差分析或回归模型
因素方差分析:将数据按照一个或多个分类变量(因素)进行分组,然后比较各组因变量的均值是否存在差异。因 素方差分析可以检验自变量的条件效应之间的差异,即交互效应。交 互效应显著就意味着在已知某个因素水平条件下自变量的简单效应不同于另一个因素水平条件下自变量的简单效应。
回归模型的原则和方法
回归模型是指使用一个或多个自变量来预测或解释因变量的变化。回 归模型可以处理连续型变量和分类变量,也可以检验调节效应假设。
回归模型的原则是尊重连续型变量的本质:不要将其人为地分组或忽略其信息。回 归模型的方法是使用回归模型和乘积项来检验调节效应。乘 积项是指自变量和调节变量的相乘,它反映了自变量对因变量的影响随着调节变量的水平而发生变化的程度。
以气候变化与人道主义的例子为案例,展示这种方法的步骤和结果。我 们可以使用线性回归模型来检验干旱原因表述(自变量)对拒绝援助理由(因变量)的影响是否为气候变化怀疑态度(调节变量)的函数。在 R中我们展示了如何使用bruceR::PROCESS()进行回归分析
分层进入定义:在回归分析中检验某个调节效应时通过将X和W的乘积加到已经包含X和W的模型中来构建回归模型,这被称为分层回归或分层变量进入。
分层进入目的:该方法的目的确定是否允许X的效应取决于W产生一个比X的效应在W的无条件作用下的模型更好的拟合模型。
判定方式:果条件模型比限定X的影响独立于W的模型解释了更多Y的变异,那么W调节X的影响的条件模型就是更好的模型。
分层进入建立步骤
第一步:Y是由X、W以及除了XW之外的其他变量,如各种协变量等来估计,将得到的模型称为模型1,它的多重相关平方为\(R_1^2\)。
第二步:添加XW到模型1产生模型2,它的多重相关平方为\(R_2^2\)。
\(\Delta R^2\):如果零假设为真,那么添加乘积项提供比模型1关于Y的个体差异的更多信息。这 两个模型的多重相关平方的差是\(\Delta R^2=R_2^2-R_1^2\)。这 个差值描述的是相比较模型1来说,模型2的拟合度增加了多少。这 个值有时被称为\(R^2\)的增量,或者简单地称为”\(R^2\)的变化”。
\(\Delta R^2\)的判断标准:当在模型中增加一个变量时,\(R^2\)不可能减小,所以\(\Delta R^2≥0\)。因 此,目前的问题不在于模型2是否会拟合得更好。而 是如果零假设为真,该模型是否碰巧比我们所期待的模型拟合得更好。为 了同答这个问题,需要使用p值。第 2.6节中已经详细说明了关于检验模型2是否比模型1拟合更好只不过是碰运气的机制,其中介绍了关于回归模型中一系列变量的推断。使 用方程2.17可以将\(R^2\)的差转换为F比(F-ratio),其中\(R_2^2-R_1^2=\Delta R^2\),m=1,p值可从自由度为1和\(df_{residual }\)的F分布中计算而来。
以灾害原因表述为例:8.1节中,我们得出结论将旱灾归因于气候变化与未指定原因(W)会调节气候变化怀疑(X)对拒绝提供援助理由(Y)的影响。b ruceR::PROCESS()包含了使用分层进入方法的结果
第一步-计算X和W估计Y的模型的拟合度:这 样做得到\(R_1^2=0.198\)。其 次,当XW加入模型后,\(R_2^2=0.246\),这意味着\(\Delta R^2=0.246-0.198=0.048\)。
第二步-调节模型:残差自由度是207。F (1,207)=13.250,p<0.001。这 表示可以拒绝零假设,即气候变化怀疑对拒绝提供援助理由强度的影响取决于是否将干旱归因于气候变化。
评价分层进入法:这个分层进入方法可以奏效,但它不是必要的。S PSS的PROCESS可以自动为简单调节模型中交互效应产生\(\Delta R^2\),这个结果在 PROCESS输出部分标记为”Test of highest order unconditional interaction(s)“,只是您再去实际分层地构建该模型。从 图8.2中可以看到,\(\Delta R^2=0.0482\)。结 果与通过计算每个模型的\(R^2\)并手动计算它们的差异一样。
适用情形:
·情形一:谈及无条件下X的影响是比较方便的,在描述过第二步的模型估计结果之后对该结论进行量化。将 X、W和XW同时进人模型产生X的效应估计值这种效应必须以W为条件。
情形二:如果需要多个回归系数来量化X对Y的影响的调节作用,例如当W或X是k个水平的多分类变量时,分层进入是一种方便检验同时发生的零假设的方式,即检验k-1个乘积项的回归系数等于零的零假设。
原理:当激发一个研究的问题是什么时候或什么情况下X对Y产生影响时,调节效应分析是个合适的分析策略。
本章介绍了使用OLS回归进行调节效应分析的原理:如果W与X对Y的影响大小有关,我们就说W调节X的影响,或者X与W交互影响Y。
关于调节效应的假设可以通过几种方法来检验:其中最常用的是将X与W的乘积项与X和W一起纳入Y的模型中。这 使得X对Y的影响线性地依赖于W。一 旦确立这种依赖关系,那么在谈及X对Y的影响时不把W的讨论作为条件就不再合理了。
图像化:调节效应的示意图可以帮助我们很好地理解视情况而定的X与Y之间关系的性质。通 过估计W取不同值时X对Y的条件效应来探测交互效应也可以做到。
选点法:是探测交互效应最常用的实现方法
詹森-内曼技术:也在慢慢地吸引用户和追随者,它迟早会比选点法更受欢迎。
本章节涉及模型:
RrMp9.1a All continuous variables moderation without any centering
RrMp9.1b All continuous variables moderation with centered X and W
RrMp9.1c All continuous variables are standardized
RrMp8.1 Moderation model with binary W (W=0/1)
中介分析定义:一种用来评估研究证据的统计方法,这些研究设计来检验关于某些因果关系中的前因变量X是如何对一个结果变量产生影响的各种假设。
切记中介最终是一种因果解释:它假设这一系统中的关系是因果的,更重要的是它假设M在X和Y之间起因果作用。它有以下三个特点:
两个结果变量:M Y
两个前因变量:X M
两条影响路径:直接效应:X→Y;间接效应:X→M→Y(M既是结果也是前因)
关于 X-Y的关系与中介效应的争论
过去(Baron and Kenny, 1986):只有在首先确立了X和Y之间的关联之后才可能去追问这是”如何关联”(how)的问题。因 此,X和Y之间的相关性是中介分析的前提。这 一做法是基于因果关系成立的三个流行法则之一,即X和Y之间具有相关性(另外两个法则是X先于Y发生和排除竞争性解释)。因此,该方法必须首先做X与Y的回归,检验X对Y的总效应。
现在:Bollen(1989)多年前在他的名著《潜变量结构方程》(Structural Equations with Latent Variables)中指出,“缺乏相关性并不能证明因果关系不存在”,“相关性既不是因果关系的必要条件,也不是充分条件”。如今,X和Y之间的简单关联不再是进行中介分析前提条件。即可直接检验中介效应
中介分析与因果
是否以事实因果为前提进行中介分析:即使不能明确地建立因果关系,研究者仍然可以进行中介分析。这是常见的甚至是典型的情况,可用于分析的数据并不确切满足因果关系的要求。
理论因果的作用:有时理论或是坚实的论点只是研究者们在数据存在局限性的情况下建立起因果关系的唯一基础。即使因果论断是建立在不太牢靠的实证基础之上。解释和赋予数学程序意义的是我们的大脑
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
在该图中有两个结果变量,因此需要两个线性模型,一个结果变量对应一个线性模型。统计图则表示了两个方程:
\[M = i_m + aX + e_m\](1)
\[Y = i_y + c^\prime X + bM + e_y\] (2)
\(c^\prime\)用以估计X对Y的直接效应。对 直接效应一般的解释是,对于两个个案,当X值相差1个单位而M相等的情况下,Y值相差\(c^\prime\)个单位。更 为正式表达如下:
\[c^\prime = [\hat{Y}| (X = x, M = m)] - [\hat{Y}| (X = x-1, M = m)]\] (3)
从方程(3)可以看出,\(c^\prime\)的符号可以表明当一个个案在X上增加1个单位时估计在Y上会增加(\(c^\prime\)=+)或是减少(\(c^\prime\)=-),所以一个正的直接效应意味着当X增加时,Y也随之增加;而负的直接效应意味着当X增加时Y反而减少。
特殊案例的辅助理解:在X是二分变量的特殊情况下,X只有两个取值时(即,X=1和X=0),\(\hat{Y}\)可以解释为一个组的均值,因此\(c^\prime = [\overline{Y}| (X = x, M = m)] - [\overline{Y}| (X = x-1, M = m)]\),表示在M不变的情况下,\(c^\prime\)估计的是两组均值之间的差异。这就相当于在协方差分析中的被称为调整后的均差。
a路径的解读:a量化了两个在X上相差1个单位的个案在M的估计值上相差多少。a的符号决定了个案在X上增加,M值会增加还是减少。也就是说,
\[a = [\hat{M}| (X = x )] - [\hat{M}|(X = x - 1 )]\] (4)
b路径的解读:对于两个个案,当M相差1个单位而X不变的情况下,估计Y值相差b个单位。与 a和c’一样,b的符号决定了个案在M上增加1个单位时,Y将增加还是减少:
\[b = [\hat{Y}| (M = m, X= x )] - [\hat{Y}|(M = m - 1, X- x )]\] (5)
a*b路径的解读:X通过M对Y产生的间接效应。两个在X上相差1个单位的个案在Y上相差ab个单位,这是因为X对M产生了影响,从而影响了Y值。
当a和b同时为正或同时为负时,X对Y所产生的间接效应是正效应(意味着当X增加时,Y也随之增加);
然而当a和b不同时为正(或负),X对Y所产生的间接效应是负的(意味着当X减少时,Y反而增加);
假如某种理论预测ab是正向的,因为根据理论解释的过程,a和b都应该是正的。但是,如果分析结果证明a和b是负的呢?这将如预期的那样产生一个正向的间接效应,但是关于a和b的符号形式却与理论预测的完全相反,这将使研究者质疑该理论能否充分描述数据的得到过程。
理解方式一:拆分总效应
总效应的构成:直接效应和间接效应很好地将X的变化如何影响Y值的变化进行了区分。
X的总效应的解读:c量化了两个在X上相差1个单位的个案,估计的Y值相差多少。也 就是说:
\[c = [\hat{Y}| (X = x )] - [\hat{Y}|(X = x - 1 )]\] (6)
在一个简单中介模型中,可以从X对Y的单独估计中推导出c:
\[Y = i_y + c X + e_y\] (7)
当X是一个二分变量时:按照在X上只相差1个单位进行编码,c表示两组在Y上的均值之差:\(c = [\overline{Y}| (X = x)] - [\overline{Y}| (X = x-1)]\)。不 管X是否是二分变量,X对Y的总效应都等于X的直接效应和间接效应之和:
\[c = c^\prime + ab \] (8)
理解方式二:差值理解
这个关系可改写为 ab=c-c’,这为间接效应提供了另一个定义:间接效应是X对Y的总效应与控制了M之后X对Y的直接效应之差。
X的总效应等于直接和间接效应之和,可以通过将方程(1)代入方程(2)来表示,从而得到一个只含有X的方程来表示Y:
\[Y = i_y + c^\prime X +b(i_M + a X + e_M) + e_Y\] (9)
同样也可以写为:
\[Y = (i_y + bi_M) +(ab + c^\prime)X +(e_Y+be_M) \] (10)
直接和间接效应的总和量化了在X变化1个单位的情况下Y值的变化。
注意,当使用OLS回归估计Y和M时,c=c′+ab这个数学表达式,意味着使用OLS法则进行模型拟合度最大化时,Y和M是被当作连续变量进行分析的。使 用基于连续型结果变量的模型最大似然法它仍然起作用。
为何需要统计推断:当使用OLS回归估计这些效应时,任何数据集中都可以得到c= c’+ab。但是这些由c、c’和ab表示的效应都是基于特定的样本实例获得的真值。它们描述的是可用数据中变量之间的关联,但它们并不具备普遍意义。
两种统计推断的方式:
假设检验:一般而言,研究者关心的是普遍意义,要么通过进行假设检验来看”碰运气”是否能作为对获得的影响的合理解释;
置信区间:要么通过为这些效应构建区间估计以确认在任何估计中所存在的抽样变异。关于X的直接效应、间接效应和总体效应的推断就是本节的主题。
定义:在一个简单中介模型中,X对Y的总效应(c)就是X对Y的直接效应(c’)和X通过M对Y的间接效应(ab)的总和。
估计方式:虽然总效应是两种路径影响之和,但可以通过模型中仅使用X对Y进行回归去估计。即方程(7)中的c,就是X的总效应。
推断方式:通过零假设检验或对c的置信区间的估计值是否包括0来进行推断。从回归结果中可以看出总效应c=0.056,但是在10%的显著性水平上是缺乏统计显著性的。
定义:直接效应量化了在M相等而X相差1个单位的情况下Y值的差异。
判断方式:如果c’不等于0,则支持了X独立于M所代表的机制而与Y相关的论断,若c’=0,则没有证据表明当M作为解释机制时X与Y相关。
定义:间接效应量化了X相差一个单位时,由于X的变动对变量M的产生影响从而影响了Y,此时Y的变化值。
判断方式:若 间接效应不等于0,则可说明M是X对Y的影响的中介变量。
推断方式:与 直接效应的推断一样,间接效应可以通过ab的零假设或通过构建置信区间来完成。
6大步骤:
其实质是将样本量为n的初始样本看作原始抽样总体的一个缩影,在观测这个样本之后又放回进行重新抽样
通过这个重新抽样过程构建的新样本量为n的样本来计算一些关心的统计量(ab)。
重复1和2步数m次——理想情况下是数以千计
一个表示统计量的抽样分布就可以实证地构建起来,这个实证表示便可以用来执行这个推断任务。
统计量的CI下限:要在k个估计值的分布中找到ab*的值,即在分布中的第2.5百分位点
统计量的CI上限:在k个估计值的分布中找到ab*的值,即在分布中的第100-2.5百分位点上的值
优势:
定义:蒙特卡洛置信区间(Monte Carlo confidence intervals),正如boolstrapping一样,是基于模拟仿真的一种置信区间。
原理:尽管ab的分布不是正态的,但是a和b的抽样分布是近似正态的。
步骤:
在使用OLS回归的简单中介分析中,a和b在重复抽样中是独立的(即它们的协方差为零)。因 此,ab的抽样分布的实证近似可以通过从μ=a,\(σ=se_a\)和μ=b,\(\sigma=se_b\)的正态分布总体中随机抽取a和b的值来生成,其中a、b、\(σ=se_a\)和\(\sigma=se_b\)分别是中介分析的OLS回归系数和标准误。
将a和b的抽样值相乘以产生\(ab^*\),并且重复该过程k次
定义:正态理论法(The Normal Theory Approach)也称为系数乘积推断法、Sobel检验,或是delta法,基于与直接效应和总效应的推断方法相同的理论来进行统计推断。
推断方式:通过对ab的标准误的估计,并且假定ab的抽样分布呈正态,根据一个已知的零假设中\(_Ta_Tb\)的具体取值可以得出ab的p值,或者可以生成一个区间估计。
定义:乘积分布法(The distribution of the product approach)依赖于乘积的分布的一种数学上的近似。这 种复杂方法不符合非数学描述,需要将ab进行标准化转化。
步骤:找到定义了标准化度量的间接效应的置信区间的上下限的标准化度量的值,然后再将这些端点转换回ab的原始度量。像蒙特卡洛方法一样,实现这种方法所需的一切就是来自中介分析的a、b、\(σ=se_a\)和\(\sigma=se_b\),不需要原始数据。
百分位bootstrap置信区间已经成为中介分析中比较广受推崇的推断间接效应的方法。但随着新数据的出现和新的检验法被发明出来,可能会发生变化。
案例背景:TalOr等(2010)的研究。参与者是在以色列大学学习政治学或传播学的43名男生和80名女生。所有参与者都阅读了两篇据称可能影响到以色列的白糖价格和供应的经济危机的新闻报道中的一篇。
操纵
实验组:大约一半的参与者(n=58)被告知他们所读的这篇报道文章,将出现在以色列一家主流报纸的头版[下文中简称为头版条件(font page)]
控制组:其余参与者(n=65)却被告知他们所读的同样的报道将出现在这份报纸的经济增刊的中间[下文简称为内页条件(interior page)]。
其他变量
Y:参与者阅读文章后的反应,被汇总形成一个购买白糖意愿的变量(intention to buy sugar)(数据文件中的REACTION),分数越高反映出白糖购买意愿越强(即尽快购买和购买更多)。
M:看了报道后他们相信社区中其他人会马上去买白糖的程度,作为预期的媒体影响力变量(presumed media influence)(数据文件中的PMI)。
## Descriptive Statistics:
## ────────────────────────────────────────────────────────
## N Mean SD | Median Min Max Skewness Kurtosis
## ────────────────────────────────────────────────────────
## X 65 0.00 0.00 | 0.00 0.00 0.00 NaN NaN
## M 65 5.38 1.34 | 6.00 1.50 7.00 -0.82 0.05
## C1 65 3.91 1.66 | 4.00 1.00 7.00 -0.18 -0.93
## Y 65 3.25 1.61 | 3.00 1.00 6.75 0.32 -1.08
## C2 65 0.29 0.46 | 0.00 0.00 1.00 0.89 -1.22
## C3 65 24.49 5.27 | 24.00 18.00 60.00 5.04 30.08
## ────────────────────────────────────────────────────────
## Descriptive Statistics:
## ────────────────────────────────────────────────────────
## N Mean SD | Median Min Max Skewness Kurtosis
## ────────────────────────────────────────────────────────
## X 58 1.00 0.00 | 1.00 1.00 1.00 NaN NaN
## M 58 5.85 1.27 | 6.00 1.00 7.00 -1.65 3.62
## C1 58 4.53 1.78 | 5.00 1.00 7.00 -0.41 -0.85
## Y 58 3.75 1.45 | 3.75 1.25 7.00 0.17 -0.68
## C2 58 0.41 0.50 | 0.00 0.00 1.00 0.34 -1.92
## C3 58 24.78 6.39 | 24.00 19.00 61.00 4.29 19.72
## ────────────────────────────────────────────────────────
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
#RrMp3.4 Mediation model with binary X (X=0/1)
#C3.pmi$X=factor(C3.pmi$X, levels=0:1, labels=c("ControlG", "ExpG"))
Freq(C3.pmi$X)## Frequency Statistics:
## ──────────
## N %
## ──────────
## 0 65 52.8
## 1 58 47.2
## ──────────
## Total N = 123
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ X
## Formula of Outcome:
## - Y ~ X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 3.250 *** 5.377 *** 0.527
## (0.191) (0.162) (0.550)
## X 0.496 0.477 * 0.254
## (0.278) (0.236) (0.256)
## M 0.506 ***
## (0.097)
## ──────────────────────────────────────────────────
## R^2 0.026 0.033 0.206
## Adj. R^2 0.018 0.025 0.193
## Num. obs. 123 123 123
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 123
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ─────────────────────────────────────────────────────────────
## Indirect (ab) 0.241 (0.134) 1.805 .071 . [ 0.004, 0.515]
## Direct (c') 0.254 (0.254) 1.003 .316 [-0.233, 0.735]
## Total (c) 0.496 (0.270) 1.835 .066 . [-0.019, 1.007]
## ─────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
##
## Model Summary
##
## ─────────────────────────────────────
## (1) M (2) Y
## ─────────────────────────────────────
## (Intercept) 5.377 *** 0.527
## (0.162) (0.550)
## X 0.477 * 0.254
## (0.236) (0.256)
## M 0.506 ***
## (0.097)
## ─────────────────────────────────────
## R^2 0.033 0.206
## Adj. R^2 0.025 0.193
## Num. obs. 123 123
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
删除误差项之后对M和Y的估计表示如下:
\[\hat{M}=5.602+0.477X\] \[\hat{Y}=3.484+0.254X+0.506M\] - a:在X上相差1个单位,则在M上相差a=0.477个单位。所以那些被分到阅读头版文章的参与者(X=1)预期的媒体影响力在平均值上比那些阅读内页文章的参与者(X=0)高出0.477个单位(因为a为正)。
b:b=0.506意味着被分配到相同实验条件的两个人(即:X相等),但在预期媒体影响力(M)上变化1个单位时,购买意愿(Y)变化0.506个单位。b符号为正,这意味着在预期媒休影响力相对较高的人,白糖的购买意愿也较高。
ab:通过预期媒体影响力操纵文章位置对购买白糖意愿的间接效应。ab=0.241意味着相对于那些被分到阅读内页文章的人来说,被分到阅读头版文章的参与者对购买白糖的意愿平均高出0.241个单位,因为文章位置对预期媒体影响力产生影响,从而进一步地影响到人们购买白糖的意愿。
c’:文章所在位置对购买意愿的直接效应被估计为c′=0.254。也就是说,当两个个案在X上相差1个单位而M保持不变,Y值相差0.254个单位。因为两个组别是使用1个单位之差在X上进行编码的,本质上可以说,除去预期媒体影响力对购买意愿的影响(因为在c’的推导中M保持不变),头版组(X=1)的参与者的平均购买意愿比内页组(X=0)高0.254个单位。
c:通过实验操纵来影响白糖购买意图的总效应,可以将直接和间接效应相加得出。本案例中,总效应为c’+ab=0.254+0.241=0.495,这意味着头版组比内页组的平均购买意愿高0.495个单位。或者也可由X的总效应只能由X对Y的回归得出(图3.4的模型1)
案例背景:Pollack等(2012)对企业主经济压力的研究。参与者是262名企业家,他们回答了一份关于最近他们企业的业绩及他们对经济氛围的认知和情绪反应的在线调查。
X:经济压力指数,分数越高反映出经济压力越大
M:与企业相关的抑郁情绪,分数越高反映出抑郁情绪越严重
Y:退出企业的意愿 ,分数越高表示退出意愿越大
模型:想知道经济压力(X)是否通过压力产生的抑郁情绪(M)从而导致企业主脱离企业经营的意愿(Y)。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
## Frequency Statistics:
## ────────────
## N %
## ────────────
## 1 5 1.9
## 1.5 3 1.1
## 2 4 1.5
## 2.5 12 4.6
## 3 25 9.5
## 3.5 22 8.4
## 4 34 13.0
## 4.5 32 12.2
## 5 30 11.5
## 5.5 32 12.2
## 6 27 10.3
## 6.5 18 6.9
## 7 18 6.9
## ────────────
## Total N = 262
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ X
## Formula of Outcome:
## - Y ~ X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 2.062 *** 0.799 *** 1.447 ***
## (0.262) (0.143) (0.252)
## X 0.056 0.173 *** -0.077
## (0.054) (0.030) (0.052)
## M 0.769 ***
## (0.103)
## ──────────────────────────────────────────────────
## R^2 0.004 0.116 0.180
## Adj. R^2 0.000 0.112 0.174
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.133 (0.033) 4.059 <.001 *** [ 0.070, 0.198]
## Direct (c') -0.077 (0.056) -1.362 .173 [-0.177, 0.040]
## Total (c) 0.056 (0.064) 0.877 .381 [-0.072, 0.178]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
##
## Model Summary
##
## ─────────────────────────────────────
## (1) M (2) Y
## ─────────────────────────────────────
## (Intercept) 0.799 *** 1.447 ***
## (0.143) (0.252)
## X 0.173 *** -0.077
## (0.030) (0.052)
## M 0.769 ***
## (0.103)
## ─────────────────────────────────────
## R^2 0.116 0.180
## Adj. R^2 0.112 0.174
## Num. obs. 262 262
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
从公式看经济压力对退出意愿的直接和间接影响的估计:
\[\hat{M}=0.799+0.173X\]
\[\hat{Y}=1.447-0.077X+0.769M\]
a和b相乘得到间接效应:ab=0.173(0.769)=0.133。在经济压力(X)上相差1个单位的两个企业家,估计他们报告的退出企业的意愿(Y)上相差0.133个单位,这是因为那些感受到更多经济压力的人会感受到更多抑郁情绪(因为a为正),从而导致了更大的退出意愿(因为b为正)。这 个间接效应统计上不为0,因为它显示在95%bootstrap置信区间完全是在零之上的(在中介效应回归中ab95%的置信区间为0.074~ 0.208)
c’:经济压力的直接效应,c′=-0.077,所估计的是具有相同水平抑郁情绪(M)但在报告的经济压力(Y)上相差一个单位的两名企业主在退出意愿上的差异。其 系数为负,意味着抑郁情绪水平相同但感觉压力更大的人,他所报告的退出企业经营活动的意愿将低0.077个单位。然 而,从PROCESS输出可以看出,这种直接效应与零没有统计学差异,在95%置信水平下的置信区间为-0.184~ 0.034,p=.157。
c:经济压力对退出意愿的总效应是通过加总直接效应和间接效应得到,或通过经济压力对退出意愿进行回归得出的:c=c′+ab=-0.077+0.133=0.056。在经济压力上相差1个单位的两个人估计在他们报告的退出意愿上相差0.056个单位。正号意味着经济压力越大的人报告了更高的退出意愿。然而,这一效应与零没有统计学差异,在95%置信水平下的置信区间为-0.075~0.169,p=.365。
总结:当X是一个连续变量而不是二分变量时,连续变量X对结果Y的总效应仍然可以清晰地划分成直接效应和通过中介M的间接效应,并且这些效应可以使用与前文所述的相同的分析程序来估计。
简单中介模型的局限性&探讨多个中介模型的必要性:
简单中介模型只基于单一中介变量,不允许研究者在单个集成模型中同时探讨多重机制。
某个假定的中介可能与某个结果变量相关,这不是因为它会导致结果,而是因为它与另一个因果的影响结果的变量相关。
在前因变量和结果变量之间包含多个中介可以比较相互竞争的理论机制
多重中介模型的主要形式:
并行多重中介模型:仅为相关而不是因果影响模型中的另一个中介;
链式多重中介模型:中介变量在因果链中联系在一起;
并行和链式过程混合的多重中介模型
定义:前因变量X直接影响结果变量Y,同时通过两个及以上的中介变量间接影响Y,并且中介变量之间不存在因果影响。
图5.1 描述了一种具有k个中介的并行多重中介模型的统计图。限定为:没有任何单向箭头从任一中介连接到任一其他中介。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
注:
中介变量之间不存在因果影响并不表示中介变量是相互独立的,大多情况下,中介之间很可能相关。
若中介变量均与Y高度相关,而中介变量之间弱相关,此时的间接效应检验效果提升,并会促进比较不同中介间接效应大小的能力。
具有k个中介的并行多重中介模型具有k+1个结果变量,需要k+1个方程来估计X对Y的所有效应。方程为: \[ \begin{gathered} M_i=i_{M_i}+a_i X+e_{M_i} \quad \text { for all } i=1 \text { to } k \\ Y=i_Y+c^{\prime} X+\sum_{i=1}^k b_i M_i+e_Y \end{gathered} \]
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
考虑一组并行多重中介中有3个中介变量,当k=3时,需要四个方程(方程5.3~5.6): \[ \begin{gathered} M_1=i_{M_1}+a_1 X+e_{M_1} \\ M_2=i_{M_2}+a_2 X+e_{M_2} \\ M_3=i_{M_3}+a_3 X+e_{M_1} \\ Y=i_Y+c^{\prime} X+b_1 M_1+b_2 M_2+b_3 M_3+e_Y \end{gathered} \]
a路径:在方程5.3、5.4和5.5中,a1、a2和a3量化了当两个个案在X上相差1个单位时,它们在M1、M2和M3上相差多少。
b路径:方程5.6中,b1估计了两个个案在M1上相差1个单位且M2、M3、X不变时,Y值相差多少。
c’路径:c’估计了两个个案在X相差1个单位且M1、M2和M3都不变的情况下,Y值相差多少。
分类X的解读:对ai和c’的解释不依赖于X的测量尺度。无论X是二分变量还是连续变量,其解释都是相同的。然而,当X被编码为两个相差1个单位的二分变量时,它们可以解释为对均值差异的估计。
在如图5.1所示的并行多重中介中,X通过k+1条路径对Y施加影响。
直接路径:从X到Y。
间接路径:其他k条路径是间接的,每条路径通过一个中介。
在多重中介模型中,间接效应被称为特定的间接效应。因此,具有k个中介的模型具有k个特定的间接效应,分别通过M1(X→M1→Y),M2(X→M2→Y),…,直到Mk(X→Mk→Y)。
间接效应:
在并行多重中介模型中,有两条路径通过Mi将X连接到Y。第一条是X到Mi的影响,第二条是从Mi到Y的路径。
与这些路径相对应的回归系数相乘,便得到X通过Mi对Y的特定间接效应。无论中介的数量如何,X通过Mi对Y的特定间接效应j即为aibi。
X通过Mi对Y产生的特定间接影响:两个个案在X上两个相差1个单位时,由于X影响Mi从而影响Y,并且其他中介变量不变,最终得到二者在Y上的差异值。
总间接效应:X通过模型中的所有中介到Y的总的间接效应,即将所有特定间接效应相加。在 具有k个中介的模型中: \[ \text { Total indirect effect of } X \text { on } Y=\sum_{i=1}^k a_i b_i \]
例如,在由方程5.3~5.6表示的具有三个中介的并行多重中介模型中,X对Y的总间接效应是:a1b1+a2b2+a3b3。
直接效应:X的直接效应量化了当控制所有中介变量时,两个个案在X上相差1个单位时,估计出的Y值的差异。该值即为c’,来自从X和所有中介到Y的模型中。
总效应:指直接效应和间接效应的总和。在具有k个中介的模型中,从方程5.1和5.2中的系数可得: \[ c=c^{\prime}+\sum_{i=1}^k a_i b_i \]
上式中c是X的总效应。总 效应也可以通过仅使用X对Y的回归来进行估计。例 如,在三个中介的模型中,c=c’+a1b1+a2b2+a3b3。
总间接效应等于总效应与X的直接效应之差: \[ \sum_{i=1}^k a_i b_i=c-c^{\prime} \]
案例背景:研究参与者对于一则关于白糖短缺报道的反应(Tal-Or et al.,2010)。
操纵:大约一半的参与者被告知这篇报道文章将出现在以色列最主要的报纸的头版,其余参与者被告知这篇报道文章将出现在报纸内部的经济增刊。
研究目的:读了这篇文章以后,测量参与者关于其他人会如何受到影响的看法(即在多大程度上,由于报道的影喇,普通民众会被驱使 去购买白糖)
初始模型:
X:文章位置(头版为1,内页为0)
Y:白糖购买意图(REACTION)
M1:预期媒体影响力
注:
通过简单中介分析建立X通过M对Y的间接效应并不意味着M是连接X与Y的唯一作用机制(参见Rucker等,2011)。间接效应可能是由于简单中介模型中的M与(X和Y因果关系中)“真正”的中介有关联。
任何与预期媒体影响力(M1)相关,又受实验操作文章位置(X)影响的变量,都可能是传递报道位置(X)对购买意愿(Y)影响的真正中介。
考虑其他中介存在的可能性:
Talor等(2010)测量了与另一种可能的机制有关的中介变量——知觉到的问题重要性。(潜在机制:也许人们会根据文章所在位置推断报道的问题重要程度进而思考并采取行动。那些更有可能相信别人会因为阅读这篇文章而受到影响去买白糖的人,也认为白糖短缺问题更重要)
因此,可得出预期媒体影响力只不过看起来在报道位置对人们反应的影响中起到了中介的作用,但参与者知觉到的问题重要性才是真正中介。
模型调整:构建和检验将预期媒体影响力和知觉到的重要性共同作为中介的并行多重中介模型。
可以同时检验每个机制,并考虑它们之间的关联。
需要三个方程来估计所有的效应,每个中介(M1和M2)需要一个,结果Y需要一个。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Parallel Multiple Mediation (2 meds)
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M1, M2
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M1 ~ X
## - M2 ~ X
## Formula of Outcome:
## - Y ~ X + M1 + M2
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ───────────────────────────────────────────────────────────────
## (1) Y (2) M1 (3) M2 (4) Y
## ───────────────────────────────────────────────────────────────
## (Intercept) 3.250 *** 3.908 *** 5.377 *** -0.150
## (0.191) (0.213) (0.162) (0.530)
## X 0.496 0.627 * 0.477 * 0.103
## (0.278) (0.310) (0.236) (0.239)
## M1 0.324 ***
## (0.071)
## M2 0.397 ***
## (0.093)
## ───────────────────────────────────────────────────────────────
## R^2 0.026 0.033 0.033 0.325
## Adj. R^2 0.018 0.025 0.025 0.308
## Num. obs. 123 123 123 123
## ───────────────────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Parallel Multiple Mediation (2 meds) (Model 4)
## Sample Size : 123
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M1" (M) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ─────────────────────────────────────────────────────────────
## Indirect (ab) 0.203 (0.114) 1.782 .075 . [ 0.016, 0.458]
## Direct (c') 0.103 (0.235) 0.440 .660 [-0.346, 0.559]
## ─────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M2" (M) ==> "Y" (Y)
## ─────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ─────────────────────────────────────────────────────────────
## Indirect (ab) 0.189 (0.107) 1.764 .078 . [ 0.003, 0.414]
## Direct (c') 0.103 (0.235) 0.440 .660 [-0.346, 0.559]
## ─────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
回归系数:a1=0.627,a2=0.477,b1=0.324,b2=0.397,c’=0.103。
R2:通过对报道位置的操纵来解释预期媒体影响力或知觉到的问题重要性方面的差异非常小(两者都是R2=0.033),但在白糖的购买意愿中,大约1/3的差异是由这两个假定的中介和报道位置引起的,R2=0.325。
第一个间接效应:即通过知觉到的问题重要性的间接效应:a1b1=0.627(0.324)=0.203。
结果解读:两个个案在X(即COND,在这个数据集中操纵为头版vs.内页)上相差1个单位时,通过知觉到的问题重要性的中介作用,他们的白糖购买意愿相差0.203个单位。
这个正的间接效应由两个正向的部分构成:a1为正:头版条件下参与者更倾向认为白糖短缺的问题很重要;b1为正:进而正向影响了其更高的购买意愿。
第二个间接效应:即通过预期媒体影响力的间接效应:a2b2=0.477(0.397)=0.189。
总间接效应:即X通过所有中介对Y的间接效应:a1b1+a2b2=0.627(0.324)+0.477(0.397)=0.392。
直接效应:c’=0.103,量化了操纵报道位置对参与者白糖购买意愿的影响,与中介变量对购买意图的影响无关。不管组间预期媒体影响力和知觉重要性的差别如何,也不管这些中介变量如何与白糖购买意图有关,头版条件下的参与者的购买意愿比内页条件下参与者的购买意愿高(因为c’是正的)。
总效应:c=0.496,总效应不由中介变量所决定,总效应等于直接效应与特定间接效应之和:c=c’+a1b1+a2b2=0.103+0.203+0.189=0.496
X的总间接效应(特定的间接效应之和)是X的总效应和直接效应之差:
c-c’=a1b1+a2b2=0.496-0.103=0.203+0.189 =0.392
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) M1 (2) M2 (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 3.908 *** 5.377 *** -0.150
## (0.213) (0.162) (0.530)
## X 0.627 * 0.477 * 0.103
## (0.310) (0.236) (0.239)
## M1 0.324 ***
## (0.071)
## M2 0.397 ***
## (0.093)
## ──────────────────────────────────────────────────
## R^2 0.033 0.033 0.325
## Adj. R^2 0.025 0.025 0.308
## Num. obs. 123 123 123
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
直接效应:关于Tc′=0的零假设检验在任何统计程序里都可以通过OLS回归对方程5.2进行估计。但无论使用哪种方法,我们都不能断定当预期媒体影响力和知觉到的问题重要性被统计控制时,被分配到阅读不同位置的报道的参与者所做出的反应是不同的。
总效应:直接效应和间接效应之和。在并行多重中介模型中,总效应c可以通过使用任何OLS回归程序进行X对Y的回归来估计。X的系数是该回归中X的总效应。
正态理论法:对于X通过Mi对Y产生的特定间接效应,二阶标准误估计值是: \[ s e_{a_i b_i}=\sqrt{a_i^2 s e_{b_i}^2+b_i^2 s e_{a_i}^2+s e_{a_i}^2 s e_{b_i}^2} \]
se2ai和se2bi是ai和bi的标准误的平方。通过将aibi除以估计的标准误并从标准正态分布推导出p值来进行TaiTbi=0的零假设的检验。或者,可以构造ci%置信区间: \[ a_i b_i-Z_{c i \%} s e_{a b_i b_i} \leqslant{ }_T a_{i T} b_i \leqslant a_i b_i+Z_{c i \%} s e_{a b_i} \]
ci是想要的置信度(例如,95),Zci%是标准正态分布中将分布中的上端(100-ci)/2%下端分隔开的那个临界值。
bootstrap置信区间:
原理和步骤:通过从原始样本中选取大小为n的随机样本进行多次重复有放回地抽样来为特定间接效应构建bootstrap置信区间,来估计数据结果中的每个特定间接效应aibi,并且重复多次抽样和估计过程,计算出置信区间的端点。如果零包含在置信区间里,则不能表明X通过Mi影响Y。
优势:当将原始数据用于分析时,运用bootstrap置信区间来进行推断是更好的方法。b ootstrap置信区间不需要对aibi的抽样分布形状做任何假设,并且往往比其他相竞争的方法例如正态理论法,具有更大统计功效。
蒙特卡洛置信区间:
在原始数据无法获得的情况下,蒙特卡洛置信区间可以替代bootstrap
对于具有k个中介的多重中介模型,每个特定间接效应使用一次蒙特卡洛法,将ai、bi、seai和sebi的值代入蒙特卡洛抽样过程。
含义:
在多重中介模型中,检验一种间接效应与另一种间接效应是否有统计学差异,即一种机制是否比另一种机制更能解释X对Y的影响。
虽然由于各个中介变量是根据不同的尺度进行测量的,但特定的间接效应完全是根据X和Y的测度得到的,所以相同前因变量对相同结果的两个特定的间接效应可以进行有意义的比较。
文献中主要有两种推断方法:
正态理论法:将aibi-ajbj除以其标准误的估计值。间接效应之差的标准误的估计值为: \[ s e_{a b_i-a b_j}=\sqrt{b_i^2 s e_{a_i}^2-2 b_i b_j C O V_{a a_i}+b_j^2 s e_{a_j}^2+a_j^2 s e_{b_j}^2-2 a_i a_j C O V_{b b_j}+a_i^2 s e_{b_i}^2} \]
COVaiaj是ai和aj之间的协方差,COVbibj是bi和bj之间的协方差。
MacKinnon(2000)提出了一种不同的标准误估计值,假设ai和aj之间的协方差为零,即限定了模型Mi和Mj的残差之间的相关性为零。 \[ s e_{a b_i,-a b_i}=\sqrt{b_i^2 s e_{a_i}^2+b_j^2 s e_{a_j}^2+a_j^2 s e_{b_j}^2-2 a_i a_j C O V_{b b_j}+a_i^2 s e_{b_i}^2} \]
然后计算这个差值与其标准误的比率,并且可以使用标准正态分布推导出TaiTbi=TajTbj的零假设检验的p值。该差异的95%置信区间可以计算为: \[ \left(a_i b_i-a_j b_j\right) \pm 1.96 s e_{a b_i-a b_j} \]
bootstrap置信区间:
正态理论法需要假设特定间接效应之间的差异的抽样分布是正态的。而bootstrap则不需要该假设。
通过重复的bootstrap抽样及模型估计得出的特定间接效应之间的差异,推导出一个bootstrap置信区间,使用所得特定间接效应差值的抽样分布的经验近似。
在具有k个中介的模型中,针对两个间接效应之间可能的差异,置信区间不包含零就证明两个间接效应之间在统计学上存在差异,而置信区间包含零则支持特定间接效应之间没有差异的说法。
预期媒体影响力的研究中,通过知觉到问题的重要性的特定间接效应减去通过预期媒体影响力的特定间接效应(即a1b1-a2b2)。特定间接效应之间的差异的点估计为0.203-0.189=0.014,但95%置信区间(-0.268~0.310)包含零。
作者将这一方法用来检验联系X到Y的作用机制的强度的差异。然而,只有当两个特定的间接效应之间比较的点估计值符号相同时,这种解释才是合理的。
辅助解读:例如,会出现a1b1=-0.30和a2b2=0.30这种情况。对这两个特定间接效应之间的差异进行检验可能会得出一个它们的差异不为零的结论,但这并不表示中介机制的强度不同。点估计表明一种机制导致Y值的正差异,而另一种机制则产生相等大小的负差异。从绝对意义上讲,它们在点估计上的大小是相等的,但是考虑到符号的问题,实际上一个间接效应并不比另一个更强。所以,如果想要比较两个不同符号的间接效应之间的强弱,可以将对比项定义为: \[ \left|a_i b_i\right|-\left|a_j b_j\right| \]
再进行差值的bootstrap时就不用考虑特定间接效应是正还是负。当置信区间不包括零时,不考虑符号来说,两个间接效应是不同的,意味着它们的强度不同;但如果置信区间包括零,那么就不能肯定地说这种间接效应在强度上是不同的。
含义:链式多重中介模型拒绝了并行多重中介模型中中介之间不相关的这一假设。当研究者估计一个链式多重中介模型时,其建模过程:X引起M1,随之导致M2,最终影响Y。研究X对Y的直接和间接影响。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
面板A:在图5.5中可以看到两个链式多重中介模型的统计图。
总路径:面板A中的图表描绘了一个双中介模型,其中X通过四条路径影响Y。
两条简单中介:第一条从X到Y只通过M1,第二条间接路径只通过M2
第三条链式中介:X的间接影响依次通过M1和M2,M1影响M2。
第四条直接效应:X的影响是从X直接到Y,不经过M1或M2而产生的。
建模:M1由X单独估计;M2由X和M1估计;Y由X、M1和M2估计。该 统计模型可以转化为三个方程(方程5.13~5.15): \[ \begin{aligned} & M_1=i_{M_1}+a_1 X+e_{M_1} \\ & M_2=i_{M_2}+a_2 X+d_{21} M_1+e_{M_2} \\ & Y=i_Y+c^{\prime} X+b_1 M_1+b_2 M_2+e_Y \end{aligned} \]
面板B:图5.5中面板B是另一个链式多重中介模型,包含三个中介变量
总路径:表示从X到Y上有八个不同的效应,包括七个间接效应和一个直接效应。顺 着X至少经过一个M到Y的路径,可以找到七条间接路径
三条简单中介:通过一个中介的可能路径(X→M1→Y;X→M2→Y;X→M3→Y)
四条链式中介:三条依次通过两个中介的路径(X→M1→M2→Y;X→M1→M3→Y;X→M2→M3→Y),以及一条依次通过三个中介的路径(X→M1→M2→M3→Y)。
第八条直接效应:直接效应不通过任何中介。
建模:三中介链式多重中介模型的四个方程(四个结果变量各一个方程)表示为: \[ \begin{aligned} & M_1=i_{M_1}+a_1 X+e_{M_1} \\ & M_2=i_{M_2}+a_2 X+d_{21} M_1+e_{M_2} \\ & M_3=i_{M_1}+a_3 X+d_{31} M_1+d_{32} M_2+e_{M_3} \\ & Y=i_Y+c^{\prime} X+b_1 M_1+b_2 M_2+b_3 M_3+e_Y \end{aligned} \]
一般来说,具有k个中介的链式多重中介模型需要k+1个方程来估计,因为其中它有k+1个结果变量(k个中介各一个,还有一个是Y)。 \[ \begin{aligned} & M_1=i_{M_1}+a_1 X+e_{M_1} \\ & M_i=i_{M_i}+a_i X+\sum_{j=1}^{i-1} d_{i j} M_j+e_{M_i} \text { for all } i=2 \text { to } k \\ & Y=i_Y+c^{\prime} X+\sum_{j=1}^k b_i M_i+e_Y \end{aligned} \]
在链式多重中介模型中,X对Y的总效应分为直接和间接两部分。
直接效应:无论模型中的中介个数为何,直接效应是c’,指的是当两个个案在X上相差1个单位且其他所有中介变量相等时Y的差异。
间接效应:大多取决于模型中中介变量的个数,通过把对应于每一步的间接路径的回归权重相乘而建立起来的。指的是当两个个案在X上相差1个单位且依次从X影响中介再影响Y时,它们的Y值的差异。
总间接效应:无论中介的个数有多少,X的总间接效应均为所有特定间接效应的总和。
总效应:直接效应和间接效应之和。
具有两个或三个中介的链式多重中介模型示例:(可推广到具有任何数量中介的链式中介模型中)
图5.5中的面板A是具有两个中介的链式多重中介模型,其有三个特定的间接效应和一个直接效应。
特定间接效应的估计:通过至少一个M连接X和Y的回归权重的乘积。X 只通过M1对Y的特定间接效应是a1b1,只通过M2的特定间接效应是a2b2,依次通过M1和M2的特定间接效应为a1d21b2。
总间接效应:a1b1+a2b2+a1d21b2。
总效应:即c,指的是X的总间接效应加上X的直接效应。可 只用X对Y进行回归来估计:
c = c’+a1b1+a2b2+a1d21b2
图3中的面板B是具有三个中介的链式多重中介模型,有七个间接效应由回归系数乘积估计而得。
特定间接效应:X通过M2对Y的特定间接效应为a2b2。依 次通过M1和M3特定间接效应为a1d31b3。依 次通过M1、M2、M3的间接效应是a1d21d32b3。
总间接效应:按照所有路径并将系数相乘,就能得到7个特定的间接效应,把它们加总即总间接效应:a1b1+a2b2+a3b3+a1d21b2+a1d31b3+a1d32b3+a1d21d32b3。
总效应:即总间接效应加上直接效应,结果是
c = c’+a1b1+a2b2+a3b3+a1d21b2+a1d31b3+a1d32b3+a1d21d32b3
正态理论法:将间接效应除以标准误的估计值,然后使用标准正态分布推导出p值,以便检验在总体中间接效应等于零的零假设。有 两个中介依次相连时,Taylor、MacKinnon和Tein(2008)提出了间接效应a1d21b2的标准误: \[ s e_{a_1} d_{z 1} b_2=\sqrt{a_1^2 d_{21}^2 s e_{b_2}^2+a_1^2 b_2^2 s e_{d_{21}}^2+d_{21}^2 b_2^2 s e_{a_1}^2} \]
Bootstrap置信区间:模拟研究(Taylor et al,2008)表明,相较于正态理论法,bootstrap置信区间通常表现更好。如果零在ci%置信区间之内,间接效应(或两个间接效应之间的差异)可以被认为在ci%置信水平下间接效应等于零
蒙特卡洛置信区间:Preacher和Selig(2012)构建蒙特卡罗置信区间的方法和代码可以被运用到链式多重中介模型中。
预期媒体影响力研究中的并行多重中介模型假设中介变量之间没有因果关系。
即使在考虑到报道位置对预期媒体影响力和知觉到问题的重要性的影响之后,这些中介变量之间应该还存在着某种关联。
图5.6是链式多重中介模型的统计图。该 模型包含了报道位置对白糖购买意愿的一个直接效应和三个间接效应,通过方程5.13、5.14和5.15的同归系数估计而整合在一起。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 6
## Model Type : Serial Multiple Mediation (2 meds)
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M1, M2
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M1 ~ X
## - M2 ~ X + M1
## Formula of Outcome:
## - Y ~ X + M1 + M2
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ───────────────────────────────────────────────────────────────
## (1) Y (2) M1 (3) M2 (4) Y
## ───────────────────────────────────────────────────────────────
## (Intercept) 3.250 *** 3.908 *** 4.610 *** -0.150
## (0.191) (0.213) (0.306) (0.530)
## X 0.496 0.627 * 0.354 0.103
## (0.278) (0.310) (0.233) (0.239)
## M1 0.196 ** 0.324 ***
## (0.067) (0.071)
## M2 0.397 ***
## (0.093)
## ───────────────────────────────────────────────────────────────
## R^2 0.026 0.033 0.097 0.325
## Adj. R^2 0.018 0.025 0.082 0.308
## Num. obs. 123 123 123 123
## ───────────────────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘lavaan’ (v0.6.21)
## Effect Type : Serial Multiple Mediation (2 meds) (Model 6)
## Sample Size : 123
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations (lavaan model)...
## LAVAAN Syntax:
## M1 ~ a1*X
## M2 ~ a2*X + d12*M1
## Y ~ c.*X + b1*M1 + b2*M2
## Indirect_All := a1*b1 + a2*b2 + a1*d12*b2
## Ind_X_M1_Y := a1*b1
## Ind_X_M2_Y := a2*b2
## Ind_X_M1_M2_Y := a1*d12*b2
## Direct := c.
## Total := c. + a1*b1 + a2*b2 + a1*d12*b2
## ───────────────────────────────────────────────────────────
## Estimate S.E. z p [Boot 95% CI] Beta
## ───────────────────────────────────────────────────────────
## Indirect_All 0.392 [ 0.096, 0.741] 0.127
## Ind_X_M1_Y 0.203 [ 0.010, 0.453] 0.066
## Ind_X_M2_Y 0.140 [-0.047, 0.358] 0.045
## Ind_X_M1_M2_Y 0.049 [ 0.001, 0.144] 0.016
## Direct 0.103 [-0.382, 0.583] 0.033
## Total 0.496 [-0.034, 1.034] 0.160
## ───────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
该模型的结果以方程形式表示为: \[ \begin{aligned} & \hat{M}_1=3.908+0.627 X \\ & \hat{M}_2=4.610+0.354 X+0.196 M_1 \\ & \hat{Y}=-0.150+0.103 X+0.324 M_1+0.397 M_2 \end{aligned} \]
直接效应:直接效应为正但在统计上并不显著(c’=0.103, p> .05),说明独立于知觉到的问题重要性和预期媒体影响力,文章在报纸中的位置与白糖购买意愿无关。
第一个间接效应:报道位置通过知觉的问题重要性对购买意愿(X→M1→Y)产生的特定间接效应a1b1=0.627(0.324)=0.203。那 些被告知文章会出现在报纸头版位置的参与者认为白糖短缺更重要(因为a1是正的),而这种更高的重要性在不受到预期媒体影响力影响的情况下,与增加的白糖购买意愿有关(因为b1是正的)。
第二个特定间接效应:报道位置通过预期媒体影响力对购买意愿产生的特定间接效应(X→M2→Y)。它 由报道位置对预设媒体影响力的影响a2与预设媒体影响力对购买意愿的影响b2相乘所得,间接效应为0.354(0.397)=0.140。
第三个间接效应:报道位置通过知觉到的问题重要性和预期的媒体影响力依次相连对购买意愿的特定间接效应,其中知觉到的问题重要性被建模为对预期的媒体影响力产生影响,从而又影响到白糖购买意愿(即X→M1→M2→Y)。这 个间接效应估计为a1d21b2=0.627(0.196)0.397=0.049,显著为正。相 对于那些被分配到内页条件的参与者,那些被告知文章会出现在头版的参与者认为白糖短缺更重要(因为a1是正的),进而又更加认为其他人会受到报道的影响(因为d21是正的),而这种对他人的想法又会转化为更大的购买口糖意图(因为b2是正的)。
总间接效应:所有特定间接效应的总和。总 间接效应为0.392,由不包含零的bootstrap置信区间(0.091~0.739)可确定这一效应不等于零。
对特定间接效果进行所有可能的成对比较。可 以看到三个差异为:
C1= a1b1-a2b2=0.203-0.140 = 0.063
C2= a1b1-a1d21b2=0.203-0.049 =0.155
C3=a2b2-a1d21b2=0.140-0.049 =-0.091
定义:在具有两个中介的模型中,链式和并行多重中介模型之间的唯一区别在于是否包含M1到M2的因果路径。链式模型估计这一效应,而并行模型则假定它为零。当有三个以上的中介时,一个模型可以是并行和链式中介过程的混合。
面板A:图5.8中的面板A是一个中介模型的统计图。该 模型有三个中介,但只有M1对另外两个中介M2和M3产生影响路径。使 用回归分析,该模型中X对Y的直接效应和间接效应可以用四个方程来估计,三个中介各用一个,另一个用于最终的结果Y(方程): \[ \begin{aligned} & M_1=i_{M_1}+a_1 X+e_{M_1} \\ & M_2=i_{M_2}+a_2 X+d_{21} M_1+e_{M_2} \\ & M_3=i_{M_3}+a_3 X+d_{31} M_1+e_{M_3} \\ & Y=i_Y+c^{\prime} X+b_1 M_1+b_2 M_2+b_3 M_3+e_Y \end{aligned} \]
特定间接效应:共5个特定间接效应,有三个仅通过一个中介(a1b1,a2b2和a3b3),两个通过两个中介(a1d21b2和a1d31b3)。
总间接效应:特定间接效应之和。
直接效应:为c’。
总效应:总间接效应+直接效应,可以通过只有X对Y的回归来估计。
面板B:图5.8中的面板B表示的是X直接进入一个并行中介过程,然后将并行过程发送路径到一个共同的中介。该 模型包括三个并行的中介,直接效应和间接效应可以用五个方程来估计,四个中介各一个,另一个用于最终结果Y。 \[ \begin{aligned} & M_1=i_{M_1}+a_1 X+e_{M_1} \\ & M_2=i_{M_2}+a_2 X+e_{M_2} \\ & M_3=i_{M_3}+a_3 X+e_{M_3} \\ & M_4=i_{M_4}+a_4 X+d_{41} M_1+d_{42} M_2+d_{43} M_3+e_{M_4} \\ & Y=i_Y+c^{\prime} X+b_1 M_1+b_2 M_2+b_3 M_3+b_4 M_4+e_Y \end{aligned} \]
特定间接效应:共计七个,四个仅通过一个中介(a1b1、a2b2、a3b3、a4b4),三个通过两个中介(a1d41b4、a2d42b4、a3d43b4)。
总间接效应:所有特定间接效应相加。
直接效应:为c’。
总效应:直接效应和所有间接效应相加。
在一个模型中包含多个中介的潜在风险:
当中介之间的相互关联变得太大时,会出现回归模型中常见的共线性问题,因为单个中介到结果的路径估计需要控制其他所有中介变量。
总效应和特定间接效应的推断检验之间可能会出现一些看似矛盾的结果:总间接效应不等于零,即使有一个或多个间接影响等于零。因为总间接效应是所有间接效应的总和,如果这些间接效应在符号上有所不同,但大小相当,那么它们的总和很可能为零或足趋近于零。
规避方法:
- 方法1:承认通过置信区间所进行的估计值存在固有的不确定性。
- 方法2:在解释结果时对总间接效应的相关性打折扣。
注:对多重中介模型的推断和解释通常更多地关注直接效应和特定间接效应,而不是总间接效应。
定义:一个多分类前因变量是一个可以分类的且有着三个或更多类别的变量。
传统方法:样本拆分法(不停做两两比较,导致样本量低);小组合并法(改变原本X的属性)
正确方法:使用表示模型中的某个多分类变量的两种系统来进行分析说明。
当X是一个多分类变量时,使用这样一个系统来表示一个多分类X进行中介分析:除了无论是否X原本出现在同归方程中,都使用g-1个变量来表示g个组。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
在方程中该模型表示为:
\[ M=i_M+a_1D_1+a_2D_2+...+a_{g-1}D_{g-1}+e_M (6.1) \] \[ Y=i_Y+c_1'D_1+c_2'D_2+...+c_{g-1}'D_{g-1}+bM+e_Y (6.2) \]
\(D_j\):表示g个组别的g-1个变量中的一个变量;
相对直接效应:用g-1个\(a_j\)回归系数表示;
相对间接效应:g-1个系数\(a_j\)和b的乘积
相对总效应:相对直接效应和相对间接效应相加
a路径:在图6.1中,从X到M有g-1条路径,其中每一个代表X的g-1个变量都对应一条。g-1个a系数中,每个系数都是X对M的影响的一部分,其值和解释将取决于用于表示g个组的系统。
b路径:尽管在M的模型中有g-1个回归系数,但在Y模型中只有一个关于M的回归系数,即路径b
a*b:表示g-1个相对间接效应的集合。
如何确定M是否对X和Y的影响起到中介作用?
定义:量化了不归因于通过M的机制的组间在Y上的均值差异部分。可使用方程6.2中表示X的g-1个变量的g-1个回归系数进行量化。每一个c’是一个相对直接效应。
定义:当X是一个多分类前因变量时,存在g-1个相对直接效应和相对间接效应。将 对应于g-1个变量编码组中的一个的相对直接效应和间接效应加在一起时,结果就是相对总效应(relative total effect)。所 以\(D_j\)的相对总效应是\(c_j\)=\(c_j'\)+\(a_jb\)。
解读例子:与相对直接和间接效应一样,相对总效应的解释取决于g个组如何用g-1个变量编码组来表示。当g=3且组3作为参照组时,c1=Y2-Y3,c2=Y2-Y3
建模方式:对于图6.1所示的模型,X的相对总效应可以首先通过使用方程6.1和6.2估计相对直接和相对间接效应,然后将它们相加,或者相反,通过在g-1变量编码组上同归Y,将M排除在模型外。
\[ Y=i_Y+c_1D_1+c_2D_2+...+c_{g-1}D_{g-1}+e_Y (6.3) \]
## Frequency Statistics:
## ──────────
## N %
## ──────────
## 0 41 31.8
## 1 43 33.3
## 2 45 34.9
## ──────────
## Total N = 129
## ────────────────────
## X d1 d2
## ────────────────────
## 1 2.000 0.000 1.000
## 2 0.000 0.000 0.000
## 3 2.000 0.000 1.000
## 4 2.000 0.000 1.000
## 5 2.000 0.000 1.000
## 6 1.000 1.000 0.000
## ────────────────────
## NOTE: `X` transformed to numeric.
##
## Descriptive Statistics:
## ───────────────────────────────────────────────────────────
## N Mean SD | Median Min Max Skewness Kurtosis
## ───────────────────────────────────────────────────────────
## C1 129 121.84 65.48 | 115.00 7.00 240.00 0.05 -1.19
## X* 129 2.03 0.82 | 2.00 1.00 3.00 -0.06 -1.52
## C2 129 5.12 0.78 | 5.12 2.87 7.00 0.12 -0.32
## C3 129 2.12 1.66 | 1.00 1.00 7.00 1.29 0.26
## Y 129 5.64 1.05 | 5.83 1.00 7.00 -1.15 2.48
## M 129 4.87 1.35 | 5.25 1.50 7.00 -0.75 -0.18
## d1 129 0.33 0.47 | 0.00 0.00 1.00 0.70 -1.52
## d2 129 0.35 0.48 | 0.00 0.00 1.00 0.63 -1.62
## ───────────────────────────────────────────────────────────
案例背景:Gareia等(2010)的研究:129名女性参与者收到关于女律师(凯瑟琳)命运的书面描述,由于高级合伙人的性别歧视行为,凯意琳没有得到晋升,反而输给了一个资质较差的男性。
操纵X:在阅读该故事后,在其他条件都相同的情况下,参与者得到一个关于凯恶琳会如何回应这种性别歧视的描述。
00组:被随机分配到”不抗议”(no protest)条件组 (PROTEST=0)的人了解到,虽然对这个决定感到非常失望,但凯瑟琳决定不采取任何措施来应对这种歧视,并且继续在该公司工作;
10组:被分配到”个人抗议”(individual protest)条件组(编号为PROTEST=1)的人被告知凯恶琳找到合伙人,并抗议这个决定,同时一再解释为什么这个决定对她来说是不公平的,比如她更能胜任这份工作,这样做会伤害她的事业等;
01组:被随机分配到”集体抗议”(collective protest)条件组(PROTEST=2)的人被告知凯琳对这一决定提出了抗议,并围绕着公司过去如何对待女性,女性与男性一样称职,以及他们应该得到平等对待来表述她的观点。
## ───────────────────────────────────────────────────────────────────
## X name mean sd d1 d2 AdjY
## ───────────────────────────────────────────────────────────────────
## 1 no protest(PROTEST=0) M 3.884 1.457 0.000 0.000 5.715
## 2 no protest(PROTEST=0) Y 5.310 1.302 0.000 0.000 5.715
## 3 individual protest(PROTEST=1) M 5.145 1.075 1.000 0.000 5.711
## 4 individual protest(PROTEST=1) Y 5.826 0.819 1.000 0.000 5.711
## 5 collective protest(PROTEST=2) M 5.494 0.936 0.000 1.000 5.495
## 6 collective protest(PROTEST=2) Y 5.753 0.936 0.000 1.000 5.495
## ───────────────────────────────────────────────────────────────────
编码方式:构建两个变量来编码实验条件(X)
第一个变量\(D_1\),设为1,参与者被告知她进行了个人抗议,其他所有参与者在\(D_1\)上设为0;
第二个变量\(D_2\),设为1,参与者被告知她进行了集体抗议,其他所有参与者都设为0。
她的行为对她受到他人喜欢的程度的相对总效应可通过在实验条件(X)下(用\(D_1\)和\(D_2\)表示)回归凯恶琳受喜欢的程度(LIKING)。在 R中,构成指示符变量并执行回归分析的代码是:
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 126) = 3.06, p = 0.051 .
## R² = 0.04625 (Adjusted R² = 0.03111)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 129
## ────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────
## (Intercept) 5.310 (0.161) 32.908 <.001 *** [4.991, 5.630]
## d1 0.516 (0.226) 2.287 .024 * [0.069, 0.962] 1.366
## d2 0.443 (0.223) 1.986 .049 * [0.002, 0.885] 1.366
## ────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 129
## ───────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────
## d1 0.233 (0.102) 2.287 .024 * [0.031, 0.434] 0.200 0.199
## d2 0.202 (0.102) 1.986 .049 * [0.001, 0.403] 0.174 0.173
## ───────────────────────────────────────────────────────────────────
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 126) = 3.06, p = 0.051 .
## R² = 0.04625 (Adjusted R² = 0.03111)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 129
## ─────────────────────────────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ─────────────────────────────────────────────────────────────────────────────────────────
## (Intercept) 5.310 (0.161) 32.908 <.001 *** [4.991, 5.630]
## factor(X)individual protest(PROTEST=1) 0.516 (0.226) 2.287 .024 * [0.069, 0.962]
## factor(X)collective protest(PROTEST=2) 0.443 (0.223) 1.986 .049 * [0.002, 0.885]
## ─────────────────────────────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 129
## ───────────────────────────────────────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────────────────────────────────────────
## factor(X)individual protest(PROTEST=1) 0.233 (0.102) 2.287 .024 * [0.031, 0.434] 0.200 0.199
## factor(X)collective protest(PROTEST=2) 0.202 (0.102) 1.986 .049 * [0.001, 0.403] 0.174 0.173
## ───────────────────────────────────────────────────────────────────────────────────────────────────────
回归模型:
\[ \hat{Y}= 5.310+0.516D_1+0.443D_2 (6.4) \]
其中,\(R^2\)=0.046,F(2,126)=3.055,p=0.051。结果表明,她对歧视的回应确实影响了她如何被人们感知。
注:当每组的\(D_1\)和\(D_2\)的模式被用于方程时,方程6.4再次产生了三组平均值:
\[ \overline{Y}_{NP}=5.310+0.516(0)+0.443(0)=5.310 \]
\[ \overline{Y}_{IP}=5.310+0.516(1)+0.443(0)=5.826 \]
\[ \overline{Y}_{CP}=5.310+0.516(0)+0.443(1)=5.753 \]
解读:从回归分析中可以得到,相对总效应是\(c_1\)=0.516和\(c_2\)=0.443。
c1:被告知她进行了个人抗议和被告知她没有进行抗议的两组之间喜欢她的程度的均值差异(\(c_1\)=\(\overline{Y}_{IP}\)-\(\overline{Y}_{NP}\)=5.826-5.310=0.516)
c2:被告知她进行了集体抗议和被告知她没有抗议的两组之间喜欢她的程度的均值差异(\(c_2\)=\(\overline{Y}_{CP}\)-\(\overline{Y}_{NP}\)=5.753-5.310=0.443)。
这两种相对总效应都具有统计显著性。与被告知她没有抗议的那组参与者相比,在被告知她进行了个人抗议以及她进行了集体抗议的参与者的组别里,凯瑟琳显著地更受喜欢。
分解相对总效应:相对直接成分和相对间接成分
构建效应:在一个回归分析中,从实验条件(X,用\(D_1\)和\(D_2\)表示)对感知到的回应恰当性(I)做出估计,得到\(\alpha_1\)和\(\alpha_2\)。在第二次回归分析中从实验条件和感知到的同应恰当性对人们对她的真欢程度进行回归得出\(c_1'\)、\(c_2'\)和b。
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(2, 126) = 22.22, p = 5e-09 ***
## R² = 0.26073 (Adjusted R² = 0.24899)
##
## Unstandardized Coefficients:
## Outcome Variable: M
## N = 129
## ────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ────────────────────────────────────────────────────────────────
## (Intercept) 3.884 (0.182) 21.288 <.001 *** [3.523, 4.245]
## d1 1.261 (0.255) 4.946 <.001 *** [0.757, 1.766] 1.366
## d2 1.610 (0.252) 6.384 <.001 *** [1.111, 2.109] 1.366
## ────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: M
## N = 129
## ───────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ───────────────────────────────────────────────────────────────────
## d1 0.443 (0.090) 4.946 <.001 *** [0.266, 0.620] 0.403 0.379
## d2 0.572 (0.090) 6.384 <.001 *** [0.394, 0.749] 0.494 0.489
## ───────────────────────────────────────────────────────────────────
##
## General Linear Model (OLS Regression)
##
## Model Fit:
## F(3, 125) = 14.12, p = 6e-08 ***
## R² = 0.25314 (Adjusted R² = 0.23522)
##
## Unstandardized Coefficients:
## Outcome Variable: Y
## N = 129
## ──────────────────────────────────────────────────────────────────
## b S.E. t p [95% CI of b] VIF
## ──────────────────────────────────────────────────────────────────
## (Intercept) 3.710 (0.307) 12.071 <.001 *** [ 3.102, 4.319]
## M 0.412 (0.070) 5.884 <.001 *** [ 0.273, 0.550] 1.353
## d1 -0.004 (0.219) -0.017 .987 [-0.437, 0.430] 1.631
## d2 -0.220 (0.228) -0.966 .336 [-0.671, 0.231] 1.808
## ──────────────────────────────────────────────────────────────────
##
## Standardized Coefficients (β):
## Outcome Variable: Y
## N = 129
## ──────────────────────────────────────────────────────────────────────
## β S.E. t p [95% CI of β] r(partial) r(part)
## ──────────────────────────────────────────────────────────────────────
## M 0.529 (0.090) 5.884 <.001 *** [ 0.351, 0.707] 0.466 0.455
## d1 -0.002 (0.099) -0.017 .987 [-0.197, 0.194] -0.002 -0.001
## d2 -0.100 (0.104) -0.966 .336 [-0.306, 0.105] -0.086 -0.075
## ──────────────────────────────────────────────────────────────────────
路径a:结果模型可以在表6.2中找到。感 知到的回应恰当性的模型是:
\[ \hat{M}=3.884+1.261D_1+1.610D_2 (6.5) \]
\[ \overline{M}_{NP}=3.884+1.261(0)+1.610(0)= 3.884 \] \[ \overline{M}_{IP}=3.884+1.261(1)+1.610(0)=5.145 \] \[ \overline{M}_{CP}=3.884+1.261(0)+1.610(1)=5.494 \] - a1和a2:\(\alpha_1\)和\(\alpha_2\)对应那些被告知她进行了个人抗议和被告知她没有抗议的两组参与者之间的均值差异(\(\alpha_1\)=\(\overline{M}_{IP}\)-\(\overline{M}_{NP}\)=5.145-3.884=1.261)以及那些被告知她进行了集体抗议和被告知她没有进行抗议的两组参与者之间的均值差异(\(\alpha_2\)=\(\overline{M}_{CP}\)-\(\overline{M}_{NP}\)=5.494-3.884=1.610)。与 不抗议相比,抗议歧视被认为更恰当,无论她是围绕自己还是围绕女性集体提出抗议。
\[ \hat{Y}=3.710-0.004D_1-0.220D_2+0.412M (6.6) \]
\[ \overline{Y}^*_{NP}=3.710-0.004(0)-0.220(0)+0.412(4.866)=5.715 \] \[ \overline{Y}^*_{IP}=3.710-0.004(1)-0.220(0)+0.412(4.866)=5.711 \] \[ \overline{Y}^*_{CP}:=3.710-0.004(0)-0.220(1)+0.412(4.866)= 5.495 \] - 解读结果:方程6.6还提供了对b的估计,凯瑟琳的回应恰当性对那些相同地被告知她的行为的参与者喜欢她的程度的影响。在两个人都被相同地告知凯瑟琳的回应时,认为她的行为恰当性高出1个单位的那个人,在喜欢她的程度上高出 0.412个单位。
c’1:与不抗议组相比,进行个人抗议组的相对直接效应为\(c_1'\)=\(\overline{Y}^*_{IP}\)-\(\overline{Y}^*_{NP}\)=5.711-5.715=-0.004
c’2:集体抗议组相对于不抗议的相对直接效应为\(c_2'\)=\(\overline{Y}^*_{CP}\)-\(\overline{Y}^*_{NP}\)=5.495 -5.715=-0.220。
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 5.310 *** 3.884 *** 3.710 ***
## (0.161) (0.182) (0.307)
## d1 0.516 * 1.261 *** -0.004
## (0.226) (0.255) (0.219)
## d2 0.443 * 1.610 *** -0.220
## (0.223) (0.252) (0.228)
## M 0.412 ***
## (0.070)
## ──────────────────────────────────────────────────
## R^2 0.046 0.261 0.253
## Adj. R^2 0.031 0.249 0.235
## Num. obs. 129 129 129
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
adjusted Y算法:直接效应的综合检验将三种调整后的均值相互比较。相当于将感知到的回应恰当性(M)作为协变量进行协方差单因素分析。使用2.6节描述的方法,首先输入感知到的回应恰当性,然后输入实验条件的两个指示符代码,这个检验的结果是不能拒绝调整后的均值相等这个零假设,△R2=0.009,F(2,125)=0.729,p=0.485。
相对间接效应:当X是一个多分类变量时,没有一个单独的数字可以被称为X的间接效应。
a1b解读:两个相对间接效应,一个表示个人抗议相对于不抗议的效应,量化了集体抗议相对不抗议的效应,这两个效应都在人们对她的行为的恰当性的看法和她被喜欢的程度的影响中起作用。这些相对间接效应估计为\(a_1\)b和\(a_2\)b。从方程6.5和6.6可知;\(a_1\)b=1.261(0.412)=0.520;\(a_2\)b=1.610(0.412)=0.663。因此,相对于不抗议,以个人为焦点的抗议活动使凯瑟琳受喜欢程度提高了0.520个单位,因为个人抗议被认为比不抗议更为恰当,这就转化为对她更为积极的评价。
a2b解读:同样,集体抗议将凯瑟琳受喜欢的程度提高了0.663个单位。因为相对于不抗议,集体抗被认为比不抗议更恰当,并且这将转化为对她更积极的评价。
bootstrap:相对间接效应是两个回归系数的乘积。两个回归系数的抽样分布是非正态的,因此这些相对间接效应的bootstrap或MonteCarlo置信区间是合适的
由于bruceR::PROCESS以及SPSS::PROCESS都不支持直接将多分类自变量进行中介效应检验。因此,将X的虚拟化变量d1和d2依次放入简单中介效应模型进行分析,得出的结果是一致的。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : d1
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : d2
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ d2 + d1
## Formula of Outcome:
## - Y ~ d2 + d1 + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 5.310 *** 3.884 *** 3.710 ***
## (0.161) (0.182) (0.307)
## d2 0.443 * 1.610 *** -0.220
## (0.223) (0.252) (0.228)
## d1 0.516 * 1.261 *** -0.004
## (0.226) (0.255) (0.219)
## M 0.412 ***
## (0.070)
## ──────────────────────────────────────────────────
## R^2 0.046 0.261 0.253
## Adj. R^2 0.031 0.249 0.235
## Num. obs. 129 129 129
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 129
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "d1" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.520 (0.153) 3.399 <.001 *** [ 0.255, 0.845]
## Direct (c') -0.004 (0.211) -0.018 .986 [-0.422, 0.420]
## Total (c) 0.516 (0.243) 2.119 .034 * [ 0.052, 1.005]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : d2
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : d1
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ d1 + d2
## Formula of Outcome:
## - Y ~ d1 + d2 + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 5.310 *** 3.884 *** 3.710 ***
## (0.161) (0.182) (0.307)
## d1 0.516 * 1.261 *** -0.004
## (0.226) (0.255) (0.219)
## d2 0.443 * 1.610 *** -0.220
## (0.223) (0.252) (0.228)
## M 0.412 ***
## (0.070)
## ──────────────────────────────────────────────────
## R^2 0.046 0.261 0.253
## Adj. R^2 0.031 0.249 0.235
## Num. obs. 129 129 129
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 129
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "d2" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.663 (0.168) 3.942 <.001 *** [ 0.368, 1.022]
## Direct (c') -0.220 (0.222) -0.992 .321 [-0.652, 0.210]
## Total (c) 0.443 (0.248) 1.788 .074 . [-0.038, 0.941]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
本章将包含二分变量或者连续型前因变量的中介分析中的路径分析利用推断方法扩展到具有多分类前因变量的中介分析中。
各种效应:代表g个组的多分类 变量X可以用g-1个变量表示,且这g-1个变量被视为中介模型中的前因变量。结 果得到g-1个X的相对直接效应、相对间接效应和相对总效应,对应于编码X的每个g-1个变量。
推断:可以使用回归输出中的标准推断方法进行相对总效应和直接效应的推断。当 X是二分变量或连续变量时间接效应的推断方法可以用于每个相对间接效应,包括bootstrap置信区间。
这里所讨论的方法的一个重要局限是:相对效应及其解释是取决于g组在分析时是如何用g-1个变量表示的,不同的编码决策可能导致关于中介的不同结论。在决定用何种系统代表多分类变量时必须格外小心。理想的选择是由对待检验的特定假设敏感的,或者是最初推动该研究的理论来决定。
定义:回答关于某个变量M是否作为X和Y之间的中介问题,与其他更先进的中介分析法相比,该方法着重关注因果系统中每条路径的显著性检验结果。
步骤:
\[第一步:Y = i_Y +cX +e_Y,c \ne 0\] - 第二个标准:X影响M
\[第二步:M = i_M +aX +e_M,a\ne0\] - 第三个标准:控制X、M影响Y
\[第三步:Y = i_Y + c'X +bM+e_Y,b\ne0\] 在以上三个标准满足的前提下,将X的直接效应c’与总效应c进行比较:
完全中介:c’比c更接近零且c’在统计上不显著
部分中介:c’比c更接近零但c’在统计上显著不等于零
优势:使用回归就可以完成,无需新软件
缺陷:
违背了统计学三个常识性的推断法则
对某种现象所作出的论断应该是基于与该论断最直接相关的现象的量化:根据逐步检验法,某个间接效应的存在逻辑是从关于某个东西的量化而不是该间接效应的一组零假设的结果而来。
为了支持该论断要求尽可能少的推断统计检验:能否断定M是一个中介取决于能否成功地拒绝三个零假设。但是假设检验本身也是可能出错的人为创造。为了做出或支持一个论断,一个人进行的假设检验越多,越可能犯错误。一个零假设不犯1类错误的概率是95%,三个都不犯就变为了95%^3。
告知论断的不确定性:使用逐步检验法的人通常对中介的描述都是二分的,即X对Y的影响是否受M的中介作用。这是一个定性描述,没有提供关于它的不确定性的信息。
多余的第一步:逐步检验法首先检验X的总效应来看X是否影响Y,但是总效应的大小不能左右或决定间接效应的大小。即 使总效应等于零,间接效应也有可能不等于零。X 对Y的总效应不应该成为寻找间接效应证据的前提条件。c接近于零的总效应的情况:
ab=-c’:总效应等于直接效应加上间接效应,如果这两个效果在正负号上有所不同,那它们相加的结果可能接近于零,甚至等于零。
对c的检验存在一个X对Y产生相反影响的亚群体:例如,对于男性,X对Y产生正向作用,而对于女性,这个影响是负向的,影响大小上相似,样本在男女之间平均分配,在不考虑男女之间的不同影响的情况下,X就可能不影响Y。
中介模型不仅包括X影响M(a)和Y(b)的关系成立,还必须声称M引起了Y(c)。但是,对X值的随机分配不能使M引起Y的变化成立,因为存在其他可能性。
附带相关(epiphenomenal association)
M可能与实际上受X影响的其他一些变量相关,如果正是另一个变量引起了Y的变化而不是M,那么就会导致错误地判定X通过M间接地影响Y,而实际上另一个变量才是X间接地发挥其影响的机制变量。
换言之,M和Y之间的相关可能是X对模型外的某个其他变量有影响这个事实的附带现象,而其他变量影响Y,但是因为M与该变量相关,所以看似是通过传递X对Y的影响的变量。附带相关严重威胁到研究者从中介分析中所做的因果推断的有效性。
混滑或虚假相关(confounding):
同样对因果排断的有效性构成严重威胁。
案例辅助解读:更多观看电视的儿童更有可能超重(例如,Brown et al., 2011; Jordan, 2010),并不意味着过多观看电视会引起体重问题。
对混淆和附带现象的相关的解释
控制的原理:附带相关(epiphenomenal association)和混淆(confounding)作为因果推断有效性的威胁可以至少部分地通过统计控制来解决。
如果两个变量M和Y由于它们与某个变量C相关而产生附带相关或混淆,那么对于那些在变量C上相等的人,M和Y之间的相关应该是不存在的。
如果已测得C,就可以在中介模型中在数学上消除C对假定的因果关联的量化的影响。例如,将C添加到M和Y的模型中可以消除C对X和M,X和Y,以及M和Y之间关联做出因果论断的附带或混淆威胁。
图4.1一个带有统计控制的简单中介模型的概念图
在中介分析中,测量所有的可能混淆中介模型相关的变量,将它们作为额外的预测因子添加到M和Y的模型中,则它们在中介模型中各条路径上的效应可以统计性的消除:
\[M=i_M+aX+\sum_{i=1}^{q}f_iC_i+e_M\]
\[Y=i_Y+c'X+bM+\sum_{i=1}^qg_iC_i+e_Y\]
\[M=i_M+cX+\sum_{i=1}^{q}f_iC_i+e_M\]
*解读
变化:对直接效应、间接效应和总效应的解释仍然是一样的,但是要加上q个控制变量”C上相等”(equal on C)、“C为常数”(holding C constant)或”统计上控制C”(statistically controlling for C)(这些术语具有相同含义,可以交替使用)。
直接效应:C量化了当控制M和C之后两个在X上相差1个单位的个案在Y上相差多少。
间接效应:ab量化了当两个个案在X上相差1个单位,但在协变量C上保持不变时,由于X对M的影响从而影响Y,它们的Y值相差多少。
X的总效应:当统计上控制C,两个在X上相 差1个单位的个案,它们的Y值相差多少
经济压力研究案例:评估经济衰退期间262名企业主感受到的经济压力和与生意有关的抑郁情绪,以及他们退出企业经营的意愿。
简单中介分析:
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ X
## Formula of Outcome:
## - Y ~ X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 2.062 *** 0.799 *** 1.447 ***
## (0.262) (0.143) (0.252)
## X 0.056 0.173 *** -0.077
## (0.054) (0.030) (0.052)
## M 0.769 ***
## (0.103)
## ──────────────────────────────────────────────────
## R^2 0.004 0.116 0.180
## Adj. R^2 0.000 0.112 0.174
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.133 (0.033) 4.059 <.001 *** [ 0.070, 0.198]
## Direct (c') -0.077 (0.056) -1.362 .173 [-0.177, 0.040]
## Total (c) 0.056 (0.064) 0.877 .381 [-0.072, 0.178]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
结果: - 经济压力更大的人感受到更强的与生意有关的抑郁情绪(a=0.173),经历更多抑郁情绪的人,报告出更强的退出意愿(b=0.769)。 - 间接效应ab=0.133,95% CI为[0.071, 0.201]。没有证据表明经济压力对退出意愿有直接影响(c’=-0.077,p=0.144)。
但是,数据来源于一次性的观察研究,没有操纵任何条件,没有跨时间测量,潜在混淆很多。例如,间接效应可能只不过是个体差异的表现,例如一个人对自己在管理生意上的信心和技能的知觉。
Pollack等(2012)研究中包括”企业家自我效能”,可以用来测量信息。相 关分析:
## Pearson's r and 95% confidence intervals:
## ───────────────────────────────────────────
## r [95% CI] p N
## ───────────────────────────────────────────
## Y-X 0.064 [-0.058, 0.184] .302 262
## Y-C1 -0.243 [-0.353, -0.125] <.001 *** 262
## X-C1 -0.158 [-0.274, -0.038] .010 * 262
## ───────────────────────────────────────────
结果:与企业家自我效能相对较低的参与者相比,企业家自我效能相对较高的参与者表示感觉相对较少的经济压力(r=-0.158,p=0.010),相对较少的与生意有关的抑郁情绪(t=-0.246,p<0.001),并报告出较弱的退出企业经营的意愿(r=-0.243,p<0.001)。
控制:将企业家自我效能(C1)纳入抑郁情绪(M)和退出意愿(Y)的线性方程中。另 外,将性别(C2)和经商时间长短(C3)作为预测因子。
直接效应和间接效应方程:
\[M=i_M+aX+f_1C1+f_2C2+f_3C3+e_M\]
\[Y=i_Y+c'X+bM+g_1C1+G_2C2+g_3C3+e_Y\]
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : C1, C2, C3
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ C1 + C2 + C3 + X
## Formula of Outcome:
## - Y ~ C1 + C2 + C3 + X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 4.009 *** 1.785 *** 2.746 ***
## (0.560) (0.308) (0.550)
## C1 -0.322 *** -0.155 *** -0.212 **
## (0.081) (0.044) (0.076)
## C2 0.138 0.015 0.127
## (0.156) (0.086) (0.144)
## C3 -0.010 -0.011 -0.002
## (0.011) (0.006) (0.011)
## X 0.019 0.159 *** -0.094
## (0.054) (0.030) (0.053)
## M 0.707 ***
## (0.105)
## ──────────────────────────────────────────────────
## R^2 0.065 0.163 0.206
## Adj. R^2 0.050 0.150 0.190
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.113 (0.028) 3.985 <.001 *** [ 0.055, 0.169]
## Direct (c') -0.094 (0.057) -1.629 .103 [-0.195, 0.025]
## Total (c) 0.019 (0.064) 0.301 .764 [-0.111, 0.140]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
将包含性别、任期和企业家自我效能的模型输出结果与删除这些控制变量的输出结果相比,没有任何实质变化。
注:将附带或虚假相关作为替代性解释消除并不能将这些影响明确地解释为因果关系,还有其他可能与X、M与Y相关的混淆变量。研究者所能尽量做的就是预料到这些混淆威胁,在研究过程中测得他们。
##
## Model Summary
##
## ─────────────────────────────────────
## (1) M (2) Y
## ─────────────────────────────────────
## (Intercept) 1.785 *** 2.746 ***
## (0.308) (0.550)
## C1 -0.155 *** -0.212 **
## (0.044) (0.076)
## C2 0.015 0.127
## (0.086) (0.144)
## C3 -0.011 -0.002
## (0.006) (0.011)
## X 0.159 *** -0.094
## (0.030) (0.053)
## M 0.707 ***
## (0.105)
## ─────────────────────────────────────
## R^2 0.163 0.206
## Adj. R^2 0.150 0.190
## Num. obs. 262 262
## ─────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
因果顺序
中介是一个因果过程,断定某个相关具有因果关系的标准之一是确定时间上的先后顺序。
对X进行实验操作和随机分配,但要保证X在中介模型中先于M和Y。随机分配在很大程度上可以保证在研究的一开始由X定义的组别在M和Y上大致相等。但是随机分配不能保证M在时间上先于Y。真正的因果顺序有可能是从X到Y再到M。
通过重新检测变量位置判断模型是否成立:如果X不是通过操纵和随机分配来确定的,那么必须把X、M和Y的因果序列的任一顺序考虑为因果链方向的一个可能的备选。
理论在建模中的作用:
理想情况下,通过强有力的理论和逻辑上的不可能来排除其中的一些,但很可能有人能够拼凑出另一个合理的论点来支持至少一个不同于您所解释的因果链的方向。
有时候某些备选的因果链方向是非常不可信的,以至于可以毫不费力地将其排除。
良好的理论也可能有助于排除一些可能的因果方向:某个有关X引起M的理论已经得到该特定领域一帮研究者和理论家的检验和接受,就很少有人会认为是M容易影响X。或者原则上可能M会导致X,但是这一理论的可能性相对于那个预测X引起M的理论更薄弱或是更差。
本例中:为了尝试得到一个备选的因果链方向,一些研究者估计与替代性解释相应的中介模型,来看直接效应和间接效应与备选顺序预测的是否一致。
以经济压力模型为例,经济压力作为退出意愿对抑郁情绪影响的中介:
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : M
## - Predictor (X) : Y
## - Mediators (M) : X
## - Moderators (W) : -
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - X ~ Y
## Formula of Outcome:
## - M ~ Y + X
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) M (2) X (3) M
## ──────────────────────────────────────────────────
## (Intercept) 1.037 *** 4.450 *** 0.325 *
## (0.086) (0.186) (0.145)
## Y 0.242 *** 0.073 0.230 ***
## (0.033) (0.071) (0.031)
## X 0.160 ***
## (0.027)
## ──────────────────────────────────────────────────
## R^2 0.174 0.004 0.272
## Adj. R^2 0.170 0.000 0.267
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "Y" (X) ==> "X" (M) ==> "M" (Y)
## ─────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ─────────────────────────────────────────────────────────────
## Indirect (ab) 0.012 (0.015) 0.784 .433 [-0.013, 0.045]
## Direct (c') 0.230 (0.044) 5.264 <.001 *** [ 0.146, 0.313]
## Total (c) 0.242 (0.041) 5.960 <.001 *** [ 0.161, 0.317]
## ─────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
结果解读:这一间接效应不显著,ab=0.012,95% CI为[-0.013,0.044],包含0。
上述分析中得出的结果并不能建立起确定的因果链方向。只有对效应方向做出明确因果解释的正确的研究设计才能解决这一问题。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
多个X变量的回归模型:
K个X变量对单个Y变量直接影响,同时通过单个M产生间接影响;
存在k个直接和间接效应,每个X各有一个;
有两个结果变量,因此需要两个线性模型来估计效应。这两个模型是:
\[M=i_M+a_1X_1+a_2X_2+\cdots+a_kX_k+e_M\]
\[Y=i_Y+c'_1X_1+c'_2X_2+\cdots+c'_kX_k+bM+e_Y\]
可以被估计为一组单独的OLS回归;
\(X_i\)通过M对Y的间接效应是\(a_ib\),直接效应为\(c'\_i\)。
\(X_i\)的总效应是直接效应和间接效应之和:\(c_i=c'_i+a_ib\)。
\(X_i\)对Y的总效应也可以通过k个X而不需要M预测的Y值来估计。
\[Y=i_Y+c_1X_1+c_2X_2+\cdots+c_kX_k+e_Y\]
当所有k个X同时都在模型中时,\(X_i\)的直接效应和间接效应被解释为当两个个案在\(X_i\)上相差1个单位,但在其他k-1个\(X_i\)上相等时,估计出的Y值的差异。
影响结果的因素之间的关系和其对结果变量的影响:在具有k个X变量的模型中,\(X_i\)的总效应、直接效应和间接效应与排除所有其他k-1个X变量的简单中介模型中的相应的效应的任何差异都取决于\(X_i\)和其他k-1个X之间相关性的大小,以及其他X、M和Y之间的相关性。
一次只纳入一个X还是同时纳入k个X:
把所有X纳入一个模型:估计的是X对Y的那部分影响(直接地和间接地通过M),这是某个X相对于模型中其他X来说其产生的特定影响。
在中介模型中纳入多个X的危险:当包括控制变量,高度相关的X可能会抵消各自的影响。模型中变量之间的联系越强,这种问题的可能性就越大。
用单个X估计出k个模型:得出X对Y的直接效应和间接效应,但是会将其他变量的影响排除在模型外。
在PROCESS中估计具有多个X变量的模型:
为了估计所有k个X变量的直接效应和间接效应,PROCESS必须执行k次,每次将一个\(X_i\)放在模型中作为X,剩余的k-1个X变量作为协变量。
每次运行PROCESS时,会生成列为X的变量的直接和间接效应。重复k-1次产生k个X变量的间接效应。
在数学上,得到的所有回归系数、直接效应和间接效应将与它们同时估计时(如在结构方程模型中)的结果相同。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : C1, C2, C3, C4
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ C1 + C2 + C3 + C4 + X
## Formula of Outcome:
## - Y ~ C1 + C2 + C3 + C4 + X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 4.280 *** 1.884 *** 2.952 ***
## (0.650) (0.357) (0.632)
## C1 -0.326 *** -0.156 *** -0.216 **
## (0.081) (0.045) (0.077)
## C2 0.149 0.019 0.136
## (0.157) (0.086) (0.145)
## C3 -0.007 -0.010 -0.000
## (0.012) (0.007) (0.011)
## C4 -0.006 -0.002 -0.005
## (0.008) (0.004) (0.007)
## X 0.020 0.160 *** -0.092
## (0.054) (0.030) (0.053)
## M 0.705 ***
## (0.105)
## ──────────────────────────────────────────────────
## R^2 0.067 0.164 0.207
## Adj. R^2 0.049 0.148 0.189
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.113 (0.028) 3.994 <.001 *** [ 0.057, 0.169]
## Direct (c') -0.092 (0.057) -1.622 .105 [-0.193, 0.024]
## Total (c) 0.020 (0.063) 0.324 .746 [-0.105, 0.144]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : C4
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : C1, C2, C3, X
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ C1 + C2 + C3 + X + C4
## Formula of Outcome:
## - Y ~ C1 + C2 + C3 + X + C4 + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 4.280 *** 1.884 *** 2.952 ***
## (0.650) (0.357) (0.632)
## C1 -0.326 *** -0.156 *** -0.216 **
## (0.081) (0.045) (0.077)
## C2 0.149 0.019 0.136
## (0.157) (0.086) (0.145)
## C3 -0.007 -0.010 -0.000
## (0.012) (0.007) (0.011)
## X 0.020 0.160 *** -0.092
## (0.054) (0.030) (0.053)
## C4 -0.006 -0.002 -0.005
## (0.008) (0.004) (0.007)
## M 0.705 ***
## (0.105)
## ──────────────────────────────────────────────────
## R^2 0.067 0.164 0.207
## Adj. R^2 0.049 0.148 0.189
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "C4" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) -0.002 (0.003) -0.476 .634 [-0.009, 0.004]
## Direct (c') -0.005 (0.007) -0.662 .508 [-0.019, 0.009]
## Total (c) -0.006 (0.008) -0.800 .424 [-0.022, 0.008]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
有k个Y变量的中介模型统计图:由于\(Y_i\)只由X和M决定,X对\(Y_i\)的直接效应和间接效应都是一样的,无论是与其他k-1个变量同时进行估计(需要结构方程模型),还是进行k次单独分析,每次只有一个Y变量。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : C1, C2, C3
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ C1 + C2 + C3 + X
## Formula of Outcome:
## - Y ~ C1 + C2 + C3 + X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 4.009 *** 1.785 *** 2.746 ***
## (0.560) (0.308) (0.550)
## C1 -0.322 *** -0.155 *** -0.212 **
## (0.081) (0.044) (0.076)
## C2 0.138 0.015 0.127
## (0.156) (0.086) (0.144)
## C3 -0.010 -0.011 -0.002
## (0.011) (0.006) (0.011)
## X 0.019 0.159 *** -0.094
## (0.054) (0.030) (0.053)
## M 0.707 ***
## (0.105)
## ──────────────────────────────────────────────────
## R^2 0.065 0.163 0.206
## Adj. R^2 0.050 0.150 0.190
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) 0.113 (0.028) 3.985 <.001 *** [ 0.055, 0.169]
## Direct (c') -0.094 (0.057) -1.629 .103 [-0.195, 0.025]
## Total (c) 0.019 (0.064) 0.301 .764 [-0.111, 0.140]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 4
## Model Type : Simple Mediation
## - Outcome (Y) : C4
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : -
## - Covariates (C) : C1, C2, C3
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ C1 + C2 + C3 + X
## Formula of Outcome:
## - C4 ~ C1 + C2 + C3 + X + M
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) C4 (2) M (3) C4
## ──────────────────────────────────────────────────
## (Intercept) 43.361 *** 1.785 *** 44.269 ***
## (4.609) (0.308) (4.909)
## C1 -0.712 -0.155 *** -0.791
## (0.665) (0.044) (0.681)
## C2 1.749 0.015 1.757
## (1.284) (0.086) (1.286)
## C3 0.410 *** -0.011 0.405 ***
## (0.094) (0.006) (0.095)
## X 0.197 0.159 *** 0.278
## (0.445) (0.030) (0.470)
## M -0.509
## (0.936)
## ──────────────────────────────────────────────────
## R^2 0.083 0.163 0.084
## Adj. R^2 0.069 0.150 0.067
## Num. obs. 262 262 262
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1)
## Effect Type : Simple Mediation (Model 4)
## Sample Size : 262
## Random Seed : set.seed(1223)
## Simulations : 2000 (Bootstrap)
##
## Running 2000 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "C4" (Y)
## ──────────────────────────────────────────────────────────────
## Effect S.E. z p [Boot 95% CI]
## ──────────────────────────────────────────────────────────────
## Indirect (ab) -0.081 (0.166) -0.489 .625 [-0.362, 0.311]
## Direct (c') 0.278 (0.491) 0.567 .571 [-0.709, 1.171]
## Total (c) 0.197 (0.455) 0.434 .665 [-0.697, 1.067]
## ──────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 2000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
将中介和调节模型进行整合有两种方式:被中介的调节和被调节的中介。
概念上,被调节的中介是指X→M→Y事件发生链会随不同的人、情境、条件、或调节变量所表示的不同情况而发生变化;被中介的调节指的是在Y模型中X和调节变量W之间的交互作用需要通过一个中介变量M来传递。
相同点:其中一种情况下的被中介的调节模型在数学运算上与被调节的中介的条件过程模型是一样的。并且用于估计模型中的系数的M和Y的方程是相同的。当它们使用相同的数据进行估计时,将产生相同的结果。
不同点1:二者的区别首先在于它们是如何被解释的,以及重点关注该模型的哪部分
被调节的中介:重点关注的是某个间接效应的条件性——间接效应是如何被调节的,旨在估计间接效应,以及该效应作为调节变量的函数是如何变化的。
被中介的调节:探究的是X和调节变量W之间的交互作用起作用的机制,其中X和W的乘积被视为自变量通过M对Y产生影响。重点是对X和W的乘积的间接影响估计。
不同点2:四类不同的MoMe和MeMo,所对应的理论模型检验有本质差异
定义:被中介的调节指的是在模型中X和调节变量W之间的交互作用对于Y的影响需要通过中介变量M。
被中介的调节实例: Preacher, Rucker & Hayes (2007, JPSP) “The role of empathic concern in the temperature–aggression relationship”
调节:环境温度(W)强化了不舒适(X)对攻击性(Y)的影响。中介:这种交互效应通过“移情关注 empathic concern(M)”传递。即,高温条件下,人们移情关注下降,从而更容易表现出攻击行为。
结构: (X×W) → M → Y,即“被移情关注所中介的调节”。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
该统计图可以被视作一个简单中介模型:
XW为影响因素(自变量);
X和W为协变量。
可以转换为方程12.13和12.14:
\[ M=i_M+a_1 X+a_2 W+a_3 X W+e_M(12.13) \] \[ Y=i_Y+c_1^{\prime} X+c_2^{\prime} W+c_3^{\prime} X W+b M+e_Y (12.14) \]
这个乘积的间接效应和其他任何间接效应一样,量化的是通过假设中介变量连接影响因素与结果变量的路径之积。XW的间接效应因此被估计为\(a_3\)和\(b\)的乘积。
XW的直接效应是\(c_3^{\prime}\);XW的总效应用\(c_3\)估计,并表示在图12.8的面板A中。即: \[ c_3=c_3^{\prime}+a_3b \]
将间接效应分离出来表明XW通过M对Y的间接影响是XW的总效应和直接效应之差。 \[ a_3b=c_3-c_3^{\prime} \]
推断检验的结果表明,\({ }_Ta_{3 T} b \neq 0\)可以确立XW通过M间接地影响Y。它还能确立XW对Y的直接影响与XW的总效应在统计上有显著差异(i. e., \({ }_T c_3-{ }_T c_3^{\prime} \neq 0\))。
灾害成因和气候变化怀疑程度之积(XW,但在PROCESS输出中列为X)的总效应为\(c_3=-0.171\),t(207)=-2.034,p=0.043。XW的总效应分为间接和直接部分。
XW的间接效应为-0.186,计算为XW在合理化拒绝捐赠模型中的效应(M,\(a_3=0.201\))乘以合理化拒绝捐赠对捐赠意愿的影响(Y,\(b=-0.923\))。根据95%bootstrap置信区间(-0.302~-0.064),间接效应显著不为零。
XW的直接效应不显著,\(c_3^{\prime}=0.015\),t(207)=0.217,p=0.829。在导致了负的合理化拒绝援助后,气候怀疑程度并没有调节灾害成因表述对捐赠意愿的影响。
XW通过M对Y的间接效应是XW对Y的总效应与XW对Y的直接效应之差: \[a_3b=c_3-c_3^{\prime}=-0.186=-0.171-0.015 \]
分析结果表明:灾害成因表述对捐赠意愿的影响受到气候变化怀疑程度的调节作用是通过合理化拒绝捐赠的强度这一中介起作用。
定义:中介变量针对调节变量对自变量与因变量之间关系的调节作用起中介作用。该模型关注 W 对 X→Y 关系的调节作用,是否通过 M 这一机制实现,即W->M->(X->Y)。
* 应该提供有说服力的证据来证明调节变量对中介变量的影响;需要阐明为何中介变量能显著调节自变量和因变量之间的关系,并传递调节变量对自变量和因变量之间关系的调节作用。
该模型对应两个方程:
\[ \begin{aligned} M &=a_{0}+a_{1} W+a_{2} X+e_{M} \\ Y &=b_{0}+b_{1} X+b_{2} M+b_{3} W+b_{4} X M+b_{5} X W+e_{Y} \end{aligned} \] 将M方程代入Y方程中,得到:
\[ \begin{aligned} Y &=b_{0}+b_{1} X+b_{2}\left(a_{0}+a_{1} W+a_{2} {X}+e_{M}\right)+b_{3} W+b_{4} X\left(a_{0}+a_{1} W+a_{2} {X}+e_{M}\right)+b_{5} X W+e_{Y} \\ &=b_{0}+b_{1} X+a_{0} b_{2}+a_{1} b_{2} W+a_{2} b_{2} {X}+b_{2} e_{M}+b_{3} W+a_{0} b_{4} X+a_{1} b_{4} X W+a_{2} b_{4} {X}^2+b_{4} X e_{M}+b_{5} X W+e_{Y} \\ &=\left(b_{0}+a_{0} b_{2}\right)+a_{2} b_{4} {X}^2+\left(b_{1}+a_{2} b_{2}+a_{0} b_{4}\right){X}+\left(a_{1} b_{2}+b_{3}\right) W+(b_{5}+a_{1} b_{4}) {XW}+\left(b_{2} e_{M}+b_{4} X e_{M}+e_{Y}\right) \end{aligned} \]
使用 Caschool 数据集进行分析。该数据集中包含学校层面的教育资源、学生背景和学业成绩等变量。为了便于模型估计和结果解释,对原始变量进行标准化处理,并将其重新命名为 X、M、W 和 Y。其中,X表示学校计算机资源,由compstu标准化得到;M表示学生贫困程度,由mealpct标准化得到;W表示阅读成绩,由readscr标准化得到;Y表示数学成绩,由mathscr标准化得到。本例检验 W 是否通过 M 间接调节 X 对 Y 的影响,即阅读成绩是否通过学生贫困程度这一机制,间接改变学校计算机资源与数学成绩之间关系的强弱。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 15
## Model Type : Moderated Mediation
## - Outcome (Y) : Y
## - Predictor (X) : W
## - Mediators (M) : M
## - Moderators (W) : X
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ W + X
## Formula of Outcome:
## - Y ~ W*X + M*X
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 0.000 -0.000 -0.004
## (0.019) (0.023) (0.020)
## W 0.923 *** -0.892 *** 0.881 ***
## (0.019) (0.024) (0.040)
## X 0.047 -0.010
## (0.024) (0.020)
## M -0.051
## (0.040)
## W:X -0.016
## (0.035)
## X:M -0.040
## (0.036)
## ──────────────────────────────────────────────────
## R^2 0.852 0.774 0.853
## Adj. R^2 0.851 0.773 0.851
## Num. obs. 420 420 420
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1), ‘interactions’ (v1.2.0)
## Effect Type : Moderated Mediation (Model 15)
## Sample Size : 420
## Random Seed : set.seed(1)
## Simulations : 5000 (Bootstrap)
##
## Interaction Effect on "Y" (Y)
## ──────────────────────────────────────────
## F df1 df2 p
## ──────────────────────────────────────────
## W * X 0.21 1 414 .650
## X * M 1.25 1 414 .264
## (All Interactions) 1.07 2 414 .345
## ──────────────────────────────────────────
##
## Simple Slopes: "W" (X) ==> "Y" (Y)
## (Conditional Direct Effects [c'] of X on Y)
## ─────────────────────────────────────────────────────────────
## "X" Effect S.E. t p [95% CI]
## ─────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.897 (0.054) 16.479 <.001 *** [0.790, 1.004]
## 0.000 (Mean) 0.881 (0.040) 21.775 <.001 *** [0.802, 0.961]
## 1.000 (+ SD) 0.866 (0.052) 16.646 <.001 *** [0.763, 0.968]
## ─────────────────────────────────────────────────────────────
##
## Interaction Effect on "Y" (Y)
## ──────────────────────────────────────────
## F df1 df2 p
## ──────────────────────────────────────────
## W * X 0.21 1 414 .650
## X * M 1.25 1 414 .264
## (All Interactions) 1.07 2 414 .345
## ──────────────────────────────────────────
##
## Simple Slopes: "M" (M) ==> "Y" (Y)
## (Conditional Effects [b] of M on Y)
## ──────────────────────────────────────────────────────────────
## "X" Effect S.E. t p [95% CI]
## ──────────────────────────────────────────────────────────────
## -1.000 (- SD) -0.011 (0.054) -0.195 .846 [-0.117, 0.096]
## 0.000 (Mean) -0.051 (0.040) -1.274 .203 [-0.129, 0.027]
## 1.000 (+ SD) -0.091 (0.052) -1.726 .085 . [-0.194, 0.013]
## ──────────────────────────────────────────────────────────────
##
## Running 5000 * 3 simulations...
## Indirect Path: "W" (X) ==> "M" (M) ==> "Y" (Y)
## (Conditional Indirect Effects [ab] of X through M on Y)
## ─────────────────────────────────────────────────────────────
## "X" Effect S.E. z p [Boot 95% CI]
## ─────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.009 (0.046) 0.205 .837 [-0.081, 0.100]
## 0.000 (Mean) 0.045 (0.036) 1.263 .207 [-0.024, 0.115]
## 1.000 (+ SD) 0.081 (0.047) 1.712 .087 . [-0.006, 0.181]
## ─────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 5000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
结果显示,W 对 M 的影响显著,a1=-0.892,说明 W 能够显著预测中介变量 M。具体而言,W 越高,M 越低。
M 与 X 的交互项对 Y 的影响不显著,b4=−0.040,说明 M 并未显著调节 X 对 Y 的影响。
进一步地,W 通过 M 对 X→Y 关系的间接调节效应为 a1b4=0.036,且不显著,p=.233。因此,本例没有发现显著的被中介调节效应。换言之,虽然 W 显著影响 M,但没有证据表明 W 是通过 M 来调节 X 与 Y 之间的关系。
此外,XW 对 Y 的影响也不显著,b5=−0.016,p=.641,说明 W 对 X→Y 的直接调节作用不显著。
定义:如果X通过M对Y产生的间接影响取决于某一个调节变量,那么可以说将X与Y连接的机制是有条件的。
示例解读:
包容型领导对员工创新行为的影响(团队心理安全感的中介与权力距离的调节)
研究变量:自变量为包容型领导,因变量为员工创新行为,中介变量为团队心理安全感,调节变量为权力距离。
作用机制:包容型领导通过提升团队心理安全感间接促进员工创新行为(中介作用);但下属的权力距离负向调节该中介作用,即权力距离越高,团队心理安全感的中介作用越弱,反之越强。
辱虐管理对员工退缩行为的影响(绩效回避目标导向的中介与差错紧张氛围的调节)
研究变量:自变量为辱虐管理,因变量为员工退缩行为,中介变量为绩效回避目标导向,调节变量为感知的差错紧张氛围。
作用机制:辱虐管理通过激发员工绩效回避目标导向间接导致退缩行为(中介作用);感知的差错紧张氛围调节该中介作用,即差错紧张氛围越强,绩效回避目标导向对退缩行为的促进作用越强,中介效应越显著。
定义:第一或二阶段中只有一阶段被调节的中介模型,调节变量改变了自变量和中介变量之间关系(即X->M)的强度/调节变量改变了中介变量和结果变量之间关系(即M->Y)的强度,进而线性地调节了整个中介作用(即X->M->Y)。
* 注:
需要说明为何自变量和中介变量之间的关系会因调节变量取值水平的高低而发生变化;
应该阐明中介变量和结果变量之间存在显著关系。由于调节变量的存在,本来显著的中介作用在调节变量取高值或低值时,有可能会变得不显著;也有可能,中介作用本来不显著,但因为调节变量的存在,在调节变量取高值或低值时,中介作用变得显著;
基于以上两个步骤,论述为何当调节变量取值较高或较低时,中介作用会增强、减弱甚至变化方向。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
如统计图(面板B)所示,X的间接效应是以W为条件,因为W调节了X对M的效应。
\[ \begin{aligned} M=& a_{0}+a_{1} X+a_{2} W+a_{3} X W+e_{M} \\ Y=& {b}_{0}+b_{1} M+c^{\prime} X+e_{Y} \\ \end{aligned} \] - 将两式合并:
\[ \begin{aligned} Y &=b_{0}+b_{1}\left(a_{0}+a_{1} X+a_{2} W+a_{3} X W+e_{M}\right)+c^{\prime} X+e_{Y} \\ &=b_{0}+a_{0} b_{1}+a_{1} b_{1} X+a_{2} b_{1} W+a_{3} b_{1} X W+b_{1} e_{M}+c^{\prime} X+e_{Y} \\ &=\left(b_{0}+a_{0} b_{1}\right)+\left(a_{1} b_{1}+a_{3} b_{1} W\right) X+c^{\prime} X+a_{2} b_{1} W+\left(b_{1} e_{M}+e_{Y}\right) \end{aligned} \]
X通过直接和间接的路径对Y发挥影响:
直接影响:将X和Y相连且独立于M;
间接效应:第一个组成部分是从X到M的路径,第二个组成部分是从M到Y的路径。
间接效应:在这个模型中X对M的影响是W的函数。X通过M对Y的间接效应也是W的一个函数,表达式为:
\[ b_1 \theta_{X \rightarrow M}=b_1\left(a_1+a_3 W\right)=a_1b_1+a_3 b_1 W \]
- \* IMM=$a_{3} b_{1}$
X的直接效应是\(c^{\prime}\);
X的总效应用\(c\)估计,并表示在面板A中。即: \[ c=c^{\prime}+a_1b_1+a_3 b_1 W \]
案例背景:Chapman和Lickcel(2016)的灾难框架研究,其中参与者阅读了有关非洲干旱造成的人道主义危机的故事。
X操纵:一半参与者被告知干早是由气候变化(气候变化条件)引起的,而另一半参与者则没告知干旱的具体原因,因此认为干旱是自然原因造成的(自然原因条件)。
其他变量:
M:参与者认为拒绝为饥荒的受害者提供援助是否合理(例如,认为这些受害者是自作自受);
W:参与者对气候变化是否真实的怀疑程度;
Y:参与者向受害者捐赠的意愿(DONATE),7分量表,分数越高代表捐赠意愿越高。
研究目的:揭示向受害者捐赠的意愿是否受到干旱归因的影响?
基本模型:对捐赠意愿(Y:捐赠)和实验条件(X:FRAME,0=自然原因条件,1=气候变化条件)进行回归。得到的模型是Y=4.565+0.084X。
不提供帮助的合理化强度的中介效应检验
模型:揭示灾害原因表述(X)是否通过影响人们对向受害者提供帮助是否合理的看法(M)从而对人们的捐助意愿(Y)产生影响。
方程:
\[ \hat{M}=2.802+0.134 X (12.2) \] \[\hat{Y}=7.235+0.212 X-0.953 M (12.3) \] ###### 图12.3 关于人际评价抗议决定的直接和间接效应的一个简单中介解释的PROCESS输出
## Error:
## ! object 'C12' not found
灾害原因表述的操纵通过拒绝提供帮助的合理化强度对捐赠意愿产生的间接影响为-0.128,表示那些被告知灾难是由气候变化引起的参与者拒绝提供援助的合理化强度比那些没有被告知干旱归因于气候变化的参与者更强(\(a=\overline{\mathrm{M}}_{\text {climate change }}-\overline{\mathrm{M}}_{\text {natural causes }}=0.134\)),并且拒绝捐助的正当理由的强度越强,捐赠意愿越低(b=-0.953)。
然而,这种间接效应的bootstrap置信区间包含零,不能确定效应的正负。而且,灾害原因表述对于捐赠意愿的直接效应在统计学上并不显著,无法支持”拒绝提供援助的合理化强度是灾害原因表述影响捐赠意愿产生影响的中介变量”的论点。
注:
上述中介分析并没有将个体差异考虑到X(旱灾归因)对M(合理化拒绝提供帮助)的影响中。
分析结果表明,模型中至少有一条路径受到气候变化怀疑程度的调节。不将气候变化怀疑程度的调节作用纳入中介模型中,就会掩盖这个机制的条件性。
对问题重新分析:估计灾害原因表述对捐赠意愿的直接和间接影响,包括对间接的调节效应进行正式统计检验。
面板A反映了简单中介分析,估计的是旱灾原因表述通过合理化拒绝捐助的强度对捐赠意愿的直接和间接影响。
面板B为调节分析。评估了气候变化怀疑态度对干早原因表述对向受害者拒绝捐赠的理由的强度的影响的调节作用。
面板C为面板A/B的合并,一个条件过程模型。该模型显示X的间接效应受到W的调节,所以X对Y并没有单一的间接效应,而是W的函数。
M模型中包含X和W的乘积,该模型中 \(a_1=-0.562\) ,\(a_2=0.105\) ,\(a_3=0.201\): \[ \hat{M}=2.452-0.562 X+0.105 W+0.201 X W \]
X通过M对Y的间接影响:将定义间接效应的两部分相乘,得到结果为:
\[ \theta_{X \rightarrow M} b=\left(a_1+a_3 W\right) b=a_1 b+a_3 b W (12.8) \]
以回归系数表示,该结果为 \[ \theta_{X \rightarrow M} b=(-0.562+0.201 W)(-0.918)=0.516-0.185 W (12.9) \]
方程12.9量化了灾害原因表述通过合理化拒绝捐赠的强度对捐赠意愿的间接影响。这是一个关于气候变化怀疑程度的线性函数。间 接效应取决于W值。当选择一个W值进行运算时,结果就是X的条件间接效应,它量化的是在那个W值上X通过M对Y的间接影响。
X的直接效应不显著,\(c^{\prime}=0.210\),p=0.122。
定义:第一和二阶段同时被调节的中介模型,调节变量改变了自变量和中介变量之间关系(即X->M)的强度,同时改变了中介变量和结果变量之间关系(即M->Y)的强度,进而非线性地调节了整个中介作用(即X->M->Y)。
这个模型中有三条路径被调节:
W通过调节X对M的影响来调节间接效应;
W通过调节M对Y的影响来调节间接效应;
同时,W调节X的直接效应。
与该模型对应的方程是:
\[ \begin{aligned} &M=a_{0}+a_{1} X+a_{2} W+a_{3} X W+{e}_{M} \\ &Y=b_{0}+b_{1} M+b_{2} M W+c_{1}^{\prime} X+c_{2}^{\prime} W+c_{3}^{\prime} X W+{e}_{Y}\\ \end{aligned} \]
\[ \begin{aligned} Y&=b_{0}+b_{1}\left(a_{0}+a_{1} X+a_{2} W+a_{3} X W+{e}_{M}\right)+b_{2} {~W}\left(a_{0}+a_{1} X+a_{2} W+a_{3} X W+{e}_{M}\right)+c_{1}^{\prime} X+c_{2}^{\prime} W+c_{3}^{\prime} {X} W+{e}_{Y}\\ &=b_{0}+a_{0} b_{1}+a_{1} b_{1} X+a_{2} b_{1} W+a_{3} b_{1} X W+b_{1} e_{M}+a_{0} b_{2} {~W}+a_{1} b_{2} X {~W}+a_{2} b_{2} W^2+a_{3} b_{2} X W^2+b_{2} {We}_{M}+c_{1}^{\prime} X+c_{2}^{\prime} W+c_{3}^{\prime} {XW}+{e}_{Y}\\ &=\left(b_{0}+a_{0} b_{1}\right)+[\left(a_{1}+a_{3} W\right)\left(b_{1}+b_{2} {~W}\right) X+\left(c_{1}^{\prime}+c_{3}^{\prime} W\right) X]+\left(a_{2} b_{1}+a_{0} b_{2}+a_{2} b_{2} {~W}+c_{2}^{\prime}\right) W+\left(b_{1} {e}_{M}+b_{2} {We}_{M}+{e}_{Y}\right) \end{aligned} \]
因为X的直接效应只受到W的调节,它是只含W的函数: \[ \theta_{X \rightarrow Y}=c_1^{\prime}+c_3^{\prime} W \]
X对M的效应是θX→M=a1+a3W,M对Y的影响是θM→Y=b1+b2W,X通过M对Y的间接效应是这两个条件效应的乘积,取决于调节变量W:\((a_{1}+a_{3} W)(b_{1}+b_{2} {W})=a_{1} b_{1}+a_{3} b_{1}W+a_{1} b_{2}W+a_{3} b_{2}W^2\)
IMM = NA:Hayes 和 Rockwood(2019,第27页)指出,当第一阶段和第二阶段均包含连续型调节变量时,不存在适用的调节中介指数;
Hayes(2015, 2018)提出了一种用于检验调节中介效应的替代性差异检验方法:选择调节变量W的两个取值w1和w2,并通过 Bootstrap 方法构建这两个取值下X的条件间接效应之差的置信区间。如果该置信区间不包含 0,则说明调节变量W对间接效应的调节作用得到支持。条件间接效应之差\(=(a_{1} b_{1}+a_{3} b_{1}Low.W+a_{1} b_{2}Low.W+a_{3} b_{2}Low.W^2)-(a_{1} b_{1}+a_{3} b_{1}High.W+a_{1} b_{2}High.W+a_{3} b_{2}High.W^2)\)
确认性方法(而非证伪):但是,置信区间包含 0 并不能否定调节中介效应的存在,因为也有可能选择其他的w1和w2取值后,所得到的条件间接效应差异的 Bootstrap 置信区间不再包含 0。因此,这种方法只能用于确认调节中介效应的存在,而不能用于否定调节中介效应。换言之,显著结果可以证明 MoMe(moderated mediation)的存在,而不显著结果不能证明 MoMe 不存在。
使用 Caschool 数据集进行分析。该数据集中包含学校层面的教育资源、学生背景和学业成绩等变量。为了便于模型估计和结果解释,对原始变量进行标准化处理,并将其重新命名为 X、M、W 和 Y。其中,X表示学校计算机资源,由compstu标准化得到;M表示学生贫困程度,由mealpct标准化得到;W表示阅读成绩,由readscr标准化得到;Y表示数学成绩,由mathscr标准化得到。研究目的是检验 W 是否同时调节 X→M、M→Y 和 X→Y 三条路径。换言之,X 通过 M 影响 Y 的中介过程,是否会随着 W 的变化而变化;同时,X 对 Y 的直接效应是否也受到 W 的调节。
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 59
## Model Type : Moderated Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : W
## - Covariates (C) : -
## - HLM Clusters : -
##
## Formula of Mediator:
## - M ~ X*W
## Formula of Outcome:
## - Y ~ X*W + M*W
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ──────────────────────────────────────────────────
## (1) Y (2) M (3) Y
## ──────────────────────────────────────────────────
## (Intercept) 0.000 -0.005 -0.066 **
## (0.047) (0.024) (0.024)
## X 0.249 *** 0.044 -0.011
## (0.047) (0.025) (0.020)
## W -0.892 *** 0.876 ***
## (0.024) (0.040)
## X:W 0.017 -0.011
## (0.023) (0.019)
## M -0.068
## (0.039)
## W:M -0.079 ***
## (0.018)
## ──────────────────────────────────────────────────
## R^2 0.062 0.775 0.859
## Adj. R^2 0.060 0.773 0.857
## Num. obs. 420 420 420
## ──────────────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1), ‘interactions’ (v1.2.0)
## Effect Type : Moderated Mediation (Model 59)
## Sample Size : 420
## Random Seed : set.seed(1)
## Simulations : 5000 (Bootstrap)
##
## Interaction Effect on "Y" (Y)
## ───────────────────────────────────────────
## F df1 df2 p
## ───────────────────────────────────────────
## X * W 0.35 1 414 .556
## W * M 18.60 1 414 <.001 ***
## (All Interactions) 9.76 2 414 <.001 ***
## ───────────────────────────────────────────
##
## Simple Slopes: "X" (X) ==> "Y" (Y)
## (Conditional Direct Effects [c'] of X on Y)
## ──────────────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ──────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.001 (0.029) 0.024 .981 [-0.056, 0.058]
## -0.000 (Mean) -0.011 (0.020) -0.540 .590 [-0.049, 0.028]
## 1.000 (+ SD) -0.022 (0.025) -0.859 .391 [-0.072, 0.028]
## ──────────────────────────────────────────────────────────────
##
## Interaction Effect on "M" (M)
## ─────────────────────────────
## F df1 df2 p
## ─────────────────────────────
## X * W 0.56 1 416 .454
## ─────────────────────────────
##
## Simple Slopes: "X" (X) ==> "M" (M)
## (Conditional Effects [a] of X on M)
## ─────────────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ─────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.027 (0.036) 0.767 .444 [-0.043, 0.097]
## -0.000 (Mean) 0.044 (0.025) 1.804 .072 . [-0.004, 0.092]
## 1.000 (+ SD) 0.061 (0.031) 1.981 .048 * [ 0.000, 0.122]
## ─────────────────────────────────────────────────────────────
##
## Interaction Effect on "Y" (Y)
## ───────────────────────────────────────────
## F df1 df2 p
## ───────────────────────────────────────────
## X * W 0.35 1 414 .556
## W * M 18.60 1 414 <.001 ***
## (All Interactions) 9.76 2 414 <.001 ***
## ───────────────────────────────────────────
##
## Simple Slopes: "M" (M) ==> "Y" (Y)
## (Conditional Effects [b] of M on Y)
## ───────────────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ───────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.011 (0.042) 0.277 .782 [-0.070, 0.093]
## -0.000 (Mean) -0.068 (0.039) -1.739 .083 . [-0.145, 0.009]
## 1.000 (+ SD) -0.147 (0.045) -3.295 .001 ** [-0.235, -0.059]
## ───────────────────────────────────────────────────────────────
##
## Running 5000 * 3 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## (Conditional Indirect Effects [ab] of X through M on Y)
## ───────────────────────────────────────────────────────────────
## "W" Effect S.E. z p [Boot 95% CI]
## ───────────────────────────────────────────────────────────────
## -1.000 (- SD) 0.000 (0.002) 0.170 .865 [-0.003, 0.005]
## -0.000 (Mean) -0.003 (0.003) -1.109 .268 [-0.009, 0.001]
## 1.000 (+ SD) -0.009 (0.006) -1.623 .105 [-0.022, -0.000]
## ───────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 5000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
结果显示,在 M 方程中,XW 对 M 的影响不显著,a3=0.017,说明 W 未显著调节 X→M 路径。在 Y 方程中,MW 对 Y 的影响显著,b 2=−0.079,说明 W 显著调节 M→Y 路径。然而,XW 对 Y 的影响不显著,\(c_3^{\prime}\)=−0.011,说明 W 未显著调节 X→Y 的直接效应。
进一步考察条件间接效应发现,低 W、中 W、高 W 条件下的间接效应分别为 0.000、-0.003 和 -0.009,均未达到显著水平。低 W 与高 W 的条件间接效应差异为0.009,p=.093,仅表现出边缘显著趋势。因此,本例没有提供充分证据支持 W 显著调节 X 通过 M 影响 Y 的间接效应。
条件总效应等于条件间接效应与条件直接效应之和。结果显示,低 W、中 W 和高 W 条件下的总效应分别为 0.001、-0.014 和 -0.031,均不显著。这表明在不同 W 水平下,X 对 Y 的总体影响均未达到显著水平。
被调节的中介模型可能以多种方式出现
灾害原因表述研究中涉及的四个变量:
Y:参与者捐赠意愿(DONATE)
X:参与者被告知于早是由气候变化造成的(X=1)或没有被告知具体原因(X=0)(FRAME)受到实验操纵
W:参与者对气候变化真实性的怀疑(SKEPTIC)
M:参与者合理化拒绝捐助的强度(JUSTIFY)。
对问题重新分析:估计灾害原因表述对捐赠意愿的直接和间接影响,包括对间接的调节效应进行正式统计检验。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
该图表示两个方程,一个用于M,一个用于Y: \[ M=i_M+a_1 X+a_2 W+a_3 X W+e_M (12.4) \] \[Y=i_Y+c_1^{\prime} X+c_2^{\prime} W+c_3^{\prime} X W+b M+e_Y (12.5) \]
该模型显示X的直接和间接效应均受到W的调节,所以X对Y并没有单一的直接或间接效应,而是W的函数。
M模型中包含X和W的乘积,该模型中 \(a_1=-0.562\) ,\(a_2=-0.105\) ,\(a_3=0.201\): \[ \hat{M}=2.452-0.562 X-0.105 W+0.201 X W \]
这种效应是气候变化怀疑程度的线性函数,该函数是:
\[ \theta_{X \rightarrow M}=a_1+a_3 W (12.6) \]
- $a_3$量化了W与X对M的影响的线性关系。然 而,$a_3$没有量化X通过M对Y的间接效应。[**在该模型中,在X-\>M路径上调节效应显著并不是对间接效应的调节的必要条件。**]{.underline}
Y的模型是: \[ \hat{Y}=7.291+0.160 X-0.043 W+0.015 X W-0.923 M(12.7) \] - X通过M对Y的间接影响:将定义间接效应的两部分相乘,即将X通过M对Y的间接影响与在控制X的情况下M对Y影响相乘,得到结果为:
\[ \theta_{X \rightarrow M} b=\left(a_1+a_3 W\right) b=a_1 b+a_3 b W (12.8) \] 以回归系数表示,该结果为 \[ \theta_{X \rightarrow M} b=(-0.562+0.201 W)(-0.923)=0.519-0.186 W (12.9) \]
方程12.9量化了灾害原因表述通过合理化拒绝捐赠的强度对捐赠意愿的间接影响。这 是一个关于气候变化怀疑程度的线性函数。间 接效应取决于W值。当选择一个W值进行运算时,结果就是X的条件间接效应,它量化的是在那个W值上X通过M对Y的间接影响。
X对Y的直接效应:假设受到W调节,并通过X和W的乘积纳入方程12.5中估计得到。X的直接效应是W的函数,表达式是: \[ \theta_{X \rightarrow M}=c_1^{\prime}+c_3^{\prime} W(12.10) \]
这是关于气候变化怀疑程度的线性函数。可以通选择W值并进行运算来构造在W的值上,X的条件直接效应。
从PROCESS输出结果中可以看出,气候变化怀疑程度的直接效应是正的。X的正的条件直接效应反映出相比与被告知为自然原因条件的人,那些被告知气候变化是灾害成因的人有更大的捐赠意愿。
操作:为了可视化条件直接和间接效应,使用由模型中的数构建的函数来产生一个数据集,该数据集包含对调节变量各种值上估的直接和间接效应。然后绘制结果。
纵轴上是直接和间接效应
横轴上是调节变量的值
不同的直线代表直接和间接效应
纵轴对应于两种不同灾害归因(气候变化和自然原因)之间在捐赠意愿上估计的差异。正值意味着那些把干旱归因于气候变化的人更愿意捐赠,而负值意味着气候变化条件下的参与者捐赠意愿更低。纵轴上的零点对应于两种不同灾害归因条件下人们的捐赠意愿没有差异。
直线的斜率表示灾害成因表述对捐赠意愿的影响随着气候变化怀疑程度的个体差异会产生多大的变化。
从方程12.10可以得出
表示直接效应的直线斜率为\(c_3^{\prime}\),这意味着W每增加一个单位,\(\theta_{X \rightarrow Y}\)相应增加\(c_3^{\prime}\)个单位。
表示条件间接效应的直线的斜率则没有这么明显。在 方程12.8中X通过M对Y的条件间接效应是\(\left(a_1+a_2 W\right) \quad b\),如果W增加一个单位,则X对Y的条件间接效应将为\(\left(a_1+a_2 (W+1)\right) \quad b\)。表 示条件间接效应的直线斜率是这两个值之间的差值
\[ \begin{aligned} {\left[a_1+a_3(W+1)\right] b-\left(a_1+a_3 W\right) b } & =a_1 b+a_3 b W+a_3 b-a_1 b-a_3 b W \\ & =\left(a_1 b-a_1 b\right)+\left(a_3 b W-a_3 b W\right)+a_3 b \\ & =a_3 b \end{aligned} \]
在这个模型中,直接效应被设定为W的线性函数: \[ \theta_{X \rightarrow Y}=c_{\mathrm{1}}^{\prime}+c_3^{\prime} W \]
\(c_3^{\prime}\)表示W变化一个单位,X的条件直接效应的变化量。
检验直接效应是否受到调节,可以做一个假设检验或构建置信区间来进行统计推断。
选点法:估计X在不同W值下对Y的条件直接效应,推导出其标准误,然后计算出检验这个条件效应等于零的零假设的p值,或构建置信区间。
对于条件过程模型中的间接影响的推断应
首先重点检验间接效应是被调节。
有了确切的间接效应调节存在的证据就可以进行条件间接效应的推断
被调节的中介的统计检验
逐步检验:M模型中X和W之间存在显著的交互作用,且Y模型中M对Y的影响也是显著的,所以间接影响受到调节。直到最近,这种逐步完成的方法仍然是检验间接效应是否受到调节的一种重要方法。
直接检验:对被调节的中介的最为直接的方法是检验X的间接效应的函数中调节变量的权重是否等于零。并且还可以为这个权重构造置信区间,从而反映出调节变量与间接效应之间关系大小的不确定性也是可能的。
在这个模型中,从方程12.8得到X通过M对Y的间接效应是 \(\left(a_1+a_3 W\right) b=a_1 b+a_3 b W\)
使用该分析中的模型估计出的回归系数,该函数是:
\[ (-0.562+0.201 W)(-0.923)=0.519-0.186 W \]
并可视化为图12.7。表示这个函数的直线斜率\(a_3 b W=-0.186\),它量化的是当W变化一个单位时,X通过M对Y的间接效应的变化。\(a_3 b\)称为这个模型的有调节的中介指数。
如果\({ }_T a_{3 T} b\)不等于0,那么W调节了X的间接效应——被调节的中介作用。
如果\({ }_T a_{3 T} b\)等于零,X的间接效应并不是随着W线性地发生变化,这意味着W没有调节X的间接效应。
由于詹森-内曼技术不能用于非正态分布假设,因而采用选点法:
首先选择调节变量的值,然后估计X在这些值上的条件间接效应,并行推断。
如果置信区间含零,则无法确切地说该W值上X的间接条件不为零。
但是,如果信区间并不包含零,这就表明这个条件间接效应不等于零。
辅助解读:在PROCESS的输出结果中可以看出,在气候变化怀疑程度(W=1.592)相对较低的人中,条件间接效应估计为0.224,但95%bootstrap置信区间包括零(-0.055,-0.516)。而在那些气候变化怀疑程度中等的人中(W=2.8),条件间接效应为0.202,其中95%bootstrap置信区间包含零(-0.206,0.205)。但在气候变化怀疑程度相对较高的人中,可以得出间接效应是负的。其点估计为-0.447,95%bootstrap置信区间完全低于零(-0.750, -0.114)。
这些结果表明,在气候变化怀疑论者中,合理化拒绝捐赠的强度是灾害成因表述对捐赠意愿的中介变量。负的间接效应意味着将干旱归因于气候变化比起未具体说明原因,降低了向受灾者捐赠的意愿。这是通过增加合理化拒绝捐赠的强度,从而降低了捐赠意愿。然而,在对气候变化怀疑程度较低的人中,这种合理化拒绝捐赠的强度并没有在灾害成因表述和捐赠意愿间起到显著的中介作用,因为气候变化怀疑程度中等和较低的人群中,两种条件间接效应都不是显著不为零的。
注:当在这种形式的模型中探测间接效应的调节时,不需要比较不同W值上的条件间接效应以确定它们是否不同。被调节中介指数的检验可以作为对两个不同的W值上的条件间接效应之间差异的检验。
这个模型中的条件间接效应被估计为\(\left(a_1+a_3 W\right) b\),因此当\(W=w_1\)与\(W=w_2\)时,两个条件间接效应之间的差异是: \[ \begin{aligned} \left(a_1+a_3 w_1\right) b-\left(a_1+a_3 w_2\right) b & =a_1 b+a_3 w_1 b-a_1 b-a_3 w_2 b \\ & =a_3 w_1 b-a_3 w_2 b \\ & =a_3 b\left(w_1-w_2\right) \end{aligned} \]
解读:表示被调节的中介指数乘以W的两个值之差。bootstrap置信区间可以用来检验两个条件间接效应之间差异的显著性。
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
如图所示,x的间接效应是以W为条件,因为W调节了M对Y的效应。
\[ M=i_M+a X+e_M \] \[ Y=i_Y+c^{\prime} X+b_1 M+b_2 W+b_3 M W+e_Y \]
X通过直接和间接的路径对Y发挥影响:
直接影响:将X和Y相连且独立于M。
间接效应:第一个组成部分是从X到M的路径,第二个组成部分是从M到Y的路径。
但是,M对Y的影响(控制X)不是方程中的b1。相 反,在这个模型中M对Y的影响是W的函数。
\[ Y=i_Y+c^{\prime} X+\left(b_1+b_3 W\right) M+b_2 W+e_Y \]
因此,M到Y的影响是θM→Y=b1+b3W是W的一个函数。X 通过M对Y的间接效应也是W的一个函数。
\[ a \theta_{M \rightarrow Y}=a\left(b_1+b_3 W\right)=a b_1+a b_3 W \]
案例背景:该研究涉及了一家汽车零部件制造公司雇用的60个工作团队,并收了该公司200多人对于他们的工作团队的一系列问题以及对于团队主管各种看法的调查反馈。
主要变量:
DYSFUNC:团队成员失调行为,例如团队成员降低了他人的工作效率或阻碍变革和创新的频率,分数越高反映团队失调行为越多。
NECTONE:团队负面情绪,通过询问团队成员在工作中感到”愤怒”“厌恶”的频率来进行测量,分数越高反映对于工作环境的情感基调越负面。
PERFORM:团队整体绩效,例如团队的效率和准时性,团队是否完成了公司的生产目标等,分值越高绩效越好。
NEGEXP:团队成员非语言负面情绪表达能力,分数越高意味着团队成员更多地表达他们的负面情绪状态。
研究目的:探究工作团队成员的失调行为对团队的良好运转能力产生负面影响的机制。
模型:
中介过程(X→M→Y):失调行为(X)导致工作环境充满负面情绪(M),进而干扰了任务绩效(Y)。
调节:当团队成员能够控制自己的负面情绪的表露(W),隐瞒自己对他人的感受时,团队就能专注于手头的任务而不必转移注意力去处理工作环境中的负面基调和别人的感受。
方程:
\[ M=i_M+a X+e_M \] \[ Y=i_Y+c^{\prime} X+b_1 M+b_2 W+b_3 M W+e_Y \]
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
##
## ****************** PART 1. Regression Model Summary ******************
##
## PROCESS Model ID : 14
## Model Type : Moderated Mediation
## - Outcome (Y) : Y
## - Predictor (X) : X
## - Mediators (M) : M
## - Moderators (W) : W
## - Covariates (C) : -
## - HLM Clusters : -
##
## All numeric predictors have been grand-mean centered.
## (For details, please see the help page of PROCESS.)
##
## Formula of Mediator:
## - M ~ X + W
## Formula of Outcome:
## - Y ~ X + M*W
##
## CAUTION:
## Fixed effect (coef.) of a predictor involved in an interaction
## denotes its "simple effect/slope" at the other predictor = 0.
## Only when all predictors in an interaction are mean-centered
## can the fixed effect be interpreted as "main effect"!
##
## Model Summary
##
## ───────────────────────────────────────────
## (1) Y (2) M (3) Y
## ───────────────────────────────────────────
## (Intercept) -0.032 0.047 -0.019
## (0.068) (0.062) (0.058)
## X 0.110 0.621 *** 0.366 *
## (0.184) (0.167) (0.178)
## W 0.085 -0.044
## (0.114) (0.113)
## M -0.431 **
## (0.131)
## M:W -0.517 *
## (0.241)
## ───────────────────────────────────────────
## R^2 0.006 0.200 0.312
## Adj. R^2 -0.011 0.172 0.262
## Num. obs. 60 60 60
## ───────────────────────────────────────────
## Note. * p < .05, ** p < .01, *** p < .001.
##
## ************ PART 2. Mediation/Moderation Effect Estimate ************
##
## Package Use : ‘mediation’ (v4.5.1), ‘interactions’ (v1.2.0)
## Effect Type : Moderated Mediation (Model 14)
## Sample Size : 60
## Random Seed : set.seed(1)
## Simulations : 5000 (Bootstrap)
##
## Direct Effect: "X" (X) ==> "Y" (Y)
## ──────────────────────────────────────────────────────────
## Effect S.E. t p [95% CI]
## ──────────────────────────────────────────────────────────
## Direct (c') 0.366 (0.178) 2.059 .044 * [0.010, 0.722]
## ──────────────────────────────────────────────────────────
##
## Interaction Effect on "Y" (Y)
## ─────────────────────────────
## F df1 df2 p
## ─────────────────────────────
## M * W 4.60 1 55 .036 *
## ─────────────────────────────
##
## Simple Slopes: "M" (M) ==> "Y" (Y)
## (Conditional Effects [b] of M on Y)
## ───────────────────────────────────────────────────────────────
## "W" Effect S.E. t p [95% CI]
## ───────────────────────────────────────────────────────────────
## -0.552 (- SD) -0.150 (0.213) -0.706 .483 [-0.577, 0.276]
## -0.008 (Mean) -0.431 (0.131) -3.289 .002 ** [-0.694, -0.169]
## 0.535 (+ SD) -0.713 (0.153) -4.656 <.001 *** [-1.019, -0.406]
## ───────────────────────────────────────────────────────────────
##
## Running 5000 * 3 simulations...
## Indirect Path: "X" (X) ==> "M" (M) ==> "Y" (Y)
## (Conditional Indirect Effects [ab] of X through M on Y)
## ───────────────────────────────────────────────────────────────
## "W" Effect S.E. z p [Boot 95% CI]
## ───────────────────────────────────────────────────────────────
## -0.552 (- SD) -0.093 (0.152) -0.615 .538 [-0.355, 0.261]
## -0.008 (Mean) -0.268 (0.118) -2.277 .023 * [-0.505, -0.051]
## 0.535 (+ SD) -0.442 (0.164) -2.696 .007 ** [-0.793, -0.136]
## ───────────────────────────────────────────────────────────────
## Percentile Bootstrap Confidence Interval
## (SE and CI are estimated based on 5000 Bootstrap samples.)
##
## Note. The results based on bootstrapping or other random processes
## are unlikely identical to other statistical software (e.g., SPSS).
## To make results reproducible, you need to set a seed (any number).
## Please see the help page for details: help(PROCESS)
## Ignore this note if you have already set a seed. :)
## Error in `nodes$no`:
## ! object of type 'closure' is not subsettable
在这个模型中,有一个X通过M对Y的单独间接影响,和一个是第四个变量W的函数的直接效应。
\[ M=i_M+a X+e_M \] \[ Y=i_Y+c_1^{\prime} X+c_2^{\prime} W+c_3^{\prime} X W+b M+e_Y \]
解读:路径X→M或M→Y都没有受到调节,所以这种间接影响是无条件的。然 而,X对Y的直接影响是有条件的,因为它是W的一个函数。
\[ Y=i_Y+\left(c_1^{\prime}+c_3^{\prime} W\right) X+c_2^{\prime} W+b M+e_Y \] - 或者,同样地:
\[ Y=i_Y+\theta_{X \rightarrow Y} X+c_2^{\prime} W+b M+e_Y \]
\[ \theta_{X \rightarrow Y}=c_1^{\prime}+c_3^{\prime} \dot{W} \] 在这个模型中,X通过M间接地对Y施加影响,独立于其他任何变量;但还直接地影响Y,直接效应的大小取决于W。
了解条件过程分析基本原理的关健是知道如何估计、推断和解释条件直接和间接 效应,以及如何检验一个间接效应是否受到调节。
条件间接效应量化的是在一个调节变量的值为条件的基础上,某个假定的自变量X通过一个假定的中介变量M对一个结果变量Y的间接影响。
相比而言,条件直接效应量化的是X对Y的影响,该影响不受任何中介变量影响,但是以某个调节变量的值为条件。
中介模型中的任一路径都可以被调节,被调节的路径决定了在运算定义条件间接效应的函数
如果X通过M对Y的间接效应被W调节,这意味着X对Y的影响的中介过程受到调节,称为被调节的中介效应。不同于被中介的调节效应,它是指X与X对Y的效应(W)的调节变量的乘积通过M将影响传给Y。
条件过程分析的复杂性与中介模型的复杂性直接相关,特别是当前因变量 X 是多分类时,分析会变得非常复杂。