Quantitative Psychology|2026-09-24 科研日报
1. BriDGE 弥合鸿沟:将有向无环图与广义加性模型整合进实验以改进行为研究
原始标题:BriDGE the gap: Improving behavioral research by integrating DAGs and GAMs into experiments
作者与出处:Giuseppe Alessandro Veltri、Sanchayan Banerjee;Behavior Research Methods,2026。
原始来源:https://doi.org/10.3758/s13428-026-03146-2
研究问题与理论背景
随机分配能够识别干预的总体效果,却不会自动解释效果经过哪些心理机制产生。尤其当中介与结局的关系存在曲率、中介间协同或治疗与中介交互时,线性回归的系数乘积可能把不同过程归到同一条路径。BriDGE 将理论因果图、受约束的因果发现、广义加性模型(GAM)和干预型中介效应组织成流程,关注“为何有效”,而不只是“是否有效”。
这是一项方法与计算研究。预设因果图和模拟生成机制构成比较基准;算法发现的不同边则属于待检验的探索性假说,不能反过来被当作已证实的心理理论。本文也没有检验某项真实行为干预的临床效果。
研究设计与方法
基准模拟包含 1,000 个单位、二元随机处理、两个中介和连续结局。处理概率为 0.5,非线性强度设为 0.5,随机种子为 42;独立标准正态噪声进入中介与结局。中介分别包含正弦及指数噪声项,结局包含平方项和三种两两交互。原文第 6 页结局生成式(4)为:
另设三个中介的链式结构、五个中介且混有无效中介的结构,以及测量误差压力测试。半合成研究保留 JOBS II 随机试验的处理分配和基线协变量,但重新生成中介与结局。因此它保留真实协变量分布,却仍是已知机制下的算法基准,不是对 JOBS II 疗效的重新估计。主文未明确列出该半合成分析的最终人数。
统计分析与建模
流程先用 DAG 表达时间顺序和调整假设,再以 bnlearn 的 MMHC 结合条件独立检验与评分搜索发现结构。连续变量默认切为五个等频组,互信息检验水平为 0.05;禁止任何边指向随机处理,并将处理指向中介的边列为白名单。敏感性分析改变分箱数和检验水平,bootstrap 边稳定性用于区分可靠结构与不确定方向。总结者评议:随机化支持处理外生性,但并不保证处理一定影响每个候选中介;后一白名单仍包含额外机制假设。
中介对二元处理采用线性回归;结局采用高斯恒等链接 GAM,薄板样条估计各中介的非线性主效应,张量积平滑项表示中介间交互,按处理分组的平滑项表示效应修饰。平滑参数由 REML 估计,默认基维度示例为 10,并检查基维度和模型诊断。两两交互不等于三重交互,不能把模型解释成自动包含所有高阶作用。
Monte Carlo g-computation 对拟合中介分布积分,估计直接效应 IDE、联合间接效应 JIIE、各中介边际效应及总效应 TE。技术附录第 11 页式(8)把 JIIE 定义为固定处理在对照状态、同时改变全部中介分布的对比;IDE 则在中介保持对照分布时改变处理。存在处理—中介交互时,这两个特定对比不能简单相加为 TE;单个中介边际效应也不必加总为 JIIE。
论文报告以 2,000 次非参数 bootstrap 构建 95% BCa 区间。附录第 12 页说明加速量采用 50 组删除式 jackknife,为节省计算仅重新平均预测、并不重新拟合 GAM,因此是计算近似。模型仍依赖中介—结局无未测混杂、正值性、一致性及联合中介分布适当设定。研究讨论多重插补或逆概率加权可用于实际缺失数据,但不能将这些建议写成模拟中已经实施的缺失处理。
研究结论
半合成基准的交互 GAM 给出 IDE 为 2.346,95% BCa 区间为 [1.986, 2.671],对应真值 2.288;JIIE 为 3.079 [2.657, 3.484],真值 3.012;TE 为 6.313 [5.750, 6.731],真值 6.360(第 12 页表 4)。仅加性 GAM 的 IDE 为 2.653 [2.404, 2.915],区间不含该基准真值。关键发现是:总体效果可以相近,机制归属却对交互设定敏感。
结果报告有需要保留的疑点。表 1、5 的基准模拟 TE 为 7.026,而表 3 未调整组均值差为 5.8027;正文称二者相符,却没有充分解释这一差距。第 10 页正文将图差异描述为第二中介与结局的方向问题,表 2 却同时将两个中介之间的双向边标为发现结果,不能直接解释成一个合法 DAG。附录表 A2 只列 20、50 次 bootstrap 的敏感性结果,不能据此验证正文对大规模重复次数稳定性的全部主张。
讨论
发现的解释
作者讨论:忽略曲率与协同会把机制压缩成平均斜率,导致干预优化瞄准错误中介。总结者评议:交互模型在与其相容的生成机制下表现较好,支持灵活建模的价值,却不意味着发现阶段已经解决因果识别。表 4 的单次区间包含真值,也不能单独证明重复抽样覆盖率达到名义水平。
局限
作者讨论:中介测量误差、未测混杂、图的马尔可夫等价及高维计算成本仍是障碍;加性潜在混杂敏感性并未穷尽行为研究的威胁。总结者评议:上述表文不一致、白名单假设和 BCa 近似都影响复现与解释;真实纵向反馈、干扰和复杂缺失机制不能仅凭当前模拟获得保证。
研究贡献
作者讨论:BriDGE 提供开放 R 包 bridgeR、模拟规划和分析报告框架。总结者评议:理论贡献是把机制假设显式化,方法贡献是并列展示结构不确定性和函数形式敏感性,实践贡献是为实验设计提前规划中介测量;它不是把任意观察关系转化为因果机制的工具。
证据定位
- 期刊论文:第 4—8 页流程、生成式与模型;第 9—14 页表 1—5;第 15—16 页识别局限与图冲突处理。
- 技术附录:第 10—12 页中介模型、估计目标式(7)—(10)、BCa 近似及表 A2。
2. 东南欧家庭导向预防情境中低龄青少年 WHO-5 幸福感指数的结构效度与测量不变性
原始标题:Structural validity and measurement invariance of the WHO-5 Well-Being Index among young adolescents in a family-focused prevention context in Southeastern Europe
作者与出处:Antonio Piolanti 等;BMC Psychology,2026,Article in Press。
原始来源:https://doi.org/10.1186/s40359-026-05624-w
研究问题与理论背景
WHO-5 是衡量积极情绪、活力及生活兴趣的简短量表,但既有研究主要来自较年长青少年及高收入社会。即使各国量表都呈单因素结构,也不能直接比较均值:相同潜在幸福感水平的人,可能因语言或文化差异而选择不同反应类别。以往跨国研究也并非总能支持完整标量不变性。
本研究预设五题单因素结构,检验经过文化适配的马其顿语和罗马尼亚语版本,在家庭导向预防项目中的 10—14 岁青少年之间是否可比。跨国潜在均值比较建立在不变性检验之后;它不是对预防项目效果的假设检验。
研究设计与方法
研究二次分析 FLOURISH Phase 2 的干预前基线。653 名青少年中,北马其顿 331 人、摩尔多瓦 322 人,平均年龄 11.90 岁,标准差 1.29。纳入要求每周至少四晚与参与照护者共同居住,并能以当地研究语言完成问卷;可能妨碍参与的严重精神、认知、身体状况或急性困扰构成排除条件。
北马其顿主要通过学校招募,摩尔多瓦通过青少年友好健康服务招募,并主动接触较脆弱家庭;两者都不是全国概率样本。青少年在与照护者分开的保密环境中,以平板完成自陈量表,研究人员提供协助。WHO-5 五题回顾过去两周,每题 0—5 分。翻译适配包含正反向翻译、专家审阅、试测及出声思考访谈。此次只分析基线,没有干预对照效应或随访变化估计。
统计分析与建模
六级反应按有序类别处理,而不是直接假定为连续等距变量。研究先检查类别频数和多分相关,再以均值及方差调整的加权最小二乘法(WLSMV)估计总体及两国单因素 CFA。除缩放卡方外,同时评价 CFI、TLI、RMSEA、SRMR,避免将大样本下的精确拟合拒绝直接等同于严重失配;修正指数与预期参数变化用于检查可能遗漏的残差相关,内部一致性用 McDonald’s ω 估计。
多组有序 CFA 采用 theta 参数化和 Wu–Estabrook 识别,依次比较构型、阈值、阈值加载荷、再加题项截距相等的模型。这里的标量模型须结合有序指标的识别约束理解,不能照搬连续指标的简化步骤。嵌套比较使用 Satorra 缩放卡方差异检验,以 CFI 下降不超过 0.010、RMSEA 增加不超过 0.015 为主要判断标准,TLI、SRMR 变化作补充。
标量不变性成立后,将北马其顿潜在均值固定为 0、方差固定为 1,估计摩尔多瓦的潜在均值差。WHO-5 无缺失值,因而不需要插补。虽然母研究是整群试验,本文没有报告学校或服务点随机效应、聚类稳健修正或年龄性别协变量调整;这是对所用测量模型的描述,不等于不存在聚类影响。
研究结论
总体单因素模型 CFI 为 0.995、TLI 为 0.990、RMSEA 为 0.069,90% 区间 [0.040, 0.102],SRMR 为 0.019;标准化载荷为 0.698—0.811,ω 为 0.84(第 5—6 页表 2、3)。北马其顿的 RMSEA 为 0.085,超过预设 0.08 标准,虽其他指标良好,也不能概括为所有指标一致优良。
阈值、度量、标量模型的卡方差异检验分别为 0.146、0.476、0.105,CFI 改变量依次为 −0.001、0.001、−0.001;结合近似拟合变化,支持本样本的跨国不变性(表 4),而非证明参数绝对相同。
摩尔多瓦潜在幸福感比北马其顿低 0.346 个北马其顿潜变量标准差,估计为 −0.346,标准误 0.092,95% 区间 [−0.525, −0.166]。这是两个招募样本的模型化差异,不是国家情境导致幸福感下降的因果效应。
讨论
发现的解释
作者讨论:两国文化地理较接近及细致的语言适配,可能有助于获得以往多国研究未必支持的标量不变性。总结者评议:这是合理解释,但研究没有随机比较适配策略,也没有直接检验“文化距离”机制。
局限
作者讨论:便利样本与不同招募渠道限制全国外推,摩尔多瓦较低均值可能反映健康服务招募的选择性;尚未检验年龄、性别不变性及聚合、区分、效标效度和时间稳定性。总结者评议:模型只有五个自由度,RMSEA 区间较宽,需要结合其他指标而非单一阈值判断;内部一致性不能替代重测信度,横断面国家不变性也不能替代干预前后的纵向不变性。
研究贡献
作者讨论:研究为中等收入国家预防情境提供免费的、简短的青少年幸福感工具。总结者评议:理论上扩展了早期青少年幸福感结构的适用范围,方法上展示有序 CFA 的完整约束序列,实践上支持两种适配版本的谨慎比较;但尚不支持诊断临界值、个体临床分类或项目有效性的判断。
证据定位
- 已接收提前发布稿:第 3 页招募和测量;第 4 页估计、识别及不变性步骤;第 5—6 页表 1—4;第 7 页讨论与局限。
- 出版页面:版本为 Article in Press;正式编辑版本可能随后替换。
3. 使用 Rasch 分析在临床人群中开发并验证正念冥想练习质量量表(MMPQS)
原始标题:Development and Validation of the Mindfulness Meditation Practice Quality Scales (MMPQS) in a Clinical Population Using Rasch Analysis
作者与出处:Sarah Strohmaier、Bruno A. Cayoun、Alice G. Shires、Oleg N. Medvedev、Christian U. Krägeloh;Mindfulness,2026。
原始来源:https://doi.org/10.1007/s12671-026-02990-9
研究问题与理论背景
冥想研究常把练习时长当作投入,但相同时长未必代表相同的注意维持、觉察和不反应能力。MMPQS 区分专注练习与洞察练习:前者关注稳定注意和分心后重新聚焦,后者关注内感受觉察、平等心,以及无常与无我的理解。两者是独立使用的量表,不是一个总分的任意分半。
作者预期练习质量随训练提高,与相关构念有中等关联,并预测较低抑郁、焦虑、压力和较高生活满意度。逐步删题与建立题组则属于样本内的探索性量表精炼,不能与独立验证混为一谈。
研究设计与方法
研究来自两家心理诊所的正念整合认知行为治疗(MiCBT),纳入寻求治疗的成年人,排除精神病性或躁狂症状者。论文报告临床参与者共 368 人,平均年龄 42.34 岁,主要为澳大利亚白人,具有多种中重度诊断及共病。首次专注量表为 211 份、洞察量表为 157 份;作者又说明洞察参与者多数也完成专注量表,因此这两个数不能简单相加当作独立人数,跨量表去重后的样本流程不够清楚。
MiCBT 通常十周,先专注、后洞察,临床需要可延长。每个初始量表十题,七级反应,由有经验的研究者依据传统文献和教学经验制定。每人各量表两次测量,合并形成专注 414、洞察 313 条观测。正文称练习后立即作答,补充图 OR.2 又说明晨间练习到门诊通常间隔 2—6 小时,测量时点的描述存在差异。没有随机对照或标准化的个体练习剂量。
统计分析与建模
RUMM2030 的部分计分 Rasch 模型适用于有序多类别反应,允许各题有自己的类别阈值;目标是检验总分能否在单维测量假设下转换为区间尺度,而不只是提高内部一致性。作者同时检查题目—特质卡方、Bonferroni 调整后的项目检验、拟合残差及 Person Separation Index(PSI)。项目残差参考范围为 −2.50 至 2.50;残差相关超过总体平均残差相关 0.20 时考虑局部依赖。
单维性通过残差主成分正负载荷题组的人参数估计比较检验,显著比较比例不超过 5% 为支持标准。专注六题版最初仍有 8.77% 显著比较,将第 4、9 题及第 5、8 题分别组成 testlet 后降为 2.5%;实际作答仍为六题,题组结构进入原始总分到区间分的换算。
DIF 检验覆盖年龄、性别、既往练习经验和测量时间。两次观测堆叠到同一标尺,作者承认同一人的记录并非独立。总结者评议:没有时间 DIF 说明项目功能较稳定,却不能消除重复观测的统计依赖。方法部分说国籍、族裔等分组不适合检验,结果段却将它们列入无 DIF 因素,故不宜宣称所有人口群体均已验证公平性。
效度分析包括 Pearson 相关,以及分别以专注或洞察分预测治疗中期 DASS-21 和生活满意度的回归。表 8 没有呈现基线症状协变量、诊所随机效应或完整的回归分析人数;缺失数据处理也未充分说明。这里的“预测”不能解释成练习质量导致症状改善。
研究结论
最终两个量表均保留六题。专注最终题组模型的卡方为 28.86、32 个自由度,p 为 0.63,PSI 为 0.91;洞察为 29.05、30 个自由度,p 为 0.51,PSI 为 0.89(第 7、9 页表 2、4)。摘要的 PSI 0.89—0.94 包含不同迭代版本,不能全部归到最终六题解。洞察初始项目“均在残差范围内”的文字,也与表 5 第 8 题残差 2.58 不完全相符。
专注预测抑郁的非标准化系数为 −0.16,95% 区间 [−0.29, −0.03];洞察为 −0.24 [−0.35, −0.12]。专注预测生活满意度为 0.21 [−0.05, 0.47],未显著;洞察为 0.36 [0.11, 0.60](第 12 页表 8)。这不证明洞察的效果显著大于专注,因为两者在治疗中的先后位置不同,也没有直接比较系数。
讨论
发现的解释
作者讨论:量表分别捕捉专注与洞察的练习内容,质量提升及与症状的关联符合理论预期。总结者评议:题目保留兼顾统计失配与构念中心性,优于机械删除最大残差项;但自陈质量与自陈症状的关联可能含共同方法成分。
局限
作者讨论:样本文化同质、仅来自 MiCBT,练习频率与时长随临床情况变化;反复删题可能利用样本偶然性,需独立确认。总结者评议:专注先于洞察带来时间混杂;样本重叠、测量延迟和 DIF 报告差异需要澄清。表 7 与自我效能的相关达到 0.63、0.62,因此不能把所有外部相关都概括为低于 0.50 的区分效度证据。没有时间 DIF 也不意味着已建立稳定条件下的重测信度。
研究贡献
作者讨论:量表可帮助研究者、治疗师和练习者识别练习困难。总结者评议:理论上区分不同冥想过程的质量,方法上将局部依赖、DIF 与区间换算纳入量表开发,实践上提供短量表和换算表;其用途是过程测量,尚不能作为跨文化通用常模、疗效替代终点或治疗机制已被证实的依据。
证据定位
- 期刊论文:第 3—6 页样本、程序及 Rasch 方法;第 7—10 页删题与表 2—5;第 11—12 页换算、相关及回归表 6—8;第 13 页局限。
- 补充材料:图 OR.1 问卷顺序、图 OR.2 练习和测量时间。