花卷铺

花卷铺

Quantitative Psychology|2026-09-30 科研日报

3
2026-09-30

1. 捕捉时间的节律:将动态时间规整引入行为研究

原始标题: Capturing the rhythm of time: introducing Dynamic Time Warping in behavioral research

作者: Juul Vossen、Evy Kuijpers、Joeri Hofmans。原始来源: Frontiers in Organizational Psychology。

研究问题与理论背景

固定滞后模型把“相隔一次测量”当作稳定的过程时间,但心理反应可能随个体、情境和同一个人的不同事件而改变。作者以尽责行为与资源耗竭为例:努力工作可能随后消耗资源,耗竭也可能反过来影响行为。预设假设是,两者同时存在即时与延迟关联,允许灵活对齐将改善模型表现;不同个体的即时、延迟关联比例也不同。跨日对齐和双向匹配属于探索性扩展,不应与原先的单向假设混同。

动态时间规整(DTW)假定两条轨迹存在可比较的形状,通过伸缩时间轴找出对应位置。它不是新的因果识别方法,也不是独立统计模型,而是统计建模前的时间对齐程序。

研究设计与方法

模拟研究从抬升至非负范围的正弦波构造周期性激活,移动激活前后的零值,使两序列交替出现领先与滞后关系;随机截取不同起点的片段,设定100名模拟个体、每人100个时间点。另生成缺失概率依赖先前观测值的随机缺失(MAR)版本。这里是特定生成机制的演示,并非覆盖多种真值与重复次数的全面蒙特卡洛性能评估。

实证部分再分析比利时两组员工的经验采样资料:原始样本分别为157人、1,699次观测和96人、2,151次观测。第一组连续五个工作日每日随机测量三次;第二组十个工作日每日固定三次。尽责性用 Mini-marker,耗竭分别用情绪衰竭分量表和四项目资源耗竭量表。表9、11的实际模型样本为141人和93人;基线/DTW分别含1,536和1,947条记录,简单滞后模型降至1,020和1,192条。并无随机干预或对照组。

统计分析与建模

算法先将两个变量做个体内标准化,构造所有可匹配观测之间的距离矩阵,以动态规划寻找累计距离最小的单调路径。窗口限定可匹配的最远时间点,方向约束限定领先或滞后,非对称步长保留一个序列的时间轴。模拟改变预测序列的对齐,实证则规整耗竭序列,以保留尽责性线性项、平方项和跨层交互的共同解释尺度。负向关联需依据理论调整方向,不能让算法把相反变化误当作待消除的距离。

模拟比较0—3阶滞后的 DSEM、不同窗口的 DTW 加混合模型,以及 DTW 后的 DSEM。DSEM 使用 Mplus 8.4 贝叶斯估计,至少2,000次迭代、非信息先验、稀疏抽样间隔5;比较 DIC 和解释方差。DTW 用 R 的 dtw 包,对齐后用 lme4。DSEM 的逐阶系数是控制其他相关滞后项后的条件效应,DTW 系数则汇总最优对齐位置的关联,不能逐项等同。

实证采用观测嵌套于个人的多层模型,包含随机截距、状态尽责性随机斜率、人格特质及其与状态线性/平方项的跨层交互。原文第15页式(2)列出的时间层方程为:

EE_{ti}=\beta_{0i}+\beta_{1i}EE_{t-1i}+\beta_{2i}C_{ti}+\beta_{3i}C_{ti}^{2}+\beta_{4i}C_{t-1i}+\beta_{5i}C_{t-1i}^{2}+e_{ij}. \tag{2}

其中 EE 为情绪衰竭,C 为个体均值中心化的尽责性,t、i 分别指测量时点和个体;误差项下标沿用原式。比较即时、简单滞后、日内与跨日 DTW 的 AIC、边际及条件解释方差。DSEM 在 MAR 下处理不完整观测;DTW 对齐时跳过缺失点,这本身不是缺失机制校正。对齐后的系数也不再代表原始钟表时间上固定间隔的效应。

研究结论

模拟并不支持“DTW 总优于 DSEM”:仅允许向前匹配时,三阶 DSEM 的解释方差约0.64,DTW约0.54。允许双向、三时点窗口后,DTW 达0.827,AIC为5,107.310(表4);这与生成数据本就含双向关系密切相关,不能外推为现实研究的预期提升。

实证样本二的边际/条件解释方差从基线0.444/0.662变为日内 DTW 的0.461/0.683;简单滞后为0.313/0.509,但观测数不同(表11)。同表日内 DTW 的状态线性项为−0.63,95% CI [−1.09, −0.18]、p=0.007,平方项为0.29,[0.08, 0.50]、p=0.006。第18页正文却把相关系数写成−0.57和−0.63,与表11的变量对应和符号不一致;上述数值明确依据表11。这些是观察性、经数据驱动对齐后的关联,未证明尽责行为造成耗竭。

讨论

发现的解释

作者讨论: 固定滞后可能把真实时间差异误表现为效应强弱差异;DTW 路径提供了考察个人过程节律的工具。总结者评议: 拟合改善部分来自直接利用两条序列选择对齐,不能独立验证心理机制;不显著变显著也不等于原模型遗漏了已被证实的因果效应。

局限

作者讨论: 过度伸缩会产生病态匹配,日内仅三次观测也限制时间分辨率;建议理论约束和保留时间依赖的置换检验。总结者评议: 这些置换评估属于未来建议,而非已完成的外部验证。简单滞后与 DTW 的观测集合不同,不能仅凭 AIC 大小判断优劣;预处理的不确定性也未自动纳入后续区间。模拟文字描述为100×100,表4却列10,100条观测,属于报告不一致,不能据此补定真实生成规模。

研究贡献

作者讨论: 提供可与回归、多层模型和 DSEM 衔接的时间对齐流程及交互式示例。总结者评议: 理论贡献是将“何时发生”从固定技术设定变成研究问题,方法贡献是展示可约束的个体内对齐;实践上适合作为探索与敏感性分析,尚不能替代预测验证、缺失机制分析或因果设计。

证据定位

  • 期刊论文:第3—5页、表1与图2说明算法;第9—11页说明假设、模拟及估计;表2—8给出模拟比较。
  • 第14—18页说明两组 ESM 设计、式(2)与匹配约束;表9和表11分别给出实际分析样本、系数及拟合。第18页与表11的系数对应存在上述差异。
  • 第24—25页讨论病态规整、时序依赖置换与解释限制;招募的更细纳排标准转引原始研究,本文未完整列出。

2. Schmidt 等人(2009)开发的 TPACK 量表及其相关改编版本的信度:一项信度概化元分析(REGEMA)

原始标题: The reliability of the TPACK scale developed by Schmidt et al. (2009) and related adaptations: a Reliability Generalization Meta-Analysis (REGEMA)

作者: Ahsen Filiz、Cem Oktay Güzeller。原始来源: BMC Psychology,Article in Press。

研究问题与理论背景

TPACK 描述技术、教学法、学科内容知识及其交叉领域,但广泛使用一套问卷不意味着不同语言、版本与教师群体中的分数同样可靠。研究针对“直接借用量表开发时的信度”这一做法,询问总体 Cronbach α 的典型水平及跨研究变异有多大。它不是检验教师培训效果,也不把高内部一致性当作七个知识领域结构效度的充分证明。作者称纳入标准与方法决策先于资料收集确定;国家、样本及版本差异的解释主要是讨论与后续调节分析建议。

研究设计与方法

研究按 REGEMA 与 PRISMA 框架检索 Web of Science、Scopus,覆盖2010年1月至2025年12月,检索于2026年1月完成。604条初始记录来自两个数据库,最终质性综合69项独立研究;47项研究的48个信度估计进入定量综合。同一样本的前后测贡献两个相关系数,不是两项独立研究。

对象为教师、师范生或教学人员的英语同行评议实证研究。21项研究未给出本样本 α,另1项虽报告 α=0.71,却缺少计算抽样方差所需的项目数,均不进入合并。两名研究者独立编码并协商分歧。可合并样本量为28—1,530、项目数7—76;4个估计来自相关但不完全相同的 TPACK 工具,另一个7项目估计疑似分量表系数,作者保留并单独做排除分析。这里合并的是已发表统计量,没有新招募被试、随机分组或个人层面随访。

统计分析与建模

直接合并 α 的正态近似可能产生超过1的区间。主分析因此采用 Bonett 变换,并在变换尺度上建立“估计嵌套于研究”的多层随机效应元分析,以限制性最大似然(REML)估计参数。第7页给出的变换、抽样方差及逆变换为:

\theta=-\ln(1-\alpha),\qquad v=\frac{2m}{(m-1)(n-2)},\qquad \alpha=1-e^{-\theta}.

m 为项目数,n 为样本量。该模型将抽样误差和研究层异质性区分开,并处理同一样本前后测估计的非独立性。研究报告反变换的合并 α、95%置信区间和95%预测区间;后者反映新研究中真实信度的可能差异,不能用较窄的均值置信区间替代。

未变换 α 用相同多层结构重估作敏感性分析。单层 Q 与 I² 仅保留作描述性比较,不是主模型的异质性检验。另检查漏斗图、Baujat式影响图、残差及方差参数轮廓似然;排除非同型工具、疑似分量表及最有影响的低信度研究。未报告正式的多变量调节元回归,也未插补没有本样本信度的研究。模型纳入依赖效应不意味着同一人前后测信度估计的全部协方差信息都已充分报告。

研究结论

主合并 α=0.944,95% CI [0.933, 0.953],95%预测区间[0.812, 0.983];研究层方差在 Bonett 尺度上为0.376(第7—8页)。高平均内部一致性与明显异质性同时存在。未变换模型给出0.934、预测区间[0.845, 1.024],上限超出信度上界,说明不能不加区分地使用原始 α 正态区间。

去除4个相关但不同工具后为0.945,[0.934, 0.955];去除7项目疑似分量表后也为0.945,[0.934, 0.954]。最有影响的低值来自 Cao 等人:440人、23项目、α=0.708;去除此项后合并值0.946,[0.937, 0.955](第8—9页)。这些稳健性结果说明均值结论不依赖这些单项选择,并不证明所有版本可互换。

原始尺度 Egger 检验 p<0.001,变换后 p=0.058;作者强调原始尺度方差与 α 的机械联系及选择性报告问题。不能把后一个不显著结果解释为“没有发表偏倚”。

讨论

发现的解释

作者讨论: 量表版本、教师经验和学科背景可能改变项目协方差,信度必须在使用它的具体样本中重新估计。总结者评议: 总分 α 接近0.94,是本次研究集合的内部一致性基准,不是单维性、内容效度或跨文化可比性的证据,更不能直接赋给七个分量表。

局限

作者讨论: 英语期刊、两个数据库与检索词限制可能遗漏合格研究;分量表信度不足以单独综合,项目数差异使可交换性存疑。总结者评议: 高 α 也可能部分反映量表长度或重复内容;只有已报告 α 的研究进入合并,敏感性分析无法消除未报告带来的选择问题。原文“数据可用性”声明称未生成或分析数据,与文中明确描述的编码文件复核及元分析存在表述冲突,妨碍读者判断可复现材料范围。

研究贡献

作者讨论: 将信度本身作为元分析对象,提供总体及异质性的参考。总结者评议: 方法价值在于变换尺度、多层依赖处理和预测区间的结合;实践价值是促使研究同时报告本样本总分、分量表 α 及适宜的其他可靠性指标,而不是用一项漂亮的合并均值取代本地测量评价。

证据定位

  • 期刊在刊前论文:第4—6页、表1及图1为检索、纳排和69项/47项/48个估计的区别;第7页为 Bonett 公式和多层 REML。
  • 第7—9页、图2—5为合并估计、预测区间、敏感性分析与影响诊断;第9—11页为范围限制及解释。
  • 第11页的 Data availability 声明与上述分析描述有冲突;不同 TPACK 领域的可靠性不能由本研究总分结果替代。

3. 同甘共苦:医疗卫生人员感知同事支持量表

原始标题: Sharing weal and woe: the perceived coworker support scale for healthcare staff

作者: Zhongwan Chen、Mayangzong Bai、Yun Xian、Zhiruo Zhang、Sisi Li。原始来源: BMC Psychology,Article in Press。

研究问题与理论背景

同事支持研究常聚焦压力与困境,却较少测量同事分享成就、共同庆祝等积极事件中的支持。作者提出医疗人员感知同事支持量表 PCS-HS,涵盖一般情境、负面事件、正面事件,预期其具有可靠性和效度,并与较少倦怠、较多工作满意度、心理安全及情感承诺相关。核心问题不只是“能否分成三组题目”,而是三类支持能否在一个强一般因子之外提供可靠、可区分的信息。

研究设计与方法

文献整理得到54个候选项目,并结合16名医疗人员的半结构访谈识别支持经验;最终18项目中,8项来自既有内容的情境调整,10项针对原先不足的内容新编。每项七点计分,覆盖三种场景中的信息、评价、情感、发展性支持及支持可得性。

2023年在中国东部三家公立医院开展横断面 Qualtrics 问卷,邀请各类医院人员。878人完成,252人未通过注意检查被排除,分析样本626人,平均年龄36.68岁,女性79.1%。另将18题全部同选一项的174人剔除,形成452人的敏感性样本;一致作答可能是真实感受,不能一概认定造假。比较工具包括八项目组织支持量表 SPOS、职业倦怠、工作满意度、情感承诺和心理安全量表。无干预与随访。含人口和职业协变量的回归使用607人;补充表S1说明除医院等级外相关协变量有19例缺失。

统计分析与建模

先做项目—总分相关、主轴因子分析和500次平行分析,再用 CFA 比较单因子、相关三因子、二阶因子及双因素模型。双因素模型让每题同时负载于一个一般因子及其情境特异因子,所有因子正交。选择不能只看 CFI、RMSEA 或 AIC/BIC,还需检查一般因子解释共同方差比例 ECV、未受维度污染的相关比例 PUC,以及层级 omega。

关键区别是:分量表的普通 α 或 omega 包含与总体支持共有的变异,而分量表层级 omega 反映控制一般因子后的独有可靠信息。AVE 与潜在维度相关比较用来评价区分效度。EFA、CFA 均基于626人,未报告独立留出验证样本;文中分析方案未明确 CFA 的具体估计器,不能自行写成 MLR 或 WLSMV。

增量效度以分层多元线性回归检验:先纳入性别、年龄、教育、收入及工龄、职业、职称、合同、轮班、医院等级和 SPOS,再考察 PCS-HS 总分或分维度带来的解释方差增量;类别变量虚拟编码,维度分数均值中心化,并检查 VIF。它是个体层回归,不能将“分层加入变量”误称为估计医院随机效应的多层模型。未报告医院聚类修正或缺失值插补;共同方法偏差仅用 Harman 检验,不能据此排除同源偏差。

研究结论

双因素模型拟合为 CFI=0.977、TLI=0.970、RMSEA=0.068、SRMR=0.017(表1)。一般因子层级 omega=0.972、ECV=0.941、PUC=0.706,三个特异因子的层级 omega 均低于0.10(第7页)。因此,内容覆盖三类场景,不等于支持三个可独立解释的可靠分量表;作者优先推荐总分。总量表 α=0.983,普通分量表 α 也很高,但不能推翻特异可靠信息很少这一结果。

三个维度相关均超过0.904,并高于对应 AVE 平方根,区分效度不足。总分与 SPOS 的相关为0.818。总分加入回归后,对工作满意度的额外解释方差仅0.002、p=0.184,不能称各项结局均获得显著增益。分维度同时进入时 VIF 可超过10,其回归系数只适合探索性解释(第9页、表4—7)。452人敏感性样本仍有一般因子层级 omega=0.955、ECV=0.912、PUC=0.705(补充附录6),总分优先的判断没有改变。

讨论

发现的解释

作者讨论: 积极事件中的支持补足了传统逆境支持视角,可能关联个人成长与组织承诺。总结者评议: 研究最清楚的心理测量结果其实是“一般支持占主导”;把积极与消极场景的回归差异解释为独立机制,需要先解决维度可区分性与共线性问题。

局限

作者讨论: 便利抽样和中国医疗场景限制推广,场景特异维度的独有解释力很小。总结者评议: 横断面自报无法确立支持降低倦怠的因果方向;同一样本探索和确认结构可能乐观。原文称所有模型拟合可接受,但表1单因子 RMSEA=0.100、卡方/自由度=7.213,超过其自定0.08及5的门槛。Harman 解释率在方法写“低于40%”,结果写“40%”,亦不宜据此作确定的偏差排除结论。

研究贡献

作者讨论: 提供兼顾“共苦”与“同甘”的医疗同事支持测量。总结者评议: 理论上扩展内容范围,方法上示范用双因素指标区别高总信度与低特异信度;实践上可用总分描述整体支持,但不能据现有回归宣称某类支持干预优于另一类。

证据定位

  • 期刊在刊前论文:第3—6页为项目开发、抽样、量表及分析;第7—10页、表1—3为结构与可靠性。
  • 第9页及表4—7为607人的增量/效标回归和共线性;第15—16页说明总分优先与推广边界。
  • 同文补充材料的表S1说明19例协变量缺失;Supplementary Material 1 的附录6及表S7—S9为452人敏感性分析;这些关联不构成干预效果。

4. 斯洛伐克语版九项目乌得勒支工作投入量表(UWES-9)的心理测量学评价

原始标题: Psychometric Evaluation of the Slovak Version of the 9-Item Utrecht Work Engagement Scale (UWES-9)

作者: Ester Nosáľová、Simona Dudová。原始来源: Studia Psychologica, 68(3), 256–279。

研究问题与理论背景

工作投入通常分为活力、奉献和专注,但三者高度相关,九项目 UWES 究竟应按一个总体维度还是三个相关维度解释,仍需在具体语言与人群中检验。研究主要评价斯洛伐克语 UWES-9 的因子结构、可靠性、聚合与区分效度及群体可比性;次要目标是考察每个维度仅留一题的 UWES-3 能否用于简短调查。作者预期与倦怠负相关、与自评工作表现及另一投入量表正相关;第二项研究的模型细化依据第一项研究,而不是完全未经探索的重复验证。

研究设计与方法

研究一于2024年10月通过调查机构招募532名就业者,平均46.2岁,女性63.7%。2025年1月和5月分别回访416人、353人;完成三波的353人进入重测相关分析。译本由四位独立译者按回译程序处理。UWES-9 七点计分,三个维度各三题;另测12题 BAT 倦怠工具和0—100的单题自评工作表现。

研究二于2025年6月经同一调查机构招募,排除145名注意检查不合格者后有985人,平均42.0岁,女性48.5%;体力、非体力及管理职业分别285、439、261人。新增九题 ISA 工作投入量表。两项研究均无随机干预;匿名招募不能排除人员跨研究重复,作者没有证明两样本完全独立。正文未明确一般项目缺失值处理程序;重测分析采用三波完整参加者,不能视为已处理全部失访偏倚。

统计分析与建模

CFA 使用 lavaan 的稳健最大似然估计(MLR),潜变量标准化。比较单因子与相关三因子,综合稳健卡方、CFI/TLI、RMSEA及90%区间、SRMR、AIC/BIC,并检查局部残差及修改指数。研究一尝试双因素模型,但第7题标准化负载超过9且残差方差为负,出现 Heywood 问题,未继续解释。研究二只增加第1—2题和第8—9题两组残差相关,不额外加入交叉负载。

多组 CFA 依次检验形态、载荷和截距不变性,依据 CFI、RMSEA变化判定;两研究检验性别,研究二增加职业组。这里是多组测量模型,不是职业层级随机效应模型。区分效度另比较把两潜因子相关固定为1后的模型,采用稳健差异检验及信息准则;约束模型出现非正定协方差矩阵,因此不能只凭其失败断言维度在实质上区分清楚。

可靠性同时报告 α、总 omega、平均方差提取 AVE、构念可复制性 H、项目间及校正项目—总分相关。重测用 Pearson 相关而非纵向潜变量模型,不能替代纵向测量不变性或绝对一致性检验。UWES-3 未作独立 CFA;与其他工具的效度证据也是 Pearson 相关,未调整工作环境或人格协变量。

研究结论

研究一三因子 CFI=0.98、TLI=0.97、RMSEA=0.08,90% CI [0.06, 0.10];单因子 RMSEA=0.11。研究二加入残差相关后三因子 CFI/TLI均0.99、RMSEA=0.05,[0.04, 0.07],AIC=25,231.48;单因子 AIC=25,260.28(表1、9)。第268页正文称单因子略优,却与表9及后文结论相反;此处明确按表中指标描述,不将两种说法合并。

UWES-9 在两研究的 α 为0.95、0.94,omega为0.95、0.93;UWES-3 两系数分别均为0.86和0.84(表6、15)。九题总分重测相关为0.77—0.82,反映较高排序稳定性,并非没有变化。性别和研究二职业组均支持至截距层面的不变性(表4、12、13),不意味着群体均值相同。

研究二九题总分与 ISA-9 相关0.72,与情感投入0.80、社会投入0.39;超短版对应0.70、0.76、0.38(表16)。但潜在三维相关高达0.94—0.97(表11),需要避免将其当作互相独立的能力画像。

讨论

发现的解释

作者讨论: 三因素虽密切相关,仍较符合理论;超短版适合问卷负担受限场景,全面评价优先九题版。总结者评议: 良好内部一致性、重测与群体不变性提供不同层面的支持,不能相互替代。高重测相关既可能来自稳定个人特征,也可能来自稳定工作环境,现有设计无法区分。

局限

作者讨论: 自报与单题表现指标有同源偏差,双因素异常解限制一般因子解释,第二样本残差相关及潜在样本重叠需谨慎。总结者评议: 除表9的表文冲突,表10第7题三因子负载0.84的95%区间印为[0.91, 0.86],顺序及点估计包含关系均异常,不能自行改成“正确区间”。表16专注与 ISA-9 相关为0.58,而相邻正文写0.69,进一步要求对具体分维度结论保持审慎。

研究贡献

作者讨论: 为斯洛伐克语环境提供结构、稳定性和跨群体可比性证据。总结者评议: 方法贡献是将总体和局部拟合、不变性与多种可靠性指标并列;实践上支持合适场景的短测量,但尚未建立临床截点、个体决策精度或短版对完整构念的等效性。

证据定位

  • 正式期刊论文:第259—262页为研究一程序、估计及表1;第264—266页、表4—8为不变性、信度与重测。
  • 第267—272页、表9—16为研究二;表9、第268页正文,表10第7题区间,以及表16和相邻文字存在上述差异。
  • 第274—276页为解释与局限;研究一、二在线补充材料分别呈现更详细负载、残差、修改指数及项目统计。

5. 中国版数学成就情绪问卷的纵向验证:一项使用探索性结构方程模型的为期一年研究

原始标题: Longitudinal validation of the Chinese Achievement Emotions Questionnaire-Mathematics: A one-year study using exploratory structural equation modeling

作者: Xia Zheng、Jian Chen、Qian-Lan Fu、Hang Wang、Yan Zhou、Xiao-Ling Liao、Ning Chen、I-Hua Chen、Olga Malas。原始来源: BMC Psychology,Article in Press。

研究问题与理论背景

控制—价值理论认为,成就情绪与学习者对活动及结果的控制感、价值判断有关;相同效价、唤醒水平或关注对象的情绪可能共享变异。中国版数学成就情绪问卷 CAEQ-M 源于台湾学生的开放式情绪描述,并非直接翻译国外问卷,测量愉悦、愤怒、焦虑和无聊。研究询问:这一四因素结构是否适用于更小年龄儿童?零交叉载荷的 CFA 是否夸大情绪间相关?同时包含全部题目与情绪的测量结构能否跨时间保持稳定?

愤怒与无聊同属负面活动情绪,理论上可能最难区分;儿童是否在一年内逐渐将其区分,是待探索的发展问题。性别不变性为补充分析。作者没有通过操纵控制感或价值检验情绪产生的因果机制。

研究设计与方法

便利整群抽样覆盖中国西南地区两所公立小学八个班,初招424人;排除转学及任何测量时点自报不健康者后,分析377人,初始平均年龄8.34岁,男生185人、女生192人。四位数学教师各教两个班,并通过协调会议保持教学内容与评价活动相近。

四次施测为2020年10月、2021年1月、5月和10月,追踪三年级至四年级。23题采用六点评分:愉悦、焦虑和无聊各6题,愤怒5题,由教师监督填写纸笔问卷。研究收集年龄、性别与健康状况,未收集个体社会经济地位和标准化数学成绩。没有随机干预;正文没有详述保留样本中的题目缺失及插补流程,不能把排除47人等同于完整缺失机制分析。

统计分析与建模

每波比较相关四因素 CFA 与目标旋转 ESEM-T。前者将非目标载荷固定为零,后者只在旋转时使之趋近零、仍自由估计,因而允许题目共享情绪内容。旋转本身不改善同一 ESEM 解的整体拟合;与 CFA 的差别来自约束结构,而非“目标旋转更能拟合”。还尝试同一学习情境项目间残差相关,但未保留。

负面情绪题有显著地板效应,故主分析使用基于多分相关的 WLSMV;MLR 作为敏感性估计,不把两种估计器的拟合指标直接排成优劣。比较 CFI、NNFI、RMSEA及90%区间、SRMR,同时考察载荷和因子相关。

纵向不变性实际建立在相关四因素 CFA,而不是纵向 ESEM上:四波同一题的误差允许相关,按有序题识别方案依次约束阈值、载荷及潜在反应截距;以 CFI下降不超过0.01、RMSEA增加不超过0.015等变化标准判断。作者因16个潜因子及大量交叉载荷的收敛负担,未拟合完整纵向 ESEM。性别多组分析在每波分别进行,不能将其写成四波 ESEM 跨性别模型。

班级依赖亦不可忽略:题目 ICC 均值0.074、平均班额47.1,对应设计效应4.4。作者计算扣除班级随机效应的相关,并尝试聚类稳健标准误,但仅八个聚类导致校正不稳定,正文模型仍为单层。随后对量表总分做重复测量 ANOVA,配合 Bonferroni 比较;这不是潜在增长模型。表5报告 Greenhouse–Geisser 系数0.90—0.94,沿用未校正自由度;一般聚类问题仍未因此解决。

研究结论

四波 ESEM-T 的 SRMR 为0.020—0.028,低于 CFA 的0.036—0.052。愤怒—无聊潜相关由 CFA 的0.95、0.90、0.94、0.88,降为 ESEM-T 的0.78、0.73、0.80、0.80(表1—2)。允许交叉载荷后两者不再近乎重合,但仍是最相关的一对,也未呈现逐年分化的趋势。

纵向阈值、载荷、截距约束的拟合变化均小于0.001;性别不变性也满足作者标准(表4)。这支持特定模型下的分数比较,不意味着男女均值相同。

无聊均分从8.03升至8.87,时间检验为 F(3,1128)=3.59、p=0.013、偏η²=0.009,差异主要在第四波(表5)。效应很小,不能把课程变难视为已证实原因;其余情绪未显著变化也不是等效性证据。愉悦的 ANOVA 在正文写 F=2.07、p=0.103,表5则为2.11、0.097;二者均未达到0.05,但具体估计并不一致。

讨论

发现的解释

作者讨论: 交叉载荷符合情绪分类中共享属性的预期,愤怒项目的“厌恶”措辞可能与无聊混淆。总结者评议: 措辞解释为事后假设,需儿童认知访谈和改题验证;相关下降不能独自证明 ESEM 还原了唯一真实情绪结构。

局限

作者讨论: 学校与班级少、自报偏差、情绪种类有限及一年时程限制推广。总结者评议: 单层标准误与拟合可能乐观;单波 ESEM 更优却用 CFA 建立不变性,使“交叉载荷跨年稳定”仍未得到直接检验。表3第四波 ANGER4 目标载荷为0.97,而正文概括上限0.95,亦存在表文差异。健康筛选可能限制对情绪困扰儿童的适用性。

研究贡献

作者讨论: 将同时测量四类情绪的纵向验证推进到低龄中国小学生。总结者评议: 方法价值在于具体展示零交叉载荷约束如何影响构念区分;实践上可用于群体情绪监测,但尚不能作为临床筛查、课程干预因果效果或愤怒题目无需修订的依据。

证据定位

  • 期刊在刊前论文:第5—7页为样本、四波程序、聚类依赖、估计器及不变性规格。
  • 第8—12页、表1—5为相关、拟合、载荷、不变性及均值比较;第12页与表5的愉悦检验、表3与第10页的载荷范围存在上述差异。
  • 第13—17页讨论词语解释、测量结构、班级聚类与发展边界;未测控制感及价值,不能区分无聊上升的竞争机制。

6. 互联网信息超载量表:中国成人样本中的开发与初步验证

原始标题: The internet information overload scale: development and initial validation in Chinese adults

作者: Zhongyao Xie、Shiyou Fu、Zhengjia Ren。原始来源: Scientific Reports,Article in Press。

研究问题与理论背景

信息超载不是接触的信息多,而是信息数量、复杂性或流速超出个人主观处理能力。既有量表多针对癌症、药物或疫情信息,难以全面描述日常互联网中的情绪、评价和行为反应。作者以认知负荷理论及压力交互理论组织内容,开发互联网信息超载量表 IIOS;并未直接测量工作记忆容量或操纵信息负荷。

研究预期量表与疫情恐惧、焦虑和抑郁症状正相关,尤其是情绪维度;与一般阴谋信念的关系属于探索性问题。这些外部变量用于检验法则网络效度,不是诊断金标准,也不是量表组成部分。

研究设计与方法

量表开发分为访谈、专家评审、探索及独立确认四阶段。18名经目的性与理论抽样招募的受访者须经常体验信息超载,每人访谈约30分钟;两名研究者编码,经讨论及裁决形成内容。四人专家组定性审查相关性、措辞及冗余,形成31题,未计算内容效度指数或评审者 kappa,访谈对象详细人口资料也未保留。

探索样本于2024年3月7日至4月17日通过问卷星招募,554份提交中剔除43份,保留511名18—64岁成人,平均30.20岁。确认样本于同年12月14—18日独立招募,1,023份中保留935份,18—67岁、平均25.89岁。两阶段均要求成年、使用互联网、能够完成中文问卷并知情同意;无招募配额,排除过短作答、全部同选及随机反应。

最终13题回顾过去一个月,七点评分;情绪超载4题,批判性评价、信息分享及回避反应各3题。确认样本另完成七题疫情恐惧、PHQ-2、GAD-2及单题一般阴谋信念。两个横断面样本不是同一队列的前后测,研究没有干预、重测或长期随访。

统计分析与建模

项目分析以总分上下27%分组比较,并考察校正项目—总分相关;删除一项低于0.40者。EFA 用主轴因子法及 Promax 斜交旋转,依据特征值至少1、主载荷至少0.40、交叉载荷及概念一致性迭代删题,每因子至少3题。未报告平行分析;选题既有统计判据也有内容判断,不能说四因素完全由无主观决策的算法决定。

独立确认样本的七级题目偏度和峰度较温和,主分析以连续近似的 ML 建立相关四因素 CFA。无修改指数驱动的残差相关或交叉载荷添加。另用 WLSMV 将所有题作为有序指标重估,比较标准化载荷、相关及整组拟合指标,而非只选择一个较好看的指标。将信息分享与回避题合并的三因素模型用于检验两类行为能否合为一个维度。

可靠性报告 α 与分半信度;聚合效度用组合信度与 AVE,区分效度用 AVE平方根对潜相关及 HTMT。性别不变性用 ML 多组 CFA,依次约束载荷和截距,以 CFI、RMSEA、SRMR变化判断;这不等于检验了 WLSMV 有序阈值不变性。外部效度为未经协变量调整的 Pearson 相关,没有时间结构、随机效应或因果中介模型。题目缺失及插补细节未披露;作者未报告相关的置信区间或多重检验校正。

研究结论

ML 四因素模型为 χ²(59)=302.79、CFI=0.973、TLI=0.965、RMSEA=0.067,90% CI [0.059,0.074]、SRMR=0.036。WLSMV 的 CFI/TLI接近,为0.975/0.967,SRMR更低为0.025,但 RMSEA升至0.103,[0.096,0.110];载荷与因子相关的最大绝对差分别0.064、0.071(第8页)。不能称两种估计器的所有指标均一致,亦不能凭 RMSEA一项断言其一更接近真模型。

合并两种行为的三因素模型明显较差:CFI=0.866、RMSEA=0.146,AIC=1,375.61,对比四因素392.79(第9页)。确认样本分量表 α=0.83—0.93;批判性评价与回避潜相关0.76,HTMT=0.75,仍须关注其内容边界。标量不变性步骤的 ΔCFI=−0.008、ΔRMSEA=0.005、ΔSRMR=0.003,符合作者预定准则。

总分与疫情恐惧、焦虑、抑郁和阴谋信念相关分别0.64、0.56、0.54、0.32;批判性评价与阴谋信念仅0.05且不显著(表5)。这些是同期关联,不能写成信息超载导致心理疾病,也不能说批判性评价对阴谋信念具有保护作用。

讨论

发现的解释

作者讨论: 情绪、评价、分享及回避是相关但不相同的主观反应,分享与回避可以并存。总结者评议: 谨慎评价信息可能是适应性素养,并不天然等于功能损害;总分较高只能表示四类反应整体赞同度较高,不能直接解释为病理严重程度。

局限

作者讨论: 横断面自报、在线中国样本、短外部测量及缺少重测限制效度;不同估计器 RMSEA差异仍需关注。总结者评议: 独立 EFA/CFA 是优点,但特征值阈值与逐项删除可能使结构依赖样本;研究未比较一般因子或双因素模型,总分 α较高也不证明单维性。没有年龄、文化及时间不变性,不能把性别结果推广到所有群体。

研究贡献

作者讨论: 提供一般互联网情境中的简短、多维研究工具。总结者评议: 理论上区分信息暴露与主观反应,方法上展示独立样本验证和有序敏感性分析的必要性;实践可用于数字素养与心理症状研究,但诊断截点、预测效度、变化敏感性及干预决策价值仍未建立。

证据定位

  • 期刊在刊前论文:第3—6页、表1为访谈、专家评审、两样本招募、分析及量表;第7—9页、表2—3和图1为删题、CFA与可靠性。
  • 第8页及补充表S2所对应的正文比较为 ML/WLSMV参数与拟合差异;第9—10页、表4—5为区分效度、性别不变性及外部相关。
  • 第11—12页解释反应模式与局限;本文未提供重测、预测效度或诊断阈值。

7. 超越一般线性模型:对人类连接组计划的功能磁共振成像数据进行线性混合效应建模

原始标题: Beyond the General Linear Model: Linear Mixed-Effects Modeling of fMRI Data from the Human Connectome Project

作者: Daniele Orzechowski、Ronaldo Martins da Costa。原始来源: Neuroinformatics。

研究问题与理论背景

任务 fMRI 通常先对每次扫描运行建立模型,再平均同一人的运行结果作群体推断。平均会丢失运行层变异和协变量;但“混合模型更保守”究竟来自层级方差建模,还是额外加入运行效应,不能仅比较两个最终显著性图回答。

作者的首要贡献是可复现的逐体素线性混合效应工具,而非提出新估计理论。研究预期传统 GLM 检出更多体素、LME揭示明显个体内变异、两方法均有较高稳定性而 LME成本更大。通过加入一个不含运行固定效应的中间 LME,进一步分离两种可能来源。

研究设计与方法

实证再分析 HCP S1200 中143名无亲缘关系、22—35岁的健康成人,比较恐惧面孔与形状匹配。每人两次运行分别采用 LR、RL相位编码,原有286次;若超过20%的帧有大于0.5毫米的帧间位移,则剔除该运行。三次运行被排除,保留142人、283次,其中一人仅一次运行。任务每次包含三个面孔及三个形状区块,无治疗或随机临床对照。

采用 HCP 最小预处理和 ICA-FIX,所有群体分析前统一进行5毫米平滑。群体掩膜由未平滑图计算并与标准脑掩膜相交,最终215,265个体素;三个模型使用相同掩膜,避免多重检验分母不一致。另分析 Harvard–Oxford 图谱的21个感兴趣区。

计算验证包括五类方差情境、每情境100次参数恢复模拟,1,000个零效应数据集、随机截距与随机斜率比较、不同运行数下 ICC精度,以及与 R 的 lme4 对照。模拟性能不能解释为真实脑区效应。

统计分析与建模

一级 GLM 包括任务条件、12个头动及导数回归量、128秒高通和 AR(1)噪声,产生每次运行的面孔相对形状对比图。二级 GLM 将个人保留运行平均后进行单样本 t 检验。完整 LME保留全部运行,按第3页式(1)建模:

\beta_{ij}=\gamma_0+\gamma_1\cdot\text{run}_{ij}+u_{0i}+\epsilon_{ij}. \tag{1}

其中 u_{0i}\sim N(0,\tau^2) 为个人随机截距,\epsilon_{ij}\sim N(0,\sigma^2) 为残差,\text{ICC}=\tau^2/(\tau^2+\sigma^2) 表示个体间方差比例。两次运行不足以稳定支持复杂随机斜率结构;文中196次比较中随机截距模型有95.4%获 AIC支持,但这是本研究条件下的结果,不是所有重复测量均应舍弃随机斜率。

逐体素模型用 statsmodels 0.14.6、REML与 Powell优化,固定效应采用 Wald z 检验;ROI模型比较五种优化算法并保留最大对数似然。中间 LME删去运行固定项而保留个人随机截距。头动敏感性分析按第5页式(2)加入每次运行的平均位移:

\beta_{ij}=\gamma_0+\gamma_1\cdot\text{run}_{ij}+\gamma_2\cdot\text{FD}_{ij}+u_{0i}+\epsilon_{ij}. \tag{2}

主要推断在共同体素集合内分别作 Benjamini–Hochberg FDR,阈值 q<0.05;ROI则在21项检验中校正。ICC区间和群体效应稳定性使用保留被试内结构的 bootstrap,另做100次随机分半及留一被试分析。单次运行被试保留以贡献固定效应,不填造第二次观测。LME截距的含义取决于运行编码与中心化,正文未充分说明这一点,不能默认完整 LME截距与跨运行平均检验具有完全相同的目标参数。

研究结论

GLM、完整 LME及中间 LME在 FDR下分别检出108,627、74,004和109,273个体素。完整 LME与 GLM 的 z图相关0.9425、Dice重叠0.769;中间 LME则为0.9942、0.993(第6—8页、图1)。因此,本案例的差异主要与运行项有关,不能笼统归结为混合模型“天然损失检验力”。显著体素变少本身也未证明假阳性更少。

全脑平均 ICC=0.199、中位数0.150,全部体素收敛;左杏仁核 ICC=0.412,95% bootstrap CI [0.218,0.570],额极近零、区间[0,0.178](表6)。低 ICC既可包含真实运行变动,也可包含测量噪声。13个 ROI的运行效应在头动调整后仍显著,但所有人 LR均先于 RL,不能排除练习、疲劳或适应。

零效应模拟的 I类错误率为 GLM 0.045,[0.034,0.060],LME 0.052,[0.040,0.068];未显示传统方法必然严重膨胀。两次运行 ICC的模拟标准差0.081,十次降至0.026。合成基准中每体素约1.99与37.20毫秒,实测完整 LME在12核机器、8个工作进程上耗时5小时41分,不能把合成外推耗时当作实际全脑运行时间。

讨论

发现的解释

作者讨论: 运行协变量吸收系统差异,LME适合需要个体内方差、运行调整和可靠性图的研究。总结者评议: 中间模型的比较思路可推广到心理纵向研究,但须先对齐估计目标、样本与检验阈值,不能仅凭同名“截距”比较方法优劣。

局限

作者讨论: 单任务、健康成人、两次运行、单变量逐体素分析及生理噪声处理限制外推;运行与顺序混杂。总结者评议: 参数接近不代表推断完全相同。第3页称右海马在0.05两侧,却同时列 p=0.056与0.058,均在阈值以上,与“分处阈值两侧”的说法不一致,不能据此报告一个已经确认的显著性分歧。方法写 bootstrap 1,000次,表6及图4写2,000次;正文 ROI最高 ICC写0.412,表6内侧额叶却为0.432。这些报告差异应区别于算法收敛。

研究贡献

作者讨论: 提供显式声明计算后端、版本化输出和环境清单的容器化管线。总结者评议: 方法贡献是将层级结构、运行协变量和实现差异拆开诊断;实践上提供全脑计算成本与可靠性边界,未证明该工具在其他任务、临床群体或更复杂随机结构下同样表现。

证据定位

  • 期刊论文:第2—5页、式(1)—(2)及表1—4为样本、模型、模拟与实现比较;出版页的对应公式给出随机项和 ICC定义。
  • 第6—10页、表6、图1—5为检出范围、ICC区间、稳定性与成本;第3页推断说明、表3及第5页与图4的 bootstrap次数存在上述不一致。
  • 第11—12页讨论运行顺序混杂、有限推广及代码;研究代码为配套实现,不能替代对模型假设的判断。

文献清单