花卷铺

花卷铺

Quantitative Psychology|2026-09-23 科研日报

3
2026-09-23

1. 自闭症儿童与青少年中自闭症影响量表(AIM)的纵向测量不变性

原始标题: Longitudinal Measurement Invariance of the Autism Impact Measure (AIM) in Children and Adolescents With Autism

作者: Nicole H. Zhong、Micah O. Mazurek。原始来源: Journal of Autism and Developmental Disorders。

研究问题与理论背景

AIM 是照护者报告的自闭症行为影响测量工具,常被用于追踪治疗期间的表现。纵向分数差异可能来自症状变化,也可能来自条目含义或测量尺度改变。本文检验的核心问题是:儿童与青少年在相隔约一年接受评定时,AIM 是否仍在以可比较的方式测量相同症状域?出版方摘要将测量不变性列为研究目的,但未交代预注册或预设判据的具体内容。

研究设计与方法

这是一项临床登记资料的纵向心理测量研究,而非随机干预试验。Autism Treatment Network Registry 的基线队列有 597 人,平均年龄 9.7 岁,标准差 3.3;具有纵向资料的分析样本为 371 人,平均复测间隔 1.17 年,标准差 0.28。摘要分别报告重复行为、沟通、非典型行为、社会互惠、同伴互动五个症状域。

具体招募流程、诊断确认、纳排标准、照护者是否前后一致、条目评分方式,以及未进入复测分析者的原因与特征,摘要均未披露。不能将基线人数当作两次测量均完整的人数,也不能由登记队列推断所有参与者接受了同一种治疗。

统计分析与建模

作者使用多组验证性因素分析检验纵向构型、度量与标量不变性。其逻辑是逐步约束测量模型:构型层面考察潜在维度和条目归属是否一致,度量层面考察载荷是否可比,标量层面进一步支持均值比较。对有序条目,具体阈值识别与约束方式尤其重要,摘要没有说明这些实现细节。

摘要只称使用既有拟合判据,没有给出估计量、各模型自由度、CFI/RMSEA、模型差异、效应量或区间。是否允许同一条目跨时间残差相关、如何处理同一个体的重复观测与缺失、是否调整年龄等协变量、采用完整个案还是其他缺失处理,均无法核实。因而不能将“多组 CFA”直接解释成两次数据相互独立,也不能补写严格不变性或个体变化模型。

研究结论

出版方摘要的 Results 报告:五个症状域均支持约一年间隔的构型、度量和标量不变性。它加强了将分数变化解释为症状表现差异、而非测量结构漂移的依据,但没有提供变化幅度、临床重要性阈值或特定治疗疗效。测量不变性不等于症状不变,也不等于每一个体均发生了可靠变化。

讨论

发现的解释

作者讨论: 摘要结论认为这些结果进一步支持 AIM 作为纵向症状追踪工具。

总结者评议: 量尺可比性是变化解释的前提之一,并不能排除照护者反应偏差、自然发展或其他同期因素,更不能单凭这一结果建立治疗因果效应。

局限

作者讨论: 摘要未展开局限。总结者评议: 复测分析只有基线队列的一部分,选择性随访值得关注;不变性检验具体容许了多大的拟合变化,以及结论是否适用于更长随访与其他年龄群,仍无法核实。

研究贡献

作者讨论: 贡献在于补充 AIM 的纵向效度依据。总结者评议: 方法层面将“测量是否改变”与“症状是否改变”分开;实践上有助于设计结局测量,但不直接回答哪种治疗有效。

证据定位

  • 出版方摘要:Purpose 界定问题,Methods 给出 597/371 人、年龄与随访间隔,Results 列出五域不变性,Conclusion 说明应用范围。
  • 估计方法、残差结构、缺失处理、拟合数值及变化效应量在摘要中未披露;这里的结果解释限于摘要所报告的测量不变性。

2. 《气候情绪量表》的乌克兰语版验证:战时背景下的测量不变性与法则网络关系

原始标题: The Ukrainian validation of the Inventory of Climate Emotions: measurement invariance and nomological relationships in a wartime context

作者: Iryna Kryazh、Vladyslav Baranov。原始来源: BMC Psychology,Article in Press。

研究问题与理论背景

气候情绪不仅包含焦虑,还包含愤怒、蔑视、热忱、无力、内疚、孤立与悲伤。研究检验 ICE-UA 的八因素结构、可靠性及性别、年龄、调查波次、流离失所状态下的测量不变性,并将情绪置于环保行为、生态焦虑与幸福感的法则网络中。战争可能改变情绪背景,也可能改变条目解释,因此跨群体可比性不能预先假定。

作者预设八因素及不变性假设,并在表 1 区分预期正负关系、预期不显著关系与既往研究不一致之处。性别比较有方向性预期;年龄、波次和流离失所比较则以非方向性、探索性框架处理,并非所有分析都属于同一层次的验证性检验。

研究设计与方法

683 名成年人完成网络调查,排除 10 名现役军人,分析 673 名平民;女性 452 人,年龄 18—76 岁,平均 36.13 岁。166 人为心理学本科生,其余通过学生社会网络招募。2024 年 3—4 月有 303 人,2025 年 1—3 月有 370 人,这是两个独立横断面样本,不是同一批人的纵向追踪。居家者 387 人,流离失所者 286 人。

32 个五级条目构成八个四题分量表,按平均分计分;翻译、回译与专家协商后直接进行验证,没有独立认知预试。其他测量涵盖生态焦虑、气候否认、环境自我效能、私人领域环保行为、自然联结、抑郁、生活满意度及正负情感。分析数据无缺失,质量筛查未进一步删除个案。

统计分析与建模

针对有序条目和非正态分布,CFA 使用 WLSMV;多组模型采用 Wu–Estabrook 的有序指标识别,依次检验构型、阈值、载荷、标量及残差方差约束。各分组分别比较,并非性别、年龄等四因素完全交叉的多组模型。拟合判断结合 CFI、RMSEA、SRMR 的变化,避免只依赖大样本敏感的卡方检验。AVE、CR、McDonald’s ω 与 HTMT 分别补充聚合、可靠性和区分效度。

八种情绪与十二项外部指标的 96 个 Spearman 相关共同进行 Holm 校正;情绪间相关不在这个检验族内。每种情绪另建线性回归,将性别、二分年龄、波次、教育、流离失所状态同时作为预测变量,以处理两波人口结构不平衡;使用 5,000 次 bootstrap、百分位 95% 区间。性别的八个系数用 Holm 校正,其他探索性预测因素分别用 Benjamini–Hochberg 校正。没有个体随机效应或时间内相关结构,因为并非面板数据。

研究结论

八因素模型 CFI=0.947、TLI=0.939、RMSEA=0.079,90% CI [0.076, 0.082],SRMR=0.057(第 9 页);RMSEA 区间上限略超 0.08,不宜称完美拟合。蔑视题 cc1 载荷仅 0.376;去掉它后 CFI=0.958、RMSEA=0.072,但作者为内容完整性保留原 32 题(表 2及第 10 页)。四类分组均支持逐级不变性(表 4)。

热忱与环境自我效能相关 0.566,95% CI [0.513, 0.616];蔑视与气候否认相关 0.476,95% CI [0.416, 0.533](表 5、附录 3)。校正后八种情绪均未与生活满意度显著相关,这不构成等效证据。调整协变量后,女性悲伤得分比男性高 0.811,95% CI [0.632, 0.990],Holm 校正 p=0.003;年龄、波次和流离失所状态未出现经相应校正后显著的关系(表 6)。这些都是横断面关联。

原文存在数值不一致:摘要和正文把 ω 下限写为 0.786,但表 3 八个值最低为 0.795;表 5 的内疚—抑郁相关为正 0.258,附录 3 对应区间却是负的 [−0.169, −0.020]。二者不能同时作为同一估计的点值与区间,也不能自行修正。

讨论

发现的解释

作者讨论: 气候愤怒、焦虑、悲伤与热忱构成亲气候情绪核心,蔑视更接近否认;战时对“气候歇斯底里”的不同理解可能解释 cc1 低载荷。

总结者评议: 这种条目解释只是情境性假说;研究没有直接测量其认知过程,也没有无战争对照,不应写成战争导致了某种情绪结构。

局限

作者讨论: 样本性别、教育和地区不均衡,单次自陈有共同方法偏差;境内外流离失所合并,缺少个体战争创伤暴露的细化测量。

总结者评议: 跨波不变性不能替代个体纵向不变性,乌克兰内部可比性也不自动支持跨国均值比较。表文可靠性和相关区间的不一致进一步限制精确数值解释。

研究贡献

作者讨论: 提供适合乌克兰语研究的多维工具。总结者评议: 方法价值在于将有序指标不变性、效度网络和多重比较分层处理;实践价值是支持更细致的情绪描述,而不是预测个人创伤或证明环保干预疗效。

证据定位

  • Article in Press 原文:第 4—8 页为假设、样本、工具与分析;第 9—13 页表 2—6 为因素、可靠性、不变性、相关与回归。
  • 第 14—16 页为作者讨论与局限;第 17 页附录 1 为两波构成;第 18 页附录 3 为相关区间。ω 下限差异见第 10 页正文与表 3,内疚—抑郁区间冲突见表 5 与附录 3。

3. 探索日常生活记忆:L-RECAP 的验证研究

原始标题: Exploring memories of everyday life: a validation study of L-RECAP

作者: Maud Billet、Lisa Dussard、Charline Colson、Marie Geurten、Sylvie Willems。原始来源: Archives of Clinical Neuropsychology。

研究问题与理论背景

实验室记忆测验能够标准化刺激,却未必完整反映人们对真实生活活动的记忆。L-RECAP 尝试以日常经验抽样形成个人化事件材料,再测量延迟回忆。研究目标是同时考察可行性、接受度、不同类型效度和重测可靠性,而非检验一种记忆训练的治疗效果。出版方摘要提出六项验证研究,没有披露预注册及预设相关强度。

研究设计与方法

研究对象为健康个体。参与者连续七天每天收到五次手机提示,报告正在进行的活动;最后一次提示后两天,对其中五项活动进行言语回忆,评估准确性、丰富度、具体性及现象学体验。不是让参与者在每次活动发生两天后都接受测验,也不是仅对词表作即时记忆测量。

六项研究分别为:S1 以 135 人的提示响应和反馈考察可行性;S2 以 79 人比较传统神经心理测验;S3 以 20 人比较先前一次研究活动的记忆;S4 以 135 人的自陈记忆问卷考察作者所称的预测效度;S5 比较对记忆功能满意与不满意者,共 56 人;S6 在 30 人中考察六周重测。各研究是否重叠招募并未在摘要中说明,人数不可相加后称作独立总样本。

招募渠道、年龄分布、健康与认知纳排、活动抽样及五项回忆事件的选择方式、评分盲法和评分者可靠性,摘要均未披露。它没有报告临床患者试验,也未提供干预组与对照组。

统计分析与建模

方法架构包含相关效度、已知组比较与时间稳定性三个层次。S2、S3 的相关用于判断日常记忆与既有任务是否相关但不完全重合;S4 以自陈问卷作为关联效标;S5 的标准化差异描述满意度不同人群的分数区分;S6 应评价同一工具重复测量的一致性。

摘要给出 r 和 d,但未说明相关属于 Pearson 还是其他估计、组间差异是否调整人口变量,以及重测采用相关还是 ICC。相关检验的协变量、缺失提示处理、异常值规则、多重比较校正、效应区间均无法核实。由于每人有多次提示和多个回忆事件,若在事件层面分析,应考虑个体内依赖;摘要没有交代是否采用多层模型,不能自行添加随机截距或事件层级。

“预测效度”是作者对 S4 的命名,但摘要未显示时间先后或预测模型,不足以认定其预测了未来功能下降;相关关系也不能证明生态任务比传统测验更优。

研究结论

出版方摘要 Results 报告良好接受度,但未给出响应率。与标准记忆测验的相关为 0.29—0.50,与自陈记忆测量相关为 0.19—0.38;具体性与先前研究活动回忆的相关为 0.54。准确性区分满意与不满意者的 d=0.34;摘要未披露该效应区间及完整显著性结果。六周重测被概括为“令人满意”,不能据此补写具体可靠性系数。

这些结果支持工具的初步生态适用性,但不意味着已有诊断敏感度、特异度或临床阈值。不同记忆维度与效标之间的关系也不能被压缩成一个已验证的总分结构。

讨论

发现的解释

作者讨论: 摘要认为 L-RECAP 是可行、可靠、具有生态效度的日常记忆测量候选工具。

总结者评议: 以参与者真实经历作为材料,能够增强情境贴近性;与传统任务不完全重合既可能反映不同记忆侧面,也可能来自测量误差,单靠中等相关无法区分。

局限

作者讨论: 仍需临床人群验证。总结者评议: 部分研究样本仅 20 或 30 人,效应精度值得关注;活动记录可能改变注意与编码,手机使用及任务依从性也可能影响可推广性。这些是测量设计风险,并非本文已经证明的偏差大小。

研究贡献

作者讨论: 为日常记忆评估提供新任务。总结者评议: 方法贡献是连接移动端经验抽样与延迟言语回忆,并按效度类型逐项评价;应用边界仍在健康样本,不能直接当成神经疾病筛查工具。

证据定位

  • 出版方文章与结构式摘要;出版方存入 Crossref 的摘要:Objective 给出六研究目标,Method 给出程序及各项样本量,Results 给出 r、d 与重测的文字判断,Conclusions 限定临床推广。
  • 具体统计模型、效应区间、响应率、重测系数及全文表图数值未在摘要披露;上述结论以结构式摘要的研究报告为限。

4. 医学生自我感知生物统计学素养量表:开发与心理测量学评价

原始标题: A self-perceived biostatistics literacy scale for medical students: development and psychometric evaluation

作者: N. Meriç Konar、Aslı Suner、Damla Özyürek、Ozan Karaca。原始来源: BMC Medical Education,Article in Press。

研究问题与理论背景

医学教育需要判断学生如何理解和使用统计证据,但“自认为会做”与“实际能够完成”并不相同。BLS 旨在测量自我感知的知识、AI 支持的技能与态度,而非客观统计考试成绩。研究借鉴统计素养框架,将 AI 工具信任、重要性及使用纳入候选内容。由于没有既定的医学生专属结构,因素探索先于验证;三维结构不能当作完全先验、未经数据修订的模型。

研究设计与方法

研究在土耳其两所医学院分别进行 EFA 与 CFA。Ege University 的 292 名合格学生中 270 人参与,按在线问卷自愿响应;另一所学校于 2025 年 5—11 月招募,207 人中 200 人参与。CFA 样本 82.5% 为一、二年级,没有五、六年级;EFA 有一人未填性别及年级。两校不是干预组与对照组,研究为横断面开发与验证。

三名专家审查后形成 40 题,EFA 删除两题,CFA 又事后删除三道知识题,最终 35 题:知识 25 题,AI 技能与态度各 5 题。各题均正向、五级评分;总分 35—175,但作者建议优先解释分量表。没有随访、重测或客观操作考核,条目缺失与模型缺失处理未充分交代。

统计分析与建模

EFA 采用主轴因素法与 oblimin 斜交旋转,允许三个维度相关;以特征值大于 1、碎石图和研究团队判断确定因素数,载荷低于 0.40 或交叉载荷问题用于筛题。独立学校样本的 DWLS-CFA 适合有序评分;然而初始模型残差协方差偏高,依据修正指标及内容冗余删除三题,因此最终拟合包含同一样本内的事后优化,仍需新的独立复验。

性别多组模型依次约束载荷、标量与残差,主要依赖 CFI 变化判据。文章称不能直接使用普通卡方差异检验;这不应被一般化为有序 CFA 不存在适当的稳健差异检验。论文未清楚列出阈值识别及全部约束细节。

聚合与区分效度使用 AVE、CR、HTMT,可靠性使用 Cronbach’s α。每个维度另拟合分级反应模型,报告条目区分度。此 IRT 分析没有充分展示各题阈值、信息函数、局部独立性及项目拟合,因此高区分度不能单独证明所有能力水平上都有高精度。没有层级随机效应或因果回归;跨学校、年级不变性也未获充分检验。

研究结论

EFA 报告 KMO=0.963,三因素解释 32.16% 方差。最终 CFA 为卡方 1150.246、df=557,CFI=0.975、NNFI=0.974、RMSEA=0.073、SRMR=0.051(第 6—8 页、表 3)。这与相关三因素结构相容,不证明工具测到了客观统计能力。

性别构型模型 CFI=0.990,度量模型降至 0.981,变化 −0.009;标量模型仍为 0.981。严格不变性存在直接冲突:第 5 页方法称不支持,第 8 页结果及表 4 却称支持,不能替作者选定结论。总量表 CFA 样本 α=0.976;EFA 总 α 在第 6 页为 0.962、第 8 页又为 0.970。表 5 的 AVE 为 0.677—0.825,HTMT 为 0.467—0.563;表 7 区分度为 1.83—5.71。EFA 的可靠性差异没有给出足够解释。

讨论

发现的解释

作者讨论: 量表适合描述感知准备程度、信心与学习需求,AI 相关内容反映新的学习环境;知识分量表极高的内部一致性也可能意味着题目冗余。

总结者评议: AI 分量表实际含信任、重要性和自报使用,称为“技能”不代表已经观察到正确操作,更不能据此证明对 AI 越信任就越有统计素养。

局限

作者讨论: 两校及低年级占多数限制推广,缺少客观效标、预测效度、训练阶段不变性与纵向敏感性,知识题过长增加负担。

总结者评议: 在验证样本内继续筛题会使最终拟合偏乐观;严格不变性和 EFA α 的相互矛盾应在实际比较前澄清。高 α 既非单维性证明,也不能替代测量误差区间、重测稳定性或改变敏感性。

研究贡献

作者讨论: 提供医学语境下的自评统计素养工具。总结者评议: 两个学校分开探索和验证、结合 CFA 与 IRT 是方法优势;其教育应用适合发现自认需求,不宜直接用于执业能力判定或宣称课程提高了真实技能。

证据定位

  • Article in Press 原文:第 3—5 页为招募、开发及模型;第 6—8 页为删题、因素拟合与不变性;第 9—10 页表 6—7 为可靠性与 IRT 区分度。
  • 第 10—12 页讨论效标、短版与推广边界;严格不变性的矛盾见第 5 页与第 8 页,EFA 总 α 的矛盾见第 6 页与第 8 页。出版方 Additional File 2 提供最终条目。

5. 用于学习非线性潜变量模型结构的海森矩阵秩约束

原始标题: Hessian Rank Constraint for Learning Structure of Nonlinear Latent Variable Models

作者: Zijian Li、Ruichu Cai、Feng Xie、Xinshuai Dong、Haoyue Dai、Yuewen Sun、Yujia Zheng、Guangyi Chen、Yingyao Hu、Kun Zhang。原始来源: arXiv,v1,2026-09-21。

研究问题与理论背景

经典 tetrad 约束通过协方差的低秩结构判断观测指标是否由共同潜变量生成,但非线性关系可能破坏协方差的诊断性。本文寻找观测分布中能反映潜变量分隔维数的替代工具:对数密度的交叉海森矩阵秩约束 HRC。目标既包括定位共同潜变量的指标群,也包括恢复潜变量之间的马尔可夫等价类,不是识别所有因果箭头或估计干预效应。

它是一篇理论与计算研究预印本。可识别性定理有明确充分条件,模拟则评估有限样本性能;两者不能互相替代,更不能把低噪声下的好表现表述为任意非线性模型都可识别。

研究设计与方法

理论模型允许潜变量及观测变量由非线性结构方程生成,噪声相互独立,观测变量不能成为潜变量的祖先。端到端应用进一步限制为纯单因子测量模型:每个指标只有一个潜在父节点,没有观测父节点和相关测量误差。

模拟取 4、6、8、10 个潜变量,每个维度 10 张随机图、每图 10 个种子,样本量从 200 到 9,000。潜变量边权在 0.7—1.3 内均匀抽取,非根潜变量为线性父节点组合加标准差 0.2 的高斯噪声;测量端使用 sin、sinh、tanh、softplus 及混合函数,载荷绝对值在 2—5,另加观测噪声。故这里的主要非线性压力来自测量机制,并非所有模拟潜在结构方程都非线性。

真实例子使用 2025 年 8 月版本 FRED-MD,原始月份范围为 1959 年 1 月至 2025 年 7 月,选 14 个宏观金融指标;替换不可用序列、取共同无缺失样本并一阶差分。最终有效月数未披露,利率、信用、汇率、股票/波动率四类结构依赖领域知识,不是实验确定的因果真值。

统计分析与建模

令 A、B 为不相交观测组,核心对象为原文式(2):

H_{A,B}:=\frac{\partial^2\log p_{A,B}}{\partial A\,\partial B^\top}.\tag{2}

假设 1 要求密度正、可二次微分、积分与求导可交换及有限后验协方差;假设 2 要求给定观测值时,条件对数密度的一阶导数对潜在分隔变量呈仿射关系。后者不是一般非线性模型自动具备的性质。若 Z 将两观测组 d-分离,则原文式(6)为:

H_{A,B}=V_A(A)\operatorname{Cov}(Z\mid A,B)V_B(B)^\top.\tag{6}

因此秩至多为分隔维数;只有再加最小分隔集的后验协方差正定、两侧斜率矩阵满列秩,才得到原文式(7):

\operatorname{rank}(H_{A,B})=d^*.\tag{7}

有限样本先以核密度估计求对数密度二阶导,再对奇异值阈值化。带宽由留一似然交叉验证选取,排除低密度点后固定求值位置;bootstrap 通过整块矩阵谱范数误差校准,而非逐个矩阵元素检验。最终截断是原文式(11):

\tau=\max\{\tau_{\mathrm{boot}},\tau_{\mathrm{rel}}\},\qquad \widehat r_\tau=\#\{j:\sigma_j(\widehat H_{A,B}(y))>\tau\}.\tag{11}

其中相对阈值为最大奇异值的预设比例;各位置取秩的众数,平票取较大秩。FOFC 用秩一模式聚类,随后 PC 型程序把潜变量条件独立转换为代理指标交叉秩检验。正确性定理还条件于第一阶段聚类正确与秩检验一致;固定 bootstrap 校准本身并未被证明一致。主要指标是聚类/结构 F1 和结构汉明距离,报告图—种子组合的均值及标准差,不是临床效应区间。

研究结论

表 1 中 HRC 跨函数平均结构 F1=0.974、标准差 0.071,SHD=0.156、标准差 0.414;该表最强比较方法的平均 F1 为 0.442。表 2 随潜变量从 4 增至 10,HRC 的 F1 从 0.962 降至 0.923。结果支持所测试环境中的优势,不构成对全部潜变量模型的性能保证。

敏感性结果更能限定适用边界:3,000 样本的 L4M3 设置中,观测噪声从 0.15 增至 1.00,结构 F1 从 0.9643 降至 0.5430(表 A4);潜变量范围从 [−0.5, 0.5] 扩大至 [−2.5, 2.5],F1 从 0.9643 降至 0.4348(表 A5)。这些数值是仿真恢复率,不是现实政策或心理干预收益。

讨论

发现的解释

作者讨论: HRC 将线性协方差秩思想推广为非线性分布的局部微分约束,低噪声与较小曲率有利于近似低秩。

总结者评议: 关键不是“海森矩阵总能找到潜变量”,而是条件导数与非退化条件如何保持维数信息;性能随噪声和取值范围变化正体现其依赖条件。

局限

作者讨论: 混合指标、相关测量误差及更复杂观测因果关系仍需新算法;定理不适用于任意非线性结构,bootstrap 一致性尚未建立。

总结者评议: KDE 在条件集合增大时面临高维密度估计困难。FRED-MD 是月度序列,差分不自动保证独立同分布,文中没有充分解决时间依赖与观测理论的衔接;经济学可解释性不能当作独立因果验证。

研究贡献

作者讨论: 提供可接入既有 FOFC、PC 程序的新秩工具。总结者评议: 理论上明确分隔维数的充分条件,方法上连接导数估计与潜结构搜索;对心理测量的启发主要是探索非线性指标模型,而非立即替代带有设计与领域约束的 CFA 或结构方程分析。

证据定位

  • arXiv v1 原文:第 2—5 页式(2)、(6)、(7)、(11)及假设 1—3;第 6—8 页为 FOFC/PC 应用与条件性正确性。
  • 第 8 页表 1—2、第 9 页图 4—5;第 22—23 页附录 D.6—D.7 区分理论误差界与 bootstrap 实现;第 29—30 页附录 G 给出模拟、FRED-MD 处理与表 A4—A5,附录 I 明确限制。