Quantitative Psychology|2026-09-25 科研日报
1. 自我关怀量表印地语版的适配与心理测量学验证
原始标题:Adaptation and psychometric validation of the Hindi version of the self-compassion scale
作者与出处:Pankaj Singh、Ashwani Mohan、Zuby Hasan;BMC Psychology,2026,Article in Press。
原始来源:https://doi.org/10.1186/s40359-026-05689-7
研究问题与理论背景
自我关怀既包含自我友善、共同人性和正念,也涉及自我评判、孤立感与过度认同负面体验。争议不仅是量表有几个因素,更关乎能否使用总分,以及正负成分究竟属于同一整体还是两个不同领域。研究将原有 26 题量表适配为印地语版 SCS-H,比较五种理论结构,并检验其与幸福感、心理困扰的关系。
预期是自我关怀与生活满意度、自尊等正相关,与抑郁、焦虑、压力负相关;控制自尊后仍应保留部分关联。因子模型比较具有理论依据,但数据中的结构差异并不直接证明印度文化赋予自我关怀不同意义:文化解释需要受访者理解过程的独立证据。
研究设计与方法
两项研究均便利招募德里国家首都辖区大学生。研究一为 462 人,18—26 岁,平均 19.63 岁,女性 384 人;研究二为另 381 人,平均 19.42 岁,女性 311 人。合计 843 人并不意味着每个模型都使用 843 人;结构分析使用第一样本,效度分析使用第二样本,其中 114 人四周后重测。
适配经过双人正向翻译、协调、回译、专家评审,以及 20 名印地语母语者的清晰度预试。六名专家评价条目相关性。研究二同时施测生活满意度、主观幸福感、正负情感、自尊、DASS-21、社会赞许性和职业适应力量表。研究没有干预、随机分组或临床诊断效标;除年龄、学生身份等样本描述外,未给出完整排除流程。
统计分析与建模
研究一先以 EFA 探索结构,用特征值大于 1 和平行分析确定因素数;KMO 为 0.87。随后在 Mplus 7.4 中以 WLSMV 处理有序类别题目,分别估计单因素、两相关因素、六相关因素、单一般因子 bifactor、两个相关一般因子 bifactor。CFA 将非目标载荷固定为零;ESEM 采用目标旋转,允许交叉载荷;bifactor 的组因子与一般因子正交,双一般因子模型允许两个一般因子相关。
模型比较依靠 CFI、TLI、RMSEA 及其 90% 区间、SRMR,并检查载荷是否能清楚定义因素,而非只挑拟合指标最高的模型。正文未给出完整嵌套差异检验、缺失数据比例与处理细节;也未采用群组随机效应或开展性别不变性检验。EFA 与 CFA/ESEM 使用同一研究一样本,不能称为独立交叉验证。
信度区分总分 omega 与 omega hierarchical。论文报告 \omega=0.92、\omega_H=0.78,其比值约 0.84,指可靠总分方差中一般因子的相对份额,不是全部题目方差的 84%。分量表另用 CR、AVE 评价。研究二采用 Pearson 相关、控制自尊的偏相关及四周重测相关;偏相关不是纵向预测模型,也不是干预效果。表 5 实际呈现总分关联,不能将正文所说的“分量表增量效度”理解成已经提供各维度完整结果。
研究结论
六因素 ESEM 的 CFI 为 0.95、TLI 为 0.92、RMSEA 为 0.05,90% 区间 [0.04, 0.06];单一般因子 bifactor ESEM 分别为 0.97、0.95、0.02 [0.010, 0.030](第 8 页表 1)。双一般因子 ESEM 虽有更高 CFI 0.98,但一般因子载荷偏弱,作者因此未推荐该解。需要注意,表 1 两因素 ESEM 的 CFI、TLI 反而低于对应 CFA;正文“ESEM 各模型均不差于 CFA”的概括并非对所有指标都成立。
六个分量表 AVE 为 0.31—0.45,均低于常用 0.50 标准;自我评判为 0.31,过度认同为 0.33,后者 CR 仅 0.65(第 10—13 页)。可接受的总分信度不能消除分量表聚合效度不足。
研究二中,总分与生活满意度相关 0.51、与抑郁相关 −0.52;控制自尊后,与主观幸福感、生活满意度、积极情感和消极情感的偏相关依次为 0.30、0.16、0.12、−0.29(第 15—16 页、表 5)。四周重测相关为 0.87。职业适应力与社会赞许性的相关分别为 −0.03 和 0.02,未显著,但这不构成严格的零相关等效检验,也不排除所有自陈偏差。
讨论
发现的解释
作者讨论:结果支持一般自我关怀与有意义的分维度共存,负向分量表可能对文化和语言更敏感。总结者评议:ESEM 的价值在于放松过强的零交叉载荷限制,而不是把拟合改善自动解释成理论更真实。总分的使用理由应结合一般因子强度、条目内容和效度,而非只看 CFI。
局限
作者讨论:样本偏年轻、城市、受教育程度高且女性占多数;缺少独立结构复制、受访者层面的概念等价研究和临床验证。总结者评议:四周 Pearson 相关反映相对排序稳定,不等于绝对一致性或纵向测量不变性。横断面偏相关也不足以证明自我关怀能缓解症状,或优于自尊干预。
研究贡献
作者讨论:SCS-H 为印地语人群的研究与应用提供工具。总结者评议:理论上澄清总分与分维度的并存,方法上展示 CFA/ESEM 与外部效度的互补,实践上扩展语言适用性;但尚无诊断阈值、筛查准确率或患者个体决策依据。
证据定位
- 提前发布的已接收稿:第 6—8 页研究一方法与表 1;第 9—13 页载荷、信度及 AVE;第 13—16 页研究二、表 5;第 17—19 页应用边界与局限。
- 出版页面:Article in Press,后续编辑版本可能替换当前稿。
2. 利用虚拟现实测量手部与眼部运动中注意捕获的动态过程
原始标题:Measuring the dynamics of attentional capture in hand and eye movements with virtual reality
作者与出处:Max D. Gurr、Jeff Moher、Matthew D. Egbert、Christopher D. Erb;Behavior Research Methods,2026,58:302。
原始来源:https://doi.org/10.3758/s13428-026-03177-9
研究问题与理论背景
传统注意捕获实验多依赖二维图形和按键反应时,难以分辨干扰发生在启动、运动还是在线修正阶段。研究利用 VR 同步记录手部与眼部运动,询问:二维实验中的干扰效应是否延伸至三维场景;连续轨迹指标能否比最大曲率更直接反映反应竞争;丰富背景是否改变干扰代价。
作者预期独特色彩干扰物损害表现、丰富环境增加一般加工负担,但环境复杂性会增强还是减弱注意捕获并不明确。文章区分主要分析与后来开展的目标—干扰物距离、轨迹时程探索;整个分析未预注册。
研究设计与方法
奥克兰大学研究参与者库最终纳入 54 人,18—26 岁,女性 40 人。另七人因设备、纳入条件、大量错误或极慢反应被排除;三名纳入者眼动缺失或不完整,故眼动分析为 51 人。参与者视力正常或矫正正常、理解英语、能够正常伸手并愿戴头显,且无已诊断的认知或社会功能障碍。
被试在简单房间和丰富温室中寻找形状独特的苹果或梨,用惯用手控制器触及目标;一半试次另有颜色独特干扰物。两个环境各三个区组,每区组 48 试次,共 288 试次,环境顺序平衡。目标形状和颜色随机变化。所有人的初始基线练习却都在温室完成,因此环境经历并非完全对称。
HTC Vive Pro Eye 的眼动硬件最高采样率为 120 Hz,但本实验手眼数据都按 Unity 帧率约 90 Hz 记录。手部重采样、10 Hz 低通滤波后,以速度及空间阈值确定启动;平均 11.85% 有效试次需盲于条件的人工调整。排除错误及其后续试次、区组首试次、低采样率、极端反应时等后,平均剔除 7.7% 试次,没有对缺失眼动做插补(第 4—9 页)。
统计分析与建模
启动时间 IT、运动时间 MT 与总反应时 RT 分开分析。传统曲率取二维投影的最大垂直偏离并标准化;新的目标吸引 TA、干扰物吸引 DA 则逐段比较手部到各物体的距离减少量,把减少最多的物体标为该段的“吸引”对象。轨迹以 B 样条函数数据方法沿深度方向归一化为 101 点,TA 是指向目标的比例,DA 差值扣除同环境、同目标位置的无干扰基线。这些是几何行为指标,不是物理力或已拟合的动力学参数。
主要分析为环境×干扰物的被试内重复测量 ANOVA;DA 已是差值,改用对零的单样本检验及环境间配对检验。Holm–Bonferroni 按效应类型分别校正八或九项指标;球形性不满足时采用 Greenhouse–Geisser 修正。分析并非包含参与者随机斜率的逐试次混合模型。次要因素检查涉及环境顺序、目标位置、颜色与形状;贝叶斯因子由 F 统计量近似计算。
探索性时程分析在各归一化点对差值作单样本检验,将同号、超过双侧 0.05 阈值的连续点组成簇,以绝对 t 值之和作为簇质量。对参与者差值随机翻转符号 1,000 次,以最大簇质量构建零分布。该方法处理单次时程分析内的多重比较,不自动控制全部指标和全部距离条件的总体错误率;簇边界也不等于精确神经加工起止时刻。
研究结论
无干扰与有干扰条件的 RT 分别为 1191±21 和 1238±24 毫秒,TA 为 92.4±0.58% 与 89.7±0.73%,DA 增量为 1.90±0.21 个百分点;这里的“±”均为均值标准误(第 11 页表 2)。RT 干扰效应为 F(1,53)=87.66,p<.001,\eta_p^2=.62。首次目标注视延后,但目标注视时间比例没有显著干扰效应。
丰富环境总体反应较慢,不过 IT、RT 和凝视距离同时受环境顺序调节。环境×干扰物交互均未显著;IT、RT、目标注视比例的 BF_{01} 分别为 4.19、4.64、3.40,其余多为较弱证据,不能概括为所有指标已证明两种环境等效(第 11—12 页)。
距离探索显示,远距离条件 RT 差值仅 2.9±7.3 毫秒、未显著,DA 仍增加 1.38±0.24 个百分点且显著(第 13 页表 5)。这说明总反应时可掩盖轨迹中的竞争。近侧干扰条件下 DA 显著簇覆盖归一化轨迹 1%—78%,远距离为 1%—53%(第 15—16 页、图 4);百分比代表空间归一化轨迹位置,不是毫秒或现实动作改善比例。
讨论
发现的解释
作者讨论:TA、DA 比单点最大曲率更易解释,能分辨动作向干扰物偏移与后续修正。总结者评议:其优势来自逐段方向信息,不宜全部归因于三维测量;作者把 TA、DA 重算为二维后仍得到相似模式。效应敏感性也不等于已建立个体差异测量的重测信度。
局限
作者讨论:固定位置和少量形状促成稳定搜索策略,基线环境造成顺序混杂;VR 的延迟、眼动精度、疲劳和深度知觉有别于现实场景。总结者评议:距离与视野位置未完全解耦,探索性比较不能单独支持普遍空间机制;平均值分析也未充分刻画试次间适应。手眼同步记录不意味着已估计两系统之间的因果耦合。
研究贡献
作者讨论:便携商业 VR 系统可提供丰富、连续的手眼行为测量。总结者评议:理论上支持注意—动作竞争跨任务形式的延伸,方法上提供可解释的轨迹指标,实践上降低同步测量的部分硬件门槛;软件处理和人工质控成本仍不可忽略,也不能把实验室效应直接外推为日常工作表现。
证据定位
- 期刊论文:第 4—9 页样本、任务与数据处理;第 10—13 页检验策略及表 1—5;第 15—16 页簇置换和图 4;第 18—21 页测量解释、现实外推与局限。
- 研究数据与分析材料:论文开放实践声明所列项目。
3. 从教师视角解构学习导向评价(LOA)的构念:一项量表开发与验证研究
原始标题:Deconstructing the constructs of learning-oriented assessment (LOA) from teachers’ perspectives: a scale development and validation study
作者与出处:Masoomeh Estaji、Maryam Kogani;Asian-Pacific Journal of Second and Foreign Language Education,2026,11:83。
原始来源:https://doi.org/10.1186/s40862-026-00456-y
研究问题与理论背景
学习导向评价不只是测量学习结果,而是让任务、反馈、同伴评价与自我评价参与学习过程;形成性和总结性评价都可能服务这一目标。既有教师研究多采用访谈,缺少能够区分知识、信念与实践的标准化工具。本文开发 LOATPS,探索教师对 LOA 的理解包含哪些维度,而不是检验某种评价干预是否提高学生成绩。
量表内容由既有框架与专家意见引导,尤其关注有助学习的任务、学习者主动参与及面向后续学习的反馈。最终五因素属于探索后提出、再以另一教师样本检验的结构,不能写成研究开始前已固定并预注册的五个假设。
研究设计与方法
研究便利招募伊朗不同机构的英语外语教师,共 408 人,女性 313 人、男性 95 人。EFA 样本 180 人,年龄 18—46 岁;CFA 为新招募的 228 人,年龄 18—50 岁。教师教授从初级到高级的学习者,问卷采用英文、五级同意度反应。分数衡量认同及自报实践,并非课堂行为的独立观察评分。
条目来自文献梳理和五位 TEFL 博士专家的线上访谈,每次约 30—45 分钟,随后由评价领域专家评审,并以 50 名教师预试。53 题进入探索阶段,删去 11 题成为 42 题,再在 CFA 阶段删两题,形成 40 题。没有干预对照、随访或学生结局测量。
样本经验分类存在歧义:正文把新手定义为 1—3 年、经验教师为五年以上,却在表 1 列出两样本各 45 名任教 3—5 年者。因而“107 名新手、301 名经验教师”的二分定义与分布表不能无条件视为一致。
统计分析与建模
探索阶段 KMO 为 0.883,Bartlett 球形检验的卡方为 6099.732、自由度 1378(第 8 页表 2)。这些说明相关矩阵适宜进一步降维,但 Bartlett 显著并不直接证明提取后的因素彼此相关。正文虽称 EFA,实际写出的提取方法及表 3 均为 PCA,采用允许成分相关的 Promax 旋转;PCA 总方差分解不能与共同因子模型的共享方差解释混用。
特征值大于 1 最初给出 11 个成分,解释 67.798% 总方差;结合平行分析和碎石图,作者改为固定五成分。删除十个载荷低于 0.40 的条目及一个双重载荷条目。另一样本的 CFA 以五因素模型开始,再删除载荷低于 0.50 的第 32、53 题,并依据理论相容的修正指数调整模型。使用 AMOS 29,但未充分说明估计量、有序题目处理、缺失数据、异常值、具体修正路径及其前后比较,不能自行补写为稳健极大似然或 WLSMV。
研究用 CR、AVE、最大信度 MaxR(H) 与 Fornell–Larcker 准则评价分量表。没有机构随机效应、协变量调整、多群组不变性、重测信度或外部效标预测分析。独立样本 CFA 比同样本拟合更有说服力,但在 CFA 样本继续删题和修正后,最终版本仍需要新的确认样本。
研究结论
最终五个维度为 LOA 知识、LOA 信念、反馈与互动实践、多样化评价实践、与他人分享实践。模型卡方 1199.98、自由度 720、RMSEA 0.054、CFI 0.922、TLI 0.913、SRMR 0.061(第 14 页表 6),属于多个指标可接受,而非所有指标均达到最严格标准;表中未给 RMSEA 置信区间。
五维度 CR 为 0.766—0.918;AVE 分别为信念 0.390、知识 0.465、反馈互动 0.388、多样评价 0.511、分享 0.400(第 15 页表 7)。除多样评价外,均未达到常用 0.50 标准,不能因 CR 高就宣布聚合效度全面充分。AVE 平方根大于表列因素相关,支持该准则下的区分效度,但不等于因素完全独立。
报告另有值得注意的问题:表 6 标题误写成“L2 grit questionnaire”;摘要提及 MSV,表 7 却未单列该指标。它们不自动推翻模型,却限制读者对完整验证流程的判断。研究没有提供量表分数预测真实教学或学生成绩的效应量。
讨论
发现的解释
作者讨论:LOA 是知识、信念及多种实践相互联系的职业取向,不宜简化为单一态度;某些理论重要条目被删除,可能反映考试压力下理想与实际的张力。总结者评议:低载荷本身不能证明该文化解释。量表中的自报实践也可能受社会赞许性和条目措辞影响,尚不能代表实际实施质量。
局限
作者讨论:讨论将部分删题现象放在伊朗课程约束与考试反拨中解释,但正文没有系统的局限小节。总结者评议:便利样本、女性占多数、PCA 与因子术语混用、CFA 估计细节不足及修正透明度有限,都约束可重复性和外推。年龄、经验或机构之间比较,以及培训前后变化评价,均需额外的不变性与变化敏感性研究。
研究贡献
作者讨论:量表可帮助教师教育者识别知识与实践支持需求。总结者评议:理论贡献是把 LOA 分解为可讨论的维度,方法贡献是形成两阶段、多维的候选工具,实践贡献是为专业发展提供反思框架;当前尚不足以用于教师高风险排名,或证明培训能改善教学成效。
证据定位
- 期刊论文:第 6—8 页样本表 1、开发流程与提取方法;第 9—13 页表 3—5、删题与载荷;第 14—15 页表 6、7;第 15—18 页讨论和应用。
- 论文 PDF:图 2 为最终修改后的 CFA 结构。