花卷铺

花卷铺

Quant Psych Daily|2026-09-18 科研日报

23
2026-09-18

1. 一种用于评估接受认知行为治疗的青年人 CBT 技能的新型任务式测量工具

原始标题:A new, task-based measure to assess cognitive behavioural therapy skills of young adults attending CBT

作者与来源:Emily Elson 等;the Cognitive Behaviour Therapist,2026,19,e42。
原始来源链接:https://doi.org/10.1017/S1754470X2610083X

研究问题与理论背景

CBT 要求来访者识别想法、感受与行为,理解三者联系,并能提出改变方案。“心理领悟能力”包含情绪觉察、内省与元认知,但自陈“我了解自己的情绪”不等于能在实际问题中运用这些技能。既有访谈或录像评分耗时,儿童及智力障碍群体的任务又不能直接推广至一般青年。作者的缺口是开发一个治疗前可用、标准化的情境任务,而不是建立新的诊断阈值。

研究一检验青少年版内部一致性与聚合效度;研究二检验青年在线版的结构、信度及与情绪觉察的关联。三个能力领域构成理论预期,但最终因子数仍经探索决定,并非事先固定三因子的纯验证研究。

研究设计与方法

研究一于 2020 年在一所中学课堂招募 12—16 岁学生,最终分析 72 人,平均 13.58 岁;排除既往/当前心理治疗及自闭症、ADHD 情况。四个纸笔情境涉及抑郁、社交焦虑、广泛焦虑和行为困扰,要求辨认信息、画联系箭头、提出改变与活动。研究二于 2023 年通过 Prolific 招募 300 名英国 18—30 岁青年,按自闭症、ADHD、神经典型各 100 人取样;自闭症组允许共病 ADHD,ADHD 筛选含自我认定,不能称为三组均经独立临床诊断。

青年版保留抑郁与社交焦虑两个在线情境,总分 0—44;三名评分者先校准,第四评分者复核 13% 数据,\kappa=.71。情绪觉察 EAQ-30 的三个分量表作为聚合效度指标。两版施测、题数和计分均不同,不能直接作年龄发展比较。(方法;表1、3、4)

统计分析与建模

研究一总分用 Cronbach \alpha、分项用有序 \alpha,情感识别与 EAQ 以 Kendall \tau 检验关联。EAQ 零星缺失按个人均值替代,两人整份缺失保留为缺失;任务未答记零,隐含“未答即不会”的测量假设。该假设可能混合能力、动机和遗漏,原文未给相应敏感性分析。

研究二各神经类型取 50 人进入 EFA,另 150 人做 CFA。题目为有序评分,因此 EFA 使用多分相关、主轴提取及允许因子相关的 oblimin/quartimin 旋转;MAP 建议两因子,特征根/碎石图建议三因子,平行分析建议四因子,作者比较载荷与解释性后选三因子。CFA 以 WLSMV 估计相关潜因子,残差不相关;这是条目测量模型,无纵向随机效应、治疗分组预测变量或协变量调整。任务因子分析无缺失,EAQ 有 13 人因技术故障按缺失处理。

拟合报告为 \mathrm{CFI}=.99、\mathrm{TLI}=.99、\mathrm{RMSEA}=.05,90\%\ \mathrm{CI}\ [.02,.07]、\mathrm{SRMR}=.07;组合信度分别为识别 .75、联系 .92、应用 .58。统计问题:CFA 段同时写 \chi^{2}(101)=98.62、p=.015,统计量、自由度与显著性表述不协调,不能据此确认卡方检验结论。没有报告跨神经类型测量不变性,分层招募不等于已证明量尺可比。(两个 Analysis plan;EFA/CFA 结果;表5—7、图1)

研究结论

主要发现是识别、联系、应用三领域的初步结构支持,但“应用”部分证据最弱。青年总分 \alpha=.83 并不能抵消应用因子组合信度 .58;青少年总分 \alpha=.87,而识别改变分项有序 \alpha=.55。(两项研究 Internal consistency;CFA)

次要发现为青年情感识别与分析自身情绪 \tau=.13、p=.002,与关注他人情绪 \tau=.09、p=.021,均是小幅相关,不是治疗反应预测。青少年结果把 \tau=.14、p=.058 也称作显著,按常见 .05 标准不应照搬该措辞。相关未报告区间。没有随机干预,不能宣称测量任务提高 CBT 效果。

讨论

发现的解释

作者讨论:应用技能可能因条目较少、改变认知与改变行为的过程不同而不一致;题型本身也可能形成三个因子。总结者评议:后续应把内容维度与作答形式交叉设计,否则良好 CFA 拟合不能排除方法因子。

局限

作者讨论:青年年龄范围窄、文化适用性未检验、评分仍需训练,应用因子需修订。总结者评议:单校青少年样本低于预期 77 人;总体信度、评分一致性和跨组等值是不同问题。标题及部分治疗史表述不能替代临床样本验证;原始数据未获公开共享同意,异常统计量的独立重估受限。

研究贡献

理论上把笼统“心理领悟”拆成可表现的技能;方法上示范任务评分与有序潜变量分析结合;实践上可作为治疗前共同讨论的辅助,而非排除来访者、评定神经类型能力或决定治疗适配的硬性工具。

证据定位

出版方全文:Introduction / Present research;Study 1、Study 2 的 Participants、Analysis plan、Results;表1—7、图1;Discussion / Limitations and future directions。上列两处统计不一致见原文结果段。

2. 土耳其语学术写作中 AI 文本检测的测量效度:时间、提供商与干预方式的变化

原始标题:Measurement Validity of AI-Text Detection in Turkish Academic Writing: Temporal, Provider, and Intervention Shifts

作者与来源:Mustafa Tüker、Mahmut Sinecen、Mehmet Taha Eser;Scientific Journal of Mehmet Akif Ersoy University,2026,9(1),53—67。
原始来源链接:https://doi.org/10.70030/sjmakeu.2033004

研究问题与理论背景

检测器输出不是天然具有固定意义的“AI 概率”。效度问题是:同一分数与阈值,在不同年代、生成器及人机协作方式中是否支持同样的判断?土耳其语的黏着形态与英语主导的训练背景,使跨语言泛化尤其值得检验。研究预先提出跨提供商迁移、低误报阈值下零样本检测、协作方式差异、历史阈值迁移,以及语言/OCR 质量控制五个问题。重点不只是 AUROC 排序,而是错误指控人类文本的实际风险。(第1节,pp.53—54)

研究设计与方法

历史审计包含 50,913 篇人类文本,其中 40,381 篇有 2000—2019 年日期;避免把生成式 AI 流行后文本当可靠纯人类对照。独立评估基准取 300 个项目内来源谱系完全留出的土耳其语来源,150—300 词,其中 195 个论文库来源、105 个学术来源。来源及其衍生文本都不能进入训练、验证或阈值选择。

四个冻结提供商模型分别执行完整生成、润色、深度人机混写、人类化改写。100 个来源覆盖全部四提供商×四方式,余下 200 个来源均分给提供商,计划 2,400 个变体,合格 2,398 个。一个截断、一个生成失败没有被悄悄替换。六个监督检测器包括词/字符 TF-IDF 的逻辑回归或 SVM、BERTurk、XLM-R、重训 ScriptMind;另有训练谱系不明的已部署 ScriptMind 和冻结 GPT-2 似然基线。后两者不具相同的留出推断资格。(第3.1—3.3节、表1—2,pp.55—58)

统计分析与建模

监督模型比较的是冻结模型在新材料上的表现,不是在测试集重新寻优。多数分类阈值为 .5,SVM 为 0;记录 \mathrm{FPR}=\frac{\mathrm{FP}}{\mathrm{FP}+\mathrm{TN}}、召回率、平衡准确率、MCC、AUROC 与 AUPRC。FPR/召回提供 Clopper–Pearson 精确二项区间;同来源变体相关,因此另按来源种子聚类 bootstrap 2,000 次,估计指标 95% 区间。表3精确区间不能误称为聚类区间。提供商成对比较用 100 来源的 400 个完整四元组,属探索分析,未校正多重比较。

历史分析另为每个检测器建立二项 logistic 回归:因变量为人类文本是否误报,核心预测变量为按十年缩放的发表年份;协变量包括对数词数、句长、词长、形态密度、词元多样性、形态分析成功率及来源固定效应,来源内依赖用聚类稳健标准误处理,不是来源随机效应模型。领域与来源完全共线,未同时纳入。来源×年份交互用于敏感性检查。另在 2000—2009 年校准 1%、5%、10% FPR 阈值,原样迁移至 2015—2019 年。

缺失/失败按预先规则区分合格样本、纳入截断记录、以及将两次失败均计漏检的 2,400 分母分析。后两者未改变主要结论。完整回归系数与诊断未公开,AIC、系数区间及拟合优度未披露。(第3.4、4.4节,pp.58—59、62)

研究结论

主要结果:XLM-R \mathrm{AUROC}=.9154,来源聚类 95\%\ \mathrm{CI}\ [.9026,.9268],但固定阈值人类 \mathrm{FPR}=4.00\%,精确 95\%\ \mathrm{CI}\ [2.08\%,6.88\%],AI 召回仅 69.52%;BERTurk \mathrm{FPR}=2.67\%、召回61.97%。部署系统召回86.03%,却将105/300人类文本误报,即35.00%,区间[29.61\%,40.69\%]。(表3、图2,p.59)高召回不能脱离误伤解读。

次要结果:XLM-R 对完整生成召回92.67%,对深度混写37.90%;提供商差异只适用于研究锁定的版本。历史5%阈值迁移后,XLM-R \mathrm{FPR}=7.96\%,\mathrm{ScriptMind}=14.76\%,而字符逻辑回归为4.92%,并非所有架构同样漂移。零样本基线 \mathrm{AUROC}=.5069、阈值下召回为零,也不代表所有零样本方法均无用。(第4.2—4.3节、图3—5,pp.60—62)

讨论

发现的解释

作者讨论:混写可能稀释检测信号,润色保留人类词汇特征;形态解释仍属推测。总结者评议:AUROC 反映排序、FPR 反映特定工作点,两者回答不同问题;基准中的人机比例也不能替代真实场景的违规基率。

局限

作者讨论:基准仍来自同一数据生态,不能审计基础模型预训练暴露,短片段不能直接推广到整篇论文。总结者评议:来源隔离比随机分行更可信,但不等于外部语料验证;发表年份关联不是 AI 改变人类写作的因果效果,未公开代码限制复现。

研究贡献

理论上把算法分数放回效度与决策代价框架;方法上结合来源谱系审计、冻结阈值、聚类区间和显式失败分母;实践上支持目标人群本地验证与人工复核,不支持单凭检测分数作学术不端裁决。

证据定位

第3节、表1—2:设计与分析;第4节、表3、图2—5:数值;第5—6节及 Data Availability(pp.62—65):解释、外推边界和复现限制。

3. 情绪传染的动力系统模型:情感环中的振荡耦合

原始标题:A dynamical systems model of emotional contagion: Oscillatory coupling in the circumplex of affect

作者与来源:Diego Alexander Garzón-Alvarado 等;PLOS ONE,2026,21(9),e0334738。
原始来源链接:https://doi.org/10.1371/journal.pone.0334738

研究问题与理论背景

情绪动力学和多主体情绪传播各有成熟研究,缺口不是“首次用数学研究情绪”,而是在同一框架中结合连续效价—唤醒坐标、个体内调节、人际网络与可解释参数。作者以 Russell 情感环为状态空间,问吸引点、阻尼及网络耦合怎样生成一致、分散、跟随或振荡放大的轨迹。这里的心理解释是待检验的生成性假设,不是由数据确认的神经机制。

研究设计与方法

每个主体以复相量 z_i=r_i\exp(i\theta_i) 表示,效价 V_i=r_i\cos\theta_i、唤醒 A_i=r_i\sin\theta_i。半径是距中性点的情感强度,不能直接叫唤醒。表1情绪坐标只是人为选取的示意标签,不是量表常模。

九个数值示例分为三人传递链、两个各10人的领导群体、20节点复杂网络。改变方向性和权重、个体吸引点以及阻尼 .01、.1、1.0;径向和角向采用相同耦合矩阵。三人链示例固定 K_{21}=50,令 K_{32}=5、50或500,以隔离中介传递强弱。所有外源驱动 F_i、\tau_i设零,起始速度为零。这些是设定条件,不是从人类互动估计出的效应。(第2—3节)

统计分析与建模

模型没有实证因变量回归、受试者招募、缺失值插补或显著性检验。核心状态方程为(式9—12,省略时间自变量):

\begin{aligned} \frac{\mathrm{d}r_i}{\mathrm{d}t} &= v_i \\ \frac{\mathrm{d}v_i}{\mathrm{d}t} &= -b_r v_i-(r_i-r_i^{*})+\sum_{j\ne i}K^{r}_{ij}(r_j-r_i)+F_i \\ \frac{\mathrm{d}\theta_i}{\mathrm{d}t} &= \omega_i \\ \frac{\mathrm{d}\omega_i}{\mathrm{d}t} &= -b_{\theta}\omega_i-\sin(\theta_i-\theta_i^{*})+\sum_{j\ne i}K^{\theta}_{ij}\sin(\theta_j-\theta_i)+\tau_i \end{aligned}

b 控制阻尼,星号表示偏好吸引点,K_{ij}为 j 对 i 的作用。质量/转动惯量归一为1,不是独立估计的心理“惯性”。耦合非负、静态、不按行归一,因此是无量纲增益而非传播概率;角向用正弦保证周期结构。径向与角向动力学分离是简化假设,重构后的效价与唤醒仍几何耦合。

Python solve_ivp 使用自适应 RK45,通常 \mathrm{rtol}=\mathrm{atol}=10^{-8},示例4—5为10^{-10};输出网格并非内部积分步长(表2)。相位同步 R_{\theta}=\left|\text{平均}\exp(i\theta)\right| 与完整状态离散度 D_z 分开衡量:角度相同不代表强度相同。另以末10%与初10%窗口的离散度比表示收敛,比较跟随者—领导者距离及振荡幅度比(式35—42)。数值稳健性包括收紧容差与 Radau 对照,不能等同样本外预测检验。

特别重要的是,原模拟对径向加速度中的 r 作[0,1]饱和处理,但这不保证积分状态不越界。作者另提 r=\varepsilon+\frac{1-2\varepsilon}{1+\exp(-\rho)} 的有界映射及潜状态方程(式14、18—20),它是替代方案,不能说已用于所有图。负半径无心理意义;正半径超过1则超出标签参照尺度。(第2.2.5、2.3节)

研究结论

主要结论是模型能在指定条件下生成不同集体轨迹,不是某种情绪管理策略已有效。两个不相连的领导群体可各自收敛于不同吸引点;添加领导者联系则可出现跨组跟随与合流(图12—13)。复杂弱连接网络即使提高阻尼仍可能持续分散、振幅增长;加入强影响者的另一配置则较易对齐(图14—15)。所以“阻尼越大群体一定同步”不成立。

次要但关键的结论是可容许性与数值收敛应独立检查:曲线平滑不保证半径合法。作者没有频率响应扫描,不宜称“共振”;没有最大 Lyapunov 指数与初值扰动验证,不宜称“混沌”。这些是模型诊断边界,而不是遗漏的统计显著性。(第2.3.1、4—5节)

讨论

发现的解释

作者讨论:领导关系与弱分散影响可生成不同的情感共调节模式。总结者评议:将吸引点标作“愤怒”只是状态命名,不能从一次轨迹图推出真实领导冲突导致群体升级。

局限

作者讨论:未经验校准,缺少噪声、学习、可塑性和动态连接,二维空间简化真实情感。总结者评议:还须检验参数可识别性、不同模型产生相似轨迹的可能,以及边界约束改变后原结论是否保留。计算准确与心理有效是两条验证链。

研究贡献

理论上把个体内调节与人际传播写成明确假设;方法上提供可比较的方程、矩阵和轨迹诊断;实践贡献目前是设计研究与模拟场景。临床或社交预测须先用重复测量估计参数,再做留出轨迹验证,不能直接应用这些手设参数。

证据定位

第2.1—2.3节,式1—42、表1—2:表征、方程及数值方法;第3节:九个参数场景;图12—15:群体结果;第5节:限制及校准路线。作者代码仓库:https://doi.org/10.5281/zenodo.20742838 。正文引用 S1 Appendix 的求解器稳健性分析。

4. 书评:评 Susan E. Embretson 与 Steven P. Reise《项目反应理论:心理学家与社会科学家的基础》(第二版,2025)

原始标题:Book Review: Review of Item Response Theory: Foundations for Psychologists and Social Scientists (2nd Edition) by Susan E. Embretson and Steven P. Reise (2025)

作者与来源:Brooke E. Magnus;Psychometrika,2026,First View,pp.1—5。
原始来源链接:https://doi.org/10.1017/psy.2026.10142

研究问题与理论背景

这篇书评回答的是:在 IRT 发展25年后,第二版能否仍为心理学与社会科学应用者提供可用的入门体系?Magnus 看重的不只是模型更新,而是“心理测量背后的心理学”:建模要解释构念与反应过程,不能把优化拟合作为最终目的。新版面向有回归与基础概率知识的研究生和研究者,兼顾量尺开发、个体评分和复杂模型。这里没有需由新样本检验的因果假设,论证基础是对教材内容、编排和实例的评价。

研究设计与方法

评论按教材五部分展开:导论、基本 IRT 模型、条目参数估计与人员评分、测验开发应用、高级模型。作者比较第一版与新版的范围变化,讨论章节的易读性、实际数据实例、R 代码和教学用途。这不是系统综述:书评未交代文献检索、纳入排除或评分者程序,也没有新招募样本、干预组和对照组。

教材中 Monte Carlo 模拟、抽象推理数据和反应时间例子只是被评内容,不能算作 Magnus 自己做的研究。书评没有逐一披露这些教材实例的原始样本量、拟合输出或效应区间。(书评导论及 Section I—V 对应段落)

统计分析与建模

以下是被评著作的方法体系,并非本篇书评的估计结果。

第一层是反应模型:二分条目的 Rasch、1PL、2PL、3PL,以及多分类反应模型。教材以反应过程组织后者,尤其说明名义反应模型的类别斜率如何帮助理解类别顺序。模型选择要同时检查信息函数、特质估计、简约性与解释,不只比较拟合数字。(教材第4—5章的评述)

第二层是推断:个体特质评分区分 ML、MAP、EAP;条目参数估计区分边际、条件、联合极大似然。贝叶斯方法与高维 MH-RM 只是有限介绍,不能把教材描述为完整贝叶斯计算手册。维度与局部独立诊断应看违背的实际后果;局部依赖可能提示具有意义的多维结构,“足够单维”是应用判断,不是数学上严格单维已经成立。(第6—8章)

第三层是应用和扩展:DIF 强调迭代、图形和实际影响;CAT 介绍设计权衡;条目信息与类别功能用于量尺开发,反对仅按区分度阈值删题。高级部分包括补偿性多维 IRT、统一框架中的确认模型与 bifactor,以及解释性 LLTM、2PL 约束模型、非补偿性多成分模型、潜类别混合和反应时间联合层级模型。协变量用于解释作答或群体异质性,不能混同于一般回归的控制变量清单。(第10—13章)

书评没有自己的似然优化、缺失值方案、模型比较统计量、稳健性检验或置信区间;这些项目对书评自身不适用。关于教材实际如何处理每个例子的缺失和拟合细节,这篇评论未详细说明。

研究结论

主要评价是新版把软件实现与构念效度贯穿教学,同时保留非方法专家可理解的深度。Magnus 特别认可第8章对模型假设和实际后果的讨论,而不是提供机械拟合切点。她也赞赏反应时间实例坦陈精度收益有限,说明复杂模型不一定改变实质结论;这是书评对教材实例的判断,不是独立量化的实证效果。

次要建议包括补充临床/健康领域的高级模型实例、单极构念测量、更多纵向应用与纵向 DIF,以及在线数据和 R 脚本。总体肯定并不意味着所有章节覆盖充分,也不是对不同 IRT 教材优劣的系统性比较。

讨论

发现的解释

作者讨论:好教材应让读者看到同一数据在不同模型下揭示什么构念信息。总结者评议:最有用的阅读路径是先确定反应过程,再评价参数和评分后果;“拟合最好”与“最适合研究目的”可以不一致。

局限

作者讨论:高级实例偏教育与认知;不会 R 的读者难以完全自学。总结者评议:单篇推荐性书评带有作者选择与教学经验,不能替代逐模型技术验证。教材的临床适用性仍需研究者检验内容覆盖、局部依赖、DIF 和分数解释,不能因教材权威而省略。

研究贡献

理论贡献在于突出构念效度而非参数竞赛;方法贡献是提供模型—估计—诊断—应用的学习地图,而非提出新估计量;实践贡献是课程与选书指导,并提醒删题要防止损失关键内容,复杂模型要报告实质增益。

证据定位

书评正文按五个 Section 组织的连续段落:Section II(教材第4—5章)、Section III(第6—8章)、Section IV(第9—11章)、Section V(第12—13章),以及末尾未来补充与课堂使用段。整篇印刷页范围为1—5。

覆盖清单

  1. CBT 技能任务测量:实证测量开发。
  2. 土耳其语 AI 文本检测效度:冻结基准与历史审计。
  3. 情绪传染动力系统:理论与仿真。
  4. IRT 第二版教材书评:书评,非原创实验。