花卷铺

花卷铺

Quantitative Psychology|2026-09-21 科研日报

5
2026-09-21

1. 可穿戴设备时间序列的缺失数据插补

原始标题: Missing data imputation for wearable time series
原始来源: https://doi.org/10.1038/s41598-026-71659-z

研究问题与理论背景

可穿戴设备能够连续记录心率等高频生理信号,但设备充电、佩戴中断、传感器接触不良与连接故障会形成缺口。关键难点不只是“如何补一个空值”,而是观测信号和缺失过程本身都可能有不同时间尺度的周期结构:心率受昼夜节律与周内生活模式影响,缺失则可能随睡眠、工作日程或充电周期重复。常规线性插值、末次观测前移或只利用局部邻域的方法通常没有显式刻画这些周期;ARIMA 等模型能处理部分时间依赖,却不一定能同时处理多个重叠周期及非随机缺失模式。

作者提出周期性多尺度插补框架 PMSI,预设目标是同时学习观测值与缺失掩码中的周期,把一维序列沿候选周期折叠为多维张量,再用核加权完成插补。核心假设是:当数据生成过程具有稳定而重复的周期依赖时,与缺失时点处于相似“周期位置”的观测值比单纯时间相邻值更有信息。研究同时检验 PMSI 是否优于五种基准方法,并通过周期强弱分层与消融分析探索性能来自何处。

研究设计与方法

数据来自以色列 PerMed 前瞻性观察研究。原项目在 2020 年 11 月至 2023 年 5 月招募 4,795 名成年参与者,统一配发 Garmin Vivosmart 4。本文使用 2022 年 5—7 月的心率记录;原始测量约每 15 秒一次,先聚合为小时均值。每位入选者随机贡献一个月序列,每条包含 672 个小时点。

作者按佩戴依从性建立两个分析队列。高依从队列有 558 条 participant-month 序列,其中 60 条无缺失,其余 498 条存在间断缺口,平均缺失率 1.2%;低依从队列有 1,957 条序列,其中 60 条完整,其余 1,897 条缺失较多,平均缺失率 6.5%。超参数在队列层面选择,即同一队列共享周期配置与核带宽,而不是为每位参与者单独拟合。

算法分两轮运行。第一轮把缺失与否编码为二元掩码,通过傅里叶变换等方法识别候选周期,将掩码按周期折叠,并用核估计时点缺失概率;拟合后的缺失机制用于产生具有现实周期结构的合成掩码。第二轮对观测值重复周期识别、张量折叠和核加权,并在合成掩码遮蔽的位置上选择参数,最后用于真实缺口。作者把 PMSI 与 KNN、ARIMA、卷积神经网络、分段线性插值和末次观测前移比较,还按 168 小时自相关强度分五组检验周期假设的敏感性,并在低依从队列进行三项消融:随机掩码、仅小时邻域的一维核、强制加入小时—日—周三维周期。

统计分析与建模

候选模型以赤池信息准则权衡拟合与复杂度,其一般形式为 \mathrm{AIC}=2k-2\log L。缺失掩码是二元变量,优化采用 Bernoulli/二项似然;心率为近似对称的连续变量,采用 Gaussian 似然。每个周期配置先在内部优化各维核带宽,再在不同维数之间选择 AIC 最小者,因此“识别到周周期”不等于最终模型一定保留周维度。高依从队列的缺失机制选择小时与日二维配置,AIC 为 22;观测值也选择小时与日配置,AIC 为 33。低依从队列的缺失机制选择小时与周配置,AIC 为 21;观测值选择小时与日配置,AIC 为 175。

性能指标为均方根误差 RMSE 与平均绝对误差 MAE。所有方法在同一组人工留出值上评估;人工缺失不是简单独立随机删除,而是从经验缺失掩码池抽取完整掩码后施加到有观测的数据上。误差区间用 10,000 次、以 participant-month 为单位的 bootstrap 计算;方法间用配对 t 检验,并以 Holm–Bonferroni 校正多重比较。可调基准方法的参数使用与最终留出值分离的数据选择,降低直接对测试缺口调参的风险。

这一设计仍有边界。AIC 在本文主要承担惩罚似然式的参数和维数选择,不能证明候选周期具有因果含义;队列级参数也默认不同个体共享足够相似的周期结构。配对检验显示平均误差差异,但误差单位是被遮蔽心率点,不等价于下游诊断、预测或临床决策效用。

研究结论

频谱分析显示,高依从队列的缺失过程以 24 小时为主、84 小时为次;观测心率以 24 小时和 168 小时周期突出。低依从队列的缺失过程则以 168 小时和 84 小时峰值最强,作者将 3.5 天模式解释为可能与设备充电有关;观测值仍以日与周周期为主。

PMSI 在两队列均取得最低误差。高依从队列中,PMSI 的 RMSE 为 7.53,五种基准为 8.18—10.01;MAE 为 6.04,基准为 6.60—8.16,所有校正后比较均为 p<0.001。低依从队列中,PMSI 的 RMSE 为 8.81,基准为 9.02—15.86,校正后均为 p<0.05;MAE 为 6.60,基准为 6.96—12.44,校正后均为 p<0.001。

但与最强基准 KNN 相比,低依从队列的增益较温和:MAE 从 6.96 降至 6.60 bpm,绝对差 0.36 bpm、相对约 5.2%;RMSE 从 9.02 降至 8.81 bpm,相对约 2.4%。消融结果支持三项组件的作用:随机掩码使 RMSE 从基准消融设置的 8.72 升至 11.22;仅小时邻域的一维核为 10.65;强制三维周期虽把 RMSE略降至 8.61,却提高 AIC,说明额外周期可能带来复杂度而只有有限边际收益。

讨论

发现的解释

作者讨论: PMSI 的优势不仅是平均误差较低,还在于把插补结果连接到可解释的日、周与充电周期。先学习缺失过程、再生成合成掩码,使调参场景更接近真实佩戴行为,而不是假定缺失完全随机。AIC 选择二维而非三维模型也表明,周模式可能已被日周期之间的交互部分吸收。

总结者评议: 结果支持“周期感知插补”在规则性较强的单变量可穿戴序列中有价值,但不应把较小的点预测误差优势直接表述为更准确的疾病识别。尤其低依从场景下,相对 KNN 的增益有限;是否值得采用,还需结合计算成本、部署复杂度以及下游参数偏差评估。

局限

作者明确指出,PMSI 依赖稳定周期,对突发心律失常、临时摘表、急诊操作或结构突变等非重复事件可能发生有偏重建;研究也未覆盖更极端的长时间不佩戴或高度稀疏监测。比较对象未包含更复杂、可能更强的深度生成式插补模型。本文仅验证单变量小时心率,能否推广到多变量、不同采样频率与不同人群尚待检验。进一步看,平均缺失率 1.2% 和 6.5% 仍低于许多真实世界低依从数据,队列共享参数也可能掩盖个体节律差异。

研究贡献

理论上,研究把“观测过程”和“缺失过程”都视为有时间结构的对象,强调缺失模式本身可能携带行为信息。方法上,它提供了一个较轻量、可解释的多尺度核框架,并用经验掩码、bootstrap、校正检验、周期分层及消融分析建立较完整的比较链。实践上,PMSI 可作为可穿戴密集纵向数据的候选预处理方法,但其适用条件是存在可重复周期,且应用者应另行验证对目标统计量和实际决策的影响。

证据定位

  • 原文 DOI 与出版页:https://doi.org/10.1038/s41598-026-71659-z。
  • 数据来源、队列构造、672 个小时点与缺失率:Article in Press PDF 第 7—8 页,“Experiment—Dataset”。
  • 算法三阶段、缺失掩码与观测值的双层 AIC 优化:第 3—7 页,“Modeling framework”,图 1 与公式(1)—(6)。
  • 基准、bootstrap、配对检验、Holm–Bonferroni、周期分层与消融:第 8—9 页,“Benchmark comparison”。
  • 周期与最优配置:第 9—11 页,图 2、表 1;误差比较:第 11—12 页,表 2。
  • 适用边界与作者解释:第 12—14 页,“Discussion”与“Conclusion”。

2. 印度尼西亚大学生社交媒体疲劳量表与社交媒体用户社交焦虑量表的心理测量学验证

原始标题: Psychometric Validation of the Social Media Fatigue Scale and Social Anxiety Scale for Social Media Users Among Indonesian University Students
原始来源: https://doi.org/10.2147/PRBM.S632681

研究问题与理论背景

社交媒体疲劳指使用者面对信息、互动与情绪要求时产生的认知、行为和情绪耗竭;社交媒体情境中的社交焦虑则更强调被评价、隐私、互动和自我呈现方面的担忧。研究以压力与应对的交易模型为背景:同样的线上环境要求,经由个体对威胁和应对资源的评估,可能形成相关但不同的心理反应。既有 SMFS 与 SAS-SMU 已有多语种版本,但东南亚集体主义文化中的社交媒体用途、群体关系与标签互动可能改变项目含义,因此不能直接假定原结构和项目功能不变。

研究预设检验两个量表既有因素结构、内部一致性、聚合效度、区分效度与并行效度,并考察性别及健康相关/非健康相关学科之间的配置、载荷和截距不变性。研究缺口不只是缺少印尼语翻译,而是缺少在同一样本中同时检验两种相关构念、项目层面异常和跨组可比性的系统证据。

研究设计与方法

研究采用横断面在线调查和便利抽样。纳入条件为正在印度尼西亚大学就读、能够阅读理解印尼语、过去一周至少使用一个社交媒体平台。问卷于 2026 年 2—3 月通过学术和学生沟通网络发放。最初招募 1,034 人,因回答不完整排除 22 人,完整案例分析样本为 1,012 人;平均年龄 19.12 岁,标准差 0.87,女性 843 人,占 83.3%。健康相关专业 551 人,非健康相关专业 461 人。

两量表经双人正向翻译、第三人回译和专家组文化语言审查;另以 30 人进行可理解性预测试,但没有开展认知访谈。SMFS 原含 15 题、三个维度,各题 1—7 分;SAS-SMU 含 21 题、四个维度,各题 1—5 分。研究还记录年龄、性别和专业类别。SMFS 第 13 题的校正项目—总分相关仅为 0.056,低于作者采用的 0.30 标准,因此在主要因素分析前删除,最终验证的是 14 题印尼语 SMFS,而非原始 15 题形式。

统计分析与建模

作者先以 Cronbach’s \alpha 与 McDonald’s \omega 评估内部一致性。由于两量表已有理论和既有结构,选择验证性因素分析而非探索性因素分析。单题偏度和峰度在作者阈值内,但 Mardia 多变量正态性检验对两量表均为 p<0.001,因此 CFA 使用带稳健标准误的最大似然估计 MLR。作者把 CFI、TLI 大于 0.90 视为可接受,把 RMSEA 小于 0.08、SRMR 小于 0.06 视为良好。

聚合效度用平均方差提取 AVE 与组合信度 CR,阈值分别为 0.50 与 0.70;区分效度用 HTMT,阈值 0.85;两构念的并行关系用 Pearson 相关。跨性别和跨学科多组 CFA 依次检验配置不变、度量不变和标量不变。作者同时参考卡方差异与近似拟合变化,并以 \Delta CFI、\Delta RMSEA 和 \Delta SRMR 的变化阈值判断实质性不变性。分析采用完整案例,没有对 22 个不完整回答进行多重插补;软件为 JASP 0.96.0 与 SPSS 29.0,显著性水平 0.05。

这种建模策略的优点是覆盖结构、信度、聚合/区分效度和跨组可比性;但删除项目后直接在同一数据中评价修订模型,带有数据驱动修模成分,若无独立样本交叉验证,拟合可能偏乐观。此外,Likert 项目使用 MLR 而非有序分类估计量是否最合适,原文没有提供估计量敏感性比较。

研究结论

删除第 13 题后,SMFS 三因子模型达到可接受拟合:CFI 0.929、TLI 0.913、RMSEA 0.056、SRMR 0.047,14 题载荷为 0.494—0.819。三个分量表 AVE 为 0.444—0.470,均略低于 0.50;CR 为 0.762—0.811,HTMT 为 0.495—0.641。因此,SMFS 的区分效度和组合信度较好,但聚合效度只能称“可接受而非最佳”,不能把 CR 达标解释为 AVE 问题消失。

SAS-SMU 四因子模型的 CFI 0.920、TLI 0.908、RMSEA 0.068、SRMR 0.049;21 题载荷为 0.628—0.934,AVE 为 0.533—0.752,CR 为 0.837—0.921,HTMT 为 0.423—0.763。两量表总分和分量表之间呈弱到中等正相关,r=0.175—0.414,均为 p<0.001,支持疲劳与焦虑有关但并非同一构念。

性别组的 SMFS 配置、度量和标量不变性均获支持。跨学科比较时,SMFS 从配置模型到度量模型的卡方差异检验为 p=0.020,按该检验会质疑度量不变性;但近似拟合指数变化仍在作者阈值内,作者据此认为可接受,并进一步支持标量不变。SAS-SMU 在性别与学科组均支持三级不变性;部分嵌套卡方比较显著,但近似拟合变化很小。这里应准确表述为“在作者采用的综合准则下获得支持”,而不是所有判据毫无冲突。

讨论

发现的解释

作者讨论: 第 13 题涉及“被他人 @ 或标签时感到焦虑”。作者认为,在强调群体联系的印尼语境中,被标签可能更常被理解为社会接纳和日常互动,而非焦虑诱因,因而与其所属疲劳维度关联很弱。两量表的弱至中等相关符合交易模型:线上要求可能同时诱发耗竭和被评价焦虑,但二者代表不同应对结果。

总结者评议: 项目删除说明跨文化适配不能停留在总量表 \alpha;项目内容、因素载荷和群体等值都需要检查。不过,文化解释来自事后讨论,研究没有认知访谈,不能确定低相关究竟由文化语义、翻译措辞、项目归属还是样本特征造成。

局限

样本为便利抽样且女性占 83.3%,跨性别不变性并不能消除代表性不足。横断面、自陈和同一问卷情境可能产生共同方法偏差,也不能推断疲劳与焦虑的方向或因果。研究没有纳入问题性社交媒体使用、错失恐惧、睡眠或客观使用日志等外部标准,因此效标关联效度仍不完整。完整案例分析默认缺失排除不会系统改变样本;项目删除和模型评估使用同一批数据,缺少独立验证。学科只被粗分为两组,也未检验年龄、地区、平台类型或使用强度的不变性。

研究贡献

理论上,研究区分社交媒体疲劳与社交焦虑这两个相关构念,并给出东南亚文化情境中的项目功能证据。方法上,它展示了从翻译、预测试、项目分析、稳健 CFA、\alpha/\omega、AVE/CR/HTMT 到多组不变性的较完整流程,同时暴露了“总体拟合可接受但局部聚合效度不足”和“不变性判据不完全一致”这类真实问题。实践上,14 题印尼语 SMFS 与 21 题 SAS-SMU 可用于后续研究,但跨人群均值比较应遵循本文限定,且 SMFS 第 13 题删除后的版本需要独立复制。

证据定位

  • 原文 DOI 与出版页:https://doi.org/10.2147/PRBM.S632681。
  • 招募、纳排、翻译与预测试:全文 “Methods—Participants and Procedure”“Instrument Translation Procedure”。
  • 量表结构、项目 13、信度与统计阈值:“Measures”及“Statistical Analysis”。
  • 样本构成:表 1;CFA 拟合:表 2;载荷、CR、AVE:表 3;相关与 HTMT:表 4;不变性:表 5。
  • 第 13 题文化解释及 AVE 的谨慎解释:“Discussion”;抽样、自陈、横断面与外部效标不足:“Strengths and Limitations”。

3. Cogniclear 的初步验证:以蒙特利尔认知评估为效标的老年人虚拟现实认知筛查工具研究

原始标题: Preliminary validation of Cogniclear: a virtual reality cognitive screening tool for older adults against the Montreal Cognitive Assessment
原始来源: https://doi.org/10.1038/s41598-026-72261-z

研究问题与理论背景

传统 MoCA 等纸笔筛查简便且标准化,但主要给出总分和粗粒度领域分数,难以持续记录操作顺序、犹豫、纠错和导航策略。虚拟现实可把认知任务置于目标导向的交互环境,并自动记录过程数据;问题在于,VR 表现可能同时受认知、年龄、手部运动、界面可用性、主观负荷和技术经验影响。

研究提出四项预设假设:MoCA 越高,Cogniclear 表现越好;两系统对应认知领域正相关;控制年龄、VR 经验、工作负荷与可用性后,MoCA 仍解释总体表现;工作负荷和可用性不在认知状态之外独立解释表现。研究缺口是:既有 VR 认知工具虽强调生态情境与行为日志,但较少同时检验与成熟筛查量表的对应关系及交互因素的混杂。

研究设计与方法

研究筛查 42 名 55—80 岁老年人,排除 2 名有癫痫史者,40 人入组;1 人未完成 MoCA,1 人中止 VR,最终分析 38 人,其中女性 20 人、男性 18 人。样本一半来自长期照护机构、一半来自社区;MoCA 为 16—30 分,既往 VR 经验者 16 人、无经验者 22 人。9 人坐轮椅完成任务;一名风湿性疾病参与者存在影响控制器操作的手部活动限制。

同一天先由心理学家实施标准 MoCA,再由不知道 MoCA 结果的另一研究者实施 VR,以形成评估者盲法,但顺序固定且无人接受中间休息。Cogniclear 使用 Meta Quest 3 和双手控制器,任务可坐姿完成。系统含 14 个任务、8 个表现领域:抽象推理、注意、灵活性、命名与语言、记忆、运动技能、时间定向和视空间。任务不是 MoCA 题目的数字复制,而是将相似构念转化为物体操作、空间探索和序列行动。每项只实施一次,任务阶段有 40—80 秒阈值,超时会跳过剩余阶段。

会话约 45—60 分钟。主要效标是系统按任务得分、效率和准确度形成的 Composite Score,再按任务最优动作数加权聚合为领域分数,八个领域等权平均为 Global Score。另记录 Success Rate、总时长、动作数和 Global Efficiency。交互后以九题 VRSUQ 评估可用性,以 NASA–TLX 六维均值评估 0—100 的工作负荷。

统计分析与建模

因样本小且若干变量非正态,相关分析主要采用 Spearman 等级相关;两组比较用 Mann–Whitney U,多组教育水平比较用 Kruskal–Wallis。异常值先由 IQR 与标准分数筛查,再结合系统日志和观察记录判断是否与运动或交互困难有关。主要分析保留全部观察,另排除两名明确交互困难者做敏感性分析,因此排除后的结果只能作为补充,不能替代全样本估计。

作者以简单线性回归检验 MoCA 与 Global Score,再建立多元模型控制年龄、既往 VR 经验,进一步加入 NASA–TLX 与 VRSUQ,并另做加入长期照护身份的敏感性模型。诊断包括残差、方差膨胀因子、杠杆值和 Cook 距离;由于残差偏离正态且存在影响点,回归推断采用 HC3 异方差稳健标准误。四组探索性分析分别使用 Benjamini–Hochberg 程序控制假发现率。

这套分析把相关、组间差异、回归和个案日志连接起来,适合初步效度研究;但五个预测变量对应仅 38 个样本,模型自由度紧张。Global Score 又包含效率成分,可能把运动和控制器熟练度混入认知结果。研究没有报告临床诊断金标准、ROC、敏感度或特异度,因此检验的是收敛关联,不是诊断准确性。

研究结论

MoCA 与 Global Score、Success Rate 呈中到强正相关,与任务时长呈显著负相关;与 Global Efficiency 没有显著关系。六个概念对应领域在全样本均显著相关,Spearman 系数为:注意 0.63、记忆 0.61、视空间 0.58、时间定向 0.55、命名与语言 0.52、抽象 0.49,BH 校正后仍显著。排除两个交互困难个案后,各领域相关均提高,但这是敏感性结果。

简单回归中,MoCA 每增加 1 分,Global Score 平均增加 2.01 分,模型解释 44.6% 的表现方差。控制年龄和 VR 经验后,模型解释 62.2%;MoCA 回归系数为 1.69,HC3 稳健标准误 0.49,年龄系数为 -0.74、稳健标准误 0.26,VR 经验系数 2.67、p=0.536。加入负荷和可用性的完整模型解释 63.0%;MoCA 系数 1.72、稳健标准误 0.64,年龄仍为 -0.74,VR 经验、NASA–TLX 和 VRSUQ 均未独立显著。VIF 为 1.04—1.86,但残差非正态且有潜在影响点,作者将多元结果定为探索性。

两个个案说明非认知限制的重要性:一名 MoCA 27 分但手部风湿影响操作者的 Global Score 为 56、Global Efficiency 为 38,动作数 169;另一名 75 岁、MoCA 28 分但持续需要交互指导者的 Global Score 为 52、成功率 43%、时长 39 分钟、动作数 142。可用性与若干表现指标有双变量相关,却在多元模型中不再独立;NASA–TLX 平均 41.70,且未显示与表现的系统关联。

讨论

发现的解释

作者讨论: 全球和领域层面的中到强关联表明,沉浸式任务虽不同于纸笔题目,仍捕捉了与 MoCA 重叠的认知功能。MoCA 在控制年龄和用户体验变量后仍有关联,支持 Cogniclear 的初步收敛效度。VR 的潜在附加价值是记录动作序列、纠错、导航与反应过程,而非仅生成第二个总分。

总结者评议: “与 MoCA 相关”只能说明共同变异,不能证明 VR 更生态、更敏感或可以替代临床筛查。年龄在多元模型中独立相关,也可能同时代表认知老化、运动速度、视觉和数字经验。两个高 MoCA 低 VR 表现个案尤其提示,若不把运动和交互能力单独建模,个体层面的低分可能被误判为认知受损。

局限

样本仅 38 人,全部为老年人,且社区与长期照护来源可能伴随未控制差异。MoCA 是筛查工具而非完整神经心理测验,研究未建立诊断准确性。固定为 MoCA 在前、VR 在后,无法区分顺序与疲劳效应。上肢功能未系统测量;领域映射由开发团队基于概念相似性预设,没有独立内容效度研究。任务各实施一次,未检验重测信度、学习效应和纵向敏感性。作者之一隶属工具开发公司,应用解释应结合潜在利益关系。所谓生态效度是设计动机,本文没有直接用现实生活功能指标验证。

研究贡献

理论上,研究把 VR 认知表现分解为目标构念和交互负担的共同产物,避免把沉浸感自动等同于效度。方法上,它结合评估者盲法、自动日志、非参数相关、BH 校正、HC3 稳健回归和基于日志的异常个案敏感性分析。实践上,Cogniclear 展示了坐姿、轮椅可完成的行为丰富型筛查路径,但目前应定位为 MoCA 的补充研究工具;进入临床前仍需更大样本、诊断金标准、可访问性测量、重测信度和阈值性能验证。

证据定位

  • 原文 DOI 与出版页:https://doi.org/10.1038/s41598-026-72261-z。
  • 假设 H1—H4:Article in Press PDF 第 2 页,“Introduction”。
  • 样本、纳排、MoCA 范围、轮椅与手部限制:第 5 页,“Materials and methods—Participants”,表 1。
  • 14 个任务、8 个领域、设备、固定顺序与评估者盲法:第 6—9 页,图 1—4。
  • 指标构成与统计方案:第 10—12 页,公式(1)—(6)及“Statistical analysis”。
  • 主要相关、异常个案和领域相关:第 13—15 页,表 2—3、图 6。
  • 回归系数、解释率与 HC3 推断:第 16—17 页,表 6—7。
  • 解释与限制:第 17—20 页,“Discussion”“Limitations and future work”。