Quantitative Psychology|2026-09-20 科研日报
1. 利用个体参与者数据的两阶段元分析预测个体化治疗效应的一般框架
原始标题: A general framework for using two-stage meta-analysis with individual participant data to predict individualized treatment effects
原始来源: BMC Medical Research Methodology
研究问题与理论背景
个体参与者数据元分析不仅要回答治疗平均是否有效,也希望预测具有不同基线特征的人能获得多少收益。多试验数据无法集中存放时,可先在各试验内部建模,再汇总结果;困难在于机器学习没有可直接对应的回归系数,惩罚回归的不确定性也不能简单套用普通回归标准误。作者提出以参数或个体效应预测为汇总对象的通用框架,考察算法表现如何依赖样本量、效应修饰和异质性。这是统计方法及模拟比较,而非预设某种算法必然胜出的临床试验。
研究设计与方法
每种情境重复100次,每次生成10个训练试验,另生成3个各1000人的测试试验。训练试验规模从50—200或300—600的均匀分布抽取;每人有8个基线协变量,连续、二分类各4个。情境改变线性或复杂交互、效应修饰幅度、部分系数是否为零,以及研究间治疗效应方差,后者取0.2或0.5。结果针对连续结局,真实个体效应由数据生成机制给定,没有真实患者招募或临床随访。
设计报告存在不一致: 正文和附录仍称16种情境,但表3—5及附录情境表实际编号至24;后者还包括不平衡分配和无关协变量。正文将不平衡分配描述为治疗概率67%,附录开头却写治疗三分之一、对照三分之二,部分生成步骤又统一写0.5。因此不能把全部情境概括为同一个随机分配比例,也不能依据旧编号解释新表。
第一阶段包括普通最小二乘、LASSO、岭回归、因果森林、XGBoost、贝叶斯线性模型及贝叶斯LASSO,并以XGBoost构造X-learner和R-learner。测试集与训练集共享生成机制,能够直接比较真实效应与预测效应,但不等于完成真实人群的外部验证。
统计分析与建模
原式(1)为:
个体嵌套于试验,协变量主效应描述预后,治疗交互描述效应修饰;治疗及交互系数共同决定预测收益。这里LASSO和岭回归仅惩罚交互项,前者允许筛选,后者连续收缩。因果森林直接预测效应;X-learner先分别拟合两组结局、填补反事实效应,再学习两组效应函数;R-learner交叉拟合结局、按已知随机化概率残差化治疗,用残差构造损失,而不是把观察性混杂校正机械套入RCT。
第二阶段有四类路径:OLS系数及协方差进入多变量元分析;通用模型的个体预测按辅助OLS方差倒数加权;或自助重抽样估计预测方差后加权;贝叶斯模型则进行多变量参数元分析或按个体效应后验方差加权汇总。多变量随机效应模型区分研究内抽样协方差和研究间异质性。辅助OLS方差只是复杂模型预测不确定性的代理,预测加权也不自动等于显式估计了异质性的随机效应模型。
附录2—4提供弱信息正态先验、残差标准差均匀先验及贝叶斯LASSO层级收缩。附录7规定第一阶段10折调参,XGBoost比较树深2—6、三档学习率和三档树数,共45种组合;贝叶斯计算为两条链,每条2000个后验样本。自助样本中的LASSO和岭回归改用5折,XGBoost沿用原训练集超参数,重抽样并未同等重做所有调参步骤。
评价量是中位绝对误差、平均偏差和真实效应对预测效应回归的决定系数;文中MAE不是常见的平均绝对误差。未报告临床效应检验、个体预测区间覆盖率或缺失数据情境的系统评价;这些与预测准确度是不同问题。
研究结论
表4情境19中,XGBoost加辅助OLS权重的MAE为1.07,OLS多变量元分析为1.86;决定系数分别为0.75、0.49,但平均偏差为−0.30、−0.06。误差降低不代表系统偏差也降低。线性交互的情境6中,OLS的MAE为0.46,XGBoost相应为0.75。
表5情境15中,X-learner加自助权重的MAE为1.06,低于OLS的1.85及普通XGBoost加自助权重的1.74;情境21中,R-learner加辅助OLS权重的决定系数为0.95,OLS和普通XGBoost均为0.89。不过,同一情境的因果森林MAE为2.31,高于OLS的1.86,不能概括成所有复杂算法都获胜。回归的频率学派和贝叶斯实现总体相近,收缩收益有限。
表文错位: 第13页把1.86对1.83归入情境3,而现行表4这对数值属于情境17;把1.07对1.86归入情境13,表中实际属于情境19。正文还称情境2所有机器学习MAE大于1.24,但表4的XGBoost加辅助OLS权重为1.10。上述结论按具体表格和算法解释,不将错位编号当成可重复的条件定义。
讨论
发现的解释
作者讨论: 模型优劣取决于未知的数据机制,应通过内部验证选择;灵活模型体现偏差—方差取舍。总结者评议: 汇总预测绕开了各试验保留不同变量的问题,却不自动解决跨人群外推和个体反事实不可同时观测的问题。
局限
作者讨论: 情境与算法有限,自助法计算昂贵;二分类、生存结局和网络元分析是后续扩展。将仅有平均效应的研究纳入时,还依赖平均效应近似个体效应的强假设。总结者评议: 情境数量、分配概率和结果编号不一致,影响复现;100次重复也需结合蒙特卡洛不确定性,不能仅按细小数值差排名。
研究贡献
理论上连接个体化收益与证据综合;方法上兼容参数合并、预测加权、后验汇总及元学习;实践上适合数据分散的试验合作。其贡献是提供可比较的分析路径,不是证明某一模型已经能准确指导真实个体治疗。
证据定位
- 期刊Article in Press及论文PDF:第3—10页Methods、原式(1)及表2;第10—12页模拟设计、表3;第14—15页表4;第20—21页表5;第19、21—23页Discussion与Conclusion。
- 补充材料:附录1为生成机制,附录2—4为先验,附录5—6为元学习算法,附录7为调参与MCMC。情境与分配比例的冲突见附录1和正文第11—13页。
2. RobinCar工具家族:用于随机临床试验稳健协变量调整的R工具
原始标题: The RobinCar Family: R tools for robust covariate adjustment in randomized clinical trials
原始来源: BMC Medical Research Methodology
研究问题与理论背景
随机化并不意味着应放弃基线预测信息,也不意味着任意结局回归的标准误都有效。作者关注怎样在不改变目标治疗效应、不过度依赖模型正确性的前提下,通过协变量调整提高精度,并让方差计算符合实际随机化设计。文章是软件与方法介绍,不是新药试验,也没有新的被试实验假设。
RobinCar侧重方法扩展,RobinCar2提供精简、经过软件工程验证的核心实现。其三项原则是围绕估计目标、依赖较弱假设、使用合适的方差估计。符合监管指南的设计取向不等于软件输出天然获得监管认可,渐近效率保证也不等于任何有限样本都能提高精度。
研究设计与方法
软件覆盖连续、离散和时间至事件结局,涉及简单随机、偏倚硬币、分层置换区组及部分最小化随机化情境,支持范围须按具体估计量区分。论文用ACTG 175既有HIV试验数据演示:原试验有四臂,按既往抗逆转录病毒用药时长分层,示例选齐多夫定单用与联合去羟肌苷两组。
协变量包括既往非齐多夫定治疗、血友病、基线体重及随机分层变量。结局涉及第20周CD4变化、二分类指标及CD4下降、AIDS相关事件或死亡的复合时间结局。案例章节未明确列出每项分析的有效样本量和缺失处理流程,不能把原试验总招募人数当成软件案例样本。本文没有重新招募患者或实施新的干预、对照与随访。
统计分析与建模
首先估计各治疗下的边际结局均值,再构造均值差、风险差、风险比或优势比。第6页原式(2)的增强逆概率加权估计为:
第一项将工作模型预测平均到全体样本,第二项用该治疗组的残差校正。这是模型辅助估计,不把回归方程当成真实生成机制。规范链接广义线性模型满足文中条件时,残差项为零,形式上等同G-computation;非规范链接或其他工作模型不能随意省略校正。治疗对比的协方差及不确定性通过相应影响函数和delta方法计算。
ANHECOVA允许治疗与协变量交互;机器学习工作模型使用交叉拟合,避免一个人的结局参与训练自身预测。历史数据生成的预后分数可作“超级协变量”,前提是基于治疗前信息事先生成。线性校准以各治疗的结局预测作为新协变量,联合校准再加入随机化分层变量,以争取渐近效率及不同随机化设计下的通用性。论文同时明确,保证效率的这些较新方法尚不推荐作为主要监管分析。
点估计稳健不等于任意稳健标准误都适用。 表3区分残差方差分解、直接残差方差估计,以及仅使用相关治疗臂协变量分布的实现。RobinCar2的Eicker–Huber–White选项限于简单随机、无治疗交互的线性模型及相应差值目标;协变量自适应分配可能带来额外设计项,不能照搬独立分组方差。
本文还加入稳健Mantel–Haenszel风险差分析:在相应条件下可针对平均治疗效应,在稀疏分层下仍有适用性,但极端效应修饰会改变可解释的目标;当前介绍限于两组、分类协变量与简单随机及相应分层简单随机,不能扩展为已支持分层置换区组的所有情境。
生存部分区分边际log-rank零假设、分层零假设及条件Cox零假设。稳健Cox检验不等于错设模型的系数仍能解释为条件风险比;边际风险比估计仍要求边际比例风险及相应删失条件。表4—5专门列出这些边界。本文没有把纵向混合模型作为所有案例的统一结构,也未提供上述软件方法新的系统缺失数据敏感性分析。
研究结论
主要成果是统一接口与适用条件,而非协变量调整本身产生的临床收益。图3生存示例输出调整后的对数危险比−0.68785,标准误0.12237,检验概率为 1.9\times10^{-8};调整log-rank统计量为−5.7444。危险比的对数与二分类风险比的对数是不同量。
图3二分类示例输出对数风险比1.31339,标准误0.20904,两组边际均值0.0493622、0.1835664。不能把1.31339直接称为风险比。案例文字将该输出解释为CD4下降风险降低,但图示方向需要明确结局编码才能解释,不能仅凭“联合治疗”推断正负方向。第15页又称展示分层调整log-rank,而图中输出只标调整log-rank,随机化分层变量作为协变量并不等同于使用分层基准风险。
讨论
发现的解释
作者论述: 精度改善依赖协变量的预后信息,而非必须存在基线不平衡;估计目标和随机化方案应先于模型选择。总结者评议: 这比“多加协变量提高显著性”更根本:治疗交互、边际目标与设计适配方差共同决定区间和检验的意义。
局限
作者说明的条件: 有限样本不保证效率收益,工作模型错设可能损失效率,生存估计仍依赖比例风险与删失假设。总结者评议: 案例有效样本及缺失流程未披露,部分图文解释不一致;心理、教育中的整群随机不能仅因同属RCT而直接套用个体随机方差。
研究贡献
方法贡献是整合边际估计、设计适配方差、校准、分层风险差与现代预测模型;实践贡献是降低可靠协变量调整的实现门槛。理论依据来自其整合的统计文献,便利的软件接口不替代事先规定估计目标、检查适用条件和实施敏感性分析。
证据定位
- 期刊Article in Press及论文PDF:第3—5页Implementation与软件原则;第6页式(1)—(2);第7—9页表3及校准;第9—10页Mantel–Haenszel分析。
- 第10—13页生存方法、表4—5;第13—15页Case study、表6和图3,数值均来自图3;第16页Data availability指向speff2trial数据。图3的输出标签与第15页案例文字共同构成上述解释限制。
3. PROMIS®药物依从性量表在接受口服抗癌药物处方的多发性骨髓瘤患者中的心理测量学评价
原始标题: Psychometric evaluation of the PROMIS® Medication Adherence Scale among patients prescribed oral anticancer medication for multiple myeloma
原始来源: Journal of Patient-Reported Outcomes
研究问题与理论背景
口服抗癌治疗依赖患者在日常生活中执行处方。自陈依从性工具既要能稳定描述用药信念和行为,也应与外部行为指标有合理联系。研究考察PROMIS药物依从性量表(PMAS)的信度、维度结构、构念效度及与电子监测的关系,填补其在多发性骨髓瘤维持治疗人群中的验证缺口。年龄、认知、症状和抑郁的关联方向来自既有理论,但作者在Data availability明确说明研究和分析计划没有预注册。
研究设计与方法
这是六个月观察研究的二次分析,2021年4月至2023年3月在美国宾夕法尼亚州西南部一个综合癌症中心的四个门诊收集资料。纳入18岁以上、获口服抗癌维持治疗处方、能用英语完成问卷并具备同意能力者。接触125人,11人不符合条件,28人拒绝;正文报告84人同意,基线前退出3人。上述招募数字并非完全相加吻合。
心理测量分析总体列为74人,电子事件监测关联子样本67人;后者排除非一、二线来那度胺或泊马度胺用药及缺乏监测数据者。平均年龄63.8岁,男性59.5%。PMAS在入组后三个月T1及六个月T2测量;总量表9题,分为4题“药物信念和知识”(MBK)及5题“服药行为”(MTB),总分9—45,行为题和整体依从性单题回忆过去7天。
MEMS瓶盖连续记录开闭,以推定服药事件;日记、病历和现场笔记用于识别医嘱停药、旅行或非服药开瓶等偏差。指标为处方剂量服用百分比、正确服药天数百分比,分别计算两段90天、全部180天及问卷前7天。开瓶并不直接证明吞服。表2的T1为72人、T2为74人且两题各缺1例,而补充表S2标73人,不能把所有分析视为同一个完整样本。
统计分析与建模
内部一致性用Cronbach系数及95%区间,并以McDonald系数考察加权分数;偏态与天花板效应促使作者采用Spearman相关评价跨时点一致性、构念关联及电子监测关联。这不是协变量调整后的因果模型,也不是测量间可互换性的检验。
各时点分别对总分和两个分量表做CFA。因样本较小,采用经验信息先验的贝叶斯估计:补充表S1给出Gibbs采样、最大似然起始值、4条链,每链25000次,前12500次作为预热,间隔10抽样;先验来自随机20%子样本。MBK载荷先验记为 N(0.8,0.2),MTB第6、7题为 N(0.05,0.25),其他为 N(0.3,0.2),残差先验为 IG(4,3)。表格未说明正态分布第二参数的统一参数化约定,不将其擅定为标准差或方差。
以CFI、RMSEA及90%区间和BIC报告拟合,但不同条目集合的总量表与分量表BIC不宜直接当作同一数据上的竞争模型比较。两时点分别拟合也不构成纵向测量不变性检验。论文未给出完整收敛诊断、先验敏感性或独立样本验证;从同一小样本提取先验信息是否影响后验精度,也需进一步分析。
统计方法称双侧检验,表7却注明按预期方向单侧检验,未报告全体相关的多重比较调整。缺失电子监测者被排除,量表按开发者规范计分;没有足够说明证明通过插补或失访加权消除了选择偏差。未设置治疗组随机效应,也没有纵向潜变量变化模型。
研究结论
表4总量表T1为 \alpha=0.82,95%区间0.74—0.87,摘要下限写0.75;T2为 \alpha=0.84,区间0.78—0.89。表5中MBK两时点为0.98、0.96,而MTB为0.59、0.73;因此“总分内部一致性好”不能掩盖行为分量表在T1的较低信度。
表6总分T2的CFI为0.412、RMSEA为0.465,不能概括为优良拟合。MBK的T2点估计CFI为1、RMSEA为0,但RMSEA的90%区间上限0.214,作者也担心过拟合;T1的MBK虽CFI为0.975,RMSEA却为0.245。摘要所谓“两因素获得支持”应结合这些实质性的结构问题理解。
表7中T2总分与年龄、认知功能的秩相关为0.300、0.294,与症状严重程度、抑郁为−0.239、−0.291。表8中T2总分与第二段90天剂量依从性的相关为0.41,与180天剂量依从性为0.28;对齐7天回忆窗时未发现显著相关。总体电子监测的剂量、天数依从性中位数为88.1%、86.6%。这些关联不证明PMAS可替代电子监测,不显著也不是两者完全无关或等效。
讨论
发现的解释
作者讨论: MBK更像反映潜在信念的反映性指标,MTB可能更像构成依从性的形成性行为集合,行为间不必高度相关;两种工具测量不同侧面。总结者评议: 这一解释提出了重要构念问题,但不能在CFA拟合不佳后就认定形成性模型已经得到验证。
局限
作者讨论: 小样本、缺失监测数据、天花板效应、单一癌种和自陈偏差限制推广。总结者评议: 经验先验、条目集合不同的BIC比较、单/双侧说明冲突与分析人数差异进一步限制证据强度。讨论把44.14称总体均值,而结果实际用该数描述“随后下降”亚组,表3总体T1为43.30,二者不能混用。
研究贡献
理论上区分信念与服药行为;方法上联合潜变量结构、内部一致性与连续电子监测;实践上支持多模态依从性评估的必要性。其贡献是观察性测量证据,并非证明使用量表能改善服药或延长生存。
证据定位
- 期刊Article in Press及论文PDF:第3页招募与图1;第4—6页测量、MEMS和统计方法;第7—10页表1—6;第12页表7—8;第13—15页讨论与结论;第16页未预注册说明。
- 补充材料:表S1为贝叶斯设定,表S2为条目分布。样本、区间、均值和检验方向的差异分别见正文第3、8、9、12—13页及这些补充表。
4. 精神病临床高风险青年中PANSS自闭症严重程度评分(PAUSS)的心理测量学特性:它真的测量自闭特征吗?
原始标题: Psychometric properties of the PANSS autism severity score (PAUSS) in young peoples at clinical high risk for psychosis: does it really measure autistic features?
原始来源: European Archives of Psychiatry and Clinical Neuroscience
研究问题与理论背景
PAUSS从PANSS的8个项目导出,本用于快速描述精神病人群中的自闭样特征。然而精神病前驱期的阴性、紊乱和社交症状与自闭特征重叠,分数一致并不意味着测到稳定的自闭构念。研究首次专门考察临床高风险人群中的内部一致性、与自闭症谱系商数(AQ)的关联、因子结构及两年变化。作者明确将其定位为探索性研究,未提出事前假设。
研究设计与方法
意大利帕尔马PARMS早期干预服务于2016—2022年招募214名求助青年,110名男性,平均年龄19.25岁、标准差3.76。纳入条件为16—25岁、符合CAARMS临床高风险类别;排除既往明显精神病发作、既往抗精神病药暴露、伴精神症状的躯体疾病及已知智力障碍。研究为单服务点纵向观察,没有随机干预或独立健康、自闭症对照组。
基线及一年、两年时进行PANSS和AQ评估。AQ是50题自陈筛查工具,并非自闭症诊断金标准;PAUSS由临床访谈评分导出。因缺少本群体的临床截点,作者用样本中位数18.5划分较高PAUSS组,并以AQ大于25界定较高自闭特征。该相对分组不等于确诊。
一年仍有189人、两年129人,共85人脱离服务。原文称“无缺失数据”,同时明确报告上述失访,实际配对分析采用随访可用者;不能据此认为214人全部完成两年随访。作者没有将治疗期间的自然变化与治疗效果随机分离。
统计分析与建模
内部一致性用Cronbach系数、项目—总分相关和删题后系数评价;作者以0.400作为项目相关参考线,但不是仅凭阈值决定删题。聚合效度采用Spearman相关,分类一致性采用Cohen系数。项目相关比较使用Bonferroni校正,表2脚注称按8次比较调整,而表中另列总分相关,校正家族的具体范围需谨慎理解。
纵向得分变化用Wilcoxon符号秩检验,稳定性用跨时点秩相关和同一阈值的分类一致性;这些分别检验位置变化、排序与分类,不是可互换指标。没有报告时间随机斜率、协变量调整的纵向混合模型或失访加权分析。两年观察间隔内真实症状可能改变,因此低相关不能直接等于短期重测信度差。
探索性因子分析使用多分相关矩阵、主轴提取与Promax斜交旋转,按特征值大于1保留因子,没有平行分析;载荷参考线为0.450。KMO为0.615,仅属边缘充分性。作者还以VIF和残差相关检查多重共线性与局部依赖。ROC分析预测的是AQ大于25,而非独立临床诊断,并用Youden指标探索最佳截点;同一数据选点与评估可能过于乐观。
研究结论
表1显示整体 \alpha=0.849,95%区间0.814—0.870;G5和G15的项目—总分相关分别为0.152、0.384,删除后系数升至0.864、0.856。作者在讨论中强调,增幅小,不能据此直接推荐删题。
表2的PAUSS与AQ总分相关为 \rho=0.168,95%区间−0.004—0.331,所列检验概率0.057;两种二分类的一致性为 \kappa=0.022,95%区间0.002—0.043。它们提示弱关联与近乎无分类一致性,但不显著不证明完全无关,AQ本身也不是完美效标。
表3的PAUSS中位数从18.5降至13和12,基线对一年、两年的秩相关分别为0.744、0.572;分类一致性为0.592、0.421。ROC曲线下面积为0.602,95%区间0.490—0.711;探索性最佳截点大于33不具备独立临床验证。表4提取两个因子,解释49.709%和13.630%的方差,但第二因子主要由G5单独构成,不能称为稳健的双因素量表。
报告细节: 表3两年相关区间的上限印为“690”,不能默默补成0.690再作为准确区间引用。表2的比较次数说明也不宜自动扩展为全部分析统一校正。作者结论提及PAUSS与PANSS阴性及紊乱维度高度相关,但项目重叠会影响这种关联的独立解释;作者也明确指出,这些结果未直接证明PAUSS测量的就是精神病症状。
讨论
发现的解释
作者讨论: PAUSS可能受到状态性的精神病理严重度影响,也可能存在自闭测量被共病症状污染,而不一定完全不含自闭相关信息。总结者评议: 最有力的结论是“不能将该分数视为纯净、稳定、已验证的自闭特征指标”,而不是已经证明它只测精神病症状。
局限
作者讨论: AQ不是金标准,未实施独立自闭诊断,没有短期稳定性资料,样本中位数截点依赖本样本,单中心及选择性失访限制推广。总结者评议: 0.744略低于作者的0.750判据,并不意味着一年相关本身很低;其区间跨越判据,更需要连续地解释精度。单项目“因子”及缺少平行分析也不能独立确认删去G5后量表已单维。
研究贡献
理论上揭示共病环境下构念重叠的重要性;方法上将信度、因子结构、效标、分类和纵向稳定性分开检验;临床上提醒PAUSS不能替代专业判断和适当的自闭诊断工具。此结论针对精神病临床高风险青年,不应不加条件地否定所有其他人群中的用途。