花卷铺

花卷铺

Quantitative Psychology|2026-09-22 科研日报

5
2026-09-22

1. 用于联合潜在空间模型自适应维度选择的累积有序尖峰—平板先验

原始标题: A Cumulative Ordered Spike-and-Slab Prior for Adaptive Dimension Selection in Joint Latent Space Models
作者与出处: Bin Lv、Yincai Tang、Siliang Zhang;Psychometrika,2026。
原始来源: https://doi.org/10.1017/psy.2026.10134

研究问题与理论背景

同一个人的社会关系与个人属性往往共享潜在结构。联合潜在空间模型将两类资料一起建模,但潜在维数选少了会遗漏结构,选多了又可能解释噪声。逐个维数拟合再比较信息准则或交叉验证,不仅计算昂贵,也把维数选择与参数估计割裂开来。本文提出累积有序尖峰—平板先验(COSS),在一次后验计算中同时估计参数与有效维数。这是方法开发及理论研究,不是检验某种心理干预效果的实验;主要目标是维数恢复、参数恢复与预测表现。

研究设计与方法

模拟研究一设四组“节点数、属性数”组合:50/10、100/20、150/30、300/60,真实维数为 3;属性分别采用高斯与伯努利分布,每个条件重复 100 次。载荷矩阵每行只有一个非零元素,比较联合模型、仅网络模型与仅属性模型。研究二固定 100 个节点、20 个属性,通过节点度数参数改变网络密度,范围为 0.07—0.42,考察网络信息稀少时能否从属性借用信息。

三个实证示例分别是:28 名法国金融精英的网络及 13 个二元属性;经过筛选的 8 个 Facebook 自我中心网络;格拉斯哥青少年研究中三波均在场的 129 名学生,使用首波网络和 34 个混合类型属性。青少年原本的有向提名被合并为无向关系,不是纵向网络分析。Facebook 示例随机遮蔽 5% 的属性,重复 30 次,比较联合模型、网络模型和链式方程多重插补;缺失属性在 Gibbs 迭代中重新插补。该实验是随机遮蔽预测任务,不检验非随机缺失下的有效性。

统计分析与建模

模型假定给定共享潜在位置后,边之间、属性之间以及两种资料来源之间条件独立。网络采用内积而非距离形式,原文式(1)为:

\operatorname{logit}(P_{ii'})=\Theta^A_{ii'}=\alpha_i+\alpha_{i'}+\mathbf z_i^{\mathsf T}\mathbf z_{i'} .\tag{1}

节点截距表示连接倾向,内积表示潜在相似性;属性的自然参数由属性截距、载荷和同一潜在位置构成,允许指数族属性。COSS 对潜在位置每一列设置共同方差,以逐渐增大的尖峰概率收缩后续维度。原文式(6)为:

z_{ih}\mid\theta_h\sim N(0,\theta_h),\qquad \theta_h\mid\pi_h\sim(1-\pi_h)\operatorname{IG}(a_\theta,b_\theta)+\pi_h\delta_{\theta_0}.\tag{6}

尖峰设在很小的正方差,而不是在计算中强制精确零;逆伽马厚尾成分保护较大的信号。尖峰概率通过累积折棒权重构造。Pólya–Gamma 数据增强处理 logistic 似然,Gibbs 抽样交替更新网络、属性和收缩参数,并以递减概率调整截断维数。

模拟初始截断为 8,逆伽马形状和尺度均为 3,后续折棒超参数为 8;联合及网络模型尖峰方差为 0.1,仅属性模型为 0.05。共运行 15,000 次迭代,舍弃前 10,000 次,每隔 5 次保留一次,得到 1,000 个后验样本。用内积矩阵的归一化 Frobenius 误差处理旋转不确定性,以有效维数后验众数作点估计;另比较 AIC、BIC、DIC、WAIC 和五折交叉验证。先验的列排序不等于完全解决旋转可识别性,实证解释仍采用 Geomin 旋转。

研究结论

联合建模总体改善潜在结构恢复,但并非所有参数都严格优于单来源模型。表 1 中高斯属性、50/10 条件的维数正确率为联合模型 0.760、网络模型 0.680;对应潜在结构误差为 0.954 与 1.067。可是属性截距误差分别为联合模型 0.193、仅属性模型 0.188,说明正文“所有指标均占优”的概括过强。

理论结论也要区分层次:定理 1 控制有效维数超过真实维数某个常数倍的后验概率;备注 1 明确没有证明精确选择一致性,排除低估还需要额外最小信号条件。定理 2 的 Hellinger 收缩率是 \epsilon_n=\sqrt{k_0\log k/n},不是有限样本中必然选中真实维数。

表 2 中联合模型在 8 个 Facebook 网络的 AUROC 为 0.866—0.931,均高于两个比较方法;但“两个网络方法均优于 MICE”有例外:Circle 7 的仅网络模型为 0.868,MICE 为 0.874。青少年数据中 COSS 主要选出五维,表 3 的网络 AUROC 为 0.9929,传递性误差为 0.0150;这些是拟合和结构恢复指标,不能证明吸烟行为导致友谊形成。

讨论

发现的解释

作者讨论: 属性信息能缓解稀疏网络的信息不足,累积收缩让复杂度选择融入参数估计。不同资料的结构不完全重合时,联合模型可能需要更多维度。

总结者评议: 三个案例展示的是表示、拟合和预测价值;同质性、同伴影响及未观测共同原因仍不能仅凭横截面潜在图形区分。

局限

作者讨论: 完全共享潜在空间是限制,未来可区分共享与来源特有结构,并扩展到动态网络和删失资料。

总结者评议: 第 3.1 节的 Beta 折棒参数与紧随其后的“大参数使首个权重变小”文字解释存在方向不一致;算法 2 与第 4.2 节对删除列的描述也不完全相同,实施时不能将它们视为无差别规则。第 6.1.1 节将 10,000 次作为舍弃期,却称自适应在第 500 次后启动,这与第 4.2 节“舍弃期后”的表述需要区分。表 1 的 100 次重复中出现正确率 0.001,也有报告精度疑点。以上问题不以重新推导替作者补齐。

研究贡献

作者讨论: COSS 将自适应维数、联合建模、可计算后验与理论保证连接起来。

总结者评议: 方法贡献在于统一推断及维数不确定性,实践贡献在于网络与测量资料的整合;理论保证、有限样本优势和社会机制解释仍是三个不同层次。

证据定位

  • 期刊版原文:第 2—4 节,PDF 第 3—9 页,模型式(1)、(6)及算法 1—2。
  • 第 5 节,PDF 第 9—11 页:定理 1、备注 1、定理 2及收缩率;第 6 节,第 11—14 页、表 1和图 1—3:模拟条件及恢复表现。
  • 第 7 节,PDF 第 15—20 页、表 2—3:样本、随机遮蔽与网络拟合;第 8 节,第 20—21 页:共享空间及可识别性边界。

2. 含相依效应量的元分析中阶梯函数选择模型的估计与推断

原始标题: Estimation and inference for step-function selection models in meta-analyses with dependent effects
作者与出处: James E. Pustejovsky、Martyna Citkowicz、Megha Joshi;Research Synthesis Methods,2026。
原始来源: https://doi.org/10.1017/rsm.2026.10117

研究问题与理论背景

心理与教育元分析常从同一研究提取多个结局,效应量因共享样本而相依;与此同时,显著且方向符合预期的结果更容易公开。仅修正相依性不能消除选择性报告偏倚,仅套用独立效应的选择模型又会低估不确定性。本文研究一个务实方案:用边际阶梯选择模型估计效应分布,在推断阶段用聚类稳健方差或聚类自助法处理相依性。预定比较重点是平均效应的偏差、均方根误差和区间覆盖,而非以新检验证明某份元分析存在发表偏倚。

研究设计与方法

研究包含方法推导、自我损耗元分析再分析及 Monte Carlo 模拟。实证示例从原有 66 项研究、116 个效应中只保留已发表研究,再排除一个大于 2 的离群效应,得到 45 项研究、68 个效应量;14 项研究各提供两个效应,3 项各提供四个效应。效应为标准化均差,正值代表自我控制能力下降。这是方法演示的选择性子集,不是重新进行的完整系统综述。

模拟先从教育干预数据库抽取样本量和每研究效应数,再生成两组多变量正态结局与 Hedges’ g。研究数取 15、30、60、90、120;平均效应为 0、0.2、0.4、0.8;研究间标准差为 0.05—0.45,平均结局相关为 0.40 或 0.80,并变化研究内异质性、研究样本量和选择强度。单变量选择只依赖该结果显著性;多变量选择还让同研究其他显著结果影响其公开概率。完整设计有 7,680 个条件,自助法子设计有 864 个条件,每个条件重复 2,400 次。

统计分析与建模

模型把“产生证据”与“报告证据”分开。原文式(1)的证据生成层为:

(Y^*\mid\sigma^*,\mathbf x^*)\sim N\!\left(\mathbf x^*\boldsymbol\beta,\tau^2+\sigma^{*2}\right).\tag{1}

回归系数描述平均效应,异质性方差描述边际总异质性,不拆成研究间与研究内方差。公开概率与单侧 p 值区间有关;原文式(2)为:

w(p^*;\boldsymbol\lambda)=\sum_{h=0}^{H}\lambda_h I(\alpha_h<p^*\leq\alpha_{h+1}).\tag{2}

首段相对权重固定为 1 才能识别其余权重,不能由此估计绝对发表概率。单阶梯阈值 0.025 对应正向且双侧 0.05 显著;双阶梯再在 0.500 区分负向结果。观测密度是正态密度乘选择权重后再归一化。

作者比较惩罚边际最大似然(PML)与增广重加权高斯似然(ARGL)。前者直接优化带弱先验惩罚的复合似然;后者按估计选择概率的倒数加权高斯估计方程,再借用选择参数方程。惩罚作用于平均效应、对数异质性及对数选择权重,以改善收敛;其尺度针对标准化均差,不能原样推广到相关或对数优势比。推断按研究聚类构造 sandwich 方差;两阶段自助法先重抽研究,再在所抽研究内重抽效应。

比较方法为不修正选择的 CHE-ISCW 和带聚类稳健修正的 PET/PEESE。模拟没有系统性调节变量,虽模型允许元回归,不能把本结果当作调节效应估计已获充分验证。实证自助法重复 1,999 次;模拟为节约计算仅做到 399 次,并据多个重复次数的覆盖率回归外推到 1,999 次。PML 不收敛时以 ARGL 结果替代,因此报告的 PML 性能含这一后备策略。

研究结论

自我损耗示例中,未修正选择的 CHE 平均效应为 0.46,95% 区间为 [0.34, 0.59]。表 1 中单阶梯 PML 为 0.25,两阶段百分位自助区间 [0.05, 0.47];双阶梯 PML 为 0.23,区间 [0.02, 0.49]。PET/PEESE 则为 −0.09,区间 [−0.76, 0.58]。模型依赖明显:偏倚修正既不是统一归零,也不是恢复了唯一真值。

模拟中选择模型在有实质性选择偏倚时通常更有利,PML 的整体均方根误差一般低于 ARGL;后者平均约高 6%。但极强选择、小研究数及高异质性下,PML 与 ARGL 的最大绝对偏差仍达 0.28、0.27。无选择时 CHE-ISCW 更有效率,其平均均方根误差约为 PML 的 82%。

大样本聚类稳健区间即使研究数达到 90,某些条件仍明显低覆盖。两阶段百分位自助区间表现较好,约 30 项研究以上更接近名义覆盖;这不是“达到 30 就保证 95%”的阈值定律。选择权重本身的区间校准仍不理想,不能把该方法未经验证地当作偏倚存在与否的诊断检验。

讨论

发现的解释

作者讨论: 边际模型避免显式计算高维联合选择概率,同时保留显著性驱动选择这一可解释机制;聚类自助法更充分反映相关效应的不确定性。

总结者评议: 贡献不是让多个效应变成独立观测,而是把点估计的工作模型与不确定性校正分开。研究级公开与结局级漏报仍无法由同一组边际参数区分。

局限

作者讨论: 信息性聚类大小、非正态随机效应、其他选择机制和调节变量尚需研究;报告效应更多的研究可能获得更大权重,稳健标准误不能自动修正这种点估计偏倚。

总结者评议: 选择机制与模拟模型仍较接近;方法应与研究领域的报告习惯和其他敏感性分析共同解释。表 2 的自助子设计列出异质性标准差 0.05、0.15、0.45,而第 4.3 节文字却举“排除 0.15”为例,存在表文不一致,不能据此自行改写实际运行条件。

研究贡献

作者讨论: 推荐将 PML 与两阶段聚类自助区间作为相依效应元分析的偏倚评估工具。

总结者评议: 方法上补齐了选择修正与相依推断的连接;实践上提供可实施的比较方案,但不能以单一校正值替代对未公开研究、结局选择和研究质量的实质判断。

证据定位

  • 期刊版原文:第 2 节,PDF 第 5—12 页,式(1)—(17)及自助法定义。
  • 第 3 节,PDF 第 12—13 页、表 1:45 项研究、68 个效应及全部实证区间。
  • 第 4—5 节,PDF 第 14—25 页、表 2、图 3—7:模拟条件、失败估计替代、覆盖率外推和性能比较。
  • 第 6 节,PDF 第 26—29 页:适用条件、信息性聚类大小及选择参数推断限制。

3. 2 型糖尿病生活质量题库:心理测量学评价与计算机化自适应测验模拟

原始标题: Quality of life item banks for type 2 diabetes: psychometric evaluation and computerized adaptive testing simulations
作者与出处: Eva K. Fenwick、Ryan E.K. Man、Aricia X.Y. Ho 等;Quality of Life Research,2026,35:290。
原始来源: https://doi.org/10.1007/s11136-026-04387-6

研究问题与理论背景

固定长度生活质量问卷要求每位患者回答相同项目,即便某些项目对其状况几乎没有信息。DiabCAT 希望以糖尿病特异题库覆盖多方面生活体验,再通过计算机化自适应测验(CAT)降低负担。核心问题是题库能否满足 Rasch 测量要求,以及减少项目后能否维持足够精度。作者预期高精度与中等精度 CAT 得分应分别与参照分数有较高、适度至较高相关;本研究不检验治疗是否改善生活质量。

研究设计与方法

这是新加坡临床横截面校准研究加计算模拟。2023 年 10 月至 2025 年 6 月从医院视网膜及内分泌门诊招募 298 名临床确诊的 2 型糖尿病患者,纳入年龄至少 21 岁者;排除 1 型或妊娠糖尿病、严重影响生活质量的其他疾病、认知损害及无法听清问题的听力损害。平均年龄 60.7 岁,男性占 57.4%,平均病程 15.3 年。样本量依据项目校准稳定性,而非治疗效应功效计算。

初始工具有活动受限、症状、饮食、情绪、担忧、糖尿病管理和工作七个领域,共 256 个项目,采用五级作答,高分表示较好生活质量。题库此前由患者及专业人员的质性资料发展,本研究不是重新进行该阶段访谈。Rasch 修订后,将项目位置与阈值输入 R 的 catR,模拟 1,000 名潜在特质服从标准正态分布的受测者。没有随机分配、干预组或随访。

统计分析与建模

使用 Andrich 单一评分量表模型及联合最大似然校准;“不适用”按结构性缺失处理,不参与项目参数和阈值估计,优化时移除无信息的极端总分。评价不局限于内部一致性:检查类别概率曲线、人员分离及信度、残差主成分、项目拟合、局部依赖、人员—项目匹配、差异项目功能(DIF)、测量范围和测验信息。

项目 infit/outfit 均方的参考范围为 0.5—1.5,残差相关大于 0.2 提示局部依赖,人员与项目均值相差超过 1 logit 提示匹配不足。DIF 用迭代 Rasch–Welch 方法考察年龄、性别、语言、病程、并发症及族群,并做多重比较校正。保留或删除项目还结合临床重要性,不能把所有保留项目理解为严格通过全部统计阈值。

CAT 采用最大似然能力估计与最大 Fisher 信息选题,停止标准分别为标准误 0.30、0.387;另评估精度标准结合最多 10 题的规则。评价平均题数、达到停止标准的比例、偏差、均方根误差及相关,并按特质十分位检查两端表现。仿真生成与估计都使用评分量表模型,因此属于模型一致条件下的性能检验;标准误所对应的信度与实际得分恢复误差不是同一指标。

研究结论

最终保留七个题库、213 个项目:症状 31、饮食 19、情绪 42、担忧 42、管理担忧 28、管理便利性 28、工作 23。活动受限题库因精度及匹配不足被放弃;管理题库因多维性拆成两库。工作题库有一个项目转入饮食库,因此不能把项目总数变化简单解释为逐库删除的和。

表 3 显示,中等精度平均需 8.7—11.2 题,较完整题库减少 48.4%—78.8%;高精度平均需 13.9—18.3 题。节省题数来自模拟,并非患者实际完成时间或真实临床疗效。 高精度下饮食库只有 75.0% 的模拟受测者达到停止标准,情绪库为 97.2%;中等精度相应为 85.7% 和 100%。不同领域不能只用平均题数概括。

高精度相关为 0.76—0.81,未达到预期至少 0.85;中等精度为 0.76—0.79。表 3—4 将相关列标为与“真实 theta”的相关,而方法及讨论又谈 CAT 与完整题库得分相关,两种参照不可直接等同。高精度 RMSE 为 0.77—1.00,也说明小的模型标准误不自动代表同样小的真实恢复误差。题库对较健康、较少受损一端覆盖不足,情绪领域的人员—项目均值差达 3.66 logits。

讨论

发现的解释

作者讨论: 自适应选题可以减少冗余,管理中的担忧与不便利应分开计分;较高功能样本可能导致项目显得过于容易。

总结者评议: “七个领域”的数量虽前后相同,内容结构已经改变,不能宣称初始七维全部得到支持。领域相关低于 0.8 也不等于统计独立。

局限

作者讨论: 马来及印度族群相对较少,最难认可类别少于 5%,阈值可能不稳定;标准正态仿真分布与临床样本不完全匹配,最大似然估计在两端可能不如后验估计稳定。真实场景的信度、效度和反应性仍需评估。

总结者评议: 第 7 页正文称领域相关范围为 0.47—0.71,表 2 却含 0.46 和 0.75;组合停止规则正文写最高标准误属于“MB”,表 4 对应的是饮食 DT。应保留这种报告差异,而不是据正文改动表格。另有作者与拟商业化相关公司的董事或股权关系,应将独立临床复核作为后续重要环节。

研究贡献

作者讨论: DiabCAT 提供多领域、可按需要组合的糖尿病患者报告结局测量。

总结者评议: 方法价值是展示题库校准、项目诊断、结构修订与 CAT 仿真的完整流程;应用边界是尚未完成真实自适应施测的验证,不能仅凭模拟效率取代现有临床量表。

证据定位

  • 期刊版原文:PDF 第 2—4 页 Methods,样本、校准、缺失处理及模拟设定。
  • PDF 第 5—7 页、图 1及表 1—4:题库调整、各领域题数、停止达标率、相关与误差;表文差异均见第 7 页。
  • PDF 第 8—10 页 Discussion、Conclusions、Declarations:真实施测限制、题库靶向及利益关系。

4. 健康心理资本简式问卷:在泰国与美国的心理测量学验证及测量不变性

原始标题: The short-form health psychological capital questionnaire: psychometric validation and measurement invariance across Thailand and the United States
作者与出处: Tanutchapon Charatcharungkiat、Hanjoe Kim、Suppanut Sriutaisuk;BMC Psychology,2026,Article in Press。
原始来源: https://doi.org/10.1186/s40359-026-05636-6

研究问题与理论背景

健康心理资本把希望、自我效能、韧性和乐观置于健康管理情境。一般生活或工作领域的量表,不能未经检验就当作健康测量;结构相似也不自动说明两种语言的分数可直接比较。作者明确提出五组假设:二阶结构拟合良好、跨国测量不变性、与其他心理资本量表高度相关、与幽默感较弱相关,以及与生活质量和健康行为正相关、与负性情感负相关。研究是量表适配和横截面验证,不是心理资本训练实验。

研究设计与方法

两项研究涉及三个分别招募的 18—40 岁在职成人样本。研究一于 2025 年 8 月末至 10 月通过 Wang 招募泰国样本,最终 323 人;美国 Prolific 样本最终 295 人。美国从 336 份完成问卷中剔除重复、注意检查失败和全程相同作答者;泰国有 1,700 人访问,564 人符合资格,350 人完成核心量表,323 人通过注意检查。

研究二于 2025 年 9 月换用 Informata 招募泰国样本,从 372 人访问中按年龄、注意检查及相同作答规则筛至 214 人。三个样本平均年龄分别为 26.8、32.4、29.8 岁,多数没有慢性疾病。不同平台提供招募渠道上的复制,但不等于全国代表性抽样。

H-PCQ-12 含希望 4 题、效能 3 题、韧性 3 题、乐观 2 题,六级作答。泰文版本由既有泰文一般心理资本措辞进行健康领域替换,不是新做的独立回译。研究一泰国样本中,162 人完成两种聚合效度量表,108 人完成其他外部量表,53 人仅完成核心项目;负性情感分析实际为 107 人。研究二全部 214 人接受外部测量,避免把核心量表样本数误当作每项相关的分母。

统计分析与建模

因四个领域有先验理论,采用验证性而非探索性因素分析,比较相关四因子模型与更简约的二阶模型。六级项目近似作为连续变量,Mardia 检验提示非正态,因此使用稳健最大似然 MLR、稳健标准误和缩放检验。比较依靠稳健 CFI、TLI、RMSEA、SRMR,以及 Satorra–Bentler 差异检验、AIC 和 BIC;没有把卡方不显著当作模型为真的证明。

跨国不变性按层次依次约束:构型、一阶载荷、二阶载荷、项目截距,再到一阶因子截距。以 CFI 变化为主要判断,RMSEA、SRMR 为补充;载荷层面 CFI 下降超过 0.010 提示潜在不变性问题,结合其他指标及缩放差异检验解释。信度以 omega 为主、alpha 为辅,两者不是独立复制证据。外部效度主要用 Pearson 相关,并补充潜变量相关;未加入时间结构或随机效应,也未检验健康行为的因果机制。

核心 CFA 基于完成 H-PCQ-12 的样本;外部量表的计划性分组测量需要按各自分母解释,正文未明确给出额外缺失的统一插补或完整信息处理设定。相关检验没有控制人口学协变量,所示关系是同期、未调整关联。

研究结论

表 2 中,二阶模型在泰国研究一的 CFI 为 0.936、RMSEA 为 0.068,在美国为 0.943、0.081,在泰国研究二为 0.995、0.025。美国 RMSEA 略高于预设 0.08 标准,不能写成所有指标均完美达标。

一阶载荷不变性得到支持;增加二阶载荷约束后,缩放卡方差为 14.9、自由度差为 3、p 为 0.002,但 CFI 仅下降 0.006,其他近似变化也较小,作者仍保留二阶载荷不变性。加入项目截距约束后 CFI 下降 0.018,标量不变性不成立。作者未继续检验二阶标量不变性,也没有通过事后释放截距强行实现部分不变性,故不能据此进行跨国潜在均值比较。

总分 omega 分别为 0.86、0.91、0.92,但研究一韧性分量表在泰国和美国仅为 0.58、0.55。总分信度好不代表各分量表均可单独精确使用。泰国研究一与一般心理资本及另一健康心理资本量表相关为 0.69、0.58;与健康行为、生活质量相关为 0.54、0.52,研究二为 0.57、0.66。

负性情感关联较弱:研究一为 −0.01,95% 区间 [−0.20, 0.18];研究二为 −0.16,区间 [−0.29, −0.02]。一项显著、另一项不显著,不意味着两项相关已经存在显著差别,更不能把前者称为等效于零。

讨论

发现的解释

作者讨论: 结构与载荷可比支持在相近人群研究健康心理资源的关联,但截距差异可能涉及文化性自我评价及作答风格。领域替换能保留心理资本理论结构。

总结者评议: 文化解释是待检验假说,招募平台、年龄及教育差异也可能参与其中;本设计不能将截距差异单独归因于“谦逊文化”。

局限

作者讨论: 全部自陈、横截面及在线中青年样本限制推广;没有独立回译和认知访谈。乐观只有两题,omega 与 Spearman–Brown 在此数值等同,内容覆盖和信度解释均有限。研究一幽默量表信度仅 0.56,区分效度证据需复制。

总结者评议: 原量表与健康量表共享题干会抬高聚合关联;弱相关也可能受测量误差影响。MLR 处理非正态不等于已经验证将有序项目连续化的所有影响,亦无证据支持把此工具直接用于个体临床诊断或干预疗效判定。

研究贡献

作者讨论: 形成简短泰文研究测量,并得到独立招募样本的结构复制。

总结者评议: 最重要的方法示范是清楚区分结构拟合、总分信度、载荷不变性和均值可比性;实践意义在于明确允许哪些跨文化问题、暂时不允许哪些分数比较。

证据定位

  • 期刊 Article in Press:PDF 第 4 页假设;第 6—9 页招募、分组施测、MLR、不变性与信度方法。
  • PDF 第 10—14 页、表 2—4:拟合、不变性、信度及研究一相关;第 14—17 页、表 5—6:研究二筛选与结果。
  • PDF 第 17—21 页:负性情感区间、研究间差异解释、语言适配和应用边界。版本为期刊已接受的待编校稿。

5. 贝叶斯累积逻辑斯蒂模型在随机对照试验中的表现评估:一项模拟研究

原始标题: Evaluating the performance of Bayesian cumulative logistic models in randomised controlled trials: a simulation study
作者与出处: Chris J. Selman、Katherine J. Lee、Steven Y. C. Tong、Mark Jones、Robert K. Mahar;BMC Medical Research Methodology,2026,Article in Press。
原始来源: https://doi.org/10.1186/s12874-026-03004-x

研究问题与理论背景

有序结局保留了严重程度或功能等级的信息,但比例优势(PO)模型假定治疗在所有二分切点拥有同一优势比。如果治疗只影响最严重结局,甚至在不同切点方向相反,一个总优势比可能掩盖重要差异。本文比较 PO、非约束及约束部分比例优势(PPO)、各切点分别 logistic 回归的表现。预定问题是不同数据生成条件下的偏差、区间覆盖和均方误差;原始研究的目标不是证明某种抗凝方案优于另一方案。

研究设计与方法

模拟对应两臂、等概率随机分配试验,总样本量设为 250、1,500、4,000、10,000,结局有 3、7、11 个类别。对照组分布由离散化 Beta 分布形成,对称分布参数为 1.8/1.8,偏向高类别的分布为 1.3/0.9。三类情景是:围绕共同对数优势比随机偏离;切点效应按预定线性关系变化;只有最高切点偏离、其他切点没有效应。第一类还包括完全满足 PO 的条件,共同优势比设为 1、1.10、1.50,偏离标准差为 0、0.05、0.10。

每个情景模拟 1,000 次。方法部分报告 216 个情景,讨论却写 162 个,二者不一致;因此不能把两个数字交替视为同一设计总数。案例来自 ASCOT 抗凝领域,只比较低剂量与中剂量低分子肝素,以完整案例分析次要有序结局。补充材料 4 中呼吸困难量表的两组分母为 115、110,WHO 八级量表为 597、607,后者测量随机化后第 28 天状态。结局样本数不同,不能把一个分母套用于所有结果。

统计分析与建模

PO 的共同效应模型见原文式(2):

\log\frac{P(Y\geq k)}{P(Y<k)}=\operatorname{logit}[P(Y\geq k)]=\alpha_k+\beta x.\tag{2}

其中每个切点有自己的截距,治疗指示变量共用同一系数。非约束 PPO 让切点治疗效应分别变化;约束 PPO 只允许按事先给定的线性模式、或最高切点单独偏离。分别 logistic 模型则对每个累计二分结果单独估计。四类方法因约束 PPO 有两种规格,实际比较五个分析方案。更灵活需要更多参数,不能预设“越复杂越稳健”。

所有模型均以贝叶斯 HMC 估计,使用 R、Stan 与 rmsb;类别概率采用 Dirichlet 先验,治疗及非 PO 参数用零中心正态先验。讨论披露治疗效应先验标准差为 100,这在优势比及概率尺度并不意味着温和的先验信息。四条链各 7,500 次,其中每链预热 3,750 次,不抽稀,总计 15,000 个预热后抽样;用有效样本量、收敛指标和发散诊断评估计算。

偏差以对数优势比后验中位数计算,同时考察 OR 尺度相对偏差、95% 可信区间覆盖和对数优势比均方误差。模拟不含协变量调整、分层因素或重复测量随机效应;案例采用完整案例而非缺失数据插补。发生发散的九个情景另做排除相关模拟数据的敏感性分析;合并稀疏类别、收紧先验则属于补充的事后探索,不是主设计中已经预定的修复策略。

研究结论

当 PO 真成立时,PO 模型最有效率。随机偏离围绕共同效应对称变化时,跨模拟重复平均偏差也可能很小,但这可能是正负条件偏差互相抵消,不能说明任意一项真实试验的切点效应都估得准确;偏离增大时区间覆盖仍会下降。

线性切点效应情景中,正确设定的线性约束 PPO、非约束 PPO 与分别 logistic 回归的相对偏差通常小于 2%,而 PO 或错误约束会产生偏差。只有最高切点偏离的情景中,匹配机制的约束 PPO 相对偏差小于 1%;较多类别、较大效应时,PO 在最高切点的覆盖可接近零,相对的正确约束 PPO、非约束 PPO 和分别 logistic 的覆盖范围为 93.8%—96.0%(结果部分第 9—11 页)。这些是模拟性能,不是治疗效应量。

ASCOT 示例揭示另一问题:WHO 量表某些类别在一组为零或仅一两人,非约束 PPO 出现不稳定切点估计和发散。增加迭代不能凭空增加稀疏类别的信息。多个可信区间跨零,不能据此判定两种剂量等效,也不能由区间相互重叠就证明 PO 必然成立。

讨论

发现的解释

作者讨论: 首先应确定需要整体优势比还是临床切点优势比,再选择模型。正确约束可提高效率,错误约束则可能把不同位置的效果强行平均。

总结者评议: 这也是估计目标错配问题:一个汇总 OR 可能有自身解释,但不能自动替代每个切点的效果。统计精度与临床可解释性必须同时考虑。

局限

作者讨论: 尚未考察更多非 PO 形态及协变量调整,研究限制于贝叶斯实现;宽正态先验在稀疏类别中可能引发不稳定,收紧非 PO 参数又会把模型拉回 PO。合并类别改变结局定义,最好事先规定。

总结者评议: Article in Press 还存在报告问题:第 7 页线性情景的参数文字与其随后展示的生成式不一致,第 17 页情景总数也与方法不符,不能擅自替换成推测公式。补充表 1 的呼吸困难等级标为 0—4,主文则以 1—5 描述同一五级结局,应用时必须明确编码与 OR 方向。先验敏感性和类别合并得到的结果也不能作为新的预设假设检验。

研究贡献

作者讨论: 为有序结局试验提供 PO、PPO 与分别 logistic 的直接性能比较和分析规划建议。

总结者评议: 方法贡献在于展示约束错配、稀疏类别及后验计算的共同影响;实践上支持预先写清切点、效应方向和替代模型,而不是在显著性结果出现后再挑选分析方式。

证据定位

  • 期刊 Article in Press:PDF 第 4—7 页,模型式(1)—(4)、三类生成机制、样本量及 HMC 设置。
  • PDF 第 8—11 页、图 2—4:偏差、覆盖、均方误差与发散敏感性分析;第 12—14 页、图 5—6:ASCOT 结局及稀疏性。
  • 补充材料 4:第 1 页表 1—2,逐结局样本数、等级编码及稀疏类别。
  • PDF 第 15—17 页 Discussion:跨模拟平均偏差的解释、先验尺度、预先规划及研究范围。版本为期刊已接受的待编校稿。