多模态◆ AI 生成 · 已溯源
无插补式 Transformer 学习实现跨异构临床队列的阿尔茨海默病稳健预测与校准不确定性量化

结论前置 / TL;DR
NITROGEN 是一种无需数据插补的 Transformer 模型,通过掩码注意力与跨样本注意力联合建模患者内特征依赖与患者间关系结构,在 ADNI、OASIS-3 和 AIBL 三大真实世界临床队列上实现了阿尔茨海默病诊断分类与认知评分预测的稳健性能及良好不确定性校准,显著优于传统插补+树模型方法。
核心问题:临床数据缺失与异质性阻碍阿尔茨海默病建模可靠性
- 真实世界临床数据普遍存在缺失(incompleteness)与异质性(heterogeneity),导致疾病建模不可靠、临床评估效能受限;
- 传统插补策略(如均值/多重插补)会引入系统性偏差、扭曲特征间关系,并产生过度自信(overconfident)预测——在诊断场景中尤为危险。
方法创新:NITROGEN 实现端到端无插补多模态学习
- 提出 NITROGEN:首个专为部分观测临床记录设计的 imputation-free transformer 架构;
- 关键机制:
- Masked attention:建模单个患者内部多模态特征(如 MRI、CSF、认知量表)间的动态依赖;
- Intersample attention:显式建模跨患者关系结构(如相似病程或生物标志物模式),缓解队列异质性影响;
- 直接以原始缺失格式输入(non-imputed, partially observed records),避免预处理污染。
实证验证:跨三队列泛化性与不确定性校准优势
- 训练数据:ADNI 队列(N=7858 次扫描);
- 独立测试:OASIS-3(N=2675)与 AIBL(N=1286);
- 任务覆盖:
- 诊断分类(CN/MCI/AD);
- 连续认知评分预测(如 MMSE、CDR-SB);
- 关键结果:
- 在 discriminative performance(AUC、MAE)上与最优树集成方法(如 XGBoost+插补)相当;
- 在 uncertainty quantification 上显著领先:预测置信区间覆盖率(coverage probability)更接近理论值,分位数损失(quantile loss)更低,ECE(Expected Calibration Error)下降达 37–52%;
- 跨队列迁移鲁棒性强,未出现性能断崖式下降。
意义与定位
- 为临床 AI 提供新范式:摆脱对脆弱插补步骤的依赖,提升模型可信度与可解释性;
- 技术路径属 multimodal learning 与 uncertainty-aware deep learning 交叉方向;
- 论文发布于 arXiv:2607.11656v2(replace-cross 版本),属前沿方法学研究。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.11656