效率优化◆ AI 生成 · 已溯源
用于可解释分布外检测的稀疏自编码器(Sparse Autoencoders)

结论前置 / TL;DR
该论文提出基于稀疏自编码器(SAEs)从神经网络中间层激活中学习可解释稀疏特征,并利用测试样本与训练分布类均值之间的余弦相似度构建新型OOD得分,在标准分布外检测基准上达到SOTA性能,同时提供关于分布偏移如何影响表征的可解释洞察。
核心方法:稀疏自编码器驱动的可解释OOD检测
该工作聚焦于神经网络中间层激活所蕴含的层次化信息,而非仅依赖最终输出层——这是多数现有OOD检测方法的局限。作者在中间层激活上训练稀疏自编码器(SAEs),使其学习出高稀疏性、语义可解释的特征基底。
ID/OOD分离机制与新型OOD得分
- 实验发现:in-distribution(ID)与out-of-distribution(OOD)样本显著激活互斥的稀疏特征子集;
- 提出新OOD得分:计算测试样本的稀疏特征激活向量与各ID类别平均激活向量的余弦相似度,取其最大值的补(即1 − max_cosine)作为OOD置信度;
- 该得分完全后处理(post-hoc),无需修改原始模型结构或重训练主干网络。
性能与可解释性双重验证
- 在CIFAR-10/100、SVHN等标准OOD基准(如LSUN、iNaturalist、Textures)上,该方法超越现有SOTA方法(包括ODIN、Mahalanobis、Energy Score等);
- 通过可视化特定稀疏特征的激活模式,可定位OOD样本触发的异常神经元组合,从而解释‘为何被判定为OOD’;
- 论文代码与实验配置已开源,arXiv编号为 arXiv:2607.12094v1。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.12094