[论文解读] $k$Folden: $k$-Fold Ensemble for Out-Of-Distribution Detection
本文提出 $k$ Folden,一种用于自然语言处理(NLP)中分布外(OOD)检测的 k 折集成框架,该方法在训练过程中通过内部机制模拟 OOD 检测,无需外部数据。通过训练 k 个子模型,每个子模型在 k 个标签中的一个被掩码为未知标签,并对未见标签使用 KL 散度优化为均匀分布,该方法通过概率平均实现自然的 OOD 检测,在基准数据集上实现了最先进性能,同时保持了域内分类的准确性。
Out-of-Distribution (OOD) detection is an important problem in natural language processing (NLP). In this work, we propose a simple yet effective framework $k$Folden, which mimics the behaviors of OOD detection during training without the use of any external data. For a task with $k$ training labels, $k$Folden induces $k$ sub-models, each of which is trained on a subset with $k-1$ categories with the left category masked unknown to the sub-model. Exposing an unknown label to the sub-model during training, the model is encouraged to learn to equally attribute the probability to the seen $k-1$ labels for the unknown label, enabling this framework to simultaneously resolve in- and out-distribution examples in a natural way via OOD simulations. Taking text classification as an archetype, we develop benchmarks for OOD detection using existing text classification datasets. By conducting comprehensive comparisons and analyses on the developed benchmarks, we demonstrate the superiority of $k$Folden against current methods in terms of improving OOD detection performances while maintaining improved in-domain classification accuracy. The code and datasets can be found at: \url{https://github.com/ShannonAI/kfolden-ood-detection}.
研究动机与目标
- 开发一种不依赖外部数据的 NLP 分布外(OOD)检测方法。
- 通过在模型训练过程中模拟检测行为,解决文本分类中的 OOD 检测挑战。
- 利用广泛使用的文本分类数据集,构建包含语义和非语义分布偏移的 OOD 示例的综合性 OOD 检测评估基准。
- 评估 $k$ Folden 相较于现有 OOD 检测方法的有效性,并证明其在 OOD 检测和域内分类性能方面的优越性。
提出的方法
- 该框架训练 k 个子模型,每个子模型在 k-1 个域内标签上进行训练,其中一个标签被掩码为未知。
- 每个子模型采用双重损失进行训练:对可见的 k-1 个标签使用交叉熵损失,对掩码的(未知)标签使用 KL 散度损失以逼近均匀分布。
- 在推理阶段,最终预测通过平均所有 k 个子模型的概率分布获得。
- KL 散度损失促使子模型在遇到未知输入时将概率均匀分配到所有标签上,从而模拟 OOD 检测行为。
- 该方法兼容多种主干模型(如 CNN、LSTM、BERT、RoBERTa),并可与后处理方法(如马氏距离或温度缩放)结合使用。
- 该框架通过生成近似均匀的输出分布自然区分 OOD 输入,而域内输入则将概率集中在单一类别上。
实验结果
研究问题
- RQ1是否可以在不依赖外部数据或预先收集的 OOD 样本的情况下,有效实现 NLP 中的 OOD 检测?
- RQ2在训练过程中模拟 OOD 检测行为,如何提升模型的泛化能力和检测性能?
- RQ3该 $k$ Folden 框架在提升 OOD 检测能力的同时,是否能保持或提升域内分类的准确性?
- RQ4该框架在真实世界文本分类基准上,对不同类型 OOD 偏移(语义偏移 vs. 非语义偏移)的表现如何?
- RQ5$k$ Folden 是否能与现有后处理 OOD 检测技术有效结合,进一步提升性能?
主要发现
- $k$ Folden 在 OOD 检测基准上实现了最先进性能,优于 ODIN、马氏距离和基于 dropout 的强基线方法。
- 在 Reuters-2K-8L OOD 测试集上,$k$ Folden RoBERTa 与马氏距离结合后,AUPR 达到 97.91,错误率为 56.06%,优于 RoBERTa 单独使用时的表现(AUPR:97.35,错误率:58.14%)。
- $k$ Folden 与马氏距离的组合在所有数据集上均取得最高性能,表明二者具有显著互补性。
- 随着未见类别的数量增加,错误率上升,但 $k$ Folden 在所有配置中均保持最低错误率,显示出对高 OOD 类别比例的鲁棒性。
- 该方法在语义偏移(SS)数据集上的性能提升大于非语义偏移(NSS)数据集,表明其在分布偏移下具有更强的泛化能力。
- 该框架同时提升了 OOD 检测和域内分类的准确性,证明在训练过程中模拟 OOD 行为可增强模型整体可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。