Skip to main content
QUICK REVIEW

[论文解读] Distribution Calibration for Out-of-Domain Detection with Bayesian Approximation

Yanan Wu, Zhiyuan Zeng|arXiv (Cornell University)|Sep 14, 2022
Software Engineering Research被引用 9
一句话总结

本文提出一种基于蒙特卡洛丢弃的贝叶斯OOD检测框架,用于校准基于Softmax模型的分布不确定性,显著降低模型对域外样本的过度自信。通过在推理阶段多次前向传播并取平均,该方法在仅增加0.41%推理时间的前提下,将OOD F1提升33.33%,有效使域外输入的预测趋于均匀分布。

ABSTRACT

Out-of-Domain (OOD) detection is a key component in a task-oriented dialog system, which aims to identify whether a query falls outside the predefined supported intent set. Previous softmax-based detection algorithms are proved to be overconfident for OOD samples. In this paper, we analyze overconfident OOD comes from distribution uncertainty due to the mismatch between the training and test distributions, which makes the model can't confidently make predictions thus probably causing abnormal softmax scores. We propose a Bayesian OOD detection framework to calibrate distribution uncertainty using Monte-Carlo Dropout. Our method is flexible and easily pluggable into existing softmax-based baselines and gains 33.33\% OOD F1 improvements with increasing only 0.41\% inference time compared to MSP. Further analyses show the effectiveness of Bayesian learning for OOD detection.

研究动机与目标

  • 为解决基于Softmax的OOD检测中模型对域外样本产生过度自信的问题,尽管缺乏先验知识。
  • 分析过度自信的根本原因,即由于训练-测试分布不匹配导致的分布不确定性。
  • 开发一种灵活、可插拔的贝叶斯框架,实现不确定性校准,无需增加参数或重新训练。
  • 通过实证验证蒙特卡洛丢弃在提升OOD检测性能方面的有效性,同时保持较低的推理开销。
  • 证明通过多次随机前向传播的预测平均,可使OOD预测更加均匀、可靠。

提出的方法

  • 在标注的IND数据上使用标准训练方法(含丢弃)训练一个域内意图分类器。
  • 在推理阶段,以固定丢弃率(例如0.7)执行多次随机前向传播(蒙特卡洛丢弃),以采样不同的模型输出。
  • 对多次前向传播得到的归一化logits取平均,获得校准后的预测分布。
  • 将平均后的输出分布作为最终预测,由于不确定性校准,该分布对OOD输入趋于均匀。
  • 将贝叶斯近似无缝集成到现有的基于Softmax的OOD检测器(如MSP或熵)中,无需修改网络结构。
  • 使用预测分布与均匀分布之间的KL散度,定量评估校准质量。

实验结果

研究问题

  • RQ1为何基于Softmax的OOD检测方法会对域外样本产生过度自信的预测?
  • RQ2由不同随机种子引起的模型变异性所导致的分布不确定性,在多大程度上导致了OOD检测中的过度自信?
  • RQ3蒙特卡洛丢弃能否有效校准分布不确定性并提升OOD检测性能?
  • RQ4蒙特卡洛采样次数与丢弃率如何影响校准精度与推理成本之间的权衡?
  • RQ5该贝叶斯近似方法是否优于或至少匹配当前最先进的基于距离的OOD检测方法(如LOF和GDA)?

主要发现

  • 与MSP相比,所提出的贝叶斯OOD检测方法在使用10次蒙特卡洛采样时,OOD F1提升33.33%,推理时间仅增加0.41%。
  • 随着采样次数增加,OOD样本的预测分布与均匀分布之间的KL散度显著降低(从3.63降至2.59),证实了有效的校准。
  • 0.7的丢弃率相比更低的丢弃率表现更优,因其通过更强的特征扰动增强了OOD预测的均匀性。
  • 采样100次可在性能与效率之间取得良好平衡,超过1000次后收益递减。
  • 该方法有效减少了IND与OOD置信度得分分布的重叠,尤其在基于熵的指标中,提升了可分性。
  • OOD输入的平均输出分布趋于均匀,而IND预测保持一致且自信,验证了该方法的校准目标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。