Skip to main content
QUICK REVIEW

[论文解读] Mitigating Uncertainty in Document Classification

Xuchao Zhang, Fanglan Chen|arXiv (Cornell University)|Jul 17, 2019
Anomaly Detection Techniques and Applications参考文献 34被引用 5
一句话总结

本文提出了一种深度神经网络模型,结合了dropout-熵不确定性估计与度量学习,以在有限人工专家审查不确定预测时提升文档分类的准确性。通过在学习到的特征空间聚类中减少预测方差,该方法在20NewsGroup数据集上,当30%最不确定的预测由人工审查时,将宏平均F1从0.78提升至0.92。

ABSTRACT

The uncertainty measurement of classifiers' predictions is especially important in applications such as medical diagnoses that need to ensure limited human resources can focus on the most uncertain predictions returned by machine learning models. However, few existing uncertainty models attempt to improve overall prediction accuracy where human resources are involved in the text classification task. In this paper, we propose a novel neural-network-based model that applies a new dropout-entropy method for uncertainty measurement. We also design a metric learning method on feature representations, which can boost the performance of dropout-based uncertainty methods with smaller prediction variance in accurate prediction trials. Extensive experiments on real-world data sets demonstrate that our method can achieve a considerable improvement in overall prediction accuracy compared to existing approaches. In particular, our model improved the accuracy from 0.78 to 0.92 when 30\% of the most uncertain predictions were handed over to human experts in "20NewsGroup" data.

研究动机与目标

  • 解决在仅有限人工专家可审查不确定预测时,提升文本分类整体预测准确性的挑战。
  • 开发一种可靠的不确定性估计方法,优先将最不确定的预测提交人工审查,而非仅关注不确定性量化。
  • 通过度量学习学习更优的特征表示,以增强模型预测的鲁棒性与置信度。
  • 克服现有方法在处理离散文本数据或依赖基于梯度的对抗训练方面的局限性。
  • 通过将不确定性感知的深度学习与人工参与的工作流相结合,实现可扩展且准确的文档分类。

提出的方法

  • 提出一种新颖的dropout-熵方法,利用dropout的贝叶斯近似特性,通过多次带有dropout的前向传播的熵来估计模型不确定性。
  • 在特征表示空间中应用度量学习,以最小化类内距离并最大化类间距离,从而减少预测方差。
  • 在dropout推理过程中引入去噪掩码操作,以稳定不确定性估计并提高可靠性。
  • 将不确定性估计与端到端训练相结合,使不确定性感知的损失优化可在反向传播中实现。
  • 采用基于边距的度量学习目标与交叉熵损失联合训练模型,以提升泛化能力与不确定性校准效果。
  • 使用t-SNE可视化定性验证度量学习显著增强了嵌入空间中的类间分离度。

实验结果

研究问题

  • RQ1在人工专家仅审查最不确定预测的子集时,采用dropout-熵不确定性估计的深度学习模型能否提升整体分类准确性?
  • RQ2在特征表示上应用度量学习如何影响文本分类中不确定性估计的方差与置信度?
  • RQ3当仅小部分预测由人工审查时,所提出的方法是否在F1分数上优于现有不确定性估计技术?
  • RQ4性能对超参数(如度量边距和词嵌入初始化)的敏感性如何?
  • RQ5预训练词嵌入(如GloVe)在多大程度上提升了不确定性与度量学习组件的有效性?

主要发现

  • 在20NewsGroup数据集上,当30%最不确定的预测由人工审查时,所提出的DE+Metric方法将宏平均F1从0.78提升至0.92。
  • 与基线Dropout方法相比,在30%不确定性比例下,该方法在微平均F1上提升了5%(从0.851提升至0.892)。
  • 度量学习在所有不确定性比例下均持续提升性能,且在多分类设置中取得最大增益。
  • 模型性能对度量边距值在10以内保持鲁棒,仅当边距超过10时性能开始下降。
  • 与随机初始化相比,基于GloVe的词嵌入在20%不确定性比例下使F1分数提升了0.29,而随机初始化仅提升0.04。
  • t-SNE可视化证实,度量学习显著增加了特征空间中的类间距离,降低了准确预测的不确定性方差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。