Skip to main content
QUICK REVIEW

[论文解读] Uncertainty in Structured Prediction.

Andrey Malinin, Mark Gales|arXiv (Cornell University)|Feb 18, 2020
Topic Modeling参考文献 27被引用 7
一句话总结

本文提出了一种统一的、基于概率集成的框架,用于结构化预测中的不确定性估计,实现了机器翻译和语音识别等序列到序列任务中的粒度级别和序列级别不确定性量化。该框架引入了可解释的不确定性度量,并在 WMT14/17 和 LibriSpeech 数据集上建立了检测错误和分布外输入的强基线。

ABSTRACT

Uncertainty estimation is important for ensuring safety and robustness of AI systems. While most research in the area has focused on un-structured prediction tasks, limited work has investigated general uncertainty estimation approaches for structured prediction. Thus, this work aims to investigate uncertainty estimation for structured prediction tasks within a single unified and interpretable probabilistic ensemble-based framework. We consider: uncertainty estimation for sequence data at the token-level and complete sequence-level; interpretations for, and applications of, various measures of uncertainty; and discuss both the theoretical and practical challenges associated with obtaining them. This work also provides baselines for token-level and sequence-level error detection, and sequence-level out-of-domain input detection on the WMT14 English-French and WMT17 English-German translation and LibriSpeech speech recognition datasets.

研究动机与目标

  • 解决结构化预测任务中缺乏通用且可解释的不确定性估计方法的问题。
  • 实现在序列建模中同时进行粒度级别和完整序列级别的不确定性量化。
  • 为检测翻译和语音识别任务中的粒度级别错误和分布外输入提供实用基线。
  • 分析估计结构化输出不确定性所面临的理论与实际挑战。
  • 在真实世界的人工智能安全与鲁棒性场景中,解释并应用各种不确定性度量。

提出的方法

  • 该框架采用模型的概率集成来估计结构化输出的预测不确定性。
  • 通过集成成员之间的预测方差计算粒度级别的不确定性。
  • 通过使用可微分的、结构化的聚合机制,将粒度级别不确定性聚合以获得序列级别不确定性。
  • 该方法在单一概率建模框架内同时支持认知不确定性(epistemic)和随机不确定性(aleatoric)的估计。
  • 将不确定性得分应用于检测翻译和自动语音识别(ASR)任务中的分布外输入和模型错误。
  • 该方法在 WMT14 英法翻译、WMT17 英德翻译以及 LibriSpeech 语音识别基准上进行了评估。

实验结果

研究问题

  • RQ1如何在结构化预测中一致地估计粒度级别和序列级别的不确定性?
  • RQ2哪些不确定性度量在结构化预测任务中最具可解释性和可操作性?
  • RQ3所提出的框架在检测分布外输入和模型错误方面的有效性如何?
  • RQ4在将不确定性估计应用于结构化输出时,面临哪些理论与实际挑战?
  • RQ5在真实世界部署场景中,不同不确定性度量的表现如何比较?

主要发现

  • 该框架为结构化任务中的粒度级别和序列级别预测提供了一体化且可解释的不确定性估计方法。
  • 该方法在 WMT14/17 和 LibriSpeech 基准上对检测分布外输入和序列级别错误表现出强劲性能。
  • 粒度级别不确定性得分与模型预测错误具有有效相关性,可实现可靠的错误检测。
  • 序列级别不确定性度量在识别低置信度或异常输出方面具有鲁棒性和可操作性。
  • 该框架揭示了在大规模序列模型中不确定性校准和计算成本方面的实际挑战。
  • 本研究为序列建模中的不确定性感知错误检测与领域检测建立了新基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。