Skip to main content
QUICK REVIEW

[论文解读] Rainproof: An Umbrella To Shield Text Generators From Out-Of-Distribution Data

Maxime Darrin, Pablo Piantanida|arXiv (Cornell University)|Dec 18, 2022
Adversarial Robustness in Machine Learning被引用 7
一句话总结

本文提出 RAINPROOF,一种用于文本生成器的黑盒分布外(OOD)检测框架,利用软概率分布检测分布偏移,无需访问内部模型状态。该研究引入 LOFTER,一个面向文本生成 OOD 检测的现实基准,证明 RAINPROOF 通过仅过滤有害 OOD 样本,提升了最终任务性能,而传统检测器则因拒绝高质量生成输出而导致性能下降。

ABSTRACT

Implementing effective control mechanisms to ensure the proper functioning and security of deployed NLP models, from translation to chatbots, is essential. A key ingredient to ensure safe system behaviour is Out-Of-Distribution (OOD) detection, which aims to detect whether an input sample is statistically far from the training distribution. Although OOD detection is a widely covered topic in classification tasks, most methods rely on hidden features output by the encoder. In this work, we focus on leveraging soft-probabilities in a black-box framework, i.e. we can access the soft-predictions but not the internal states of the model. Our contributions include: (i) RAINPROOF a Relative informAItioN Projection OOD detection framework; and (ii) a more operational evaluation setting for OOD detection. Surprisingly, we find that OOD detection is not necessarily aligned with task-specific measures. The OOD detector may filter out samples well processed by the model and keep samples that are not, leading to weaker performance. Our results show that RAINPROOF provides OOD detection methods more aligned with task-specific performance metrics than traditional OOD detectors.

研究动机与目标

  • 开发一种实用的、黑盒的文本生成器 OOD 检测方法,无需访问内部模型状态或 OOD 训练数据。
  • 解决条件文本生成中 OOD 检测的空白,因为现有分类任务方法在高词汇量标记空间下表现不佳。
  • 创建一个更真实的评估基准,涵盖语言迁移(如英语到西班牙语)和领域迁移(如医学与新闻),超越标准英文 GLUE 基准。
  • 使 OOD 检测与最终任务性能对齐,确保过滤操作提升而非损害真实部署中的模型可靠性。
  • 证明 OOD 检测不应仅通过检测指标评估,而应与下游任务性能联合评估。

提出的方法

  • RAINPROOF 使用相对信息投影(RIP)计算新颖性得分,基于预测软概率与参考分布或均匀分布之间的差异。
  • 在无参考数据(场景 s₀)时,通过计算预测分布的负熵作为正常性的度量。
  • 在有参考数据(场景 s₁)时,应用信息投影将模型输出分布与数据驱动的参考集进行比较。
  • 该框架完全无监督,仅依赖软概率输出,因此可通过对 API 调用的方式部署于任何预训练语言模型。
  • 阈值选择基于控制假阳性率,通过保留 99% 的分布内样本实现,避免在校准过程中依赖 OOD 数据。
  • 通过平均聚合各标记生成的得分,保留序列级不确定性,这对检测至关重要。

实验结果

研究问题

  • RQ1是否可以仅使用软概率输出,无需访问内部模型表示,有效实现文本生成中的 OOD 检测?
  • RQ2是否存在一种 OOD 检测方法能提升下游任务性能,还是现有检测器因过滤高质量生成样本而降低性能?
  • RQ3语言迁移(如荷兰语到阿非利堪斯语)和领域迁移(如医学到新闻)如何影响文本生成中 OOD 检测的性能?
  • RQ4是否可以通过联合测量检测性能与最终任务性能,构建一个更能反映 OOD 检测器实际价值的统一评估框架?
  • RQ5是否存在一种方法能将 OOD 检测与任务特定指标对齐,而非仅与 OOD 检测 AUC 对齐?

主要发现

  • RAINPROOF 在 OOD 检测 AUC 和下游 BLEU 分数上均优于传统 OOD 检测器(如 MSP 和 CQE),尤其在语言迁移场景中表现更优。
  • 在 LOFTER 基准上,使用 s₀ 设置时,RAINPROOF 在语言迁移任务(如荷兰语到阿非利堪斯语)中平均 BLEU 分数提升 +5.4 点。
  • 传统检测器如 MSP 在 OOD 设置下 BLEU 分数最高下降 -3.1 点,表明其错误地过滤了高质量生成样本。
  • RAINPROOF 中负熵与信息投影的结合,即使在无参考数据时也能实现有效检测,在 s₀ 场景中表现强劲。
  • 研究揭示了一个关键错位:高 AUC 的 OOD 检测器可能损害最终任务性能,凸显了与下游指标联合评估的必要性。
  • 基于保留 99% 分布内样本的阈值设定方法被证明有效且实用,避免了校准阶段对 OOD 数据的依赖。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。