Skip to main content
QUICK REVIEW

[论文解读] Diversify and Disambiguate: Learning From Underspecified Data

Yoonho Lee, Huaxiu Yao|arXiv (Cornell University)|Feb 7, 2022
Machine Learning and Data Classification被引用 4
一句话总结

DivDis 是一种两阶段框架,首先通过在共享主干网络上训练多个头,使它们在未标记的目标数据上对未指定数据产生分歧,从而学习一组多样化的假设;然后通过使用最少的目标标签选择最佳函数来实现消歧。该方法在 Waterbirds 基准上将最差组准确率提升了超过15%,在 Camelyon17 上优于半监督方法,表现出对严重分布偏移和未指定性的鲁棒性。

ABSTRACT

Many datasets are underspecified: there exist multiple equally viable solutions to a given task. Underspecification can be problematic for methods that learn a single hypothesis because different functions that achieve low training loss can focus on different predictive features and thus produce widely varying predictions on out-of-distribution data. We propose DivDis, a simple two-stage framework that first learns a diverse collection of hypotheses for a task by leveraging unlabeled data from the test distribution. We then disambiguate by selecting one of the discovered hypotheses using minimal additional supervision, in the form of additional labels or inspection of function visualization. We demonstrate the ability of DivDis to find hypotheses that use robust features in image classification and natural language processing problems with underspecification.

研究动机与目标

  • 解决机器学习中训练数据未指定导致的分布偏移挑战,允许多个合理的假设解释数据。
  • 克服标准 ERM 和鲁棒性方法仅选择一个函数的局限,即使存在多个有效解释时亦如此。
  • 通过在选择最佳函数前发现多样且互补的假设,提升子群体偏移和域泛化下的泛化能力。
  • 通过利用未标记目标数据上的分歧,仅使用少量标记样本即可实现对目标域的样本高效适应。
  • 提供一种可扩展的端到端框架,在无需虚假属性标注的情况下发现有意义且解耦的特征。

提出的方法

  • DivDis 使用带有共享主干的多头神经网络,每个头代表一个不同的假设。
  • 在 Diversify 阶段,所有头在标记数据上最小化源损失,同时被鼓励在未标记的目标数据集上做出多样化预测。
  • 通过最大化目标数据上各头之间的预测分歧来强制实现多样性,促进对替代函数的探索。
  • 在 Disambiguate 阶段,基于目标数据中一小部分有信息量的标签,使用不确定性或分歧度量来指导选择最优头。
  • 该框架分两个阶段运行:首先在无目标标签的情况下发现多样化假设;其次通过最小监督解决歧义。
  • 该方法可扩展至大规模视觉和文本基准,且无需事先了解虚假特征或因果结构。

实验结果

研究问题

  • RQ1学习框架能否从未指定数据中发现多个合理的假设,以提升在分布偏移下的鲁棒性?
  • RQ2在不依赖目标数据标签的情况下,如何有效促进假设之间的多样性?
  • RQ3当存在多个假设时,极少的目标标签在多大程度上能提升性能?
  • RQ4在高度未指定的设置下,该框架是否优于标准 ERM 和现有鲁棒性方法?
  • RQ5该框架能否自动识别并利用互补的、解耦的特征,而无需显式监督?

主要发现

  • DivDis 在 Waterbirds 基准上实现了最差组准确率超过15%的绝对提升,且未使用任何虚假属性标注。
  • 在 Camelyon17 数据集上,DivDis 在域偏移条件下优于现有半监督学习方法。
  • 仅使用4个目标域标签,DivDis 在完全相关虚假属性设置下即超越使用128个标签的微调基线方法。
  • 可视化结果表明,该方法能自动发现有意义且互补的特征,适用于图像和文本任务。
  • DivDis 在大规模基准(包括 ImageNet 和文本分类)上表现出色,且在多种分布偏移设置下保持强大性能。
  • 该框架表明,假设的多样性结合最小消歧,相比单函数模型可显著提升鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。