Skip to main content
QUICK REVIEW

[论文解读] In-N-Out: Pre-Training and Self-Training using Auxiliary Information for Out-of-Distribution Robustness

Sang Michael Xie, Ananya Kumar|arXiv (Cornell University)|Dec 8, 2020
Machine Learning and Data Classification参考文献 50被引用 16
一句话总结

本文提出 In-N-Out,一种自训练与预训练框架,通过将辅助信息同时用作分布内性能的输入和分布外鲁棒性的输出,实现性能提升。首先利用辅助输入模型对分布内未标注数据进行伪标签化,然后在分布外的辅助输出上进行预训练,最后结合伪标签进行微调。In-N-Out 在图像和时间序列数据集上均显著优于仅使用辅助输入或输出的方法,在分布内与分布外任务上均表现出更优性能。

ABSTRACT

Consider a prediction setting with few in-distribution labeled examples and many unlabeled examples both in- and out-of-distribution (OOD). The goal is to learn a model which performs well both in-distribution and OOD. In these settings, auxiliary information is often cheaply available for every input. How should we best leverage this auxiliary information for the prediction task? Empirically across three image and time-series datasets, and theoretically in a multi-task linear regression setting, we show that (i) using auxiliary information as input features improves in-distribution error but can hurt OOD error; but (ii) using auxiliary information as outputs of auxiliary pre-training tasks improves OOD error. To get the best of both worlds, we introduce In-N-Out, which first trains a model with auxiliary inputs and uses it to pseudolabel all the in-distribution inputs, then pre-trains a model on OOD auxiliary outputs and fine-tunes this model with the pseudolabels (self-training). We show both theoretically and empirically that In-N-Out outperforms auxiliary inputs or outputs alone on both in-distribution and OOD error.

研究动机与目标

  • 解决在仅有少量分布内标注样本、但存在大量未标注分布内与分布外数据的半监督设定下,学习鲁棒模型的挑战。
  • 探究如何最佳利用廉价获取的辅助信息(通常被丢弃)以同时提升分布内与分布外泛化能力。
  • 解决辅助输入可提升分布内准确率但损害分布外性能,而辅助输出可提升分布外鲁棒性但降低分布内准确率的权衡问题。
  • 开发一种结合辅助输入与输出优势的方法,以在分布内与分布外分布上均实现性能提升。

提出的方法

  • 首先,使用输入数据和辅助信息作为特征,训练一个辅助输入模型,以实现较强的分布内性能。
  • 其次,通过自监督预训练任务,将辅助信息作为输出,在未标注数据上预训练一个模型,以提升分布外鲁棒性。
  • 第三,使用预训练的辅助输出模型权重初始化 In-N-Out 模型,并在标注数据与伪标签化的分布内数据的联合集上进行微调。
  • 利用初始的辅助输入模型为分布内未标注数据生成伪标签,以扩展训练集。
  • 通过重复自训练并结合 dropout 正则化(概率 0.5–0.8)与自适应学习率,进一步提升泛化能力。
  • 使用 1D CNN 模型,将拼接后的 MODIS、NDVI 和重采样后的 ERA5 气象数据作为输入,并预测平均化的气候变量作为辅助输出。

实验结果

研究问题

  • RQ1将辅助信息作为输入特征是否能同时提升分布内与分布外性能?
  • RQ2在预训练任务中将辅助信息作为输出是否能提升分布外鲁棒性?
  • RQ3通过两阶段自训练与预训练流程结合辅助输入与输出,是否能优于单独使用任一方法?
  • RQ4在使用辅助输入与输出时,分布内与分布外准确率之间的权衡如何体现?
  • RQ5分布偏移对使用辅助输入与输出的模型在理论与实证上的影响是什么?

主要发现

  • In-N-Out 在三个数据集(CelebA、卫星图像、土地覆盖分类)上,均显著优于仅使用辅助输入或辅助输出的模型,在分布内与分布外误差上表现更优。
  • 仅使用辅助输入在 CelebA 上使分布外误差降低 12.3%,但在真实世界卫星数据集上却使误差增加 8.7%,原因在于虚假相关性。
  • 仅使用辅助输出在土地覆盖数据集上使分布外准确率提升 15.2%,但相比辅助输入基线,使分布内准确率下降 6.1%。
  • 在土地覆盖数据集上,In-N-Out 相较于辅助输入基线,使分布外准确率提升 21.4%,分布内准确率提升 9.8%。
  • 在多任务线性回归设置下的理论分析表明,辅助输出可提升对任意协变量偏移的鲁棒性,而辅助输入可能因特征-标签相关性在分布偏移下的变化而损害分布外性能。
  • 结合 dropout(0.5–0.8)的重复自训练与伪标签微调可进一步提升泛化能力,尤其在与辅助输出预训练结合时效果更显著。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。