Skip to main content
QUICK REVIEW

[论文解读] Tailoring: encoding inductive biases by optimizing unsupervised objectives at prediction time

Ferran Alet, Maria Bauzá|arXiv (Cornell University)|Sep 22, 2020
Domain Adaptation and Few-Shot Learning参考文献 49被引用 5
一句话总结

本文提出了微调(tailoring)与元微调(meta-tailoring)方法,通过在推理时优化无监督目标来编码归纳偏置,从而消除泛化差距,并使训练目标与最终预测目标对齐。通过在推理过程中对每个输入的无监督损失进行模型参数的在线微调,并利用元学习优化此适应过程,该方法在计算开销极小的情况下,显著提升了视觉与语言任务中的泛化能力与表征学习效果。

ABSTRACT

From CNNs to attention mechanisms, encoding inductive biases into neural networks has been a fruitful source of improvement in machine learning. Adding auxiliary losses to the main objective function is a general way of encoding biases that can help networks learn better representations. However, since auxiliary losses are minimized only on training data, they suffer from the same generalization gap as regular task losses. Moreover, by adding a term to the loss function, the model optimizes a different objective than the one we care about. In this work we address both problems: first, we take inspiration from extit{transductive learning} and note that after receiving an input but before making a prediction, we can fine-tune our networks on any unsupervised loss. We call this process {\em tailoring}, because we customize the model to each input to ensure our prediction satisfies the inductive bias. Second, we formulate {\em meta-tailoring}, a nested optimization similar to that in meta-learning, and train our models to perform well on the task objective after adapting them using an unsupervised loss. The advantages of tailoring and meta-tailoring are discussed theoretically and demonstrated empirically on a diverse set of examples.

研究动机与目标

  • 通过在推理时而非仅在训练期间优化辅助损失,解决辅助损失的泛化差距问题。
  • 解决训练目标(任务损失 + 辅助损失)与实际预测目标(仅任务损失)之间的不匹配问题。
  • 使模型能够利用无监督归纳偏置在推理时适应单个输入,从而提升泛化能力与表征质量。
  • 通过元微调训练模型,使其在通过无监督损失适应后能有效完成任务目标,模仿元学习原则。
  • 证明微调与元微调可在无需任务特定微调的情况下,提升多样化视觉与语言基准上的性能。

提出的方法

  • 微调在推理时对模型参数进行在线微调,基于无监督损失使用输入查询对模型进行定制化处理,再进行预测。
  • 该方法采用两阶段优化:首先,针对特定输入在无监督损失(如对比学习、自编码)上微调模型;随后,使用调整后的参数生成最终预测结果。
  • 元微调通过在训练期间模拟适应过程(内层循环:微调;外层循环:任务损失最小化),使基础模型对微调具有鲁棒性。
  • 该方法利用一阶近似(WarpGrad)降低元微调中的内存与计算成本,实现对适应步骤的高效反向传播。
  • 该方法采用可微分架构,支持对多个输入的共享批处理适应,每个样本具有独立的归一化参数(γ, β)。
  • 该框架支持多种无监督损失(如对比学习、自监督学习),可应用于视觉、语言及结构化预测任务。

实验结果

研究问题

  • RQ1在推理时优化无监督目标是否能减少辅助损失的泛化差距?
  • RQ2通过使用无监督归纳偏置对单个输入进行模型适应,是否能提升最终任务性能?
  • RQ3元微调能否在训练期间未见过适应过程的情况下,使模型在微调后仍具备良好泛化能力?
  • RQ4与标准预训练和微调相比,微调在归纳偏置编码与下游性能方面表现如何?
  • RQ5在实际应用中,微调与元微调的计算成本与内存开销如何?

主要发现

  • 微调通过利用无监督归纳偏置使模型能够针对单个输入进行适应,显著提升了视觉与语言基准上的零样本泛化能力。
  • 元微调在仅使用极小部分训练计算资源的情况下,实现了与完整微调相当的性能,通过有效学习利用微调机制。
  • 该方法通过确保辅助损失在推理时针对实际输入进行优化,而非仅在训练数据上优化,从而减少了辅助损失的泛化差距。
  • 实证结果表明,在图像分类、语义分割与文本生成等多样化任务中,使用元微调模型均表现出一致的性能提升。
  • 元微调中使用的一阶近似(WarpGrad)显著降低了内存使用量并提升了训练稳定性,且未牺牲性能。
  • 在归纳偏置对泛化至关重要的场景下,该方法优于标准辅助损失训练与标准微调方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。