Skip to main content
QUICK REVIEW

[论文解读] Weighted Training for Cross-Task Learning

Shuxiao Chen, Koby Crammer|arXiv (Cornell University)|May 28, 2021
Topic Modeling参考文献 34被引用 6
一句话总结

本文提出目标感知加权训练(TAWT),一种用于跨任务学习的方法,通过最小化源任务与目标任务之间的基于表示的梯度距离,自适应地分配样本权重。TAWT在低资源NLP序列标注任务上使BERT的性能平均提升3.1个百分点,具有理论保证且超参数调优极少。

ABSTRACT

In this paper, we introduce Target-Aware Weighted Training (TAWT), a weighted training algorithm for cross-task learning based on minimizing a representation-based task distance between the source and target tasks. We show that TAWT is easy to implement, is computationally efficient, requires little hyperparameter tuning, and enjoys non-asymptotic learning-theoretic guarantees. The effectiveness of TAWT is corroborated through extensive experiments with BERT on four sequence tagging tasks in natural language processing (NLP), including part-of-speech (PoS) tagging, chunking, predicate detection, and named entity recognition (NER). As a byproduct, the proposed representation-based task distance allows one to reason in a theoretically principled way about several critical aspects of cross-task learning, such as the choice of the source data and the impact of fine-tuning.

研究动机与目标

  • 为解决跨任务学习中缺乏理论理解的问题,尤其是在深度学习设置下。
  • 开发一种实用、高效且理论基础扎实的方法,以提升跨任务学习中的样本效率。
  • 实现对源数据价值和跨任务迁移中微调必要性的合理推理。
  • 克服现有迁移学习框架中关于任务间共享表示的强假设。
  • 提供一种轻量级、可训练的加权方案,以增强预训练和联合训练,且无需大量超参数调优。

提出的方法

  • TAWT通过最小化源任务与目标任务之间的基于表示的梯度距离,引导自适应样本加权。
  • 该方法基于源任务与目标任务最优表示之间的差异来计算梯度距离,而非基于任务特定函数。
  • 它为源样本或源任务分配可训练的、自适应的权重,以改善与目标任务表示的对齐。
  • 该算法与多任务学习中的现有范式(如预训练和联合训练)兼容。
  • 理论分析提供了非渐近泛化界,其中依赖于最小化梯度距离的项趋于消失。
  • 该方法避免了如所有任务间存在单一共享表示等强假设,从而实现更灵活且可解释的迁移。

实验结果

研究问题

  • RQ1我们如何从理论上证明并提升深度神经网络中跨任务学习的效率?
  • RQ2如何以合理的方式量化给定目标任务下源数据的价值?
  • RQ3在跨任务学习中,何时需要微调?我们能否通过表示差异来检测?
  • RQ4我们能否设计一种轻量级、高效且理论基础扎实的源任务或样本加权方案?
  • RQ5最小化基于表示的梯度距离如何导致低资源设置下泛化能力和性能的提升?

主要发现

  • 在低资源目标数据设置下,TAWT在四个NLP序列标注任务(词性标注、短语切分、谓词检测和命名实体识别)上实现了平均3.1个百分点的绝对性能提升。
  • 基于表示的梯度距离为源数据质量提供了可解释的度量,反映了最优源表示与目标表示之间的差异。
  • 该方法表明,当基于表示的梯度距离非零时,微调是必要的,因为源表示无法收敛到最优目标表示。
  • TAWT所需超参数调优极少,计算效率高,适用于实际部署。
  • 理论分析确认了非渐近泛化界,其中由于重加权,梯度距离项趋于可忽略,支持了泛化性能的提升。
  • 实证结果表明,即使在目标数据有限的情况下,使用BERT在多种NLP任务上均表现出一致的性能增益,验证了该方法的鲁棒性和有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。