Skip to main content
QUICK REVIEW

[论文解读] On the Complementarity of Data Selection and Fine Tuning for Domain Adaptation

Dan Iter, David Grangier|arXiv (Cornell University)|Sep 15, 2021
Topic Modeling参考文献 42被引用 6
一句话总结

本文研究了在神经网络语言建模和机器翻译的领域自适应中,数据选择与微调之间的互补性。提出使用判别性领域分类器——特别是微调后的 BERT——来选择与目标领域相似但不过于特定的域外预训练数据,结果表明此类选择能显著提升泛化能力,并优于对比性数据选择方法,尤其在与微调结合时表现更优。

ABSTRACT

Domain adaptation of neural networks commonly relies on three training phases: pretraining, selected data training and then fine tuning. Data selection improves target domain generalization by training further on pretraining data identified by relying on a small sample of target domain data. This work examines the benefit of data selection for language modeling and machine translation. Our experiments assess the complementarity of selection with fine tuning and result in practical recommendations: (i) selected data must be similar to the fine-tuning domain but not so much as to erode the complementary effect of fine-tuning; (ii) there is a trade-off between selecting little data for fast but limited progress or much data for slow but long lasting progress; (iii) data selection can be applied early during pretraining, with performance gains comparable to long pretraining session; (iv) data selection from domain classifiers is often more effective than the popular contrastive data selection method.

研究动机与目标

  • 分析神经网络模型在领域自适应中数据选择与微调之间的互补性。
  • 评估不同数据选择方法(尤其是对比性评分与判别性领域分类器)在语言建模与机器翻译中的有效性。
  • 识别数据选择的最佳超参数,包括选择规模、相对于预训练的时机以及微调前的训练时长。
  • 为实践者提供实用建议,说明何时以及如何应用数据选择以最大化性能提升。

提出的方法

  • 作者采用三阶段训练流程:在通用域外数据上进行预训练,对这部分数据的子集进行数据选择,然后在目标领域数据上进行微调。
  • 数据选择通过对比性评分(例如基于句子嵌入)或使用少量领域内样本训练的判别性领域分类器来执行。
  • 判别性分类器为微调后的 BERT 模型,用于预测预训练样本是否属于目标领域,其得分用于对数据进行排序和选择。
  • 研究在不同预训练步数和选择规模下,对语言建模与神经机器翻译(En-De 和 En-Fr)任务评估了选择方法。
  • 通过微调后在目标领域数据上的验证损失衡量泛化性能,并通过消融实验分析选择规模、时机和模型类型的影响。
  • 通过在保留的领域内/领域外数据上的二分类准确率以及领域内样本在排序选择列表中的平均分位数,对比不同选择方法。

实验结果

研究问题

  • RQ1所选数据与微调数据之间的相似性如何影响数据选择与微调之间的互补性?
  • RQ2在泛化能力和训练速度之间权衡时,选择少量高质量数据与选择更大但质量较低的数据集有何影响?
  • RQ3选择数据的方法(对比性评分 vs. 判别性领域分类器)如何影响下游性能?
  • RQ4是否可以在预训练早期应用数据选择,以减少总训练时间同时保持性能?
  • RQ5与仅微调相比,数据选择在多大程度上提升了泛化能力?在何种情况下反而会损害性能?

主要发现

  • 判别性领域分类器,尤其是微调后的 BERT,无论在语言建模还是机器翻译任务中,均持续优于对比性数据选择方法,在机器翻译任务中达到 93.51% 的二分类准确率。
  • 通过领域分类器选择的数据比对比性选择带来更好的泛化性能,后者因过度拟合目标训练集而表现更差,表现为尽管训练集性能强,但验证损失更高。
  • 仅从预训练数据中选择前 100 万条样本(使用对比性评分)的泛化性能,反而不如使用精度较低但多样性更高的方法选择更多数据。
  • 数据选择可应用于预训练早期——仅在 20 万步后——即可达到远长于此时间的预训练模型的性能水平。
  • 数据选择与微调的结合可超越仅微调的基线,但前提是所选数据具有足够的互补性;若互补性不足,性能可能低于仅微调的基线。
  • 在微调前对所选数据进行短期诊断性能评估具有误导性:小样本集收敛快但易过拟合,而大样本集泛化更好但需要更多训练步骤。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。