Skip to main content
QUICK REVIEW

[论文解读] Insights into Pre-training via Simpler Synthetic Tasks

Yuhuai Wu, Felix Li|arXiv (Cornell University)|Jun 21, 2022
Advanced Neural Network Applications被引用 8
一句话总结

本文通过简化合成任务,探究了预训练的关键组件,发现即使是最基础的任务——从序列中去除重复项(Set)——也能实现自然预训练65%的性能提升。令人惊讶的是,仅使用此类合成预训练的统计量进行初始化,即可获得39%的收益;而仅调整预注意力层的层归一化参数,即可在关键任务上弥补超过40%的性能差距。

ABSTRACT

Pre-training produces representations that are effective for a wide range of downstream tasks, but it is still unclear what properties of pre-training are necessary for effective gains. Notably, recent work shows that even pre-training on synthetic tasks can achieve significant gains in downstream tasks. In this work, we perform three experiments that iteratively simplify pre-training and show that the simplifications still retain much of its gains. First, building on prior work, we perform a systematic evaluation of three existing synthetic pre-training methods on six downstream tasks. We find the best synthetic pre-training method, LIME, attains an average of $67\%$ of the benefits of natural pre-training. Second, to our surprise, we find that pre-training on a simple and generic synthetic task defined by the Set function achieves $65\%$ of the benefits, almost matching LIME. Third, we find that $39\%$ of the benefits can be attained by using merely the parameter statistics of synthetic pre-training. We release the source code at https://github.com/felixzli/synthetic_pretraining.

研究动机与目标

  • 识别预训练中对下游性能提升至关重要的属性。
  • 评估现有合成预训练方法在多样化下游任务上的泛化性与有效性。
  • 将合成预训练任务简化至最小复杂度,同时保持性能优势。
  • 探究仅使用合成预训练的参数统计量是否能复现其全部优势。
  • 确定是否可通过极简的初始化调整(如调整层归一化值)实现显著性能提升。

提出的方法

  • 在六个多样化的下游自然语言处理任务上,系统评估三种现有合成预训练方法(LIME、Dyck 和 Set)的性能。
  • 设计一种全新的、极简的合成任务(Set),要求从序列中去除重复标记,同时保持顺序。
  • 仅提取并使用来自 Set 任务的预训练模型权重的统计分布(均值与标准差)进行模型初始化。
  • 比较以下初始化方式的性能:随机初始化、自然预训练(T5-Small)、合成预训练(LIME、Set)、Set 统计量,以及预注意力层归一化参数调整。
  • 使用与原始 T5 预训练相同的超参数,训练一个 T5-Small 模型(6000 万参数),以确保公平比较。
  • 在六个下游任务上微调所有初始化模型:代码翻译、语义解析、逆合成分析、阅读理解与摘要生成。

实验结果

研究问题

  • RQ1与自然预训练相比,现有合成预训练方法在广泛下游任务上的有效性如何?
  • RQ2像 Set 这类极简、通用的合成预训练任务,能否实现与更复杂合成方法相近的性能?
  • RQ3预训练权重的统计特性(如均值与方差)在多大程度上能复现完整合成预训练的优势?
  • RQ4是否可通过极简的单值初始化调整(如降低预注意力层归一化值)实现显著的下游性能提升?
  • RQ5实现预训练中显著性能提升所需的最小组件集合是什么?

主要发现

  • 现有合成方法中表现最佳的 LIME 方法,在六个下游任务上的平均性能达到自然预训练增益的 67%。
  • 所提出的 Set 任务——从序列中去除重复标记——实现了自然预训练 65% 的性能增益,几乎与 LIME 相当。
  • 仅使用 Set 预训练中权重的均值与标准差进行模型参数初始化,可实现自然预训练 39% 的性能增益。
  • 仅将预注意力层归一化参数调整为更低值(每层一个标量),即可在摘要生成和语义解析任务上弥补超过 40% 的性能差距,在全部六个任务上平均弥补 21% 的差距。
  • 合成预训练的有效性并非源于复杂的数据模式,而是特定的模型权重统计特性与层归一化行为。
  • 结果表明,预训练的核心优势可能源于权重统计特性与归一化模式,而非复杂数据分布的学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。