[论文解读] Are Pre-trained Convolutions Better than Pre-trained Transformers?
本文在8个NLP任务上对比评估了预训练的卷积式Seq2Seq模型与预训练的Transformer,结果表明基于CNN的模型具有竞争力,在若干情境下甚至优于Transformer,且预训练对CNN的收益与Transformer相似。
In the era of pre-trained language models, Transformers are the de facto choice of model architectures. While recent research has shown promise in entirely convolutional, or CNN, architectures, they have not been explored using the pre-train-fine-tune paradigm. In the context of language models, are convolutional models competitive to Transformers when pre-trained? This paper investigates this research question and presents several interesting findings. Across an extensive set of experiments on 8 datasets/tasks, we find that CNN-based pre-trained models are competitive and outperform their Transformer counterpart in certain scenarios, albeit with caveats. Overall, the findings outlined in this paper suggest that conflating pre-training and architectural advances is misguided and that both advances should be considered independently. We believe our research paves the way for a healthy amount of optimism in alternative architectures.
研究动机与目标
- 评估在预训练–微调范式下,卷积结构是否能够匹配或超越基于Transformer的模型。
- 在多样的NLP任务中评估多种卷积变体(轻量级、扩张、动态卷积)。
- 在准确性、速度和可扩展性方面衡量预训练对CNN与Transformer的影响。
提出的方法
- 开发一个使用基于片段的序列到序列去噪目标的预训练卷积Seq2Seq模型,灵感来自T5。
- 研究若干卷积变体:轻量级深度卷积、动态卷积和膨胀卷积。
- 在大型语料库(C4)上对CNN与Transformer进行524K步的预训练,采用3-token span污染,然后在下游任务上微调。
- 在覆盖毒性检测、情感分析、新闻分类、问题分类和组合法则泛化的8个数据集上进行评估。
- 使用12层的编码器–解码器结构,模型维度768,注意力头数12;与相似规模的Transformer基线(T5)进行比较。
实验结果
研究问题
- RQ1卷积在预训练中是否能像Transformer那样受益?
- RQ2预训练的卷积模型是否能与预训练的Transformer相比竞争,在哪些任务和设定中它们表现出色或失败?
- RQ3在速度、FLOPs和可扩展性方面,预训练卷积相对于Transformer提供了哪些实际好处?
- RQ4预训练卷积的警告与失效模式是什么,何时应避免使用?
- RQ5在预训练下,是否有某些卷积变体(轻量级、动态、膨胀)通常优于其他变体?
主要发现
- 预训练的卷积与Transformer具有竞争力,在若干任务上甚至优于它们。
- 在8个数据集上,预训练卷积在7个任务中的6个任务上优于先进的Transformer(T5),在某些情景下有显著提升。
- 卷积比Transformer更快、FLOP更高效,且对更长序列的扩展性更好。
- 预训练对CNN的收益与Transformer相似,表明预训练带来的优势并非Transformer架构所独有。
- 在卷积变体中,膨胀卷积和动态卷积在多数设置下通常表现优于轻量级卷积。
- CNNs中的跨注意力限制可能妨碍需要跨序列交互的任务,但单层跨注意力层可以在很大程度上弥补这一差距。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。