[论文解读] Optimizing Deeper Transformers on Small Datasets
本文提出 DT-Fixup,一种数据相关的权重初始化方法,可在无需学习率预热或层归一化的情况下,从零开始在小数据集上训练极深的变换器(最多 48 层)。通过将 DT-Fixup 应用于包含 24 个微调的 RoBERTa 层和 24 个从零训练的关系感知层的混合模型,该方法在 Spider 文本到 SQL 基准测试中实现了 70.9% 的精确匹配准确率,达到当前最先进水平,且训练步数更少,无需特定任务的预训练。
It is a common belief that training deep transformers from scratch requires large datasets. Consequently, for small datasets, people usually use shallow and simple additional layers on top of pre-trained models during fine-tuning. This work shows that this does not always need to be the case: with proper initialization and optimization, the benefits of very deep transformers can carry over to challenging tasks with small datasets, including Text-to-SQL semantic parsing and logical reading comprehension. In particular, we successfully train $48$ layers of transformers, comprising $24$ fine-tuned layers from pre-trained RoBERTa and $24$ relation-aware layers trained from scratch. With fewer training steps and no task-specific pre-training, we obtain the state-of-the-art performance on the challenging cross-domain Text-to-SQL parsing benchmark Spider. We achieve this by deriving a novel Data-dependent Transformer Fixed-update initialization scheme (DT-Fixup), inspired by the prior T-Fixup work. Further error analysis shows that increasing depth can help improve generalization on small datasets for hard cases that require reasoning and structural understanding.
研究动机与目标
- 为解决人们普遍认为在小数据集上从零训练深层变换器需要大规模数据集,尤其是对推理密集型任务而言。
- 克服在小数据集上训练深层变换器时的优化挑战,如受限小批量导致的不稳定性,以及对学习率预热或层归一化的依赖。
- 开发一种可泛化的初始化方法,使更深的变换器架构能够在小而复杂的 NLP 基准上提升泛化能力和推理能力。
- 证明即使在没有特定任务预训练的情况下,经过恰当初始化的深层变换器在 Spider 和 ReCola 等数据集上也能超越浅层模型。
提出的方法
- DT-Fixup 衍生出自适应于输入数据分布的数据相关初始化方案,受 T-Fixup 启发,通过调整权重缩放以适应输入数据分布,从而在无需层归一化或学习率预热的情况下稳定训练。
- 该方法将 T-Fixup 扩展至混合架构:将预训练的 RoBERTa 层与新训练的关系感知变换器层结合,使在小数据集上构建更深模型成为可能。
- 采用改进的权重初始化方法,考虑输入表征的方差,确保在深层网络中反向传播时梯度稳定。
- 该方法被推广至关系感知变换器,使在文本到 SQL 解析等任务中能更好地建模结构和关系依赖。
- 训练采用小数据集典型的较小批量,但 DT-Fixup 仍保持收敛性和泛化性能。
- 该方法在两个具有挑战性的基准上进行了评估:Spider(跨领域文本到 SQL)和 ReCola(逻辑阅读理解),两者训练样本均少于 10k。
实验结果
研究问题
- RQ1能否在无需预训练或大批次训练的情况下,成功从零开始在小数据集上训练极深变换器(最多 48 层)?
- RQ2像 DT-Fixup 这样的数据相关初始化方案是否在小而复杂的 NLP 任务中,优于标准训练方法,表现出更好的泛化能力和更快的收敛速度?
- RQ3在推理密集型任务(如文本到 SQL 解析和逻辑阅读理解)中,更深的变换器架构在多大程度上能提升性能?
- RQ4为何标准训练方法在小数据集上会失效?仅通过优化改进是否足以恢复深度的优势?
主要发现
- 所提出的 DT-Fixup 方法使在仅 10k 训练样本的 Spider 基准上训练 48 层变换器模型(24 个预训练 RoBERTa 层 + 24 个从零训练的关系感知层)成为可能。
- 该模型在 Spider 测试集上实现了 70.9% 的精确匹配准确率,创下当时最先进水平。
- DT-Fixup 在泛化性能上优于标准训练,尤其在需要推理和结构理解的困难样本上表现更优。
- 错误分析表明,更深的模型(N=24)显著减少了模板错误和结构错误,表明其结构推理能力得到提升。
- 该方法消除了对学习率预热和层归一化的依赖,使在小数据集上使用更小批量也能实现稳定训练。
- 性能提升并非仅源于架构设计,而是源于优化策略,因为使用标准训练的更深模型在小数据上无法实现泛化。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。