Skip to main content
QUICK REVIEW

[论文解读] Meet in the Middle: A New Pre-training Paradigm

Anh‐Tu Nguyen, Nikos Karampatziakis|arXiv (Cornell University)|Mar 13, 2023
Topic Modeling被引用 4
一句话总结

本文提出了一种名为 'Meet in the Middle'(MIM)的新预训练范式,该范式在相同数据上联合训练一个自左向右和一个自右向左的语言模型,通过强制两者预测结果一致来提升数据效率和填充性能。该方法在困惑度和代码补全任务上取得了最先进结果,其双向推理过程通过利用来自两侧的上下文信息,降低了延迟并提高了准确性。

ABSTRACT

Most language models (LMs) are trained and applied in an autoregressive left-to-right fashion, assuming that the next token only depends on the preceding ones. However, this assumption ignores the potential benefits of using the full sequence information during training, and the possibility of having context from both sides during inference. In this paper, we propose a new pre-training paradigm with techniques that jointly improve the training data efficiency and the capabilities of the LMs in the infilling task. The first is a training objective that aligns the predictions of a left-to-right LM with those of a right-to-left LM, trained on the same data but in reverse order. The second is a bidirectional inference procedure that enables both LMs to meet in the middle. We show the effectiveness of our pre-training paradigm with extensive experiments on both programming and natural language models, outperforming strong baselines.

研究动机与目标

  • 通过在训练过程中利用前缀和后缀上下文,尽管标准语言模型具有自回归性质,仍旨在提升预训练数据效率。
  • 通过使模型能够同时利用双向上下文,提升在填充任务(用户在现有序列中插入内容)上的性能。
  • 开发一种统一的训练与推理框架,保持与现有自回归模型的兼容性,同时提升质量与效率。
  • 通过检测前向与后向预测的收敛性,减少填充任务中的推理延迟。

提出的方法

  • 在相同单调排序的训练数据上,联合训练两个共享参数的语言模型:一个自左向右(前向)模型和一个自右向左(后向)模型。
  • 引入基于总变差距离的一致性正则化项,使前向与后向模型在每个标记位置的预测概率分布保持一致。
  • 使用由标准语言建模损失与一致性正则化项组成的联合损失函数,在预训练过程中同时优化两个模型。
  • 在推理阶段,同时并行运行前向与后向生成,当预测的标记在中间相遇且一致时停止。
  • 将两个模型的收敛性作为停止条件,减少生成步数,从而改善延迟。
  • 将前向模型作为标准自回归语言模型的即插即用替代品,而后向模型则支持如填充等双向任务。

实验结果

研究问题

  • RQ1联合训练自左向右与自右向左语言模型是否能提升预训练阶段的数据效率?
  • RQ2强制前向与后向预测保持一致是否能提升下游填充任务的性能?
  • RQ3一种在中间相遇的双向推理过程是否能相比自回归基线,同时减少延迟并提高准确性?
  • RQ4与现有方法(如 FIM 和 CM3)相比,MIM 范式在困惑度与代码补全性能方面表现如何?

主要发现

  • MIM 预训练范式在自然语言与代码数据集上,困惑度均低于强基线模型(包括 FIM)。
  • 在 HumanEval 代码补全基准测试中,MIM 在零样本代码补全准确率上优于 FIM 与其他基线模型。
  • 与 FIM 相比,双向推理过程将平均推理延迟降低了最多 50%,尤其在模型早期收敛时效果更显著。
  • 消融实验表明,一致性正则化项显著提升了预测一致性与整体性能,尤其在填充任务中表现突出。
  • 该方法保持了与现有自回归模型的兼容性,因为前向模型可直接作为标准语言模型的替代品使用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。