[论文解读] Residual Energy-Based Models for Text Generation
该论文通过在预训练自回归语言模型的残差空间中学习序列的能量函数,提出了一种用于文本生成的残差能量模型(EBM)。利用噪声对比估计和重要性采样,该方法在困惑度和生成质量方面优于强基准的自回归模型,且人类评估也更青睐其输出结果。
Text generation is ubiquitous in many NLP tasks, from summarization, to dialogue and machine translation. The dominant parametric approach is based on locally normalized models which predict one word at a time. While these work remarkably well, they are plagued by exposure bias due to the greedy nature of the generation process. In this work, we investigate un-normalized energy-based models (EBMs) which operate not at the token but at the sequence level. In order to make training tractable, we first work in the residual of a pretrained locally normalized language model and second we train using noise contrastive estimation. Furthermore, since the EBM works at the sequence level, we can leverage pretrained bi-directional contextual representations, such as BERT and RoBERTa. Our experiments on two large language modeling datasets show that residual EBMs yield lower perplexity compared to locally normalized baselines. Moreover, generation via importance sampling is very efficient and of higher quality than the baseline models according to human evaluation.
研究动机与目标
- 为解决自回归文本生成中的暴露偏差和长距离连贯性不足问题,通过整体建模序列而非逐个标记建模。
- 实现未归一化能量模型(EBM)在自然语言中的可 tractable 训练与高效生成,这类模型通常因归一化和采样困难而难以处理。
- 通过残差形式将预训练自回归模型的优势与 EBM 的全局序列评分能力相结合,以提升文本生成质量。
- 证明基于 EBM 的文本生成在困惑度和人类评估中均优于强自回归基线模型。
提出的方法
- 该模型采用残差形式:$ P_{\theta}(x) \propto P_{LM}(x) \exp(-E_{\theta}(x)) $,其中 $ P_{LM}(x) $ 是固定的预训练自回归语言模型,$ E_{\theta}(x) $ 是可学习的能量函数。
- 训练采用条件噪声对比估计(NCE),将真实训练序列作为正例,将基模型生成的样本作为负例。
- 通过在基模型生成的大量候选序列上进行重要性采样实现生成,从而实现高效且高质量的采样。
- 在能量函数中利用双向上下文表示(如 BERT、RoBERTa)以提升序列级建模能力。
- 困惑度通过联合模型进行估计,从而可与自回归基线直接比较。
- 该方法可被解释为通过学习残差能量函数来微调类似 BERT 的双向 Transformer 模型以用于文本生成。
实验结果
研究问题
- RQ1当直接最大似然估计和 MCMC 采样不可行时,能否有效训练并使用能量模型进行文本生成?
- RQ2在预训练语言模型的残差空间中学习序列级能量函数,是否能提升生成质量并降低困惑度?
- RQ3在基模型生成的大量候选序列上进行重要性采样,是否能产生比自回归模型中的贪婪搜索或束搜索更高质量的输出?
- RQ4与基语言模型相比,联合 EBM 模型对真实数据分布的拟合程度如何?
主要发现
- 在两个大规模语言建模数据集上,残差 EBM 的困惑度低于基自回归语言模型。
- 真实数据与模型采样之间平均对数似然得分的差异,从基模型的 21.64 降低至联合模型的 6.20,表明对数据分布的拟合更好。
- 人类评估显示,残差 EBM 生成的文本显著优于基模型生成的文本。
- 该模型在训练和推理阶段均保持高效率,依赖预生成的负例和重要性采样。
- 能量函数成功降低了基模型生成的低质量文本权重,从而提升了整体输出质量。
- 该方法证明,基于 EBM 的文本生成在自动评估和人类评估指标上均优于强自回归基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。