[论文解读] Exposing the Implicit Energy Networks behind Masked Language Models via Metropolis--Hastings
该论文提出了一种马尔可夫链蒙特卡洛(Metropolis–Hastings)采样框架,通过将掩码语言模型(MLMs)解释为隐式能量模型,从其中提取高质量的无条件与条件文本样本。通过从预训练的MLM中推导出两种能量参数化形式,并使用其掩码条件分布作为提议分布,该方法实现了有效的MCMC采样,在机器翻译和开放式生成任务中均优于以往的无向生成方法。
While recent work has shown that scores from models trained by the ubiquitous masked language modeling (MLM) objective effectively discriminate probable from improbable sequences, it is still an open question if these MLMs specify a principled probability distribution over the space of possible sequences. In this paper, we interpret MLMs as energy-based sequence models and propose two energy parametrizations derivable from the trained MLMs. In order to draw samples correctly from these models, we develop a tractable sampling scheme based on the Metropolis--Hastings Monte Carlo algorithm. In our approach, samples are proposed from the same masked conditionals used for training the masked language models, and they are accepted or rejected based on their energy values according to the target distribution. We validate the effectiveness of the proposed parametrizations by exploring the quality of samples drawn from these energy-based models for both open-ended unconditional generation and a conditional generation task of machine translation. We theoretically and empirically justify our sampling algorithm by showing that the masked conditionals on their own do not yield a Markov chain whose stationary distribution is that of our target distribution, and our approach generates higher quality samples than other recently proposed undirected generation approaches (Wang et al., 2019, Ghazvininejad et al., 2019).
研究动机与目标
- 通过将掩码语言模型(MLMs)解释为隐式能量模型,建立其原理性概率解释。
- 从预训练的MLM中推导出两种能量参数化形式,为序列分配得分,实现概率建模。
- 设计一种可计算的采样方案,使用掩码条件分布作为提议分布的Metropolis–Hastings方法,克服双向模型中祖先采样与Gibbs采样的局限性。
- 通过实证验证,这些能量模型在条件生成(机器翻译)与无条件生成设置下所生成样本的质量。
- 证明通过标准目标训练的MLM隐式学习到了一个全局能量网络,从而可通过MCMC实现有效采样。
提出的方法
- 从预训练MLM的隐藏表征中推导出两种能量参数化形式——原始得分与局部归一化能量,使用注意力分数或logit输出作为能量得分。
- 在Metropolis–Hastings MCMC采样器中,使用MLM的掩码条件分布作为提议分布,实现从目标能量基分布中采样。
- 引入非连续块替换提议机制,提升马尔可夫链的混合效率与收敛速度。
- 采用温度退火策略,探索能量分布模式周围的区域,促进条件生成中的模式查找。
- 通过机器翻译任务中的BLEU分数与无条件生成任务中的人工评估(连贯性、流畅性)验证采样质量。
- 理论分析表明,使用掩码条件分布进行朴素Gibbs采样是无效的,因为其不对应于一个合理的联合分布。
实验结果
研究问题
- RQ1通过MLM目标训练的掩码语言模型能否被解释为隐式能量基模型,从而在序列上定义一个原理性概率分布?
- RQ2MLM训练中使用的掩码条件分布是否构成一个有效的马尔可夫链,其平稳分布是否与目标能量基分布一致?
- RQ3使用MLM条件分布作为提议的Metropolis–Hastings采样能否生成优于现有无向生成方法的高质量样本?
- RQ4不同的能量参数化形式(原始 vs. 归一化)在无条件与条件生成中如何影响样本质量?
- RQ5对目标分布进行退火是否能提升样本质量,并在机器翻译中实现有效的模式查找?
主要发现
- 所提出的MH采样器在原始能量参数化下,在De-En测试集上达到30.12的BLEU分数,在Ro-En上达到30.86,优于掩码预测基线与退化Gibbs采样。
- 在机器翻译任务中,使用原始能量参数化的MH采样器性能与自回归模型相当,在De-En上达到30.12 BLEU,在Ro-En上达到30.86。
- 人工评估显示,MH采样器生成的样本(尤其是原始能量形式)在BERT-base上流畅性(2.05)与连贯性(2.05)均高于退化Gibbs采样器(分别为1.23与1.20)。
- MH采样器生成的样本GPT-2困惑度显著更低(BERT-base原始形式为125.42),而退化Gibbs采样器为296.45,表明其更具流畅性与合理性。
- 在原始能量参数化下,MH采样器的接受率高于归一化版本,尤其在目标分布退火时,该现象与更优的生成性能相关。
- 非连续块替换提议机制提升了混合效率并减少了采样时间,实现更快收敛与更优的样本多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。