[論文レビュー] Exposing the Implicit Energy Networks behind Masked Language Models via Metropolis--Hastings
本稿では、マスクされた言語モデル(MLM)を暗黙のエネルギーに基づくモデルとして解釈することにより、高品質で無条件および条件付きのテキストサンプルを抽出するためのメトロポリス・ハスティングスサンプリングフレームワークを提案する。事前学習済みMLMから二つのエネルギーパrametrizationを導出し、それらのマスクされた条件付き分布を提案分布として用いることで、有効なMCMCサンプリングを可能にし、機械翻訳およびオープンエンド生成の両タスクで先行する非方向的生成手法を上回る性能を発揮する。
While recent work has shown that scores from models trained by the ubiquitous masked language modeling (MLM) objective effectively discriminate probable from improbable sequences, it is still an open question if these MLMs specify a principled probability distribution over the space of possible sequences. In this paper, we interpret MLMs as energy-based sequence models and propose two energy parametrizations derivable from the trained MLMs. In order to draw samples correctly from these models, we develop a tractable sampling scheme based on the Metropolis--Hastings Monte Carlo algorithm. In our approach, samples are proposed from the same masked conditionals used for training the masked language models, and they are accepted or rejected based on their energy values according to the target distribution. We validate the effectiveness of the proposed parametrizations by exploring the quality of samples drawn from these energy-based models for both open-ended unconditional generation and a conditional generation task of machine translation. We theoretically and empirically justify our sampling algorithm by showing that the masked conditionals on their own do not yield a Markov chain whose stationary distribution is that of our target distribution, and our approach generates higher quality samples than other recently proposed undirected generation approaches (Wang et al., 2019, Ghazvininejad et al., 2019).
研究の動機と目的
- マスクされた言語モデル(MLM)を暗黙のエネルギーに基づくモデルとして解釈することで、シーケンス上に原理的確率分布を定義する。
- 事前学習済みMLMから導出される二つのエネルギーパラメータ化を提案し、シーケンスにスコアを割り当てることで確率的モデリングを可能にする。
- マスクされた条件付き分布を提案分布として用いるメトロポリス・ハスティングスによる実用的なサンプリングスキームを設計し、双方向モデルにおけるアンサンブルサンプリングおよびギブスサンプリングの限界を克服する。
- 条件付き(機械翻訳)および無条件生成設定の両方で、これらのエネルギーモデルから抽出されたサンプルの品質を実証的に検証する。
- 標準的な目的関数で学習されたMLMが、有効なMCMCによるサンプリングを可能にするグローバルエネルギーネットワークを暗黙的に学習していることを示す。
提案手法
- 事前学習済みMLMの隠れ表現から二つのエネルギーパラメータ化——原始スコアおよび局所正規化エネルギー——を導出し、アテンションスコアまたはロジット出力をエネルギースコアとして用いる。
- MLMのマスクされた条件付き分布をメトロポリス・ハスティングスMCMCサンプラーの提案分布として用い、ターゲットエネルギーに基づく分布からのサンプリングを可能にする。
- マルコフ連鎖内の混合および収束速度を向上させるために、非連続ブロック置換の提案メカニズムを導入する。
- 温度アニーリングを用いてエネルギー分布のモード周辺を探索し、条件付き生成におけるモード探索を容易にする。
- 機械翻訳ではBLEUスコア、無条件生成では人間評価(一貫性、流暢さ)を用いてサンプリング品質を検証する。
- 理論的分析により、マスクされた条件付き分布を用いたナイーブなギブスサンプリングは無効であることが示され、それは適切な結合分布に対応しない。
実験結果
リサーチクエスチョン
- RQ1マスクされた言語モデルがMLM目的関数で学習された場合、シーケンス上に原理的確率分布を定義する暗黙のエネルギーに基づくモデルとして解釈可能か?
- RQ2MLM学習で用いられるマスクされた条件付き分布が、ターゲットエネルギーに基づく分布と一致する定常分布を持つ有効なマルコフ連鎖を形成するか?
- RQ3MLMの条件付き分布を提案分布として用いるメトロポリス・ハスティングスサンプリングは、既存の非方向的生成手法よりも優れた品質のサンプルを生成できるか?
- RQ4異なるエネルギーパラメータ化(原始対正規化)は、無条件および条件付き生成におけるサンプル品質にどのように影響するか?
- RQ5ターゲット分布をアニーリングすることで、サンプル品質が向上し、機械翻訳における有効なモード探索が可能になるか?
主な発見
- 原始エネルギーパラメータ化を用いた提案されたMHサンプラーは、De-Enテストセットで30.12のBLEUスコアを達成し、Ro-Enでは30.86を記録し、マスク予測ベースラインおよび退化したギブスサンプリングを上回る。
- 機械翻訳タスクにおいて、原始エネルギーパラメータ化を用いたMHサンプラーは、自己回帰モデルと同等の性能を示し、De-Enで30.12、Ro-Enで30.86のBLEUスコアを達成した。
- 人間評価では、MHサンプラー(特に原始エネルギー)が、BERT-baseで流暢さ(2.05)および一貫性(2.05)の点で退化したギブスサンプリング(1.23および1.20)を上回った。
- MHサンプラーのサンプルは、退化したギブスサンプリング(296.45)よりも著しく低いGPT-2パープレキシティ(BERT-baseの原始エネルギーで125.42)を示し、より流暢で妥当性の高いテキストであることを示している。
- 特にターゲット分布をアニーリングした場合、原始エネルギーパラメータ化では正規化バージョンよりも高い受容率を示し、これと併せて生成性能の向上が見られた。
- 非連続ブロック置換の提案メカニズムにより、混合が向上し、サンプリング時間が短縮され、収束が速くなり、より多様なサンプルが得られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。