Skip to main content
QUICK REVIEW

[論文レビュー] Non-Autoregressive Text Generation with Pre-trained Language Models

Yixuan Su, Deng Cai|arXiv (Cornell University)|Feb 16, 2021
Topic Modeling参考文献 24被引用数 10
ひとこと要約

本稿では、BERTをバックボーンとして用いる非自己回帰的テキスト生成フレームワークを提案する。[eos]トークンの学習可能化による動的長さ決定と、繰り返しを低減するための文脈に配慮した学習目的を導入している。非自己回帰モデルにおいて最先端の性能を達成するとともに、自己回帰モデルと同等の結果を出し、新規のratio-firstデコード戦略により高速な推論を実現している。

ABSTRACT

Non-autoregressive generation (NAG) has recently attracted great attention due to its fast inference speed. However, the generation quality of existing NAG models still lags behind their autoregressive counterparts. In this work, we show that BERT can be employed as the backbone of a NAG model to greatly improve performance. Additionally, we devise mechanisms to alleviate the two common problems of vanilla NAG models: the inflexibility of prefixed output length and the conditional independence of individual token predictions. Lastly, to further increase the speed advantage of the proposed model, we propose a new decoding strategy, ratio-first, for applications where the output lengths can be approximately estimated beforehand. For a comprehensive evaluation, we test the proposed model on three text generation tasks, including text summarization, sentence compression and machine translation. Experimental results show that our model significantly outperforms existing non-autoregressive baselines and achieves competitive performance with many strong autoregressive models. In addition, we also conduct extensive analysis experiments to reveal the effect of each proposed component.

研究の動機と目的

  • 非自己回帰モデルの生成品質を向上させること。非自己回帰モデルは一般的に自己回帰モデルに比べて性能に劣る傾向がある。
  • 従来のNAGモデルにおける固定出力長の不柔軟性を解消し、推論時に動的長さ決定を可能にする。
  • 非自己回帰生成における繰り返しや不文閲な出力を引き起こす条件付き独立性仮定を軽減すること。
  • 要約や文の圧縮など、出力長比が予測可能であるタスクにおける推論効率を向上させること。
  • 自己回帰モデルと同等の性能を達成しつつ、非自己回帰生成の速度優位性を維持すること。

提案手法

  • 出力側の依存関係をモデル化し、系列の整合性を向上させるために、CRF層をBERTエンコーダーの上に追加する。
  • 生成を停止するタイミングを動的に決定できる学習可能な[ eos ]トークン機構を導入し、長さ予測や長さ並列デコードの必要性を排除する。
  • 隣接する位置で同一または類似した予測がなされないようにペナルティを課す文脈に配慮した学習目的を提案する。
  • 事前に得られた出力-入力長比の知識に基づき、入力長の割合αに制限されたソース側隠れ状態処理を実行するratio-firstデコード戦略を採用する。
  • 比較のためのベースラインとして、複数の長さ候補を生成し、別モデルで再順序付けを行う長さ並列デコード(LPD)を用いる。
  • BERTエンコーダー、CRF層、[eos]トークン予測ヘッドを統合的に最適化することで、エンドツーエンドのモデル学習を実現する。

実験結果

リサーチクエスチョン

  • RQ1BERTを非自己回帰的テキスト生成のバックボーンとして効果的に適応させることで、生成品質を向上させることができるか?
  • RQ2学習可能な[ eos ]トークンによる動的長さ決定は、固定長または長さ並列デコード戦略に比べ、品質と速度の両面で優れているか?
  • RQ3文脈に配慮した学習目的は、非自己回帰生成における繰り返しを低減し、文の流れを改善できるか?
  • RQ4ratio-firstデコード戦略は、生成品質を損なわずにどの程度推論速度を向上させられるか?
  • RQ5多様なテキスト生成タスクにおいて、提案モデルは強力な自己回帰モデルと比較してどの程度の性能を示すか?

主な発見

  • 提案モデルは、IWSLT14 DE-EN翻訳データセットでBLEUスコア30.45を達成し、LPD-10ベースライン(27.15)を上回り、はるかに遅いデコード戦略を用いたモデルと同等の性能を示した。
  • 自己回帰モデルと比較して11.31倍の推論速度向上を達成した。これはLPD-1デコードと同等の速度であり、生成品質でははるかに優れていた。
  • ratio-firstデコードを用いることで、Gigawordsデータセットでα = 0.3のとき9.31倍の速度向上を達成した。これは速度と品質の最適なバランスに相当する。
  • Gigawordsデータセットにおける出力-入力長比の分布を分析したところ、70%のインスタンスが比0.3未満に収まっており、α = 0.3の選択が最適性能を発揮する根拠となった。
  • アブレーションスタディの結果、動的長さ機構と文脈に配慮した目的の両方が、特に繰り返しの低減と文の自然さ向上において顕著な性能向上に寄与していることが確認された。
  • テキスト要約、文の圧縮、機械翻訳の各タスクにおいて、強力な自己回帰モデルと同等の結果を達成した。BERTベースのNAGが高品質な生成を実現可能であることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。