Skip to main content
QUICK REVIEW

[論文レビュー] Non-Autoregressive Neural Dialogue Generation

Qinghong Han, Yuxian Meng|arXiv (Cornell University)|Feb 11, 2020
Topic Modeling参考文献 61被引用数 11
ひとこと要約

本稿では、自己回帰的(AR)デコーディングにおける非グローバル最適化問題を克服するため、最大相互情報量(MMI)を統合した非自己回帰的(non-AR)ニューラル対話生成モデルを提案する。非自己回帰的生成により、各トークンを独立して生成することで、生成直後に $p(x|y)$ を即座に計算でき、グローバル最適化が可能になる。実験の結果、本手法はより多様で整合性が高く、コンテンツ豊富な応答を生成し、BLEUスコアおよび人間評価においてARベースのMMIモデルを大きく上回る成果を上げた。

ABSTRACT

Maximum Mutual information (MMI), which models the bidirectional dependency between responses ($y$) and contexts ($x$), i.e., the forward probability $\log p(y|x)$ and the backward probability $\log p(x|y)$, has been widely used as the objective in the \sts model to address the dull-response issue in open-domain dialog generation. Unfortunately, under the framework of the \sts model, direct decoding from $\log p(y|x) + \log p(x|y)$ is infeasible since the second part (i.e., $p(x|y)$) requires the completion of target generation before it can be computed, and the search space for $y$ is enormous. Empirically, an N-best list is first generated given $p(y|x)$, and $p(x|y)$ is then used to rerank the N-best list, which inevitably results in non-globally-optimal solutions. In this paper, we propose to use non-autoregressive (non-AR) generation model to address this non-global optimality issue. Since target tokens are generated independently in non-AR generation, $p(x|y)$ for each target word can be computed as soon as it's generated, and does not have to wait for the completion of the whole sequence. This naturally resolves the non-global optimal issue in decoding. Experimental results demonstrate that the proposed non-AR strategy produces more diverse, coherent, and appropriate responses, yielding substantive gains in BLEU scores and in human evaluations.

研究の動機と目的

  • 対話生成に最大相互情報量(MMI)を用いる際の自己回帰的(AR)デコーディングにおける非グローバル最適化問題を解決すること。
  • 各トークンの生成と同時に $p(x|y)$ を即時計算することで、全シーケンスの完了に依存しないMMI目的関数のグローバル最適化を可能にすること。
  • オープンドメイン対話システムにおける応答の多様性、整合性、コンテンツ豊かさを向上させること。
  • 非自己回帰的生成にMMIを適用した手法の有効性を、対話生成および機械翻訳の両タスクにおいて評価すること。

提案手法

  • ターゲットトークンを独立して生成する非自己回帰的(non-AR)生成フレームワークを採用し、各トークンの生成直後に $p(x|y)$ を即座に計算可能にする。
  • 非自己回帰的デコーディングプロセスにMMI目的関数 $\log p(y|x) + \log p(x|y)$ を統合し、各トークンの生成段階で $p(x|y)$ を評価することでグローバル最適化を実現する。
  • コンテキストエンコーディングおよび応答生成の両方において、Transformerバックボーンを備えたseq2seqモデルを用いる。
  • 非自己回帰的生成における学習安定性と性能向上のため、知識 distillation を適用する。
  • 各トークンごとにMMIスコアを段階的に計算することでデコードを実行し、ビームサーチの制限を回避するとともに、多様な出力を可能にする。
  • OpenSubtitlesデータセットを用いた対話生成と、WMT14/16ベンチマークを用いた機械翻訳の両方でモデルを評価する。

実験結果

リサーチクエスチョン

  • RQ1非自己回帰的生成は、自己回帰的MMIデコーディングに内在する非グローバル最適化問題を解消できるか?
  • RQ2逐次的トークン生成中に $p(x|y)$ の計算を統合することで、より多様で整合性の高い応答が得られるか?
  • RQ3非自己回帰的+MMIは、自己回帰的モデルにMMIを適用し、多様なデコーディング戦略を用いた場合と比較して、応答品質およびBLEUスコアで優れているか?
  • RQ4提案手法は、対話生成にとどまらず、機械翻訳などの他のシーケンスtoシーケンスタスクにも一般化可能か?

主な発見

  • 非自己回帰的+MMIモデルは、コンテンツ豊かさの分野で55.3%の人的評価スコアを達成し、同じ指標でAR+MMI(43.2%)およびAR+MMI+RL(48.7%)を大きく上回った。
  • 人的評価では、非自己回帰的+MMIがAR+MMIよりも著しく整合性が高く、コンテンツ豊かであることが判明し、両指標ともp値 < 0.01であった。
  • WMT14 En→De翻訳タスクにおいて、非自己回帰的+MMIは23.80のBLEUスコアを達成し、ベースの非自己回帰的モデル(22.32)に対して+1.48の向上を示した。
  • 非自己回帰的+MMIモデルは、ARベースのモデルと比較してより多様な応答を生成しており、AR+MMI出力における「I」などの共通プレフィックスの繰り返し減少がその証左となった。
  • 非自己回帰的+MMIは、AR+MMIおよびAR+MMI+RLと比較して、コンテンツ豊かさ(p < 0.01)および整合性(p < 0.01)において統計的に有意な向上を示した。
  • 非自己回帰的+MMIモデルは、OpenSubtitles対話データセットで44.6のBLEUスコアを達成し、人的評価指標においてAR+MMI(30.6)およびAR(38.2)を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。