Skip to main content
QUICK REVIEW

[論文レビュー] Trading Off Diversity and Quality in Natural Language Generation

Hugh Zhang, Daniel Duckworth|arXiv (Cornell University)|Apr 22, 2020
Natural Language Processing Techniques参考文献 35被引用数 19
ひとこと要約

本稿では、応答の質と多様性を同時に最適化することで、自然言語生成におけるデコードアルゴリズムを評価するためのマルチオブジェクティブフレームワークを提案する。質と多様性のスペクトルにわたる大規模な評価を初めて実施し、質を優先する場合にはnucleus samplingが他の手法を上回ることを明らかにした。また、高確率出力がしばしば低品質であるという「尤度の罠(likelihood trap)」を実証的に確認した。さらに、グローバルに正規化された温度サンプリングの近似として実用的な手法として選択的サンプリング(selective sampling)を導入した。

ABSTRACT

For open-ended language generation tasks such as storytelling and dialogue, choosing the right decoding algorithm is critical to controlling the tradeoff between generation quality and diversity. However, there presently exists no consensus on which decoding procedure is best or even the criteria by which to compare them. We address these issues by casting decoding as a multi-objective optimization problem aiming to simultaneously maximize both response quality and diversity. Our framework enables us to perform the first large-scale evaluation of decoding methods along the entire quality-diversity spectrum. We find that when diversity is a priority, all methods perform similarly, but when quality is viewed as more important, the recently proposed nucleus sampling (Holtzman et al. 2019) outperforms all other evaluated decoding algorithms. Our experiments also confirm the existence of the `likelihood trap', the counter-intuitive observation that high likelihood sequences are often surprisingly low quality. We leverage our findings to create and evaluate an algorithm called \emph{selective sampling} which tractably approximates globally-normalized temperature sampling.

研究の動機と目的

  • 対話や物語生成などのオープンエンドド言語生成タスクにおけるデコードアルゴリズムに、まだ合意が得られていない点を解決すること。
  • 質と多様性の両方のスケールをカバーする、信頼性のある人間評価に基づくフレームワークを構築し、デコード手法の比較を可能にすること。
  • モデルの尤度が高いほど人間による評価が低くなるという直感に反する現象(いわゆる「尤度の罠」)を調査すること。
  • パーティション関数の明示的計算なしに、グローバルに正規化された温度サンプリングを近似する新しいデコードアルゴリズムである選択的サンプリングの開発と評価。
  • 約10,000件の生成出力について38,000件以上の人的判断を用いて、スケーラブルな大規模評価を実施すること。

提案手法

  • 人間の評価結果を質の代理指標として用い、応答の質と多様性の両方を同時に最適化するマルチオブジェクティブ最適化問題としてデコードを定式化する。
  • 146名のクラウドワーカーが、さまざまなモデル尤度を持つ100文の文を評価する大規模な人的評価調査を実施し、質と尤度の関係を測定する。
  • パーティション関数の計算なしに、グローバルに正規化された温度分布を近似する、リジェクションサンプリングに基づく選択的サンプリングを導入する。
  • 逆Kullback-Leibler発散と競合する目的関数の最大化を理論的根拠として用い、サンプリングされた文の確率密度推定を可能にする。
  • グリーディサーチ、ビームサーチ、top-k、top-p(nucleus sampling)、温度サンプリングなど、複数のデコードアルゴリズムを、多様性重視と質重視の両設定で評価する。
  • 2段階のプロセスを採用する:まず人間が書いたコーパスでモデルを学習(質の代理として)、次にさまざまなデコード戦略を用いて推論し、望ましいトレードオフを最適化する。

実験結果

リサーチクエスチョン

  • RQ1オープンエンドド言語生成において、さまざまなデコードアルゴリズムは質と多様性の全スケールでどのように性能を発揮するか?
  • RQ2モデル尤度と人間による応答品質の間にはどの程度相関があるか。また、この関係は非単調的パターンを示すか?
  • RQ3パーティション関数の明示的計算なしに、グローバルに正規化された温度サンプリングを近似できる実用的なデコードアルゴリズムは存在するか?
  • RQ4質を多様性よりも優先する状況では、nucleus samplingが他のデコード戦略を上回るか?
  • RQ5選択的サンプリングは、生成出力の確率密度推定を可能にしつつ、多様性と質の両立を効果的に実現できるか?

主な発見

  • 多様性を優先する場合には、すべてのデコードアルゴリズムが同程度に性能を発揮しており、標準的手法間で多様性の差は顕著でないことが示された。
  • 質を優先する場合には、nucleus sampling(top-p)が、グリーディサーチ、ビームサーチ、top-k、温度サンプリングなど、他のデコードアルゴリズムを顕著に上回った。
  • 本研究では、実証的に「尤度の罠」の存在を確認した:高尤度のシーケンスは、一般的に質と相関があるものの、人間のアノテーターによって低品質と評価される傾向がある。
  • 尤度の罠は、尤度分布の極端な領域で最も顕著であり、非常に低尤度および非常に高尤度のシーケンスが、人間による評価で低品質になりがちである。
  • 選択的サンプリングは、グローバルに正規化された温度サンプリングの実用的かつ正確な近似を提供し、パーティション関数の明示的計算なしに生成文の確率密度推定を可能にした。
  • 本フレームワークにより、質と多様性の全フロンティアにわたる、人的評価に基づくデコード手法のスケーラブルな比較が可能となり、今後の評価のための信頼性のあるベンチマークを提供した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。