Skip to main content
QUICK REVIEW

[論文レビュー] TLDR: Token Loss Dynamic Reweighting for Reducing Repetitive Utterance Generation

Shaojie Jiang, Thomas Wolf|arXiv (Cornell University)|Mar 26, 2020
Topic Modeling参考文献 38被引用数 11
ひとこと要約

本稿では、トークンの難易度に基づいてトレーニング損失の重みを動的に調整するTLDR(Token Loss Dynamic Reweighting)を提案する。繰り返し発話生成を低減するため、学習が難しいトークンの勾配を増幅し、簡単なトークンの勾配を抑制することで、RNNおよびトランスフォーマーの両アーキテクチャにおいて、chit-chatベンチマークでFocal Loss や均一重み付けと比較して優れた性能を発揮する。

ABSTRACT

Natural Language Generation (NLG) models are prone to generating repetitive utterances. In this work, we study the repetition problem for encoder-decoder models, using both recurrent neural network (RNN) and transformer architectures. To this end, we consider the chit-chat task, where the problem is more prominent than in other tasks that need encoder-decoder architectures. We first study the influence of model architectures. By using pre-attention and highway connections for RNNs, we manage to achieve lower repetition rates. However, this method does not generalize to other models such as transformers. We hypothesize that the deeper reason is that in the training corpora, there are hard tokens that are more difficult for a generative model to learn than others and, once learning has finished, hard tokens are still under-learned, so that repetitive generations are more likely to happen. Based on this hypothesis, we propose token loss dynamic reweighting (TLDR) that applies differentiable weights to individual token losses. By using higher weights for hard tokens and lower weights for easy tokens, NLG models are able to learn individual tokens at different paces. Experiments on chit-chat benchmark datasets show that TLDR is more effective in repetition reduction for both RNN and transformer architectures than baselines using different weighting functions.

研究の動機と目的

  • 神経的テキスト生成モデル、特にオープンドメイン対話タスクにおいて、繰り返し発話生成という継続的な問題に対処すること。
  • RNNにおける事前アテンションやハイウェイ接続といったモデルアーキテクチャの変更が、繰り返しを低減できるかどうかを調査すること。
  • トレーニングデータにおける学習が難しいとされるトークンが繰り返し発話の原因であるという仮説を検証し、実証的に裏付けられること。
  • アーキテクチャ依存性のない、トレーニング中にトークン難易度に応じて適応するより効果的な損失再重み付け手法を開発すること。
  • トークンの学習難易度に基づいて勾配更新を動的に調整することで、生成品質を向上させること。

提案手法

  • 学習損失が大きい(つまり、学習が難しい)トークンに高い重みを割り当てる、微分可能で再重み付け可能な損失メカニズムであるTLDRを提案する。
  • コサインベースの重み関数を用い、交差エントロピー損失が大きいトークンに対して損失重みを増加させ、トレーニング中に各トークンの重要性を動的に調整する。
  • バックプロパゲーション中にこの手法を適用し、学習が難しいトークンの勾配を増幅し、簡単なトークンの勾配を抑制することで、バランスの取れた学習を促進する。
  • 例レベルではなくトークンレベルでの難易度に応じた再重み付けを、Focal Lossにインspiredした動的再重み付け戦略を採用する。
  • chit-chatベンチマークデータセットを用いて、RNNおよびトランスフォーマーに基づくエンコーダデコーダモデルの両方でこの手法を検証する。
  • 標準的な交差エントロピー損失と、動的かつトークン固有の重み付けを組み合わせた、一般化を向上させ、繰り返しを低減するための新規トレーニング目的を導入する。

実験結果

リサーチクエスチョン

  • RQ1RNNにおける事前アテンションやハイウェイ接続といったアーキテクチャ的変更は、chit-chatモデルにおける繰り返し発話生成を低減できるか?
  • RQ2繰り返し問題は、トレーニングデータにおける学習が難しいトークンに起因しており、これは実証的に裏付けられるか?
  • RQ3トレーニング難易度に基づいて動的に再重み付けされるトークンレベルの損失再重み付けは、静的または例レベルの再重み付け手法を上回るか?
  • RQ4提案されたTLDR手法は、RNNやトランスフォーマーといった異なるアーキテクチャに一般化可能か?
  • RQ5TLDRは、BLEU や l-DIMEN といった繰り返し低減および生成品質の指標を向上させるか?

主な発見

  • 事前アテンションおよびハイウェイ接続を備えたRNNは、標準的な事後アテンションRNNよりも繰り返し発話をより効果的に低減するが、この改善効果はトランスフォーマーには一般化されない。
  • Focal Lossを用いた実証的検証により、学習が難しいトークンが不十分に学習されており、繰り返し発話の原因となっていることが確認された。
  • TLDRは、RNNおよびトランスフォーマーの両モデルで一貫して繰り返し率を低減し、TFL や均一重み付けと比較して優れた性能を発揮した。
  • Movie Dialogsデータセットでは、図4の検証曲線に示されるように、TLDRはベースラインよりもトレーニングの初期段階で繰り返しを低減した。
  • LDRは小規模データセットでは限られた効果または負の効果を示すことがあるが、TLDRはすべてのデータセットおよびアーキテクチャで一貫した性能向上を維持した。
  • TLDRの動的勾配調節は、単純な均一損失スケーリング(例:w=2)よりも効果的であり、学習率を一様に増加させるのではなく、困難な例からの勾配を的確に増幅するためである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。