Skip to main content
QUICK REVIEW

[論文レビュー] MAD for Robust Reinforcement Learning in Machine Translation

Domenic Donato, Lei Yu|arXiv (Cornell University)|Jul 18, 2022
Natural Language Processing Techniques被引用数 5
ひとこと要約

本稿では、ニューラル機械翻訳におけるロバスト強化学習のための分散型方策勾配アルゴリズムMADを提案する。MADは、条件付き報酬正規化と平均絶対偏差(MAD)に基づくロバストな重要度重み付け方式を組み合わせることで、学習の安定性と一般化性能を向上させる。MADは交差エントロピー事前学習より平均2.0 BLEUの向上を達成し、ビームサーチのハイパーパrameterに依存性を低減する。

ABSTRACT

We introduce a new distributed policy gradient algorithm and show that it outperforms existing reward-aware training procedures such as REINFORCE, minimum risk training (MRT) and proximal policy optimization (PPO) in terms of training stability and generalization performance when optimizing machine translation models. Our algorithm, which we call MAD (on account of using the mean absolute deviation in the importance weighting calculation), has distributed data generators sampling multiple candidates per source sentence on worker nodes, while a central learner updates the policy. MAD depends crucially on two variance reduction strategies: (1) a conditional reward normalization method that ensures each source sentence has both positive and negative reward translation examples and (2) a new robust importance weighting scheme that acts as a conditional entropy regularizer. Experiments on a variety of translation tasks show that policies learned using the MAD algorithm perform very well when using both greedy decoding and beam search, and that the learned policies are sensitive to the specific reward used during training.

研究の動機と目的

  • ニューラル機械翻訳における既存の報酬に依存する学習手法の不安定さと一般化性能の低さを解消すること。
  • 壊れやすい補助価値ネットワークに依存せずに、方策勾配推定の分散を低減すること。
  • 各ソース文ごとに高報酬・低報酬翻訳の多様でバランスの取れたサンプリングを保証することで、方策のロバスト性を向上させること。
  • 温度範囲サンプリングを用いることで、計算コストを低減しつつ効果的なハイパーパrameterチューニングを可能にすること。
  • 学習済み方策が訓練時に使用された報酬関数に敏感であることを確認し、報酬駆動型学習であることを裏付けること。

提案手法

  • 複数のワーカーが、わずかに古くなった方策を用いて、さまざまなサンプリング温度を用いて多様な翻訳候補を生成する分散アーキテクチャを採用する。
  • 各ソース文ごとに条件付き報酬正規化を適用し、報酬を経験的平均を中心にシフトし、標準偏差でスケーリングすることで、各バッチに正例と負例の両方が含まれるようにする。
  • 平均絶対偏差(MAD)に基づく新しいロバストな重要度重み付け方式が、条件付きエントロピー正則化子として機能し、現在の方策からわずかに逸脱した軌道に注目することで、探索性と安定性を維持する。
  • 中央の学習者(learner)は、正規化報酬とMAD重みを用いて計算された方策勾配を用いて方策を更新し、小さな、保守的な更新を実現する。
  • バッチレベルのベースラインや補助価値ネットワークに依存せず、入力ごとに複数の翻訳をサンプリングした経験的報酬統計を用いる。
  • ハイパーパrameterサーチの効率を向上させるために、単一の温度ではなく温度範囲をサンプリングに用いる。

実験結果

リサーチクエスチョン

  • RQ1分散型方策勾配アルゴリズムは、機械翻訳の系列レベル強化学習における学習の安定性と一般化性能を向上させることができるか?
  • RQ2入力ごとに正例と負例の両方が含まれるように保証する条件付き報酬正規化は、方策学習を改善するか?
  • RQ3平均絶対偏差(MAD)に基づくロバストな重要度重み付け方式は、サンプルの多様性を向上させるとともに、方策更新の分散を低減できるか?
  • RQ4学習済み方策はどの程度異なる報酬関数に対して一般化可能であり、訓練時に使用された報酬に特化して適応するか?
  • RQ5単一の温度ではなく温度範囲を用いることで、最適性能を得るためのハイパーパrameterスイープ回数を削減できるか?

主な発見

  • MADアルゴリズムは、複数の翻訳タスクにおいて、ホールドアウトテストセットで初期の交差エントロピー微調整モデルより平均2.0 BLEUの向上を達成する。
  • MADは、REINFORCE、MRT、PPOといった強力なベースラインを上回り、学習の安定性と一般化性能の両面で優れる。
  • 学習済み方策はビームサーチのハイパーパrameterにあまり依存せず、大きなビームサイズでも最小限の性能低下しか示さない。
  • 条件付き報酬正規化は、アルゴリズムの成功にとって不可欠な要素であると特定され、性能と安定性の両面で顕著な向上をもたらす。
  • MADの重要度重み付け方式はサンプルの多様性を向上させ、多数の学習ステップにわたり安定的で、保守的な方策更新を実現する。
  • 異なる報酬関数で学習されたモデルは、それぞれの指標に対して良好に一般化するため、方策が報酬に特化した行動を学習していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。