Skip to main content
QUICK REVIEW

[論文レビュー] Parallel Scheduled Sampling

Daniel Duckworth, Arvind Neelakantan|arXiv (Cornell University)|Jun 11, 2019
Multimodal Machine Learning Applications参考文献 25被引用数 12
ひとこと要約

本稿では、教師強制(teacher-forcing)とは異なった分布をとる推論時における自己回帰的生成の分布ずれを低減する効果を持つ、スケジュールドサンプリング(Scheduled Sampling)の完全に並列化可能な代替手法であるParallel Scheduled Samplingを提案する。本手法は、モデルの予測を並列に生成し、学習可能な確率スケジュールを用いて真値トークンと混合することで、順方向処理に起因するボトルネックを解消する。画像生成、要約、対話生成のタスクにおいて、FIDが最大20%低く、ISが13.8%高いという最先端の性能を達成している。

ABSTRACT

Auto-regressive models are widely used in sequence generation problems. The output sequence is typically generated in a predetermined order, one discrete unit (pixel or word or character) at a time. The models are trained by teacher-forcing where ground-truth history is fed to the model as input, which at test time is replaced by the model prediction. Scheduled Sampling aims to mitigate this discrepancy between train and test time by randomly replacing some discrete units in the history with the model's prediction. While teacher-forced training works well with ML accelerators as the computation can be parallelized across time, Scheduled Sampling involves undesirable sequential processing. In this paper, we introduce a simple technique to parallelize Scheduled Sampling across time. Experimentally, we find the proposed technique leads to equivalent or better performance on image generation, summarization, dialog generation, and translation compared to teacher-forced training. In dialog response generation task, Parallel Scheduled Sampling achieves 1.6 BLEU score (11.5%) improvement over teacher-forcing while in image generation it achieves 20% and 13.8% improvement in Frechet Inception Distance (FID) and Inception Score (IS) respectively. Further, we discuss the effects of different hyper-parameters associated with Scheduled Sampling on the model performance.

研究の動機と目的

  • 教師強制による学習と推論時の自己回帰的デコードの間で生じる訓練-推論の分布ずれを解消すること。
  • スケジュールドサンプリングにおける逐次処理に起因する計算ボトルネックを克服し、長文シーケンスや大規模モデルにおけるスケーラビリティを向上させること。
  • スケジュールドサンプリングの実証的利点を維持しつつ、完全に並列化可能な代替手法を開発し、現代のMLアクセラレータ上で効率的な学習を可能にすること。
  • 提案手法が、画像生成や対話応答モデリングを含む多様なシーケンス生成タスクにおいて、教師強制およびスケジュールドサンプリングと同等または優れた性能を達成することを実証すること。

提案手法

  • 真値のコンテキストを用いて、教師強制のフォワードパスに相当する完全なシーケンスの予測を並列に生成する。
  • 各時刻tにおけるトークンが、スケジュールされた確率に従い、真値またはモデルの予測トークンから独立に選択される並列混合処理を適用する。
  • 時間経過に伴い増加する学習可能な混合確率を用い、元のスケジュールドサンプリングのカリキュラム学習スケジュールを模倣する。
  • 混合シーケンスを入力として通常の教師強制学習を実行し、全シーケンスにわたるバックプロパゲーションを可能にする。
  • モデルが真の自己回帰的デコードの分布に収束するように、予測と混合のステップを複数回繰り返す。
  • 学習の安定化を図るため、初期段階では教師強制を用い、その後混合学習体制に段階的に入れ替えるウォームアップ段階を導入する。

実験結果

リサーチクエスチョン

  • RQ1スケジュールドサンプリングを、自己回帰的モデルにおける訓練-推論の分布ずれ低減能力を損なわず、並列化可能か。
  • RQ2提案手法による並列化は、大規模モデルにおけるスケジュールドサンプリングの性能向上を維持しつつ、効率的な学習を可能にするか。
  • RQ3混合確率やパス数といったハイパーパrameterが、さまざまなシーケンス生成タスクにおけるモデル性能に与える影響は何か。
  • RQ4どのような状況でParallel Scheduled Samplingは教師強制を上回り、その有効性の限界は何か。
  • RQ5要約や画像生成のような長文シーケンスタスクに、順次処理が非効率であるスケジュールドサンプリングでは不適切な長文タスクに対しても、本手法は効果的に適用可能か。

主な発見

  • CIFAR-10の画像生成タスクにおいて、Parallel Scheduled SamplingはFIDを20%改善し、ISを13.8%向上させ、教師強制を上回った。
  • 対話応答生成タスクでは、BLEUスコアが教師強制を1.6ポイント(相対改善率11.5%)上回った。
  • 要約タスクでは、ベースモデルではビームサーチおよびグリーディデコード、大規模モデルではグリーディデコードにおいて、教師強制を上回った。
  • 訓練時間は、順次スケジュールドサンプリングに比べてたったの0.3%にまで短縮され、大規模モデルや長文シーケンスに対して実用的となった。
  • 画像およびテキストタスクでは顕著な向上が得られたが、機械翻訳(WMT 2014 英語=ドイツ語)では改善が観察されなかった。これは、シーケンス長が短いことが要因とされる可能性がある。
  • 特定のハイパーパrameter設定下では、本手法はスケジュールドサンプリングと等価であり、教師強制と完全な自己回帰的デコードの間の補間を保ったままにした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。