Skip to main content
QUICK REVIEW

[論文レビュー] Hybrid Data-Model Parallel Training for Sequence-to-Sequence Recurrent Neural Network Machine Translation

Junya Ono, Masao Utiyama|arXiv (Cornell University)|Aug 1, 2019
Natural Language Processing Techniques参考文献 19被引用数 1
ひとこと要約

本論文は、機械翻訳における系列対系列RNNのハイブリッドデータ・モデル並列学習手法を提案している。RNNエンコーダ・デコーダにはモデル並列を、アテンション・ソフトマックス部にはデータ並列を適用する。4つのGPUを用いた場合、BLEUスコアに劣化を来さずに4.13–4.20倍の高速化を達成し、特許翻訳のようなタスクにおける高速な学習を可能にする。

ABSTRACT

Reduction of training time is an important issue in many tasks like patent translation involving neural networks. Data parallelism and model parallelism are two common approaches for reducing training time using multiple graphics processing units (GPUs) on one machine. In this paper, we propose a hybrid data-model parallel approach for sequence-to-sequence (Seq2Seq) recurrent neural network (RNN) machine translation. We apply a model parallel approach to the RNN encoder-decoder part of the Seq2Seq model and a data parallel approach to the attention-softmax part of the model. We achieved a speed-up of 4.13 to 4.20 times when using 4 GPUs compared with the training speed when using 1 GPU without affecting machine translation accuracy as measured in terms of BLEU scores.

研究の動機と目的

  • 特許翻訳のような計算負荷の高いタスクを対象として、機械翻訳における系列対系列RNNモデルの学習時間を短縮すること。
  • 純粋なデータ並列またはモデル並列のスケーラビリティの限界を克服するため、両方の戦略を組み合わせること。
  • マルチGPUシステム上で学習を高速化しつつ、BLEUスコアで測定される翻訳精度を維持すること。
  • 計算およびメモリ特性に基づいて、異なるモデル部品を異なる並列化戦略に割り当てることでGPUの利用効率を最適化すること。

提案手法

  • RNNエンコーダ・デコーダ部にモデル並列を適用し、隠れ状態の計算をGPU間で分散処理する。
  • アテンション・ソフトマックス部にデータ並列を適用し、シーケンスのバッチをGPU間で分割して独立して処理する。
  • バックプロパゲーション中にパラメータ同期と勾配平均化を用いてGPUパーティション間の通信を調整する。
  • メモリ集約的なRNNレイヤーをモデル並列に、計算集約的なアテンション機構をデータ並列に割り当てることで、計算負荷をバランスさせる。
  • ハイブリッド学習パイプラインにおけるオーバーヘッドを最小限に抑えるために、GPUパーティション間の効率的な通信プロトコルを実装する。

実験結果

リサーチクエスチョン

  • RQ1ハイブリッドデータ・モデル並列アプローチは、翻訳品質を損なわせることなく、Seq2Seq RNNの学習時間を短縮できるか?
  • RQ2モデル並列とデータ並列の組み合わせは、純粋な並列化戦略に比べて、スループットと精度の両面で優れているか?
  • RQ3RNNエンコーダ・デコーダ部とアテンション・ソフトマックス部の最適なパーティショニング戦略は何か? これはGPU利用効率を最大化することを目的とする。
  • RQ4ハイブリッドアプローチは、単一GPU学習と比較して、BLEUスコアをどの程度維持できるか?

主な発見

  • 4つのGPUを用いた学習において、ハイブリッドアプローチは単一GPUに比べて4.13~4.20倍の高速化を達成した。
  • 翻訳品質に劣化が生じず、学習実行間で一貫したBLEUスコアが確認された。
  • RNN部にモデル並列、アテンション・ソフトマックス部にデータ並列を活用することで、計算負荷のバランスが効果的に取れた。
  • 効率的な同期によりGPU間の通信オーバーヘッドが最小限に抑えられ、高い学習効率が維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。