Skip to main content
QUICK REVIEW

[論文レビュー] Language Modeling with Gated Convolutional Networks

Yann Dauphin, Angela Fan|arXiv (Cornell University)|Dec 23, 2016
Topic Modeling参考文献 24被引用数 1,121
ひとこと要約

ゲート付き畳み込みネットワーク(GCNN)とGated Linear Unitsを言語モデリングに導入し、WikiText-103で最先端を達成し、Google Billion Wordでは競争的な結果を得た。再発モデルに比べてはるかに高い効率性を実現。

ABSTRACT

The pre-dominant approach to language modeling to date is based on recurrent neural networks. Their success on this task is often linked to their ability to capture unbounded context. In this paper we develop a finite context approach through stacked convolutions, which can be more efficient since they allow parallelization over sequential tokens. We propose a novel simplified gating mechanism that outperforms Oord et al (2016) and investigate the impact of key architectural decisions. The proposed approach achieves state-of-the-art on the WikiText-103 benchmark, even though it features long-term dependencies, as well as competitive results on the Google Billion Words benchmark. Our model reduces the latency to score a sentence by an order of magnitude compared to a recurrent baseline. To our knowledge, this is the first time a non-recurrent approach is competitive with strong recurrent models on these large scale language tasks.

研究の動機と目的

  • 有限文脈で高度に並列化可能な言語モデリングを、リカレントネットワークの代替として動機づける。
  • 勾配の流れと非線形モデリングを促進するため、ゲート機構(GLU)をゲート付き畳み込みネット内に提案する。
  • 大規模データセット(Google Billion Word、WikiText-103)上でGCNNをリカレントモデルやベースラインと比較して評価する。
  • 文脈サイズ、ゲーティング機構、訓練手法、アーキテクチャの選択が性能と効率に与える影響を分析する。

提案手法

  • GLUを用いた残差ボトルネックブロック内の畳み込みアーキテクチャを定義する。
  • 将来を覗くのを防ぐための適切な因果パディングを用いて、隠れ表現を h_l(X) = (X * W + b) ⊗ σ(X * V + c) で計算する。
  • 深い積み重ねと勾配フローを可能にするために事前活性化残差ブロックを用いる。
  • 効率的な大語彙予測のために適応型ソフトマックスで訓練する。
  • ゲーティングのバリアント(GLU対GTU)を実験し、線形および双線形/非線形の代替案と比較する。
  • 文脈サイズの効果を評価し、LSTMと比較してスループットと応答性を比較する。

実験結果

リサーチクエスチョン

  • RQ1ゲート付き畳み込みネットワークは再帰なしで言語モデリングにおける長距離依存性を効果的に捉えられるか。
  • RQ2GLUゲーティング機構は訓練効率とパープレキシティの点でLSTM型ゲートとどう比較されるか。
  • RQ3大規模データセット上でGCNNsの性能へ文脈窓サイズの影響はどうか。
  • RQ4アーキテクチャの選択(残差ブロック、ボトルネック)と最適化の工夫が訓練速度と最終性能にどう影響するか。
  • RQ5現実的な計算資源の制約下で、GCNNsは大規模言語モデリングのベンチマークで最新のリカレントモデルと競争力を持つか。

主な発見

  • GCNNはWikiText-103で最先端のパープレキシティを達成し、Google Billion Wordでは競争力のある結果を示す。
  • GLUベースのGCNNは、Wik-103とGBWの両方でLSTM型ゲートや他の活性化より収束が速く、パープレキシティも低い。
  • 文脈サイズはおよそ20-40トークン程度まで性能を向上させ、それを超えると収益が減少する。長文でも同様。
  • ボトルネック残差ブロックと勾配クリッピングを伴う重み正規化は、訓練を大幅に速め、効率を改善する。
  • GCNNはGPU上で強力なスループットと優れた応答性を提供し、同等のハードウェアと出力近似設定のもとでリカレントベースラインに対して大きな速度アップを示す。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。