Skip to main content
QUICK REVIEW

[論文レビュー] Neural Transformation Machine: A New Architecture for Sequence-to-Sequence Learning.

Fandong Meng, Zhengdong Lu|arXiv (Cornell University)|Jun 22, 2015
Natural Language Processing Techniques参考文献 17被引用数 9
ひとこと要約

Neural Transformation Machine (NTram) は、入力系列から出力系列への非線形変換を実行するために、学習可能な読み書き操作を備えたスタックされたメモリ層を用いる、新しいシーケンス・トゥ・シーケンスアーキテクチャである。NTram は、小さな語彙と限定的なパラメータ数で、Moses らのような従来のフレーズベースシステムと同等の性能を達成しているが、スケーラブルであり、先行する最先端モデルを特別なケースとして包含できる。

ABSTRACT

We propose Neural Transformation Machine (NTram), a novel architecture for sequence-to-sequence learning, which performs the task through a series of nonlinear transformations from the representation of the input sequence (e.g., a Chinese sentence) to the final output sequence (e.g., translation to English). Inspired by the recent Neural Turing Machines [8], we store the intermediate representations in stacked layers of memories, and use read-write operations on the memories to realize the nonlinear transformations of those representations. Those transformations are designed in advance but the parameters are learned from data. Through layer-by-layer transformations, NTram can model complicated relations necessary for applications such as machine translation between distant languages. The architecture can be trained with normal back-propagation on parallel texts, and the learning can be easily scaled up to a large corpus. NTram is broad enough to subsume the state-of-the-art neural translation model in [2] as its special case, while significantly improves upon the model with its deeper architecture. Remarkably, NTram, being purely neural network-based, can achieve performance comparable to the traditional phrase-based machine translation system (Moses) with a small vocabulary and a modest parameter size.

研究の動機と目的

  • 機械翻訳などのタスクにおける複雑な言語的関係をモデル化できる、新しいシーケンス・トゥ・シーケンスアーキテクチャの設計。
  • 学習可能な読み書き操作を備えた階層的メモリユニットにより、より深い、より表現力のある表現の実現。
  • 小さな語彙と限られたパラメータ数で、Moses らのような従来のシステムと競合する性能を達成すること。
  • 標準的なバックプロパゲーションを用いて大規模な並列コーパス上で効率的に学習可能なスケーラブルな訓練フレームワークの提供。
  • より深いメモリ層への拡張によって、既存の最先端神経翻訳モデルのアーキテクチャを一般化すること。

提案手法

  • NTram は、入力系列の間接的表現を格納するためにスタックされたメモリ層を用いる。
  • これらのメモリ層に対して、学習可能な読み取りおよび書き込み操作を介して事前に定義された非線形変換を適用する。
  • 変換パラメータは、並列テキストデータ上で標準的なバックプロパゲーションを用いてエンド・ツー・エンドで訓練される。
  • このアーキテクチャは、先行モデルよりも深い表現を可能にし、複雑なクロスリンガル依存関係のモデル化を可能にする。
  • 深さが1層に減少した場合、既存の最先端神経翻訳モデルを特別なケースとして包含できるように設計されている。
  • メモリ機構は、神経的チューリングマシンからインspirationを受けており、シーケンス処理中に動的かつ柔軟な情報操作を可能にする。

実験結果

リサーチクエスチョン

  • RQ1より深い、メモリ拡張型の神経アーキテクチャは、遠隔言語間翻訳のシーケンス・トゥ・シーケンスモデリングを改善できるか?
  • RQ2限られたパラメータ数を有する完全にニューラルなモデルは、従来のフレーズベースシステムの性能にどの程度まで達することができるか?
  • RQ3学習可能な読み書き操作を備えたスタックされたメモリ層は、シーケンスモデリングにおける表現学習をどのように向上させるか?
  • RQ4標準的なバックプロパゲーションを用いて、大規模な並列コーパス上で、提案されたアーキテクチャを効率的に訓練できるか?
  • RQ5このモデルは、既存の最先端神経翻訳モデルをどの程度一般化または拡張できるか?

主な発見

  • NTram は、小さな語彙と限定的なパラメータ数であるにもかかわらず、フレーズベースのMosesシステムと同等の性能を達成している。
  • モデルはスケーラブルであり、標準的なバックプロパゲーションを用いて大規模な並列コーパス上で効率的に訓練可能である。
  • 深さが1層に減少した場合、NTram は [2] に提示された最先端神経翻訳モデルを特別なケースとして包含する。
  • NTram のより深いアーキテクチャは、シーケンス・トゥ・シーケンスタスクにおける複雑な言語的関係のモデル化をより良く可能にする。
  • スタックされたメモリ層における学習可能な読み書き操作の使用は、シーケンス表現における非線形変換を効果的に捉える。
  • このアーキテクチャは、外部の言語モデルや大規模な語彙辞書に依存せずに、純粋にニューラル的でメモリ拡張型のモデルが競争力のある結果を達成できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。