Skip to main content
QUICK REVIEW

[論文レビュー] CAPE: Encoding Relative Positions with Continuous Augmented Positional Embeddings

Tatiana Likhomanenko, Qiantong Xu|arXiv (Cornell University)|Jun 6, 2021
Advanced Neural Network Applications被引用数 10
ひとこと要約

CAPEは、データ拡張を用いて相対的な位置情報を暗黙的に符号化することで、一般化性能を向上させる連続的で拡張された絶対的位置埋め込み手法を提案する。この手法は、機械翻訳、音声認識、画像処理の各タスクにおいて、標準的な絶対的または相対的位置埋め込みよりも優れた性能と安定性を達成しながら、計算効率を維持している。

ABSTRACT

Without positional information, attention-based Transformer neural networks are permutation-invariant. Absolute or relative positional embeddings are the most popular ways to feed Transformer models with positional information. Absolute positional embeddings are simple to implement, but suffer from generalization issues when evaluating on sequences longer than seen at training time. Relative positions are more robust to input length change, but are more complex to implement and yield inferior model throughput due to extra computational and memory costs. In this paper, we propose an augmentation-based approach (CAPE) for absolute positional embeddings, which keeps the advantages of both absolute (simplicity and speed) and relative positional embeddings (better generalization). In addition, our empirical evaluation on state-of-the-art models in machine translation, image and speech recognition demonstrates that CAPE leads to better generalization performance as well as increased stability with respect to training hyper-parameters.

研究の動機と目的

  • 訓練時に見られなかったより長いシーケンスで評価する際の、Transformerにおける絶対的位置埋め込みの一般化限界を解消すること。
  • 相対的位置埋め込みの計算およびメモリのオーバーヘッドを克服しながら、そのシーケンス長の変動に対するロバストネスを維持すること。
  • アーキテクチャの変更なしに、機械翻訳、音声認識、画像認識といった多様な分野におけるモデルの安定性と性能を向上させること。
  • CAPEに基づく新しい適応的トレーニング方式を導入することで、パディングを不要にするエンドツーエンドの音声認識トレーニングを可能にすること。
  • 学習可能な絶対的位置埋め込みを連続的拡張によって顕著に向上させることで、相対的位置埋め込みと同等の性能を達成しつつ、複雑性を低減できることを示すこと。

提案手法

  • CAPEは、視覚、音声、動画のデータの連続的性質と整合性を高めるために、離散的絶対位置埋め込みを連続的ものに置き換える。
  • トレーニング中、CAPEは位置埋め込みを制御的にシフトするデータ拡張戦略を適用し、相対的位置情報が暗黙的に保持されるようにする。
  • グローバルシフトとローカルシフトの2段階の拡張を用いる:グローバルシフトは全位置に一定のオフセットを加えるのに対し、ローカルシフトは小さなランダムな摂動を加え、相対順序を維持する。
  • 拡張処理はトレーニング時のみに適用され、推論時には適用されないため、実行時オーバーヘッドがない。
  • アテンションメカニズムの変更を避けるため、標準的なTransformerの単純さと高速性を維持する。
  • 機械翻訳におけるソースおよびターゲットシーケンスの位置を整合させるために、スケーリング係数αを用い、コーパス長の統計に基づく。

実験結果

リサーチクエスチョン

  • RQ1データ拡張を用いた連続的位置埋め込みは、標準的な絶対的位置埋め込みを上回る一般化性能をTransformerにもたらすか?
  • RQ2CAPEは、精度と計算効率の両面で相対的位置埋め込みを上回るか?
  • RQ3CAPEは、アーキテクチャの変更なしに、画像認識や音声認識といったマルチモーダルタスクに効果的に適用可能か?
  • RQ4CAPEは、パディングを不要にする音声認識におけるエンドツーエンドトレーニングを可能にし、標準的なCTCやseq2seqトレーニングと比較してどのように異なるか?
  • RQ5ハイパーパrameterの選択に応じて、CAPEはモデルの安定性にどのように影響を与えるか?

主な発見

  • CAPEは、標準的な絶対的位置埋め込みや相対的位置埋め込みよりも、機械翻訳、画像認識、音声認識の各タスクで一般化性能が向上する。
  • 機械翻訳において、CAPEはベースラインモデルよりも低いWER(単語誤り率)を達成し、CTCベースのモデルではTED-LIUM v3で最大1.5%の相対的改善を示した。
  • 画像認識においては、CAPEでトレーニングされた1つのUniViTモデルが、未学習の画像解像度に対してもより良い一般化性能を示し、単一解像度ベースラインを上回った。
  • ASRにおけるCAPEベースのトレーニングにより、パディングの必要がなくなり、パフォーマンスに劣化を来さずに、より効率的なエンドツーエンドトレーニングが可能になった。
  • CAPEの計算コストは無視できるほど低く、前方および逆伝搬の両方で遅延が生じない。一方、相対的位置埋め込みはV100 GPU上で2倍の遅延を引き起こした。
  • ハイパーパrameter設定の変化に対してもCAPEは安定性が向上しており、特に学習率と重み減衰の観点で、標準的な絶対的位置埋め込みよりもロバストネスに優れた性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。