Skip to main content
QUICK REVIEW

[論文レビュー] PiSLTRc: Position-informed Sign Language Transformer with Content-aware Convolution

Pan Xie, Mengyi Zhao|arXiv (Cornell University)|Jul 27, 2021
Hand Gesture Recognition Systems参考文献 50被引用数 4
ひとこと要約

本稿では、コンテンツに依存するおよび位置にインスパイアされた畳み込みを用いて、符号表現を向上させるPiSLTRcという、符号言語Transformerモデルを提案する。また、自己注意機構に相対的位置符号化を組み込む。動的に意味的に類似した隣接フレームを選択し、位置に配慮した畳み込みでそれらを集約することで、相対的位置符号化を用いることで、符号翻訳ベンチマークでSOTA性能を達成し、+1.6 BLEUの向上を実現した。

ABSTRACT

Since the superiority of Transformer in learning long-term dependency, the sign language Transformer model achieves remarkable progress in Sign Language Recognition (SLR) and Translation (SLT). However, there are several issues with the Transformer that prevent it from better sign language understanding. The first issue is that the self-attention mechanism learns sign video representation in a frame-wise manner, neglecting the temporal semantic structure of sign gestures. Secondly, the attention mechanism with absolute position encoding is direction and distance unaware, thus limiting its ability. To address these issues, we propose a new model architecture, namely PiSLTRc, with two distinctive characteristics: (i) content-aware and position-aware convolution layers. Specifically, we explicitly select relevant features using a novel content-aware neighborhood gathering method. Then we aggregate these features with position-informed temporal convolution layers, thus generating robust neighborhood-enhanced sign representation. (ii) injecting the relative position information to the attention mechanism in the encoder, decoder, and even encoder-decoder cross attention. Compared with the vanilla Transformer model, our model performs consistently better on three large-scale sign language benchmarks: PHOENIX-2014, PHOENIX-2014-T and CSL. Furthermore, extensive experiments demonstrate that the proposed method achieves state-of-the-art performance on translation quality with $+1.6$ BLEU improvements.

研究の動機と目的

  • フレーム単位の注目によって符号ジェスチャーの時間的意味的構造を捉えることができない、アンビエントなTransformerの限界を解消するため。
  • 符号言語モデリングにおいて絶対的位置符号化の方向および距離に依存しない性質を克服するため。
  • コンテンツに依存する近隣フレームの収集と位置に配慮した畳み込みを統合することで、符号言語認識および翻訳を向上させるため。
  • 自己注意機構に相対的位置情報をエンコーダ、デコーダ、およびクロスアテンションの両方に組み込むことで、より良いシーケンスモデリングを実現するため。
  • 高い認識品質を維持したまま、符号言語翻訳でSOTA性能を達成するため。

提案手法

  • 意味的類似性に基づいて動的に隣接フレームを選択することで、局所的ジェスチャー表現を強化するコンテンツに依存する近隣フレーム収集法を提案する。
  • 相対的位置符号化を用いて位置的文脈を保持しながら、選択された特徴を集約する位置に配慮した時系列畳み込み層を導入する。
  • エンコーダ、デコーダ、およびクロスアテンションの自己注意機構に、分離された相対的位置符号化(DRPE)を組み込み、方向および距離の認識を向上させる。
  • 共有された特徴学習を用いて、符号言語認識と翻訳を同時に実行する統合フレームワーク、PiSLTRcを設計する。
  • 特徴抽出にCNN-LSTM-HMMバックボーンを用い、その後に提案されたCPTcnモジュールとDRPE強化型Transformerブロックを適用する。
  • 認識(語彙)と翻訳(テキスト)の目的関数を統合したマルチタスク損失を用いて、エンドツーエンドでモデルを学習する。
Figure 1: The overview of our sign language Transformer model equipped with Content-aware and Position-aware Temporal Convolution (CPTcn) and Disentangled Relative Position Encoding (DRPE).
Figure 1: The overview of our sign language Transformer model equipped with Content-aware and Position-aware Temporal Convolution (CPTcn) and Disentangled Relative Position Encoding (DRPE).

実験結果

リサーチクエスチョン

  • RQ1時間的意味的整合性を活用することで、コンテンツに依存する近隣フレーム収集は符号表現を向上させ得るか?
  • RQ2位置に配慮した畳み込みを組み込むことで、符号ジェスチャー表現のロバスト性は向上するか?
  • RQ3自己注意機構における相対的位置符号化は、絶対的位置符号化を上回る符号言語モデリングを可能にするか?
  • RQ4符号言語認識と翻訳の共同学習は、独立した学習よりも優れた性能をもたらすか?
  • RQ5提案手法は大規模な符号言語ベンチマークでSOTA結果を達成できるか?

主な発見

  • PHOENIX-2014-Tデータセットにおいて、PiSLTRcはアンビエントなSLTRモデルに対して+1.6 BLEUの向上を示し、優れた翻訳品質を実証した。
  • PHOENIX-2014のsign2glossタスクにおいて、PiSLTRc-Rは開発セットでアンビエントなSLTR-Rより12%、テストセットで7%の向上を達成した。
  • CSLデータセットにおいて、PiSLTRc-RはテストセットでSLTR-Rより24%の向上を示し、多様な符号言語への強い一般化能力を示した。
  • sign2textタスクにおいて、PiSLTRc-TはアンビエントなSLTR-TモデルよりBLEU-4スコアで3.8%および5.6%の向上を示し、提案された構成要素の有効性を確認した。
  • アブレーションスタディにより、コンテンツに依存する近隣フレーム収集と相対的位置符号化の両方が、性能向上に顕著な寄与をしていることが確認された。
  • 本モデルは、認識および翻訳の両タスクにおいて、評価された3つのベンチマーク(PHOENIX-2014、PHOENIX-2014-T、CSL)でSOTA結果を達成した。
Figure 2: Vanilla self-attention and self-attention equipped with Content-aware and Position-aware Temporal Convolution (CPTcn). Where neighborhood gathering denotes selecting adjacent relevant features in a contiguous local region, TCNs denote stacked temporal convolution layers.
Figure 2: Vanilla self-attention and self-attention equipped with Content-aware and Position-aware Temporal Convolution (CPTcn). Where neighborhood gathering denotes selecting adjacent relevant features in a contiguous local region, TCNs denote stacked temporal convolution layers.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。