[論文レビュー] Self-Supervised Video Transformers for Isolated Sign Language Recognition
本稿では、マスク再構築事前学習(MaskFeat)と階層的ビジョントランスフォーマーを活用することで、分離型サイン言語認識(ISLR)のための自己教師付きビデオトランスフォーマーを提案する。WLASL2000データセットにおいて、MaskFeat事前学習を施したMViTv2は79.02%のトップ1精度を達成し、ポーズベースおよび教師ありモデルを1.59%上回る。線形プローブの結果から、階層的アーキテクチャが、ハンドシェイプや動きといったフォノロジカル特徴をより効果的に捉えていることが示された。
This paper presents an in-depth analysis of various self-supervision methods for isolated sign language recognition (ISLR). We consider four recently introduced transformer-based approaches to self-supervised learning from videos, and four pre-training data regimes, and study all the combinations on the WLASL2000 dataset. Our findings reveal that MaskFeat achieves performance superior to pose-based and supervised video models, with a top-1 accuracy of 79.02% on gloss-based WLASL2000. Furthermore, we analyze these models' ability to produce representations of ASL signs using linear probing on diverse phonological features. This study underscores the value of architecture and pre-training task choices in ISLR. Specifically, our results on WLASL2000 highlight the power of masked reconstruction pre-training, and our linear probing results demonstrate the importance of hierarchical vision transformers for sign language representation.
研究の動機と目的
- 低データ環境下における自己教師付きビデオトランスフォーマーが分離型サイン言語認識(ISLR)にどの程度有効であるかを評価すること。
- 異なる事前学習タスクおよびアーキテクチャがサイン言語表現学習に与える影響を調査すること。
- BrentariのASLのプロソディックモデルからのフォノロジカル特徴を用いて、モデル表現を分析すること。
- 語彙ベースのWLASL2000ベンチマークにおいて、新たなSOTAを確立すること。
提案手法
- ビデオトランスフォーマーを4つの自己教師学習手法(VideoMAE:ピクセル再構築、MaskFeat:特徴再構築、BEVT:BERT風ビデオ事前学習、SVT:DINOベースの対照的学習)を用いて事前学習する。
- 線形プローブとエンドツーエンド学習を用いて、WLASL2000データセット上で事前学習モデルを語彙ベースのサイン分類に微調整する。
- 空間的および時間的階層をよりよくモデル化できるよう、階層的ビジョントランスフォーマー・アーキテクチャ(例:MViTv2、VideoSwin)を用いる。
- Brentariのプロソディックモデルから得られる15のフォノロジカル特徴(ハンドシェイプ、動き、対称性、位置など)を用いて、表現を線形プローブで評価する。
- 2つの事前学習データレジームで学習する:Kinetics400(アクションビデオ)とWLASL2000(ASLビデオ)、または両者の組み合わせ。
- 層ごとのプローブ精度を分析することで、微調整がモデルの深さに応じて言語的特徴の符号化をどの程度向上させるかを評価する。
![Figure 1 : Sample frames from isolated sign language video extracted from the WLASL2000 dataset [ 19 ] .](https://ar5iv.labs.arxiv.org/html/2309.02450/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1WLASL2000におけるISLRのパフォーマンスを最も高める自己教師学習事前学習タスクは何か?
- RQ2平らなViTと比較して、階層的アーキテクチャ(例:MViTv2)がサイン言語表現に与える影響は何か?
- RQ3自己教師学習モデルは、ハンドシェイプや動きといった言語的意味のある特徴をどの程度学習できるか?
- RQ4ISLRで微調整を施すことにより、明示的にそれらの特徴に学習していないにもかかわらず、フォノロジカル特徴の表現能力が向上するか?
- RQ5事前学習時のビデオサンプリング戦略が、サインの動きといった時間依存的特徴を捉える能力に与える影響は何か?
主な発見
- MViTv2にMaskFeat事前学習を施したモデルは、WLASL2000で79.02%のトップ1精度を達成し、新たなSOTAを樹立。前回のポーズベースSOTAを1.59%上回った。
- 階層的ビジョントランスフォーマー(例:BEVT、MaskFeat)は、全15のフォノロジカル特徴において、平らなViTよりも一貫して高い線形プローブ精度を示し、より優れた言語表現学習が可能であることを示した。
- ISLRで微調整を施すことで、特にパス・ムーブメントのような動きに基づく特徴の線形プローブ精度が顕著に向上した。特に、間隔サンプリング戦略で事前学習したモデルで顕著であった。
- 連続的なサインビデオ(例:Kinetics400)で事前学習したモデルは、フレームの間隔サンプリングのため、時間依存的特徴を捉えるのが困難であったが、短い単一サインビデオで微調整することで性能が回復した。
- 層ごとのプローブ解析から、微調整により線形プローブ精度が最終層に近づくにつれて単調に向上することが示され、言語的特徴の符号化が改善されたことがわかった。
- MaskFeatとBEVTは、I3D(強力なCNNベースライン)と同等またはそれ以上の性能を、すべてのフォノロジカル特徴で達成した。一方、VideoMAEとSVTは、多くの特徴でI3Dに劣った。
![Figure 2 : Sample frames extracted from ASL to English translation dataset OpenASL [ 32 ] .](https://ar5iv.labs.arxiv.org/html/2309.02450/assets/x2.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。