[論文レビュー] BEST: BERT Pre-Training for Sign Language Recognition with Coupling Tokenization
BESTは、手と体の動きをポーズ三重項ユニットとしてモデル化し、カップリングトークナイゼーションを用いて連続的な動画信号と離散的なBERTの目的の間の意味的ギャップを埋める自己教師ありBERT型事前学習フレームワークを提案する。4つのベンチマークで最先端の性能を達成し、WLASL2000では19.12%の正確性向上を達成した。
In this work, we are dedicated to leveraging the BERT pre-training success and modeling the domain-specific statistics to fertilize the sign language recognition~(SLR) model. Considering the dominance of hand and body in sign language expression, we organize them as pose triplet units and feed them into the Transformer backbone in a frame-wise manner. Pre-training is performed via reconstructing the masked triplet unit from the corrupted input sequence, which learns the hierarchical correlation context cues among internal and external triplet units. Notably, different from the highly semantic word token in BERT, the pose unit is a low-level signal originally located in continuous space, which prevents the direct adoption of the BERT cross-entropy objective. To this end, we bridge this semantic gap via coupling tokenization of the triplet unit. It adaptively extracts the discrete pseudo label from the pose triplet unit, which represents the semantic gesture/body state. After pre-training, we fine-tune the pre-trained encoder on the downstream SLR task, jointly with the newly added task-specific layer. Extensive experiments are conducted to validate the effectiveness of our proposed method, achieving new state-of-the-art performance on all four benchmarks with a notable gain.
研究の動機と目的
- テキストとは異なり連続的な動画信号を扱うため、BERTの自己教師あり事前学習の成功を、手書き文字認識に適応すること。
- BERTの交差エントロピー目的を低レベルの連続的ポーズ系列に適用する課題に対処するため、意味的ブリッジメカニズムを導入すること。
- 新しい事前学習タスクを通じて、手と体の動きの間の階層的文脈的手がかりをモデル化すること。
- 大規模で弱教師ありの動画データを用いた事前学習により、下流の分離型シグナリングランゲージ認識性能を向上させること。
- カップリングトークナイゼーションが連続的ポーズ三重項ユニットに対する離散的擬似ラベルを生成する有効性を示すこと。
提案手法
- 手と体のキーポイント系列からポーズ三重項ユニットを構築し、シグナリングランゲージジェスチャーの空間的・時間的構成を表現する。
- ランダムにマスクされたポーズ三重項ユニットを文脈から再構築する、マスクされたユニットモデリング(MUM)事前学習タスクを導入する。
- カップリングトークナイゼーションを用いて連続的ポーズ三重項ユニットから離散的擬似ラベルを生成し、BERTの交差エントロピー目的の使用を可能にする。
- 事前学習フェーズでは、MUMを通じて汚染された入力系列からの階層的文脈を学ぶため、Transformerバックボーンを用いる。
- 事前学習後、下流の分離型SLRベンチマークでタスク固有の分類ヘッドを用いてエンコーダーをファインチューニングする。
- エンドツーエンドのファインチューニングを通じて、文脈モデリングと意味的表現学習を同時に最適化する。
実験結果
リサーチクエスチョン
- RQ1連続的・低レベルの動画信号を扱うため、BERTスタイルの事前学習がシグナリングランゲージ認識に効果的に適応可能か?
- RQ2連続的ポーズ系列と離散的BERTトークン目的の間の意味的ギャップを、効果的な自己教師あり学習のためにどのように埋め合わせられるか?
- RQ3マスクされたユニットモデリングタスクにおいて、手と体の両方をマスクするのと、片方だけをマスクするのとでは、性能にどのような差が生じるか?
- RQ4ポーズユニットのための意味的擬似ラベルを生成する際、カップリングトークナイゼーションは、標準的なベクトル量子化やクラスタリングと比べてどのように優れているか?
- RQ5大規模でクリーニングされていないシグナリングランゲージデータを用いた事前学習が、下流の分離型SLRの正確性にどの程度向上効果をもたらすか?
主な発見
- BESTは、評価された4つのベンチマーク(MSASL100、MSASL200、MSASL1000、WLASL2000)すべてで、新たな最先端性能を達成した。
- WLASL2000データセットでは、事前学習なしのベースラインと比較して、1インスタンスあたりのTop-1正確性が19.12%の絶対的向上を達成した。
- 提案されたカップリングトークナイゼーション手法は、K-MeansやVQを上回り、それぞれMSASL100で80.98%、MSASL200で81.24%の正確性を達成した。
- MUMタスクで手と体の両方をマスクすると、MSASL100でベースライン比7.54%の向上を達成し、最良の性能を示した。
- 事前学習データの規模が大きくなるに従い、性能が単調に向上する傾向を示し、本手法のスケーラビリティとデータ効率性を裏付けた。
- カップリングトークナイゼーションを用いたMUM事前学習タスクは、MSASL1000で58.82%、WLASL2000で54.87%のTop-1正確性を達成し、すべてのアブレーション設定を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。