[論文レビュー] Time Is MattEr: Temporal Self-supervision for Video Transformers
本稿では、時間的ダイナミクスを学習し空間的バイアスを低減することで、動画変換器の表現学習を向上させるシンプルで効果的な自己教師あり手法TIME(Time Is MattEr)を提案する。フレーム順序予測と時間的フローディレクション予測を補助タスクとして導入し、Something-Something-v2における性能を著しく向上させるとともに、画像分類における背景シフトに対するロバスト性も向上させる。
Understanding temporal dynamics of video is an essential aspect of learning better video representations. Recently, transformer-based architectural designs have been extensively explored for video tasks due to their capability to capture long-term dependency of input sequences. However, we found that these Video Transformers are still biased to learn spatial dynamics rather than temporal ones, and debiasing the spurious correlation is critical for their performance. Based on the observations, we design simple yet effective self-supervised tasks for video models to learn temporal dynamics better. Specifically, for debiasing the spatial bias, our method learns the temporal order of video frames as extra self-supervision and enforces the randomly shuffled frames to have low-confidence outputs. Also, our method learns the temporal flow direction of video tokens among consecutive frames for enhancing the correlation toward temporal dynamics. Under various video action recognition tasks, we demonstrate the effectiveness of our method and its compatibility with state-of-the-art Video Transformers.
研究の動機と目的
- 動画変換器が時間的ダイナミクスではなく空間的ダイナミクスに偏って学習するという限界に対処すること。
- アーキテクチャの革新を超えて、自己教師ありの時間的モデリングが動画表現学習をどのように向上させられるかを調査すること。
- シャッフルされたフレームに対して低信頼度の予測を強制することで、空間的特徴と動画行動認識の間の誤った相関関係を低減すること。
- 連続するフレーム間の動画トークンのフローディレクションを学習することで、時間的モデリングを強化すること。
- 複数の最先端の動画変換器において、アクション認識ベンチマークで互換性と一貫した性能向上を示すこと。
提案手法
- フレームの正しい時間的順序を予測するフレームレベルの自己教師ありタスクを導入し、予測順序に対して交差エントロピー損失を適用する。
- ランダムにシャッフルされた動画フレームに対して高信頼度の予測をペナルティ化するデバイアス低減目的を実装し、不確実性を促進するためにKLダイバージェンスを用いる。
- 連続するフレーム間の時間的フローディレクション(8方向+中心の9種類)を注意機構を用いたモジュールで予測するトークンレベルの自己教師ありタスクを提案する。
- トークンレベルタスクの正例ラベルとして、Gunnar Farnebäckの光流アルゴリズムを用いて真値のフローラベルを生成する。
- 主な動画分類目的と損失関数を一括して端末から端末まで学習可能に統合する。
- フレーム順序予測とデバイアス低減目的を画像分類に適応することで、背景バイアスを低減し、背景チャレンジベンチマークでロバスト性が向上することを示す。
実験結果
リサーチクエスチョン
- RQ1自己教師ありの時間的モデリングは、動画理解における空間的ダイナミクスへの動画変換器のバイアスを効果的に低減できるか?
- RQ2フレームの時間的順序を学習することは、動画表現の一般化性とロバスト性を向上させるか?
- RQ3動画トークンのフローディレクションを予測することで、長距離の時間的依存関係をモデルがよりよく捉える能力が向上するか?
- RQ4提案された自己教師あり目的が、多様な動画変換器アーキテクチャにおいてどの程度性能向上をもたらすか?
- RQ5同じ自己教師あり原理を画像分類に拡張することで、背景バイアスを緩和できるか?
主な発見
- 提案されたTIME手法は、Something-Something-v2ベンチマークで最先端の動画変換器を一貫して向上させ、高い互換性と性能向上を示している。
- Something-Something-v2データセットでは、元の動画とシャッフルされた動画の間の精度差を顕著に縮小しており、空間的バイアスの低減が確認された。
- Only-FG背景シフトベンチマークではトップ-1精度が58.91%に達し、ベースラインの50.27%から著しく向上しており、背景シフトに対する強いロバスト性を示している。
- フレーム順序予測とデバイアス低減目的は性能向上に直交的に寄与しており、両方の損失を組み合わせた場合の精度は58.91%に達する一方、順序損失のみでは54.15%にとどまる。
- この手法は画像分類へも一般化可能であり、ImageNet-9ではトップ-1精度を77.26%から83.26%に、Only-FG背景シフトベンチマークでは50.27%から58.91%に向上させた。
- 時間的順序予測と背景デバイアス低減の相乗効果により、複数のベンチマークで顕著かつ一貫した性能向上が得られ、本手法のロバスト性と一般化能力が裏付けられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。