[論文レビュー] InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges
本論文では、Ego4D ECCV 2022 Challengeの5つのトラックすべてで最先端の性能を達成した、ビデオ基礎モデルを活用したInternVideo-Ego4Dを提案する。VideoMAEとUniFormerに基づくInternVideoバックボーンを活用し、単純なタスク固有のヘッドを組み合わせることで、Moment Queries、Natural Language Queries、Future Hand Prediction、State Change Object Detection、Short-term Object Interaction Anticipationの各タスクで、先行SOTAモデルを上回る性能を発揮した。
In this report, we present our champion solutions to five tracks at Ego4D challenge. We leverage our developed InternVideo, a video foundation model, for five Ego4D tasks, including Moment Queries, Natural Language Queries, Future Hand Prediction, State Change Object Detection, and Short-term Object Interaction Anticipation. InternVideo-Ego4D is an effective paradigm to adapt the strong foundation model to the downstream ego-centric video understanding tasks with simple head designs. In these five tasks, the performance of InternVideo-Ego4D comprehensively surpasses the baseline methods and the champions of CVPR2022, demonstrating the powerful representation ability of InternVideo as a video foundation model. Our code will be released at https://github.com/OpenGVLab/ego4d-eccv2022-solutions
研究の動機と目的
- 1つのビデオ基礎モデルを用いて、多数のエゴセントリック動画理解タスクに対して統合的かつ効果的なアプローチを開発すること。
- 一般動画データセットとエゴセントリック動画データの間のドメインギャップを、Ego4Dデータセットでのファインチューニングによって解消すること。
- InternVideoが多様なエゴセントリック認識タスクにわたって、強力な汎化性と適応性を示すことを実証すること。
- エゴセントリック動画理解に適した異なるバックボーンアーキテクチャと融合戦略の有効性を調査すること。
- 強力な事前学習済み基礎モデルに依存することで、複雑なタスク固有のヘッド設計の必要性を最小限に抑えること。
提案手法
- 5つのタスクすべての主要バックボーンとして、VideoMAEとUniFormerを統合したビデオ基礎モデルであるInternVideoを採用した。
- 未編集のエゴセントリック動画から空間的・時間的表現を学習するために、VideoMAEを用いたマスキング動画再構成事前学習を実施した。
- 効率的かつ正確な動画表現学習を向上させるために、UniFormerの統合型畳み込みおよび自己注意メカニズムを統合した。
- 一般動画データとエゴセントリック動画データの間のドメインギャップを埋めるために、事前学習済みInternVideoモデルをEgo4Dデータセットでファインチューニングした。
- 5つのEgo4Dチャレンジトラックに適した軽量なタスク固有ヘッドを設計した。これには、検出ヘッド(VSGN、ActionFormer)と、時間までの接触予測のための回帰ヘッドが含まれる。
- 境界ボックス座標に学習可能な位置エンコーディングを適用し、それらをRoI特徴と連結することで、特徴の統合を強化し、局所化および回帰性能を向上させた。
実験結果
リサーチクエスチョン
- RQ1広範なエゴセントリック動画理解タスクにわたって、広く一般化できる強力な1つのビデオ基礎モデルが、広範なヘッド設計なしに効果的に機能するか。
- RQ2InternVideoの性能は、Ego4Dチャレンジの5つのトラックで、既存のSOTA手法と比較してどの程度優れているか。
- RQ3Ego4Dデータセットでのファインチューニングが、一般動画データセットとエゴセントリック動画データの間のドメインシフトをどの程度軽減するか。
- RQ4時間までの接触予測のような回帰タスクにおいて、RoI特徴に位置エンコーディングを組み込む影響は何か。
- RQ5モデル予測と公式ベースライン出力の間の結果統合は、全体の性能向上にどの程度有効か。
主な発見
- InternVideo-Ego4Dは、5つのEgo4Dチャレンジトラックすべてで1位を達成し、多様なエゴセントリック動画タスクにわたる強力な一般化性と頑健性を示した。
- 10の評価指標すべてにおいて、ベースラインモデルおよびCVPR 2022チャレンジ優勝モデルを上回り、基礎モデルアプローチの優位性を確認した。
- 事前学習済みInternVideoバックボーンをEgo4Dでファインチューニングすることで、ドメインギャップが顕著に縮小され、全タスクで一貫した性能向上が得られた。
- RoI特徴に位置エンコーディングを統合することで、時間までの接触予測の性能が向上し、空間的なインダクティブバイアスが回帰性能を向上させることを示した。
- モデルと公式予測の上位10個のボックスを統合した結果融合は、個別の予測よりも優れた性能を示した。冗長性を除去するために、高いIoU閾値を用いたNMSを適用した。
- 名詞分類スコアに基づき上位5個のボックスにフィルタリングすることで、推論速度と一般化性能が向上したが、上位3個に留めるとバリデーションセットで過学習が生じた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。