[論文レビュー] Opening the Vocabulary of Egocentric Actions
本論文は、オブジェクトに依存しない動詞エンコーダーと、CLIPに基づくプロンプト学習法を用いてアクティブなオブジェクトを特定することで、エゴセントリック動画におけるオープンボキャブラリー行動認識を導入する。この手法は、EPIC-KITCHENS-100およびAssembly101ベンチマークで最先端の性能を達成し、訓練時に見られなかった動詞+オブジェクトの組み合わせを認識する点で、クローズドセット手法を著しく上回る。
Human actions in egocentric videos are often hand-object interactions composed from a verb (performed by the hand) applied to an object. Despite their extensive scaling up, egocentric datasets still face two limitations - sparsity of action compositions and a closed set of interacting objects. This paper proposes a novel open vocabulary action recognition task. Given a set of verbs and objects observed during training, the goal is to generalize the verbs to an open vocabulary of actions with seen and novel objects. To this end, we decouple the verb and object predictions via an object-agnostic verb encoder and a prompt-based object encoder. The prompting leverages CLIP representations to predict an open vocabulary of interacting objects. We create open vocabulary benchmarks on the EPIC-KITCHENS-100 and Assembly101 datasets; whereas closed-action methods fail to generalize, our proposed method is effective. In addition, our object encoder significantly outperforms existing open-vocabulary visual recognition methods in recognizing novel interacting objects.
研究の動機と目的
- エゴセントリック行動データセットにおける動詞+オブジェクトの組み合わせのスパarsityを解消し、新規オブジェクトへの一般化を可能にする。
- 訓練時に見られなかったオープンボキャブラリーのオブジェクトに対しても、動詞の一般化を可能にする行動認識モデルを実現する。
- エゴセントリック動画理解における長尾分布や静的フレーム表現に起因するバイアスを克服する。
- ごみや他のオブジェクトが存在する複雑なシーンにおいても、状態変化を undergoing しているアクティブなオブジェクトを信頼性高く認識する方法を確立する。
- EPIC-KITCHENS-100およびAssembly101における現実的なオープンボキャブラリーのベンチマークを構築し、ベースクラスを超えた一般化を評価する。
提案手法
- エゴセントリック動画のための教師あり対照的損失とタスク固有のガイド付き拡張を用いた、オブジェクトに依存しない再トレーニング(OAP)戦略により、動詞とオブジェクトの予測を分離する。
- 時間的動きとオブジェクト間相互作用を保持するガイド付き拡張を設計し、カメラの動きや不要なオブジェクトに強い耐性を向上させる。
- アクティブオブジェクトプロンプト(AOP)を提案。これは、CLIPがエゴセントリックシーンにおけるアクティブなオブジェクトを特定するのを支援する、学習可能な動詞条件付きプロンプト機構である。
- 各オブジェクトクラスごとに学習可能な語彙埋め込みをCLIPのテキストエンコーダーに微調整し、視覚的特徴とオープンボキャブラリーのオブジェクトラベルの整合性を向上させる。
- 二本のブランチアーキテクチャを採用:OAPで学習されたオブジェクトに依存しない表現を学ぶ動詞エンコーダーと、AOPを用いたCLIPによるゼロショット一般化を実現するオブジェクトエンコーダー。
- EPIC-KITCHENS-100およびAssembly101の既存スプリットを再利用し、推論時に新規オブジェクトクラスを導入することで、オープンボキャブラリーのベンチマークを構築する。
実験結果
リサーチクエスチョン
- RQ1エゴセントリック動画において、オブジェクト固有の特徴から動詞表現を分離することで、新規オブジェクトへの一般化が可能になるか?
- RQ2ごみや他のオブジェクトが存在する複雑なエゴセントリックシーンにおいて、状態変化を undergoing しているアクティブなオブジェクトを信頼性高く認識できるか?
- RQ3CLIPに基づく視覚・言語モデルは、プロンプト学習を用いて、エゴセントリック行動認識における新規相互作用オブジェクトをどれほど適応的に認識できるか?
- RQ4ガイド付き拡張を用いたオブジェクトに依存しないトレーニングは、未学習オブジェクトへの動詞のゼロショット一般化を向上させるか?
- RQ5本手法は、実世界のエゴセントリックデータセットにおいて、クローズドセットベースラインと比較して、オープンボキャブラリー設定でどれほど効果的か?
主な発見
- 提案手法は、HOIクロップアブレーションで10.8のハーモナイズドメーン(HM)を達成し、フルフレームベースライン(HM=7.5)を著しく上回り、局所化されたオブジェクトおよびハンドのクロップが有効であることを示している。
- 各オブジェクトに対してm=5の学習可能な語彙埋め込みを用いることで、モデルは最も優れた新規クラス性能を達成しており、プロンプト語彙の微調整が未学習オブジェクトへの一般化を向上させることを示している。
- ガイド付き拡張を用いたオブジェクトに依存しない動詞エンコーダーは、標準的な対照的学習と比較して、新規オブジェクトの組み合わせに対して高い性能を示し、一般化が向上していることが確認された。
- アクティブオブジェクトプロンプト(AOP)により、複雑なエゴセントリックシーンにおいて複数のオブジェクトが存在する中で、唯一状態変化を undergoing しているオブジェクトを正しく特定できるようになった。
- 解釈可能性解析の結果、微調整されたプロンプトは、複数形(例:'eggs' ではなく 'egg')や類義語(例:'faucet' ではなく 'tap')の修正をよく行い、自然言語との整合性を高めていることがわかった。
- 本手法は、EPIC-KITCHENS-100およびAssembly101の両方で、クローズドアクション認識ベースラインを著しく上回り、オープンボキャブラリー一般化における有効性が実証された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。