Skip to main content
QUICK REVIEW

[論文レビュー] RareAct: A video dataset of unusual interactions

Antoine Miech, Jean-Baptiste Alayrac|arXiv (Cornell University)|Aug 3, 2020
Human Pose and Action Recognition参考文献 4被引用数 13
ひとこと要約

この論文では、ゼロショットおよびフェイントショットの構成性を行動認識において評価するため、まれな動詞・名詞のペア(例:'phoneをブレンドする'、'靴を電子レンジで加熱する')を含む、稀な人間-物体のインタラクションを特徴とする動画データセット RareAct を紹介する。HowTo100Mで事前学習された動画-テキストモデルを用いて、動詞・名詞ペアの共同モデリングが個別検出を著しく上回ることを示しており、これは構成性が動画理解における主要な課題のまま残っていることを示している。

ABSTRACT

This paper introduces a manually annotated video dataset of unusual actions, namely RareAct, including actions such as "blend phone", "cut keyboard" and "microwave shoes". RareAct aims at evaluating the zero-shot and few-shot compositionality of action recognition models for unlikely compositions of common action verbs and object nouns. It contains 122 different actions which were obtained by combining verbs and nouns rarely co-occurring together in the large-scale textual corpus from HowTo100M, but that frequently appear separately. We provide benchmarks using a state-of-the-art HowTo100M pretrained video and text model and show that zero-shot and few-shot compositionality of actions remains a challenging and unsolved task.

研究の動機と目的

  • 一般的な動作動詞と物体名詞のまれで不自然な組み合わせに対して、行動認識モデルの構成性を評価すること。
  • 既存のデータセットが頻度の高い行動にのみ焦点を当てているというギャップを埋めるために、まれで不審なインタラクションのためのベンチマークを構築すること。
  • モデルの一般化能力をテストするために、動詞または名詞のいずれかを共有するハードネガティブ例を含む標準化された評価プロトコルを提供すること。
  • 現在の最先端モデルが、動画理解におけるゼロショットおよびフェイントショットの構成性に対して依然として困難を抱えていることを示すこと。
  • 公開可能なデータセットを通じて、将来的な動画行動認識における構成的一般化に関する研究を可能にすること。

提案手法

  • HowTo100Mで頻出するが、共起頻度が極めて低い動詞・名詞ペアを選定し、意味的妥当性と認識の難易度を確保することで RareAct を構築した。
  • 各動詞・名詞ペアに対して、動画共有プラットフォームを用いた検索による動画収集を行い、10秒のクリップに分割した。
  • 7段階のアノテーションスキームを採用:ポジティブ(動詞が名詞に適用されている)、ハードネガティブ(動詞のみ、名詞のみ、または動詞と名詞が相互作用していない)、ネガティブ(両方なし)、曖昧、または破棄されたクリップ。
  • 複数のクリップが同一動画に存在する場合のバイアスを軽減するため、逆動画頻度重み付けを用いて mWAP を計算し、サブサンプリングによる mSAP を算出した。
  • HowTo100Mで事前学習された S3D テキスト-動画モデルを用いて、動詞、名詞、および動詞・名詞ペアの各々の類似度スコアを計算した。
  • 3つのベースラインを評価:動詞と名詞スコアの乗算型、加算型、および共同モデリング型。ハードネガティブ例を含む・含まないの両方の条件で評価した。

実験結果

リサーチクエスチョン

  • RQ1行動認識モデルは、一般的な動詞と名詞のまれな、未観測の組み合わせを動画で一般化できるか?
  • RQ2動詞または名詞を共有するハードネガティブ例の導入は、まれな構成におけるモデルの性能にどのように影響するか?
  • RQ3動詞・名詞ペアの共同モデリングは、個別検出および動詞・名詞スコアの組み合わせよりも優れているか?
  • RQ4最先端の動画-テキストモデルにおいて、ゼロショットおよびフェイントショットの構成性はどの程度依然として課題のままであるか?
  • RQ5異なる評価指標(mWAP、mSAP)は、まれな行動認識における構成的一般化の評価にどのように影響を与えるか?

主な発見

  • 共同モデリングアプローチ $ s((Verb,Noun)|X) $ は、40.7 mWAP および 44.6 mSAP を達成し、加算型および乗乗型ベースラインを著しく上回った。
  • 加算ベースライン $ s(Verb|X) + s(Noun|X) $ は、乗乗型よりも優れた性能を示し、稀な構成においてスコアを加算で結合することが、論理積(AND)よりも効果的であることを示唆している。
  • ハードネガティブ例の導入は、すべてのベースラインで性能を低下させた。これは、構成的一般化の評価においてハードネガティブ例の重要性を確認するものである。
  • ハードネガティブ例を含む共同モデルは、30.5 mWAP および 34.8 mSAP を達成し、優れたモデルですら稀な構成に対して困難を抱えていることを示している。
  • 最高の共同モデルと加算ベースラインとの間の性能差は、動画理解におけるより良い構成的推論の必要性を浮き彫りにしている。
  • このデータセットは、大規模な動画-テキストデータで学習した現在のモデルが、稀な人間-物体のインタラクションに対して構成的に一般化できていないことを明らかにしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。