Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Domain First Person Audio-Visual Action Recognition through Relative Norm Alignment

Mirco Planamente, Chiara Plizzari|arXiv (Cornell University)|Jun 3, 2021
Human Pose and Action Recognition参考文献 58被引用数 6
ひとこと要約

本論文は、視覚的および聴覚的特徴の相対的大きさに基づいて動的に寄与を調整することにより、クロスドメインのファーストパーソンアクション認識を向上させる、新しい音声・視覚損失、相対ノルムアライメント(RNA)を提案する。モダリティ固有の特徴の相対的ノルムをアライメントさせることで、ドメイン一般化および非教師ありドメイン適応の設定において一般化性能が向上し、最小限のアーキテクチャでEPIC-Kitchensで最先端の性能を達成する。

ABSTRACT

First person action recognition is an increasingly researched topic because of the growing popularity of wearable cameras. This is bringing to light cross-domain issues that are yet to be addressed in this context. Indeed, the information extracted from learned representations suffers from an intrinsic environmental bias. This strongly affects the ability to generalize to unseen scenarios, limiting the application of current methods in real settings where trimmed labeled data are not available during training. In this work, we propose to leverage over the intrinsic complementary nature of audio-visual signals to learn a representation that works well on data seen during training, while being able to generalize across different domains. To this end, we introduce an audio-visual loss that aligns the contributions from the two modalities by acting on the magnitude of their feature norm representations. This new loss, plugged into a minimal multi-modal action recognition architecture, leads to strong results in cross-domain first person action recognition, as demonstrated by extensive experiments on the popular EPIC-Kitchens dataset.

研究の動機と目的

  • 学習された表現における環境バイアスによって引き起こされるファーストパーソンアクション認識におけるドメインシフトを解消すること。
  • 訓練時にターゲットデータにアクセスできない状況でも、未観測ドメインへの一般化を向上させること。
  • 音声と視覚のモダリティの補完的性質を活用して、多様な環境間でより強力な性能を実現すること。
  • 複雑なアーキテクチャを必要とせず、モダリティ間の協調を向上させる軽量で効果的な損失関数を開発すること。
  • エゴセントリック動画アクション認識における単一ソースおよびマルチソースドメイン一般化のための新しいベンチマークを確立すること。

提案手法

  • 視覚的および聴覚的特徴ノルムの相対的大きさに作用する新しいクロスモダリティ損失、相対ノルムアライメント(RNA)を提案する。
  • RNA損失は、訓練中にノルム分布の乖離を最小化することで、各モダリティの相対的寄与を動的に調整する。
  • 柔軟性を確保するため、ラテンまたはミッドレベル特徴統合を施したシンプルな音声・視覚二ストリームネットワークに統合される。
  • 損失関数は、クラス内コンパクト性と構造的識別性を維持すると同時に、モダリティの不均衡を低減することを目的として設計されている。
  • EPIC-Kitchensデータセット上でドメイン一般化(DG)および非教師ありドメイン適応(UDA)の両設定で検証された。
  • アブレーションスタディでは、ハードノルムアライメントベースラインおよび標準的な自己教師あり同期タスクとRNAを比較した。

実験結果

リサーチクエスチョン

  • RQ1ファーストパーソンアクション認識において、音声と視覚のモダリティを効果的にバランスさせることでドメインシフトを軽減できるか?
  • RQ2音声および視覚ストリームの相対的特徴ノルムを動的にアライメントさせることで、未観測環境間での一般化性能が向上するか?
  • RQ3クロスドメイン設定において、提案されたRNA損失は敵対的および自己教師ありアライメント手法と比較してどのように性能を発揮するか?
  • RQ4RNAのような軽量でモダリティ固有の損失は、より複雑なアーキテクチャを上回る性能をドメイン一般化タスクで発揮できるか?
  • RQ5クラス活性化マップから示されるように、RNA損失はより局所的かつ解釈可能な注目をネットワークにもたらすか?

主な発見

  • マルチソースドメイン一般化において、RNAは51.06%のトップ-1正答率を達成し、ベースラインより6.39ポイント高い性能を示した。
  • 非教師ありドメイン適応設定では、RNAは47.71%の正答率に達し、ベースラインより1.95ポイント向上した。
  • 敵対的アライメント手法よりも4%の性能向上を達成し、より複雑なMM-SADAアプローチと同等の性能を示したが、簡素なアーキテクチャを採用した。
  • アブレーションの結果、RNAは固定ノルム調整よりも相対的調整の利点を明確に示すハードノルムアライメント(HNA)バージョンを一貫して上回った。
  • 定性的分析から、RNAは特徴選別性を向上させ、上位300個の特徴がノルム寄与を維持または増加させ、より鋭いクラス活性化マップをもたらすことがわかった。
  • RNAと敵対的アライメントの組み合わせはわずかな性能向上をもたらし、分布保存とモダリティバランスの両方の強みが相補的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。