Skip to main content
QUICK REVIEW

[論文レビュー] FBK-HUPBA Submission to the EPIC-Kitchens 2019 Action Recognition Challenge

Swathikiran Sudhakaran, Sérgio Escalera|arXiv (Cornell University)|Jun 21, 2019
Human Pose and Action Recognition参考文献 4被引用数 6
ひとこと要約

本論文は、エゴセントリック動画における行動認識のための、CNN-LSTAおよびHF-TSNの変種のアンサンブルを提示する。本研究では、後期および早期の時系列特徴統合、クロスモーダル統合、構造的予測を用いて、動詞と名詞の依存関係をモデル化している。アンサンブルはEPIC-Kitchens 2019データセットのS1で35.54%のトップ1正解率を達成し、S2では20.25%を記録した。これは、補完的モデリングアプローチとモデルアンサンブルの有効性を示している。

ABSTRACT

In this report we describe the technical details of our submission to the EPIC-Kitchens 2019 action recognition challenge. To participate in the challenge we have developed a number of CNN-LSTA [3] and HF-TSN [2] variants, and submitted predictions from an ensemble compiled out of these two model families. Our submission, visible on the public leaderboard with team name FBK-HUPBA, achieved a top-1 action recognition accuracy of 35.54% on S1 setting, and 20.25% on S2 setting.

研究の動機と目的

  • エゴセントリック動画における小規模な物体操作を伴う細分化された行動認識の課題に対処すること。
  • 後期(LSTA)および早期(HF-TSN)統合という補完的時系列特徴統合戦略を組み合わせることで、認識精度を向上させること。
  • 行動レベルのバイアス項を用いた構造的予測により、動詞と名詞のクラス間の依存関係をモデル化すること。
  • 外観と動きのストリームを用いたクロスモーダル統合により、性能を向上させること。
  • 多様なアーキテクチャおよび学習戦略を用いたモデルアンサンブルにより、最先端の結果を達成すること。

提案手法

  • ImageNetおよびKineticsで微調整された、ResNet-34、ResNet-50、InceptionV3バックボーンを用いたCNN-LSTAの提案変種。
  • 出力状態のGRUベースの統合と、光流体を用いた二ストリームアーキテクチャによるクロスモーダル統合を備えた強化LSTA。
  • 畳み込み時系列ゲーティングを用いた階層的特徴統合を実装したHF-TSNの変種。バックボーンにはResNet-50およびBNInceptionを使用。
  • 二つの線形層を通じて、行動スコアをインスタンス固有のバイアス項として動詞および名詞分類器に適用することにより、構造的予測を実装。
  • 複数のモデルからの予測スコアのアンサンブル平均を用いて、汎化性能および性能を向上させること。
  • 両モデルファミリーにおいて、時系列プーリングおよび後期統合を適用し、フレームレベル特徴を行動レベルの予測に統合すること。

実験結果

リサーチクエスチョン

  • RQ1後期および早期の時系列特徴統合戦略は、エゴセントリック行動認識において互いに補完し合うことができるか?
  • RQ2外観と動きのストリームのクロスモーダル統合は、EPIC-Kitchensデータセットにおける認識精度を向上させるか?
  • RQ3行動レベルのバイアス項を用いた構造的予測により、現実的でない動詞-名詞ペアの予測が削減できるか?
  • RQ4多様なアーキテクチャおよび学習戦略を用いたモデルアンサンブルは、どの程度性能を向上させるか?
  • RQ5異なるバックボーンネットワーク(ResNet、Inception)は、細分化されたエゴセントリック行動認識にどのように影響を与えるか?

主な発見

  • すべてのモデルのアンサンブルは、S1設定で35.54%のトップ1正解率を達成し、個々のモデルを上回った。
  • ResNet-34を用いたLSTA-GRU変種は32.14%のトップ1正解率を達成し、クロスモーダル統合により32.60%に向上した。
  • HF-TSN-ResNet50モデルはS2で17.38%のトップ1正解率を記録したが、フルアンサンブルにより20.25%に向上した。
  • クロスモーダル統合によりLSTAモデルで2%の正解率向上が得られ、LSTA-2SおよびHF-TSN-BNInceptionをアンサンブルすることで1%の向上が得られた。
  • 構造的予測アプローチにより、行動レベルのバイアス項を用いて依存関係をモデル化したことで、現実的でない動詞-名詞ペアの予測が削減された。
  • アーキテクチャ的および学習戦略的多様性に基づくモデルアンサンブルは非常に有効であり、最終的なアンサンブルはS2で20.25%のトップ1正解率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。