Skip to main content
QUICK REVIEW

[論文レビュー] Removing the Background by Adding the Background: Towards Background Robust Self-supervised Video Representation Learning

Jinpeng Wang, Yuting Gao|arXiv (Cornell University)|Sep 12, 2020
Human Pose and Action Recognition参考文献 62被引用数 12
ひとこと要約

本論文では、背景バイアスに対するモデルの頑健性を向上させるために、動画の各フレームに静止フレームを追加することで、動きに不変な特徴を学習させることを目的とした、シンプルでありながら効果的な自己教師あり動画表現学習手法であるBackground Erasing (BE) を提案する。BEはMoCoと組み合わせることで、UCF101で16.4%、HMDB51で19.1%の性能向上を達成し、強力な一般化性能とシーンの手がかりへの依存度低減を示している。

ABSTRACT

Self-supervised learning has shown great potentials in improving the video representation ability of deep neural networks by getting supervision from the data itself. However, some of the current methods tend to cheat from the background, i.e., the prediction is highly dependent on the video background instead of the motion, making the model vulnerable to background changes. To mitigate the model reliance towards the background, we propose to remove the background impact by adding the background. That is, given a video, we randomly select a static frame and add it to every other frames to construct a distracting video sample. Then we force the model to pull the feature of the distracting video and the feature of the original video closer, so that the model is explicitly restricted to resist the background influence, focusing more on the motion changes. We term our method as \emph{Background Erasing} (BE). It is worth noting that the implementation of our method is so simple and neat and can be added to most of the SOTA methods without much efforts. Specifically, BE brings 16.4% and 19.1% improvements with MoCo on the severely biased datasets UCF101 and HMDB51, and 14.5% improvement on the less biased dataset Diving48.

研究の動機と目的

  • データセットのバイアスにより、動画モデルが背景の手がかりに過度に依存するあまり、一般化性能が低下する問題に対処すること。
  • トレーニング中に背景の一貫性を明示的に破壊することで、モデルが静的シーン情報に依存するのを減らすこと。
  • アーキテクチャの変更なしに、既存の自己教師あり動画学習フレームワークに簡単に統合可能な、シンプルで即席的な手法を開発すること。
  • 動きのパターンに注目することで、新しい行動や背景に依存しない行動認識の一般化を向上させること。

提案手法

  • 各動画に対して、ランダムに選択された静止フレームを、動画のすべてのフレームに追加して、干渉を引き起こす動画サンプルを作成する。
  • 一貫性正則化を用いて、元の動画と背景が攪乱された動画の特徴間の距離を最小化するようにモデルを訓練する。
  • 既存の自己教師あり学習パイプラインに容易に統合可能なデータオーグメンテーション技術として実装される。
  • 対照的学習(例:MoCo)および事前学習タスクベースの手法の両方と互換性がある。
  • 背景が消去されたサンプルにより、モデルは静的シーン構造ではなく動きのパターンに注目するよう強制される。
  • 軽量であり、追加のパラメータや複雑なトレーニング手順を必要としない。

実験結果

リサーチクエスチョン

  • RQ1シンプルなデータオーグメンテーション戦略が、自己教師あり動画学習における背景の手がかりへの依存度を低下させられるか?
  • RQ2背景ノイズを追加することで、行動認識におけるモデルの動きのパターンへの注目度がどのように変化するか?
  • RQ3Background Erasingは、バイアスの強いおよび弱い動画データセットにおいて、どの程度性能を向上させられるか?
  • RQ4本手法は、事前学習中に見られなかった新しい行動への一般化を向上させるか?
  • RQ5シーンバイアスが最小限のデータセットでテストされた場合、モデルは頑健性を維持できるか?

主な発見

  • BEはMoCoと組み合わせることで、UCF101で16.4%、HMDB51で19.1%の行動認識精度向上を達成し、顕著な向上効果を示している。
  • バイアスが少ないDiving48データセットでは、MoCoよりも14.5%の向上を達成しており、低バイアス環境でも有効であることが示された。
  • 俳優主導のActor-HMDB51データセットでは、教師ありと自己教師ありモデルの性能差が、19.1%から2.9%に著しく縮小し、BEがシーンバイアスへの依存を低減していることが確認された。
  • 可視化結果から、BEで事前学習されたモデルは、敵対的摂動下でも動きの対象に注目し、静的背景にあまり注目しないことが確認された。
  • 異なるバックボーンや自己教師ありフレームワークにおいても一貫した向上効果を示しており、一般化可能性と頑健性が裏付けられた。
  • BEで訓練されたモデルは、新しいクラスへの転送性能が優れており、アテンションマップが明確に動き領域を強調している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。