Skip to main content
QUICK REVIEW

[論文レビュー] Activity Driven Weakly Supervised Object Detection

Zhenheng Yang, Dhruv Mahajan|arXiv (Cornell University)|Apr 2, 2019
Human Pose and Action Recognition参考文献 52被引用数 4
ひとこと要約

本論文は、バウンディングボックスアノテーションが不要な弱教師付きオブジェクト検出フレームワークを提案する。行動ラベルを活用することで、アクティビティ駆動型の空間的事前分布を学習し、一貫したオブジェクトの外観を学習し、行動分類器とオブジェクト分類器を共同で学習することで、Charades動画データセットにおいてSOTAを6%上回るmAP向上を達成した。

ABSTRACT

Weakly supervised object detection aims at reducing the amount of supervision required to train detection models. Such models are traditionally learned from images/videos labelled only with the object class and not the object bounding box. In our work, we try to leverage not only the object class labels but also the action labels associated with the data. We show that the action depicted in the image/video can provide strong cues about the location of the associated object. We learn a spatial prior for the object dependent on the action (e.g. "ball" is closer to "leg of the person" in "kicking ball"), and incorporate this prior to simultaneously train a joint object detection and action classification model. We conducted experiments on both video datasets and image datasets to evaluate the performance of our weakly supervised object detection model. Our approach outperformed the current state-of-the-art (SOTA) method by more than 6% in mAP on the Charades video dataset.

研究の動機と目的

  • バウンディングボックスアノテーションの高コストな依存を減らすために、行動ラベルを弱教師信号として活用すること。
  • 行動における人間-オブジェクトインタラクションから得られる空間的および外観的事前分布を活用することで、弱教師付き検出における局所化精度を向上させること。
  • オブジェクト検出と行動分類のモデルを共同で学習させることで、特徴学習の向上と相互の教師信号の強化を図ること。
  • 動画および画像データセット、特にエゴセントリック動画を含む、異なるデータモダリティにおけるアクティビティ駆動型教師信号の有効性を評価すること。
  • 行動ラベルからの弱教師信号が、オブジェクト検出における強教師信号の必要性を顕著に低減できることを示すこと。

提案手法

  • 本手法は、行動に関与する人間の身体部位(例:手)に基づいて、オブジェクトの空間的事前分布を学習し、オブジェクトの位置を行動コンテキストに依存するものとしてモデル化する。
  • 共有された特徴とマルチタスク学習を用いて、行動分類とオブジェクト検出を同時に最適化する共同学習フレームワークを導入する。
  • 同じオブジェクトが異なる行動に登場する場合に、一般化可能なオブジェクト外観モデルを訓練し、一貫した特徴学習を実現する。
  • RPNからのオブジェクト候補を用い、分類ヘッドを適用してオブジェクトの存在を予測するが、監視信号は行動ラベルから得る。
  • 行動コンテキストと空間的事前分布に基づいて、正しいオブジェクト候補が選択されるよう促す弱教師付き損失を組み込む。
  • エゴセントリック動画への応用のため、人間キーポイント検出が困難なため、中心に基づく空間的事前分布を用いる。

実験結果

リサーチクエスチョン

  • RQ1行動ラベルは、弱教師付きオブジェクト検出の向上に寄与する意味のある空間的および外観的事前分布を提供できるか?
  • RQ2行動分類とオブジェクト分類を共同で学習することで、独立した学習に比べて検出性能がどの程度向上するか?
  • RQ3アクティビティ駆動型教師信号は、オブジェクト検出におけるバウンディングボックスアノテーションの必要性をどの程度低減できるか?
  • RQ4本手法は、動画および画像を含む異なるデータモダリティにどの程度一般化可能か?
  • RQ5行動ベースの弱教師信号と組み合わせた場合、限定的な真値バウンディングボックスアノテーションが与えられた場合に、性能にどのような影響を与えるか?

主な発見

  • 提案手法は、Charades動画データセットにおいて、以前のSOTAを6%上回るmAPを達成し、弱教師付き検出における優れた性能を示した。
  • HICO-DET画像データセットにおいても、既存の弱教師付きアプローチを上回り、動画データを超えた一般化性能を示した。
  • エゴセントリックEPIC-KITCHENSデータセットでは、R*CNNやPCLを上回り、第一人称動画における暗黙の空間的事前分布の恩恵を受けていた。
  • トレーニングサンプルの70%にのみバウンディングボックスアノテーションが存在する状況でも、Charadesでは100%のアノテーションが与えられた完全教師ありモデルと同等の性能を達成した。
  • 100%のバウンディングボックスアノテーションが与えられた状態でも、行動分類とオブジェクト分類の共同学習のおかげで、完全教師ありベースラインを2 mAPポイント上回った。
  • アブレーションスタディにより、各コンポonent(空間的事前分布、共同学習、外観モデリング)が最終的な性能向上に顕著に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。