Skip to main content
QUICK REVIEW

[論文レビュー] Visual Compositional Learning for Human-Object Interaction Detection

Zhi Hou, Xiaojiang Peng|arXiv (Cornell University)|Jul 24, 2020
Multimodal Machine Learning Applications参考文献 39被引用数 12
ひとこと要約

本稿では、視覚的構成学習(VCL)という深層学習フレームワークを提案する。VCLは、人間-対象インタラクション(HOI)特徴を共有される動詞と対象の表現に分解し、特徴空間上で新しいHOIサンプルを構成することで、長尾分布の問題を緩和し、ゼロショットおよび少数ショット検出性能を向上させる。VCLはHICO-DETベンチマークにおいて、特にレアおよび未学習のHOIカテゴリで最先端の性能を達成し、未学習セットにおいて最大1.0 mAPの向上を達成した。

ABSTRACT

Human-Object interaction (HOI) detection aims to localize and infer relationships between human and objects in an image. It is challenging because an enormous number of possible combinations of objects and verbs types forms a long-tail distribution. We devise a deep Visual Compositional Learning (VCL) framework, which is a simple yet efficient framework to effectively address this problem. VCL first decomposes an HOI representation into object and verb specific features, and then composes new interaction samples in the feature space via stitching the decomposed features. The integration of decomposition and composition enables VCL to share object and verb features among different HOI samples and images, and to generate new interaction samples and new types of HOI, and thus largely alleviates the long-tail distribution problem and benefits low-shot or zero-shot HOI detection. Extensive experiments demonstrate that the proposed VCL can effectively improve the generalization of HOI detection on HICO-DET and V-COCO and outperforms the recent state-of-the-art methods on HICO-DET. Code is available at https://github.com/zhihou7/VCL.

研究の動機と目的

  • 多くの動詞-対象ペアが訓練例が少なく、あるいは存在しない人間-対象インタラクション(HOI)検出における長尾分布問題に対処すること。
  • 多様な画像およびインタラクションを横断して動詞と対象の共有で分離された表現を学習することで、ゼロショットおよび少数ショットHOI検出を向上させること。
  • 視覚的特徴空間における構成学習を通じて、新しいHOIサンプルおよび新しいインタラクションタイプの生成を可能にすること。
  • 結合ボックスの監視を用いて動詞表現を人間と対象の特徴から分離することで、モデルの汎化性能を向上させること。
  • 大規模なHOIベンチマークで既存の最先端手法を上回る、シンプルでありながら効果的なフレームワークの開発

提案手法

  • VCLは、動詞と人間のストリーム間に共有重みを持つマルチブランチネットワークを用いて、HOI表現を動詞と対象の特徴に分解する。
  • 人間と対象の結合ボックスから動詞表現を構築することで、人間ボックスのみの特徴よりも、インタラクション固有の手がかりをより効果的に捉える。
  • 異なる画像およびインタラクションタイプからの動詞と対象の特徴を組み合わせることで、新しいHOIサンプルを構成し、ゼロショットおよび少数ショットの一般化を可能にする。
  • 特徴再構成と構成学習のバランスを取るために、ハイパーパrameter λ₁ と λ₂ を用いた損失関数を導入し、表現の分離を改善する。
  • 再重み付けおよび後処理戦略を用いて、特に珍しいクラスにおいてベースライン検出性能を向上させる。
  • 十分な構成学習を実現しつつGPUメモリの過負荷を避けるために、ミニバッチあたりのインタラクションクラス数を増加させることで、学習を最適化する。

実験結果

リサーチクエスチョン

  • RQ1動詞と対象の特徴における構成学習は、人間-対象インタラクション検出におけるゼロショットおよび少数ショット一般化を向上させることができるか?
  • RQ2人間と対象の結合ボックスを用いた動詞表現学習は、人間ボックスのみを用いる場合と比較して、検出性能にどのような影響を与えるか?
  • RQ3視覚的特徴空間において、新しいHOIサンプルをどれほど効果的に構成できるか、長尾分布の緩和に寄与するか?
  • RQ4別個の動詞-対象ブランチと空間的-人間ブランチの貢献は、未学習のHOIカテゴリの検出性能向上にどの程度寄与するか?
  • RQ5ハイパーパrameter λ₁ と λ₂ は、特徴再構成と構成一般化のトレードオフにどのように影響を与えるか?

主な発見

  • VCLはHICO-DETの全テストセットで19.43 mAPを達成し、以前の最先端手法を1.0 mAP上回った。
  • 未学習カテゴリでは、珍しいインタラクションを優先して選択した際、7.55 mAPを達成し、空間的-人間ブランチよりも3.52%、ベースラインよりも4.90%の向上を示した。
  • 珍しいインタラクションを優先した場合、動詞-対象ブランチ単体でも未学習mAPが7.85%向上し、強力なゼロショット一般化能力を示した。
  • 動詞-対象ブランチと空間的-人間ブランチの両方を融合させることで、全セットmAPが16.58に上昇し、全体の検出性能向上に相乗効果があることが示された。
  • ミニバッチあたりのインタラクションクラス数を増加させることで、一般化性能が1.0 mAP向上(18.43から19.43 mAP)した。
  • アブレーションスタディにより、再重み付けおよび後処理戦略が、特に珍しいクラスにおいてベースライン性能を顕著に向上させること(13.62から16.87 mAP)を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。