Skip to main content
QUICK REVIEW

[論文レビュー] Glance and Gaze: Inferring Action-aware Points for One-Stage Human-Object Interaction Detection

Xubin Zhong, Xian Qu|arXiv (Cornell University)|Apr 12, 2021
Visual Attention and Saliency Detection参考文献 34被引用数 7
ひとこと要約

本稿では、1段階的HOI検出フレームワークとして、GlanceとGazeネットワーク(GGNet)を提案する。GGNetは2段階のプロセスにより、行動に敏感な点(ActPoints)を自己適応的に推定する。まず、潜在的な相互作用ピクセルを特定するための「グレースプーン」段階を経て、次に、より高精度なActPointsを段階的に精錬する「ガazes」段階を実行する。GGNetは、1つの共有バックボーンと外観特徴のみを用いて、V-COCOおよびHICO-DETベンチマークの両方で最先端の性能を達成し、従来の手法を顕著に上回る。

ABSTRACT

Modern human-object interaction (HOI) detection approaches can be divided into one-stage methods and twostage ones. One-stage models are more efficient due to their straightforward architectures, but the two-stage models are still advantageous in accuracy. Existing one-stage models usually begin by detecting predefined interaction areas or points, and then attend to these areas only for interaction prediction; therefore, they lack reasoning steps that dynamically search for discriminative cues. In this paper, we propose a novel one-stage method, namely Glance and Gaze Network (GGNet), which adaptively models a set of actionaware points (ActPoints) via glance and gaze steps. The glance step quickly determines whether each pixel in the feature maps is an interaction point. The gaze step leverages feature maps produced by the glance step to adaptively infer ActPoints around each pixel in a progressive manner. Features of the refined ActPoints are aggregated for interaction prediction. Moreover, we design an actionaware approach that effectively matches each detected interaction with its associated human-object pair, along with a novel hard negative attentive loss to improve the optimization of GGNet. All the above operations are conducted simultaneously and efficiently for all pixels in the feature maps. Finally, GGNet outperforms state-of-the-art methods by significant margins on both V-COCO and HICODET benchmarks. Code of GGNet is available at https: //github.com/SherlockHolmes221/GGNet.

研究の動機と目的

  • 1段階的HOI検出における事前に定義された相互作用領域の限界を是正すること。これは、意味的曖昧性を引き起こし、複雑な相互作用の表現が不十分になることがある。
  • 人間の視覚的注意を模倣するために、動的で自己適応的な推論を可能にする2段階のメカニズム(グレースプーンとガゼ)を導入すること。
  • 分類ごとに特化した回帰器を割り当てることで、空間的局在化を向上させる行動に敏感な点マッチング戦略を設計し、相互作用予測の精度を向上させること。
  • 挑戦的なサンプルに注目する新しいハードネガティブアテンション損失を導入することで、モデル最適化を強化すること。
  • 1つの共有バックボーンと外観特徴のみを用いて、1段階的HOI検出で最先端の性能を達成すること。

提案手法

  • グレースプーン段階では、軽量なヘッドを用いて特徴マップ全体のピクセルごとの分類を実行し、各ピクセルが潜在的な相互作用点かどうかを素早く同定する。
  • ガゼ段階では、行動に敏感な点(ActPoints)の位置を2段階のサブステップで精錬する。まず粗い位置を予測し、その後、残差オフセットを推定することで段階的な精錬を実現する。
  • 精錬されたActPointsからの特徴は、学習可能なアグリゲーションモジュールを用いて集約され、相互作用予測に適した文脈豊かな表現が生成される。
  • 行動に敏感な点マッチング(APM)戦略により、各相互作用カテゴリごとに固有の位置回帰器を割り当て、予測された点と真値の人間・物体ペア間の空間的整合性を向上させる。
  • 困難で誤分類されたサンプルに注目する新しいハードネガティブアテンション損失を導入し、一般化性能と最適化の安定性を向上させる。
  • すべてのモジュールが1つのエンドツーエンドで学習可能な1段階的フレームワークに統合され、物体検出と相互作用予測の同時かつ効率的な処理が可能になる。

実験結果

リサーチクエスチョン

  • RQ1動的かつ自己適応的な相互作用点の推論を可能にする1段階的HOI検出モデルは、効率性を保ちつつ、2段階手法を上回る精度を達成できるか?
  • RQ2グレースプーンとガゼという2段階の視覚的注意メカニズムは、静的で事前に定義された領域と比較して、相互作用点の局在化と表現をどのように向上させるか?
  • RQ3相互作用点にカテゴリ固有の回帰器を割り当てることで、より良い空間的整合性と向上した検出性能が得られるか?
  • RQ4ハードネガティブアテンション損失は、HOI検出におけるモデル最適化と一般化性能をどの程度向上させるか?
  • RQ51つの共有バックボーンと外観特徴のみを用いて、1段階的HOI検出で最先端の性能を達成できるか?

主な発見

  • V-COCOベンチマークにおいて、GGNetは34.89のmAPを達成し、同じバックボーン設定下で前回の最先端手法PPDMを3.6%上回った。
  • HICO-DETにおいて、GGNetはDTモードで33.50 mAPを達成し、外観特徴のみを用いても、最良の2段階手法PD-Netを1.10 mAP上回った。
  • レアおよびノンレアカテゴリのDTモードにおいて、GGNetはPPDMよりそれぞれ2.70%および2.64%のmAP向上を達成し、長尾データにおける優れた一般化性能を示した。
  • DRGの物体検出結果を用いて評価した場合、GGNet‡はDTモードで34.89 mAPを達成し、DRG⋄‡を4.64%上回った。これは、その頑健性と効率性を示している。
  • 定性的な結果から、ガゼ段階で精錬されたActPointsは、常により特徴的な人体部位(例:手)や物体部位に位置しているのに対し、初期のグレースプーン段階の点は曇った背景領域に位置していることが明らかになった。
  • アブレーションスタディの結果、行動に敏感な点マッチング戦略とハードネガティブアテンション損失は、mAPと局在化精度を顕著に向上させる重要な構成要素であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。