Skip to main content
QUICK REVIEW

[論文レビュー] Reformulating HOI Detection as Adaptive Set Prediction

Chen Ming-fei, Yue Liao|arXiv (Cornell University)|Mar 10, 2021
Multimodal Machine Learning Applications参考文献 45被引用数 11
ひとこと要約

本稿では、学習可能なインタラクションクエリエンベッディングとトランスフォーマー基盤のデコーダーを用いて、インタラクション検出を適応的セット予測に再定式化する、新しい1段階型HOI検出フレームワークAS-Netを提案する。グローバルなコンテキスト特徴に適応的に注目し、微分可能なマッチングにより予測値をアノテーションと照合することで、人体ポーズや言語特徴に依存せずにHICO-DETで31%の相対的mAP向上を達成し、最先端の性能を実現した。

ABSTRACT

Determining which image regions to concentrate on is critical for Human-Object Interaction (HOI) detection. Conventional HOI detectors focus on either detected human and object pairs or pre-defined interaction locations, which limits learning of the effective features. In this paper, we reformulate HOI detection as an adaptive set prediction problem, with this novel formulation, we propose an Adaptive Set-based one-stage framework (AS-Net) with parallel instances and interaction branches. To attain this, we map a trainable interaction query set to an interaction prediction set with a transformer. Each query adaptively aggregates the interaction-relevant features from global contexts through multi-head co-attention. Besides, the training process is supervised adaptively by matching each ground truth with the interaction prediction. Furthermore, we design an effective instance-aware attention module to introduce instructive features from the instance branch into the interaction branch. Our method outperforms previous state-of-the-art methods without any extra human pose and language features on three challenging HOI detection datasets. Especially, we achieve over $31\%$ relative improvement on a large-scale HICO-DET dataset. Code is available at https://github.com/yoyomimi/AS-Net.

研究の動機と目的

  • 1段階型HOI検出器における固定されたインタラクション位置の制限が特徴の適応性を制限する問題に対処すること。
  • グローバル画像特徴からの動的でコンテキストに敏感な注目メカニズムを可能にすることで、インタラクション特徴の学習を向上させること。
  • 人体ポーズや言語埋め込みなどの外部情報に依存せずに高い性能を維持すること。
  • 1段階型の統合的でエンドツーエンドのフレームワークを設計し、インスタンスとインタラクションの並列ブランチにより、効率的かつ正確なHOI検出を実現すること。

提案手法

  • トランスフォーマー基盤のインタラクションデコーダーを介して、学習可能なインタラクションクエリセットをインタラクション予測セットにマッピングする。
  • インタラクションクエリとグローバル画像特徴の間でマルチヘッド共注意力を用い、インタラクション関連のコンテキストを適応的に集約する。
  • 予測されたインタラクションセットとアノテーションのトリプレットとの間で微分可能なマッチングを用いて、適応的監視を実現する。
  • 共注意力を介してインスタンスレベルの特徴をインタラクションブランチに統合するインスタンスに敏感な注目モジュールを導入する。
  • 2ブランチアーキテクチャを採用:1つはインスタンス検出(位置とカテゴリ)を、もう1つはインタラクション予測(ベクトルと動詞カテゴリ)を担当する。
  • 人間の中心から物体の中心へ向かうインタラクションベクトルを用い、予測値と検出されたインスタンスを関連付ける。

実験結果

リサーチクエスチョン

  • RQ1HOI検出を適応的セット予測に再定式化することで、特徴の関連性とインタラクションの正確性が向上するか?
  • RQ2共注意力を介してグローバルコンテキストからインタラクションクエリを学習することで、1段階型HOI検出器における固定位置予測を上回る性能が得られるか?
  • RQ3予測値とアノテーションとのマッチングによる適応的監視は、外部監視なしでもモデルの汎化性能を向上させるか?
  • RQ4インスタンスに敏感な注目が、インスタンスレベルの特徴をインタラクション予測に統合するのにどの程度効果的か?
  • RQ5人体ポーズや言語特徴に依存せずに、1段階型HOI検出器がSOTA性能を達成できるか?

主な発見

  • AS-Netは、先行する最先端手法と比較して、大規模なHICO-DETデータセットで31%の相対的mAP向上を達成した。
  • インスタンスに敏感な注目モジュールは、基本モデルでmAPを0.44ポイント向上させ、意味的埋め込みと組み合わせると1.12ポイント向上させた。
  • 意味的埋め込みとインスタンスに敏感な注目を両方組み合わせたモデルは、埋め込みのみのベースラインと比較して1ポイントの性能向上を達成した。
  • アブレーションスタディの結果、6層のインタラクションデコーダーと6つのインスタンスに敏感な注目モジュールを組み合わせた構成が、パラメータ効率と性能のバランスを最適化した。
  • 定性的な注目可視化の結果、モデルは関連する身体部位(例:傘、手)に注目する一方で、不要な特徴には注目せず、特徴選別能力の向上が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。