Skip to main content
QUICK REVIEW

[論文レビュー] QAHOI: Query-Based Anchors for Human-Object Interaction Detection

Junwen Chen, ‪Keiji Yanai‬|arXiv (Cornell University)|Dec 16, 2021
Multimodal Machine Learning Applications被引用数 9
ひとこと要約

QAHOIは、マルチスケール特徴抽出と学習可能なクエリ埋め込みを活用して、高い精度でHOIインスタンスを局所化・分類するクエリベースのトランスフォーマー枠組みを提示する。変形可能なアテンションメカニズムを用いたトランスフォーマー基盤とクエリベースのアンカーを採用することで、HICO-DETで最先端の性能を達成した。

ABSTRACT

Human-object interaction (HOI) detection as a downstream of object detection tasks requires localizing pairs of humans and objects and extracting the semantic relationships between humans and objects from an image. Recently, one-stage approaches have become a new trend for this task due to their high efficiency. However, these approaches focus on detecting possible interaction points or filtering human-object pairs, ignoring the variability in the location and size of different objects at spatial scales. To address this problem, we propose a transformer-based method, QAHOI (Query-Based Anchors for Human-Object Interaction detection), which leverages a multi-scale architecture to extract features from different spatial scales and uses query-based anchors to predict all the elements of an HOI instance. We further investigate that a powerful backbone significantly increases accuracy for QAHOI, and QAHOI with a transformer-based backbone outperforms recent state-of-the-art methods by large margins on the HICO-DET benchmark. The source code is available at $\href{https://github.com/cjw2021/QAHOI}{ ext{this https URL}}$.

研究の動機と目的

  • 既存の1段階HOI検出手法が、人間-オブジェクト相互作用における空間的変動性やスケールの多様性を処理する点での限界を解消すること。
  • マルチスケール特徴マップと自己アテンション機構を活用して、遠く離れているか、小スケールの人間-オブジェクトペアの特徴抽出を改善すること。
  • 空間的位置に依存せずにHOIインスタンスを局所化・分類できる柔軟なクエリベースの検出ヘッドを開発すること。
  • 強力なトランスフォーマー基盤が、HOIタスクにおける検出精度を顕著に向上させることを示すこと。
  • スクラッチから訓練可能で、現代の物体検出パラダイムと互換性を持つ強力な1段階ベースラインを確立すること。

提案手法

  • QAHOIは、異なる空間解像度からのマルチスケール特徴を抽出する階層的トランスフォーマー基盤を採用する。
  • トランスフォーマーエンコーダーを用いて、これらのマルチスケール特徴にアテンションを適用し、文脈を豊かにした視覚的表現を生成する。
  • 学習可能なクエリベースのデコーダーが、各クエリが潜在的なHOIインスタンスに対応するHOI埋め込みを生成する。
  • 相互作用ヘッドは、クエリ埋め込みから直接バウンディングボックス、オブジェクトクラス、アクションクラスを予測する。
  • 固定された相互作用ポイントに依存しないクエリベースのアンカーを採用することで、多様な空間的構成に柔軟に対応した局所化が可能になる。
  • 標準的なHOI検出損失を用いてエンドツーエンドで訓練可能であり、Swin-LargeやDeformable DETRなどの強力なバックボーンで微調整可能である。
(a) Larger Area
(a) Larger Area

実験結果

リサーチクエスチョン

  • RQ1クエリベースのトランスフォーマー枠組みは、多様な空間的スケールや距離における人間-オブジェクト相互作用の検出を向上させることができるか?
  • RQ2マルチスケール特徴抽出は、HOI検出における小スケールまたは遠距離の人間-オブジェクトペアの検出をどのように向上させるか?
  • RQ3バックボーンアーキテクチャの選択が、1段階HOI検出器の性能にどの程度影響を与えるか?
  • RQ4クエリベースの検出ヘッドは、長距離および曖昧な人間-オブジェクト関係を捉える点で、相互作用ポイントベースの手法を上回ることができるか?
  • RQ5自己アテンションを備えた純粋なトランスフォーマー基盤は、CNNベースのバックボーンに比べて、HOI検出において顕著な利点を提供するか?

主な発見

  • Swin-Largeバックボーンを搭載したQAHOIは、HICO-DETベンチマークで最先端の性能を達成し、最近のSOTA手法を上回った。
  • 小スケールのHOIインスタンス(最初の3つのビン)において、QAHOIはResNet-101を用いたQPICを上回ったが、特に最小のビンで顕著な優位性を示した。
  • Deformable DETRから微調整したResNet-50を搭載したQAHOIは、小スケールインスタンスにおいてQPIC(ResNet-101)と同等の結果を達成した。
  • QAHOIは、他の手法が性能を低下させる傾向のある長距離のHOIインスタンス(中心距離 < 0.3×画像サイズ)においても、強力な性能を維持した。
  • クエリベースのアンカーは、局所化において柔軟性を示し、アンカーが人間-オブジェクトペアの中心にない場合でもHOIインスタンスを検出できた。
  • 相互作用ポイントの監視に依存せず、高い精度を達成した。これは、クエリベース表現がHOI検出において有効であることを示している。
(b) Center Distance
(b) Center Distance

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。