Skip to main content
QUICK REVIEW

[論文レビュー] Relational Context Learning for Human-Object Interaction Detection

Sanghyun Kim, Deunsol Jung|arXiv (Cornell University)|Apr 11, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

本稿では、人間-物体インタラクション(HOI)検出のための三本のブランチを持つトランスフォーマー基盤手法MURENを提案する。関係性の推論を強化するため、複数の関係的文脈を学習する。人間、物体、インタラクションのトークン間における一元的、二元的、三元的関係をモデル化し、注意に基づく統合モジュールを用いて文脈を的確に伝達することで、HICO-DETおよびV-COCOベンチマークで最先端の性能を達成した。

ABSTRACT

Recent state-of-the-art methods for HOI detection typically build on transformer architectures with two decoder branches, one for human-object pair detection and the other for interaction classification. Such disentangled transformers, however, may suffer from insufficient context exchange between the branches and lead to a lack of context information for relational reasoning, which is critical in discovering HOI instances. In this work, we propose the multiplex relation network (MUREN) that performs rich context exchange between three decoder branches using unary, pairwise, and ternary relations of human, object, and interaction tokens. The proposed method learns comprehensive relational contexts for discovering HOI instances, achieving state-of-the-art performance on two standard benchmarks for HOI detection, HICO-DET and V-COCO.

研究の動機と目的

  • 既存の二本のブランチを持つトランスフォーマー基盤のHOI検出手法におけるデコーダーのブランチ間での文脈交換の制限を解決すること。
  • 分離型アーキテクチャにおけるインタラクションに敏感な文脈の不足により生じる関係性推論能力の欠如を克服すること。
  • 人間、物体、インタラクションのトークン間で、一元的、二元的、三元的という多段階の関係的文脈をモデル化することで、HOI検出を向上させること。
  • 人間検出、物体検出、インタラクション分類のためのより判別力の高い特徴を学習できる三本のブランチアーキテクチャを設計すること。
  • タスク固有のトークン条件付けとチャネル別注意を用いた注意に基づく統合機構により、ブランチ間で効果的かつタスクに特化した文脈交換を可能にすること。

提案手法

  • 人間、物体、インタラクションのトークンから一元的、二元的、三元的関係的文脈を計算する、複数関係埋め込みモジュール(MURE)を提案する。
  • 一元的文脈を各トークンタイプ内での自己注意(例:インタラクション専用の文脈)としてモデル化し、二元的文脈を二つのタイプ間のクロス注意(例:人間-インタラクション)としてモデル化し、三元的文脈をすべての三つのタイプの共同表現としてモデル化する。
  • タスク固有のトークン条件付けとチャネル別注意を用いて、各サブタスクに適した文脈情報を選択的に伝える注意に基づく統合モジュールを導入する。
  • 各ブランチのタスク固有のトークンと選択された関係的文脈を要素ごとの加算により統合することで、ターゲットに特化した文脈交換を可能にする。
  • 三本のブランチからなるトランスフォーマー・デコーダー・アーキテクチャを採用:人間検出用、物体検出用、インタラクション分類用のそれぞれのブランチ。
  • 標準的なHOI検出損失を用いてエンドツーエンドで学習し、多タスク学習により検出ヘッドと分類ヘッドを最適化する。
Figure 1 : The illustration of relation context information in an HOI instance. We define three types of relation context information in an HOI instance: unary, pairwise, and ternary relation contexts. Each relation context provides useful information for detecting an HOI instance. For example, in o
Figure 1 : The illustration of relation context information in an HOI instance. We define three types of relation context information in an HOI instance: unary, pairwise, and ternary relation contexts. Each relation context provides useful information for detecting an HOI instance. For example, in o

実験結果

リサーチクエスチョン

  • RQ1一元的、二元的、三元的という複数段階の関係的文脈をモデル化することで、HOI検出の性能が向上するか?
  • RQ2注意に基づく統合モジュールによる選択的文脈伝達は、HOI検出における関係性推論を向上させるか?
  • RQ3三本のブランチアーキテクチャは、二本のブランチまたは一本のブランチ設計と比較して、特徴の判別力と性能において優れているか?
  • RQ4人間と物体のブランチを分離することで、パrameter共有と比較して検出精度がどの程度向上するか?
  • RQ5ブランチ間での豊富な文脈交換は、分離型トランスフォーマーにおける関係性推論の制限を緩和できるか?

主な発見

  • MURENはHICO-DETでAP 68.8、V-COCOでAP 71.0を達成し、先行手法を上回る最先端の性能を示した。
  • アブレーションスタディの結果、注意に基づく統合モジュールを削除すると、HICO-DETで2.25%p、V-COCOで2.04%p性能が低下し、その有効性が裏付けられた。
  • 統合モジュールにおける「条件付け」と「チャネル注意」の組み合わせが最良の性能をもたらし、サブタスクが異なる文脈を必要としていることを確認した。
  • 人間と物体のブランチ間でパラメータを共有すると、性能が著しく低下する—MUREN-(6)はHICO-DETで2.2%p、V-COCOで1.9%p低下し、非共有のMUREN-(0)と比較して劣化した。
  • 可視化結果から、インタラクションブランチがインタラクションが発生する領域に注目していることが確認され、MUREモジュールが包括的な関係的領域を強調していることから、関係性推論におけるその役割が妥当であることが裏付けられた。
  • 完全に分離されたアーキテクチャ(MUREN-(0))は、パラメータ数を同等にした共有層を有するバージョン(MUREN†)よりも高い精度を達成しており、人間および物体エンコーダーの専用化の利点を実証した。
Figure 2 : The overall architecture of MUREN. The proposed method adopts three-branch architecture: human branch, object branch, and interaction branch. Each branch is responsible for human detection, object detection, interaction classification. The input image is fed into the CNN backbone followed
Figure 2 : The overall architecture of MUREN. The proposed method adopts three-branch architecture: human branch, object branch, and interaction branch. Each branch is responsible for human detection, object detection, interaction classification. The input image is fed into the CNN backbone followed

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。