Skip to main content
QUICK REVIEW

[論文レビュー] ViPLO: Vision Transformer based Pose-Conditioned Self-Loop Graph for Human-Object Interaction Detection

Jeeseung Park, Jinwoo Park|arXiv (Cornell University)|Apr 17, 2023
Multimodal Machine Learning Applications被引用数 4
ひとこと要約

ViPLOは、量子化フリーな特徴抽出のための新規な重複領域マスキング(MOA)モジュールと、ポーズに依存する自己ループグラフを用いたVision Transformerベースの2段階型人間オブジェクトインタラクション(HOI)検出器を提案する。これにより、関節に注目する分類と、人間の視覚的注意に類似した局所的関節特徴の統合が可能となり、最先端の性能を達成した。HICO-DETで+2.07 mAPの向上を達成し、効率性を維持したまま先行手法を上回った。

ABSTRACT

Human-Object Interaction (HOI) detection, which localizes and infers relationships between human and objects, plays an important role in scene understanding. Although two-stage HOI detectors have advantages of high efficiency in training and inference, they suffer from lower performance than one-stage methods due to the old backbone networks and the lack of considerations for the HOI perception process of humans in the interaction classifiers. In this paper, we propose Vision Transformer based Pose-Conditioned Self-Loop Graph (ViPLO) to resolve these problems. First, we propose a novel feature extraction method suitable for the Vision Transformer backbone, called masking with overlapped area (MOA) module. The MOA module utilizes the overlapped area between each patch and the given region in the attention function, which addresses the quantization problem when using the Vision Transformer backbone. In addition, we design a graph with a pose-conditioned self-loop structure, which updates the human node encoding with local features of human joints. This allows the classifier to focus on specific human joints to effectively identify the type of interaction, which is motivated by the human perception process for HOI. As a result, ViPLO achieves the state-of-the-art results on two public benchmarks, especially obtaining a +2.07 mAP performance gain on the HICO-DET dataset. The source codes are available at https://github.com/Jeeseung-Park/ViPLO.

研究の動機と目的

  • 2段階型HOI検出器の性能を向上させること。これは、効率性の利点があるものの、1段階型手法に性能で劣っているため。
  • HOI検出における領域ベースの特徴抽出とVision Transformer(ViT)を組み合わせた際の量子化問題を解決すること。
  • 人間のHOI認識プロセスを模倣するために、ポーズに敏感で関節に焦点を当てた推論をインタラクション予測プロセスに統合すること。
  • ViTバックボーンの表現力を利用しつつ、高い推論速度とメモリ効率を維持すること。

提案手法

  • 重複領域マスキング(MOA)モジュールを導入し、ViTのパッチとオブジェクト領域の重複領域を用いてアテンションを計算することで、空間的量子化を回避する。
  • MOAを用いたViTをバックボーンとして採用し、ROIAlignに依存しない、高精度な特徴抽出を実現。パッチインデックスの量子化に依存しない。
  • 人間ノードの埋め込みを、局所的関節特徴をクエリ・キー構造で用いて更新するポーズに依存する自己ループグラフを設計。人間の視覚的注意に類似した処理を模倣する。
  • 空間的関係性と人間のポーズ特徴を用いてインタラクションエッジを符号化し、グラフ内での「相互作用に敏感な」メッセージ伝達を可能にする。
  • クエリベースのアテンション機構を採用し、人間の関節特徴に注目することで人間ノード表現を精緻化し、インタラクション分類性能を向上させる。
  • CLIPの重みを用いてViTバックボーンを事前学習することで、特に少サンプルやゼロショットの状況下でも特徴品質と汎化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1空間的量子化の問題に直面することなく、2段階型HOI検出に効果的かつ効率的にVision Transformerバックボーンを適用できるか?
  • RQ2人間のポーズ情報をインタラクション予測プロセスに統合することで、分類精度を向上させられるか?
  • RQ3局所化 → 相互作用性 → 関節への注目という3段階の人的認知パイプラインとしてのインタラクション認識プロセスをモデル化することで、性能向上が達成できるか?
  • RQ4グラフネットワークにおける自己ループ構造が、局所的関節特徴に注目することで性能向上をもたらすか?
  • RQ5CLIPで事前学習した重みをViTに適用することで、ImageNet や COCO で事前学習した重みよりもHOI検出性能が向上するか?

主な発見

  • ViPLOは、HICO-DETデータセットのFull設定において、36.97のmAPという新たな最先端性能を達成した。
  • 前回の最先端手法と比較して、HICO-DETで+2.07 mAPの向上を達成し、提案手法の有効性を裏付けた。
  • MOAモジュールは量子化に起因する性能劣化を低減し、ベースラインのViT + ROI手法と比較して1.08ポイントのmAP向上を達成した。
  • ポーズに依存する自己ループグラフは、自己ループなしのベースラインと比較して0.44 mAPの向上をもたらし、関節に注目する役割が有効であることを検証した。
  • 推論速度とGPUメモリ使用量は、ResNet-50ベースのモデルと同等であり、SCGに使用されるResNet-50よりも低いメモリ消費量を維持した。
  • CLIPで事前学習したViT重みを用いることで、同じ事前学習スキームであっても、COCOで事前学習したResNetよりも優れた性能を達成した。CLIP初期化の利点を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。