Skip to main content
QUICK REVIEW

[論文レビュー] HOICLIP: Efficient Knowledge Transfer for HOI Detection with Vision-Language Models

Shan Ning, Longtian Qiu|arXiv (Cornell University)|Mar 28, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

HOICLIPは、知識蒸留を経由せずにCLIPから空間的・動詞的・言語的事前知識を直接抽出する、HOI検出のための知識移転フレームワークを提案する。クロスアテンション相互作用デコーダー、動詞表現のための視覚的意味的算術、トレーニングフリーのプロンプトベース分類器を用いることで、HICO-Detで4.04 mAPの向上を達成し、少データおよびゼロショット設定でも優れたデータ効率性を示す。

ABSTRACT

Human-Object Interaction (HOI) detection aims to localize human-object pairs and recognize their interactions. Recently, Contrastive Language-Image Pre-training (CLIP) has shown great potential in providing interaction prior for HOI detectors via knowledge distillation. However, such approaches often rely on large-scale training data and suffer from inferior performance under few/zero-shot scenarios. In this paper, we propose a novel HOI detection framework that efficiently extracts prior knowledge from CLIP and achieves better generalization. In detail, we first introduce a novel interaction decoder to extract informative regions in the visual feature map of CLIP via a cross-attention mechanism, which is then fused with the detection backbone by a knowledge integration block for more accurate human-object pair detection. In addition, prior knowledge in CLIP text encoder is leveraged to generate a classifier by embedding HOI descriptions. To distinguish fine-grained interactions, we build a verb classifier from training data via visual semantic arithmetic and a lightweight verb representation adapter. Furthermore, we propose a training-free enhancement to exploit global HOI predictions from CLIP. Extensive experiments demonstrate that our method outperforms the state of the art by a large margin on various settings, e.g. +4.04 mAP on HICO-Det. The source code is available in https://github.com/Artanic30/HOICLIP.

研究の動機と目的

  • CLIPからの知識蒸留に基づく従来のHOI検出手法の低いデータ効率性およびゼロショット一般化性能の問題を解決すること。
  • 大規模なアノテート済みトレーニングデータに依存せずに、長尾動詞クラスやレアな相互作用の性能を向上させること。
  • CLIPの事前学習済み視覚・言語表現を効果的かつトレーニングフリーに活用するための方法を提供すること。
  • 知識統合ブロックを通じてCLIPの空間的および言語的事前知識を検出バックボーンの特徴と統合し、検出精度を向上させること。

提案手法

  • トランスフォーマーに基づく相互作用デコーダーがクロスアテンションを用いて、CLIPの視覚特徴マップから局所化された相互作用特徴を抽出し、情報量の多い領域に注目する。
  • 視覚的意味的算術を用いて、CLIPで学習された視覚的意味的関係からクラス重みを計算することで、大規模な動詞固有データに依存しない動詞分類器を構築する。
  • 微細な相互作用の識別を向上させるために、軽量な動詞表現アダプタを導入する。
  • トレーニングフリーの強化では、CLIPのテキストエンコーダーを用いてプロンプトベースの言語表現を生成し、推論時に統合することでゼロショット予測を実現する。
  • 知識統合ブロックがCLIPの空間的および言語的特徴を検出バックボーンの特徴と統合し、人間-物体ペアの局所化および相互作用分類を向上させる。
  • 視覚・言語・空間的モodalのすべてにおいて、事前学習済みCLIPの事前知識を直接取得・活用することで、知識蒸留を回避する。
(a) Data Efficiency Comparison
(a) Data Efficiency Comparison

実験結果

リサーチクエスチョン

  • RQ1知識蒸留と比較して、CLIPの事前学習済み知識を直接抽出することで、HOI検出におけるデータ効率性が向上するか?
  • RQ2長尾および低データ環境下で、視覚的意味的算術はどのように動詞表現学習を向上させるか?
  • RQ3トレーニングフリーのプロンプトベース分類器は、HOI検出におけるゼロショット一般化性能を向上させ得るか?
  • RQ4CLIPの空間的および言語的事前知識を統合することで、全クラス、レアクラス、非レアクラスのすべてにおいて、検出精度と頑健性がどの程度向上するか?

主な発見

  • HOICLIPは、完全教師あり設定下でHICO-Detデータセットにおいて、前回のSOTAより+4.04 mAPの向上を達成した。
  • モデルは優れたデータ効率性を示し、5%にまでデータを削減した場合でも、GEN-VLKTなどのベースラインを上回った。
  • 視覚的意味的算術を用いた動詞分類器は、文脈記述法と比較して1.16 mAP向上、平均HOI表現法と比較して1.45 mAP向上を達成した(全クラス設定下)。
  • トップ-kグローバル予測を用いたトレーニングフリーの強化により、平均で0.15 mAPの向上が得られ、推論コストは最小限に抑えられた。
  • 単一のA100 GPU上で55.52 ms/imgという競争力ある推論速度を維持しており、より高い性能を発揮する一方で、GEN-VLKTと比較してわずかに遅延が増加した。
  • アブレーションスタディにより、空間的特徴抽出、動詞アダプタ、言語的強化の各コンポonentが、性能向上に段階的に寄与していることが確認された。
(b) Verb Long-tail Problem
(b) Verb Long-tail Problem

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。