Skip to main content
QUICK REVIEW

[論文レビュー] Boosting Human-Object Interaction Detection with Text-to-Image Diffusion Model

Jie Yang, Bingliang Li|arXiv (Cornell University)|May 20, 2023
Multimodal Machine Learning Applications被引用数 6
ひとこと要約

本稿では、Stable Diffusion および CLIP からのセマンティック特徴をアダプタースタイルのチューニングで統合することで、相互作用表現学習を向上させる、凍結されたテキスト対画像拡散モデルを活用する新しい人物対象インタラクション(HOI)検出フレームワーク、DiffHOI を提案する。また、140万枚を超える画像を有する大規模でクラスバランスが取れ、多様性に富んだ合成HOIデータセットであるSynHOIを導入し、HICO-DETで41.50 mAPを達成し、レアカテゴリで11.55%のmAP向上を示した。これは、ゼロショットおよび通常の検出設定の両方で、SOTAを顕著に上回った結果である。

ABSTRACT

This paper investigates the problem of the current HOI detection methods and introduces DiffHOI, a novel HOI detection scheme grounded on a pre-trained text-image diffusion model, which enhances the detector's performance via improved data diversity and HOI representation. We demonstrate that the internal representation space of a frozen text-to-image diffusion model is highly relevant to verb concepts and their corresponding context. Accordingly, we propose an adapter-style tuning method to extract the various semantic associated representation from a frozen diffusion model and CLIP model to enhance the human and object representations from the pre-trained detector, further reducing the ambiguity in interaction prediction. Moreover, to fill in the gaps of HOI datasets, we propose SynHOI, a class-balance, large-scale, and high-diversity synthetic dataset containing over 140K HOI images with fully triplet annotations. It is built using an automatic and scalable pipeline designed to scale up the generation of diverse and high-precision HOI-annotated data. SynHOI could effectively relieve the long-tail issue in existing datasets and facilitate learning interaction representations. Extensive experiments demonstrate that DiffHOI significantly outperforms the state-of-the-art in regular detection (i.e., 41.50 mAP) and zero-shot detection. Furthermore, SynHOI can improve the performance of model-agnostic and backbone-agnostic HOI detection, particularly exhibiting an outstanding 11.55% mAP improvement in rare classes.

研究の動機と目的

  • 既存のHOIデータセットに見られる長尾分布と多様性の欠如が、稀で繊細なインタラクションカテゴリの有効な学習を妨える問題に対処すること。
  • 事前学習済みのテキスト対画像拡散モデルからの豊富で文脈に配慮した表現を活用することで、HOI検出における相互作用予測の曖昧さを軽減すること。
  • 完全にアノテートされたトリプレット(人物、対象、インタラクション)を備えた、高多様性・高精度な合成HOI画像を自動で生成するスケーラブルなパイプラインの開発。
  • アダプタースタイルのチューニングにより、凍結された拡散モデルとCLIPモデルからのセマンティック特徴を統合し、人物および対象の表現学習を強化すること。
  • 合成データと拡散ベースの表現が、モデルに依存せず、バックボーンに依存しないHOI検出性能を向上させることを実証すること。

提案手法

  • 事前学習済みのオブジェクト検出器と、凍結されたテキスト対画像拡散モデル(Stable Diffusion)およびCLIPからのセマンティック表現を統合するインタラクションデコーダーを統合した検出フレームワーク、DiffHOIを提案する。
  • 拡散モデルの内部特徴空間から、動詞関連の文脈的表現($\boldsymbol{V}_{sd}$)を抽出・統合するアダプタースタイルのチューニング手法を導入し、CLIPのグローバルおよびローカル表現($\boldsymbol{v}_{clip}$)と一致させる。
  • 140万枚を超える合成HOI画像を自動で生成するスケーラブルなパイプラインを設計し、トリプレット(人物、対象、インタラクション)を完全にアノテートすることで、クラスバランスと高い多様性を確保する。
  • 特徴抽出中にノイズレベルを制御するために、拡散時間ステップ $t$ を用いる。アブレーション実験では、$t=0$(元のノイズあり画像)で最良の性能が得られた。
  • 一般化性能とレアカテゴリ検出性能の向上を目的に、SynHOI およびその高品質サブセットである SynHOI-Sub を用いた事前学習およびジョイントトレーニング戦略を採用する。
  • 対照的学習と知識蒸留の原則を活用し、異なるモデル間でのインタラクション表現を一致させ、ゼロショット一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1凍結されたテキスト対画像拡散モデルの内部表現は、HOI検出に適した動詞の概念とその文脈的ニュアンスを効果的に捉えられるか?
  • RQ2事前学習済みの拡散モデルからのセマンティック特徴を、下流の検出タスクにおける人物対象インタラクション表現の向上に効果的に適応できるか?
  • RQ3大規模で合成されたクラスバランスが取れたHOIデータセットは、実世界のHOIデータセットにおける長尾分布問題をどの程度軽減できるか?
  • RQ4拡散ベースとCLIPベースの表現を統合することで、頻度の高いカテゴリとレアカテゴリの両方で一貫したmAP向上が得られるか?
  • RQ5提案手法は、アーキテクチャの変更なしに、さまざまなバックボーンや検出アーキテクチャに一般化可能か?

主な発見

  • DiffHOIは、HICO-DETベンチマークで41.50 mAPを達成し、同じ評価プロトコル下で33.73 mAPを報告した先行SOTAを顕著に上回った。
  • レアHOIカテゴリ(10件未塔の学習インスタンスを有する)で11.55%のmAP向上を達成し、長尾分布への強い一般化能力を示した。
  • SynHOI-Subを用いたジョイントトレーニングにより、DiffHOIモデルで0.58 mAP、GEN-VLKTで0.69 mAPの向上が得られ、合成データの一般化への有効性を裏付けた。
  • アブレーションスタディにより、$t=0$ で抽出された $\boldsymbol{V}_{sd}$ が最良の性能を示し、より高いノイズレベル($t=500$)では性能が低下することが確認され、初期の拡散ステップでの特徴抽出が最適であることが示された。
  • 拡散モデルからの $\boldsymbol{V}_{sd}$ を組み込むことで、ベースラインから3.36 mAPのレアmAP向上が得られ、微細なインタラクション意味を捉える役割が顕著になった。
  • SynHOIはモデルに依存せず、バックボーンに依存しない改善を実現し、特にレアカテゴリ検出で最大の向上が得られた。これは、データ不足の緩和に有効であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。