Skip to main content
QUICK REVIEW

[論文レビュー] Novel Human-Object Interaction Detection via Adversarial Domain Generalization

Yuhang Song, Wenbo Li|arXiv (Cornell University)|May 22, 2020
Multimodal Machine Learning Applications参考文献 44被引用数 5
ひとこと要約

本稿では、学習中に未確認の述語-目的語の組み合わせがテストで現れる新しい人間-物体インタラクション(HOI)検出タスクにおけるゼロショット一般化を向上させるため、敵対的ドメイン一般化フレームワークを提案する。条件付きおよび無条件のドメイン一般化を通じて物体不変特徴を学習することで、新しいHICO-DETスプリットでは最大50%の性能向上を達成し、UnRelでは最大125%の向上を示し、未学習のHOIトリプレットを検出する際、ベースラインを著しく上回る性能を発揮する。

ABSTRACT

We study in this paper the problem of novel human-object interaction (HOI) detection, aiming at improving the generalization ability of the model to unseen scenarios. The challenge mainly stems from the large compositional space of objects and predicates, which leads to the lack of sufficient training data for all the object-predicate combinations. As a result, most existing HOI methods heavily rely on object priors and can hardly generalize to unseen combinations. To tackle this problem, we propose a unified framework of adversarial domain generalization to learn object-invariant features for predicate prediction. To measure the performance improvement, we create a new split of the HICO-DET dataset, where the HOIs in the test set are all unseen triplet categories in the training set. Our experiments show that the proposed framework significantly increases the performance by up to 50% on the new split of HICO-DET dataset and up to 125% on the UnRel dataset for auxiliary evaluation in detecting novel HOIs.

研究の動機と目的

  • オブジェクト-述語ペアの組み合わせの長尾分布と組み合わせ爆発のため、未学習のヒューマンオブジェクトインタラクション(HOI)トリプレットの組み合わせへの一般化が困難であるという課題に対処すること。
  • 既存のHOI検出器が頻度の偏向に依存するのを軽減するため、述語分類のための物体不変特徴を学習すること。
  • テスト時のトリプレットが学習時に完全に未確認である新しいHICO-DETスプリットと、UnRelからの補助評価セットを構築すること。
  • 既存のHOIモデルに統合可能な包括的な敵対的ドメイン一般化フレームワークを開発すること。

提案手法

  • 異なるオブジェクトカテゴリ間でのドメインシフトを最小化することで、述語予測のための物体不変特徴を学習する包括的な敵対的ドメイン一般化(ADG)フレームワークを提案する。
  • 条件付きおよび無条件のADGバージョンを設計:条件付きADG(CADG)と無条件ADG(ADG)、前者はオブジェクト特徴に明示的に条件づけることで特徴の分離性を向上させる。
  • 人間ボックス(H)、空間特徴(Sp)、ユニオンボックス(U)の3本の特徴抽出ヘッドを導入し、ユニオンボックスブランチが人間-オブジェクトインタラクション特徴を捉える。
  • ドメイン識別器を用いた敵対的訓練によりドメイン一般化を実現し、オブジェクトカテゴリ間でドメイン不変な特徴を生成するようモデルを促進する。
  • ドメイン整合性損失として、カルバック・ライブラー(KLD)とジェンセン・シャノン(JSD)ダイバージェンスを用い、ドメイン間の特徴分布を最適化する。
  • Grad-CAM可視化を導入し、モデルが偶然的な手がかりではなく、インタラクション関連領域に注目していることを検証する。

実験結果

リサーチクエスチョン

  • RQ1敵対的ドメイン一般化は、ゼロショット設定下での未学習のヒューマンオブジェクトインタラクショントリプレットの組み合わせへの一般化を効果的に向上させることができるか?
  • RQ2条件付きドメイン一般化(CADG)は、無条件ADGと比較して、述語分類のための物体不変特徴を学習する上でどのように優れているか?
  • RQ3提案フレームワークは、頻度の偏向への依存をどの程度軽減し、長尾および新しいHOI検出の性能を向上させるか?
  • RQ4敵対的ドメイン一般化を適用した場合、モデルの注目マップはどのように変化するか?また、人間インタラクション領域と一致するか?
  • RQ5未学習のテストトリプレットを含む本稿のベンチマークは、ゼロショットHOI一般化の評価に意味のあるものであるか?

主な発見

  • 提案されたCADG-JSD手法は、新しいHICO-DETテストスプリットにおいてベースライン比でR@1に95.4%の相対的向上を達成し、最終的なR@1は43.47に達した。
  • UnRelデータセットでは、CADG-JSDモデルがR@1に95.4%の相対的向上を示し、珍しいおよび未学習のシーンにおける強力なゼロショット一般化を実証した。
  • CADG-KLDおよびCADG-JSDモデルは、ユニオンボックスブランチで60–100%の向上を示し、インタラクションに敏感な特徴の効果的な学習を裏付けた。
  • Grad-CAM可視化により、CADGモデルが正しいインタラクション領域(例:手と物体の接触)に注目しているのを確認したのに対し、ベースラインモデルは目などの関係のない身体部位に注目していた。
  • アブレーションスタディの結果、条件付きADG(CADG)は無条件ADG(ADG)を著しく上回り、オブジェクト特徴への明示的な条件づけが特徴の分離性を向上させることを実証した。
  • HICO-DETの新しいスプリットとUnRelの評価セットは、未学習のトリプレット組み合わせを的確に分離できており、一般化性能の信頼性あるゼロショット評価を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。