Skip to main content
QUICK REVIEW

[論文レビュー] Detecting Human-Object Interactions with Action Co-occurrence Priors

Dong-Jin Kim, Xiao Sun|arXiv (Cornell University)|Jul 17, 2020
Multimodal Machine Learning Applications参考文献 64被引用数 14
ひとこと要約

本稿では、長尾分布のデータセットにおける人間-オブジェクトインタラクション(HOI)検出を、HOIクラス間の自然な相関および逆相関を活用することで向上させるため、アクション共起事前知識(ACPs)を提案する。階層的ディープラーニングアーキテクチャと知識蒸留に基づくラベル拡張を導入し、トレーニングを強化することで、HICO-DetおよびV-COCOで最先端の性能を達成した。特に、0〜9件のトレーニングサンプルを有するレアなHOIクラスにおいて、mAPが38.24%向上した。

ABSTRACT

A common problem in human-object interaction (HOI) detection task is that numerous HOI classes have only a small number of labeled examples, resulting in training sets with a long-tailed distribution. The lack of positive labels can lead to low classification accuracy for these classes. Towards addressing this issue, we observe that there exist natural correlations and anti-correlations among human-object interactions. In this paper, we model the correlations as action co-occurrence matrices and present techniques to learn these priors and leverage them for more effective training, especially in rare classes. The utility of our approach is demonstrated experimentally, where the performance of our approach exceeds the state-of-the-art methods on both of the two leading HOI detection benchmark datasets, HICO-Det and V-COCO.

研究の動機と目的

  • 多くのインタラクションクラスが非常に少ないラベル付きトレーニングサンプルしか持たない、HOI検出における長尾分布問題に対処すること。
  • 人間-オブジェクトインタラクション間の自然な相関および逆相関を活用し、稀なHOIクラスの検出を向上させること。
  • ターゲットデータセットからの共起統計を事前知識として使用する方法を構築し、外部の言語リソースに依存しないこと。
  • アーキテクチャ設計と損失正則化を通じて、低リソースなHOIクラスにおいてもモデルの汎化性とロバスト性を向上させること。

提案手法

  • トレーニングラベル統計からアクション共起行列を構築し、HOIクラス間の自然な相関および逆相関をモデル化する。
  • 分類をまずアクショングループレベルで行う階層的ニューラルネットワークを設計し、共起事前知識に基づいて互いに排他的なアンカーアクションでグループを定義する。
  • 共起するより頻度の高いHOIの予測を活用して、稀なHOIの追加の正例ラベルを生成する知識蒸留に基づくラベル拡張技術を実装する。
  • 共起行列を用いたプロジェクション関数を適用し、最適化なしに真のクラスの信頼性を向上させ、誤検出を抑制する。
  • 共起行列から導出された精錬された目的関数を用いてトレーニング損失を正則化し、テールクラスのインタラクションにおけるロバスト性を向上させる。
  • 共起事前知識をネットワークアーキテクチャ(グループ化)と損失関数(正則化)の両方で使用し、直交的な改善を実現する。

実験結果

リサーチクエスチョン

  • RQ1人間-オブジェクトインタラクション間の自然な共起パターンは、稀なHOIクラスの検出を向上させるために効果的に事前知識としてモデル化可能か?
  • RQ2アクション共起事前知識は、長尾分布のHOIデータセットにおけるディープラーニングアーキテクチャにどのように統合可能か?
  • RQ3共起事前知識を用いた知識蒸留は、ゼロショットおよび低ショット設定において、より良い汎化性能をもたらすか?
  • RQ4共起事前知識は、10件未満のトレーニングサンプルを有するクラスにおいて、どの程度性能を向上させるか?

主な発見

  • ゼロショットHICO-Detベンチマークにおいて、本手法は35.0 mAPを達成し、前回のSOTA(28.6 mAP)を22.4%相対的に上回った。
  • ゼロショット設定下でのACPモデルは、同じモデルの教師ありベースラインを上回り、強力な事前知識の転送が実現した。
  • 0〜9件のトレーニングサンプルを有するHOIクラスにおいて、本手法はベースライン比で38.24%の相対的mAP向上を達成し、稀なクラスにおいて顕著な向上を示した。
  • 共起行列に基づくプロジェクション関数は、最適化なしに真のHOIクラスの信頼性を向上させるとともに、誤検出のスコアを低下させた。
  • すべてのサンプルサイズグループで性能向上が一貫しており、特にリソースが最も限られたカテゴリで最大の向上が観察された。
  • 本手法はHICO-DetおよびV-COCOの両方のデータセットでSOTAモデルを上回り、ベンチマーク間で汎化性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。