[論文レビュー] Detecting Human-Object Interaction via Fabricated Compositional Learning
本稿では、合成オブジェクト特徴を生成することで新しいバランスの取れたHOIサンプルを構成する、オープンな長尾分布におけるHOI検出のための新規フレームワークであるFCL(Fabricated Compositional Learning)を提案する。オブジェクトの生成器を訓練して現実的なオブジェクト表現を生成し、それらを実際の動詞特徴と組み合わせることで、珍しいおよび未観測のHOIカテゴリにおける性能を顕著に向上させ、HICO-DETでSOTA(最先端)の結果を達成した。特にゼロショットおよびローフォット設定で顕著な改善が見られた。
Human-Object Interaction (HOI) detection, inferring the relationships between human and objects from images/videos, is a fundamental task for high-level scene understanding. However, HOI detection usually suffers from the open long-tailed nature of interactions with objects, while human has extremely powerful compositional perception ability to cognize rare or unseen HOI samples. Inspired by this, we devise a novel HOI compositional learning framework, termed as Fabricated Compositional Learning (FCL), to address the problem of open long-tailed HOI detection. Specifically, we introduce an object fabricator to generate effective object representations, and then combine verbs and fabricated objects to compose new HOI samples. With the proposed object fabricator, we are able to generate large-scale HOI samples for rare and unseen categories to alleviate the open long-tailed issues in HOI detection. Extensive experiments on the most popular HOI detection dataset, HICO-DET, demonstrate the effectiveness of the proposed method for imbalanced HOI detection and significantly improve the state-of-the-art performance on rare and unseen HOI categories. Code is available at https://github.com/zhihou7/HOI-CL.
研究の動機と目的
- 訓練データに含まれない珍しいおよび未観測のインタラクションが不足する、HOI検出におけるオープンな長尾分布問題に対処すること。
- 人間の構成的認識に類似したアプローチを用い、既存の動詞およびオブジェクトコンポーネントから新しいHOIサンプルを生成すること。
- 合成されたバランスの取れた訓練データを用いることで、ローフォットおよびゼロショットHOI検出における一般化性能を向上させること。
- 再サンプリング、再重み付け、知識移譲に依存するが、有効なデータ拡張が行われない既存手法の限界を克服すること。
- 学習可能なオブジェクト生成器を用いて、多様で高品質なHOIサンプルを生成するスケーラブルでエンドツーエンドのフレームワークを開発すること。
提案手法
- ノイズと動詞表現から視覚的オブジェクト特徴を生成する学習可能なオブジェクト生成器を設計し、新しいHOIサンプルの制御された構成を可能にする。
- 実際の動詞特徴と合成されたオブジェクト特徴を組み合わせて、訓練用の合成HOIサンプルを形成する。
- 異なるHOI構成間での動詞表現を整えるために補助的な動詞正則化損失を導入し、一般化性能を向上させる。
- 2段階の訓練戦略を採用する——まず生成器と分類器を同時に最適化し、次に段階的最適化を用いて微調整することで、珍しいおよび未観測のカテゴリにおける性能を向上させる。
- 合成されたオブジェクト特徴を実際のオブジェクト特徴と一致させるためにコントラスト学習の目的関数を採用し、意味的整合性を確保する。
- 検出器(例:Faster R-CNN)と分類器からなる2段階のHOI検出パイプラインを用い、生成器が訓練データの分布を強化する。
実験結果
リサーチクエスチョン
- RQ1合成されたオブジェクト生成は、とくに珍しいおよび未観測のインタラクションにおいて、オープンな長尾分布におけるHOI検出の一般化を向上させることができるか?
- RQ2合成されたオブジェクト特徴を用いたHOIサンプルの構成は、従来の再サンプリングや再重み付け戦略よりも優れた性能をもたらすか?
- RQ3提案されたオブジェクト生成器は、HOI構成に適した意味的に意味のあるおよび判別力のあるオブジェクト表現をどれほど効果的に生成できるか?
- RQ4段階的最適化と1段階最適化の違いが、珍しい、非珍しい、未観測のHOIカテゴリタイプにおけるFCLの性能に与える影響は何か?
- RQ5オブジェクト検出の品質が、下流のHOI検出における合成特徴の有効性にどの程度影響を及えるか?
主な発見
- FCLはHICO-DETで全mAP 24.68を達成し、ベースラインの21.24に対して顕著な向上を示した。特に珍しいカテゴリの検出で顕著な改善が見られた。
- 珍しいカテゴリのmAPは、ベースラインの17.44%からFCLの20.03%に向上し、ローフォット学習における強力な性能向上を示した。
- ゼロショット評価では、FCLは未観測カテゴリで17.64%のmAPを達成し、ベースラインより2.05ポイント高い性能を示した。
- 段階的最適化は1段階最適化に比べ、珍しいおよび非珍しいカテゴリでより高い性能を示したが、未観測カテゴリではわずかに性能が劣った。
- HICO-DETデータ上でオブジェクト検出器を微調整することで、FCLの性能が向上し、全mAPは21.80から24.68に上昇した。これにより、検出品質の重要性が強調された。
- 訓練過程において、合成された特徴と実際の特徴間のコサイン類似度が低下し、安定化することが確認され、生成器の有効な整合性と一般化が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。