Skip to main content
QUICK REVIEW

[論文レビュー] Affordance Transfer Learning for Human-Object Interaction Detection

Zhi Hou, Baosheng Yu|arXiv (Cornell University)|Apr 7, 2021
Robot Manipulation and Learning参考文献 42被引用数 7
ひとこと要約

本稿では、人間-物体インタラクション(HOI)表現をアフォーダンスとオブジェクトの成分に分離するアフォーダンス転送学習(ATL)を提案する。これにより、既知のアフォーダンス特徴と新しいオブジェクト特徴を組み合わせることで、新規オブジェクトに対するゼロショットHOI検出が可能になる。このアプローチは、特にレアで未確認のインタラクションにおいてHOI検出性能を向上させるとともに、弱教師付きのオブジェクトアフォーダンス認識を可能とし、HICO-DETおよびHOI-COCOデータセットにおいて最先端の手法を上回る性能を発揮する。

ABSTRACT

Reasoning the human-object interactions (HOI) is essential for deeper scene understanding, while object affordances (or functionalities) are of great importance for human to discover unseen HOIs with novel objects. Inspired by this, we introduce an affordance transfer learning approach to jointly detect HOIs with novel objects and recognize affordances. Specifically, HOI representations can be decoupled into a combination of affordance and object representations, making it possible to compose novel interactions by combining affordance representations and novel object representations from additional images, i.e. transferring the affordance to novel objects. With the proposed affordance transfer learning, the model is also capable of inferring the affordances of novel objects from known affordance representations. The proposed method can thus be used to 1) improve the performance of HOI detection, especially for the HOIs with unseen objects; and 2) infer the affordances of novel objects. Experimental results on two datasets, HICO-DET and HOI-COCO (from V-COCO), demonstrate significant improvements over recent state-of-the-art methods for HOI detection and object affordance detection. Code is available at https://github.com/zhihou7/HOI-CL

研究の動機と目的

  • 視覚的シーンにおける新規または未確認のオブジェクトを有する人間-物体インタラクションの検出という課題に対処すること。
  • 既存のアフォーダンス表現を新しいオブジェクトに転送することで、ゼロショット一般化を実現するHOI検出を可能とすること。
  • 統一的で構成可能なフレームワークを用いて、HOI検出とオブジェクトアフォーダンス認識を同時に向上させること。
  • レアまたは未確認のインタラクションの完全なアノテーションデータに依存するのを減らすために、アフォーダンス転送を活用すること。

提案手法

  • 共有バックボーンネットワークを用いて、HOI表現を分離されたアフォーダンス特徴とオブジェクト特徴に分解する。
  • HOIデータセットからのアフォーダンス特徴と、追加のオブジェクト検出データセットからのオブジェクト特徴を組み合わせることで、新しいHOIサンプルを構築する。
  • 事前に学習済みのアフォーダンス表現の特徴バンクを用いて、新規オブジェクトにおけるゼロショット推論を可能にする。
  • 2段階の検出パイプラインを採用し、オブジェクト検出器をHICO-DETで微調整し、特徴の組み合わせによりアフォーダンス特徴を転送する。
  • 同じHOI分類器を用いて組み合わせたHOIサンプルを分類することで、弱教師付きのアフォーダンス認識を実行する。
  • HOIとオブジェクト検出データセット間のドメインシフトを軽減するため、ドメイン適応技術を適用する。

実験結果

リサーチクエスチョン

  • RQ1既存のHOIデータから得たアフォーダンス表現を、新規オブジェクトに効果的に転送することで、ゼロショットHOI検出を実現できるか?
  • RQ2アフォーダンス特徴とオブジェクト特徴を組み合わせることで、まれで未確認のインタラクションにおける検出性能がどのように向上するか?
  • RQ3HOI検出モデルを、弱教師付きのオブジェクトアフォーダンス認識にどの程度活用できるか?
  • RQ4アフォーダンス転送学習は、オブジェクト検出ボックスの品質に対してどの程度感受性を示すか?
  • RQ5HOIとオブジェクト検出データセット間のドメインシフトが、アフォーダンス転送の性能を低下させるか?

主な発見

  • 微調整されたオブジェクト検出器を用いた場合、ATL手法はHICO-DETテストセットで30.79%のmAPを達成し、ベースライン(23.44%)およびCOCO検出器ベースライン(20.08%)を顕著に上回る。
  • 正解のオブジェクトボックスを用いた場合、ATLはHICO-DETで44.27%のmAPを達成し、理想状態での優れた性能を示している。
  • HOI-COCOデータセットでは、COCO画像のサブセットからのオブジェクト特徴を用いた場合、ATLは完全なHOIに対して24.74%のmAPを達成し、ドメイン間での転送可能性を示している。
  • ATLは、すべての信頼度閾値でオブジェクトアフォーダンス認識のF1スコアを向上させ、特に検出信頼度が低い場合に、オブジェクト検出結果に基づく手法を上回っている。
  • この手法はオブジェクト検出器の品質に対して非常に感受性が高く、COCO検出器を用いるとドメインシフトのため性能が著しく低下する。これは、ATLにおいて高品質なオブジェクト検出の重要性を強調している。
  • 定性的な結果から、ATLはベースラインが完全に失敗する未確認のHOI(例:「トラの上で乗る」)を正しく検出できており、ゼロショット一般化の能力を確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。