Skip to main content
QUICK REVIEW

[論文レビュー] Care about you: towards large-scale human-centric visual relationship detection

Bohan Zhuang, Qi Wu|arXiv (Cornell University)|May 28, 2017
Multimodal Machine Learning Applications参考文献 29被引用数 17
ひとこと要約

本稿では、9,852の関係カテゴリと18,471のゼロショット関係を備えた大規模な人中心の視覚的関係検出データセットHCVRDを紹介する。長尾分布とゼロショット認識の課題に対処する。ウェブから取得した埋め込みとメトリック学習を用いたウェブリースーパービズド手法を提案し、ゼロショット一般化性能を向上させ、少数ショットおよびゼロショットベンチマークの最先端性能を達成した。

ABSTRACT

Visual relationship detection aims to capture interactions between pairs of objects in images. Relationships between objects and humans represent a particularly important subset of this problem, with implications for challenges such as understanding human behaviour, and identifying affordances, amongst others. In addressing this problem we first construct a large-scale human-centric visual relationship detection dataset (HCVRD), which provides many more types of relationship annotation (nearly 10K categories) than the previous released datasets. This large label space better reflects the reality of human-object interactions, but gives rise to a long-tail distribution problem, which in turn demands a zero-shot approach to labels appearing only in the test set. This is the first time this issue has been addressed. We propose a webly-supervised approach to these problems and demonstrate that the proposed model provides a strong baseline on our HCVRD dataset.

研究の動機と目的

  • 人-対象関係検出における長尾分布問題に対処するため、多様な関係カテゴリを備えた大規模で細分化されたデータセットを構築すること。
  • トレーニング時に未確認の関係に対してもゼロショット認識を可能にすること。これは、実世界の展開において希少な相互作用が一般的であるため重要である。
  • 弱いラベルが付与されたウェブデータを活用するスケーラブルなウェブリースーパービズド手法を開発し、希少および未確認の関係における一般化性能を向上させること。
  • 現実的で大規模なデータを用いた人中心の視覚的関係検出に関する今後の研究の強力なベースラインを提供すること。

提案手法

  • 人間の被験者(男性、女性、男の子、女の子)を4つのサブカテゴリに分け、Visual Genomeを拡張して9,852の細分化された述語を追加することで、HCVRDを構築。これにより、人-対象相互作用のより洗練されたモデリングが可能になる。
  • Google Imagesからのウェブデータを活用し、希少および未確認の関係のトレーニングデータを自動的に収集・拡張。検索結果からの弱い監視を活用。
  • 関係を共有の意味的空間に埋め込むための距離メトリック学習フレームワークを適用。これにより、ウェブから取得した埋め込みの最近傍探索によってゼロショット予測が可能になる。
  • ノイズ除去ステップを統合し、ウェブ由来の埋め込みの品質を向上。ノイズや関連のないウェブ結果の影響を低減。
  • 2段階の検出パイプラインを採用:まず人間および対象のバウンディングボックスを検出し、次に意味的類似度に基づいてウェブ埋め込みプロトタイプと照合して関係トリプレットを予測。
  • 特徴抽出用にVGG-16バックボーンを訓練。テストサンプルと関係カテゴリの平均埋め込みとのコサイン類似度を計算し、推論を実行。

実験結果

リサーチクエスチョン

  • RQ1長尾ラベル分布を持つ大規模で細分化された人中心の視覚的関係検出データセットは、視覚的関係認識の現実性と実用性を向上させることができるか?
  • RQ2ウェブリースーパービズド学習は、視覚的関係検出における希少および未確認の関係のデータ不足問題をどれほど効果的に緩和できるか?
  • RQ3ウェブから取得した埋め込みに対するメトリック学習は、人-対象相互作用認識における頑健なゼロショット一般化をどの程度可能にするか?
  • RQ4ウェブデータ拡張とノイズフィルタリングおよびメトリック学習の間で、ゼロショット性能向上に寄与する相対的な貢献度は何か?
  • RQ5統合されたフレームワークは、人中心の視覚的関係検出において少数ショットおよびゼロショットの両設定を効果的に処理できるか?

主な発見

  • 非ゼロショットテストセットにおける関係検出で、本手法は10.03% R@50および13.05% R@100を達成。これは、SeparateCNN(0.06%および0.11% R@50およびR@100)などのベースラインを著しく上回った。
  • ゼロショットテストセットでは、述語検出で8.15% R@50および13.42% R@100を達成。未確認の関係への一般化性能が顕著に優れていることを示した。
  • アブレーションスタディの結果、メトリック学習モジュールを削除すると性能が最も著しく低下(10.03%から5.87% R@50に低下)、意味的整列におけるその重要性が示された。
  • ノイズフィルタリングはメトリック学習ほど寄与は小さいが、依然として性能向上に寄与。ウェブデータ品質の精錬に寄与しているが、主因ではない。
  • ウェブデータとメトリック学習の両方を含む完全なモデルは、関係検出でトップ1正解率0.59、トップ3正解率0.72を達成。主要なコンponentsを欠落させたバージョンを上回った。
  • 本手法は未確認の関係へも頑健に一般化され、意味的空間内での最近傍探索に外部ウェブデータを活用したことが、性能向上の要因であると示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。