Skip to main content
QUICK REVIEW

[論文レビュー] Exploring the Hierarchy in Relation Labels for Scene Graph Generation

Yi Zhou, Shuyang Sun|arXiv (Cornell University)|Sep 12, 2020
Multimodal Machine Learning Applications参考文献 32被引用数 6
ひとこと要約

本稿では、意味的関係を多段階ラベル階層を用いてモデル化することで、共同の粗い・細かい監視による特徴抽出を改善する階層ガイドドアプローチを提案する。階層ガイドド特徴学習(HGFL)と階層ガイドドモジュール(HGM)を導入することで、最小限の推論コストで複数のデータセットでRecall@50が最大33%向上する。

ABSTRACT

By assigning each relationship a single label, current approaches formulate the relationship detection as a classification problem. Under this formulation, predicate categories are treated as completely different classes. However, different from the object labels where different classes have explicit boundaries, predicates usually have overlaps in their semantic meanings. For example, sit\_on and stand\_on have common meanings in vertical relationships but different details of how these two objects are vertically placed. In order to leverage the inherent structures of the predicate categories, we propose to first build the language hierarchy and then utilize the Hierarchy Guided Feature Learning (HGFL) strategy to learn better region features of both the coarse-grained level and the fine-grained level. Besides, we also propose the Hierarchy Guided Module (HGM) to utilize the coarse-grained level to guide the learning of fine-grained level features. Experiments show that the proposed simple yet effective method can improve several state-of-the-art baselines by a large margin (up to $33\%$ relative gain) in terms of Recall@50 on the task of Scene Graph Generation in different datasets.

研究の動機と目的

  • 予測ラベルを独立したクラスとして扱うという限界を是正すること(それらに意味的重複があるにもかかわらず)。
  • 人間および機械の理解に基づく階層的組織を用いて、関係ラベルの内在的な意味的構造をモデル化すること。
  • 粗い・細かい予測ラベルの両方を共同で監視することで、領域特徴の学習を改善すること。
  • 粗い・細かい特徴間のクロスレベル相関を活用して特徴表現を向上させること。
  • 最小限の計算コストで、最先端モデルを効果的に改善できる汎用的な手法を開発すること。

提案手法

  • 意味的重複のある関係を親クラス(粗い粒度)にクラスタリングし、元のラベル(細かい粒度)を保持することで予測ラベル階層を構築する。
  • 粗い粒度と細かい粒度の両方のラベルを用いて特徴を同時に最適化する二重ブランチ学習戦略である階層ガイドド特徴学習(HGFL)を提案する。
  • 粗い・細かい特徴間の領域別およびチャネル別相関をモデル化することで特徴を精緻化するための階層ガイドドモジュール(HGM)を設計する。
  • 推論パイプラインを変更せずに、既存のシーングラフ生成フレームワークにHGFLおよびHGMを適用する。
  • 人間および機械による意味的理解を用いて予測階層の構築をガイドする。
  • 階層の両レベルでマルチタスク監視を用いてエンドツーエンドに学習させ、粗いレベルと細かいレベル間での知識移行を可能にする。

実験結果

リサーチクエスチョン

  • RQ1シーングラフ生成において、関係ラベル間の意味的重複を効果的にモデル化する方法は何か?
  • RQ2粗い粒度と細かい粒度の両方の予測ラベルからの学習は、特徴表現と性能を向上させ得るか?
  • RQ3粗い・細かい特徴間のクロスレベル相関を活用して領域特徴を精緻化する方法は何か?
  • RQ4提案手法は異なるデータセットおよびバックボーンアーキテクチャに一般化可能か?
  • RQ5標準分類と比較して、階層的監視を用いることで性能向上の相対的増加はどの程度か?

主な発見

  • 提案されたHGFL戦略は、VG-DR-Netデータセットで最大33%の相対的向上、VG-MSDNデータセットで18.9%の相対的向上をRecall@50で達成した。
  • 階層ガイドドモジュール(HGM)は、HGFL単体よりもさらに5%以上の相対的向上をRecall@50で達成した。
  • VG-MSDNおよびVG-DR-Netデータセットの両方で最先端のモデルを上回り、IH-Treeなどの先行手法を上回った。
  • 4つの異なるシーングラフ生成フレームワークにわたって一般化され、すべてのフレームワークで一貫した性能向上を達成した。
  • わずかな訓練コストと追加の推論コストなしに、実用的なリアルタイムデプロイメントに適した手法である。
  • VG-Hデータセットの3つのタスクにおいて、平均してRecall@50と@100が4.27%向上し、IH-Treeの2.01%の向上を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。