Skip to main content
QUICK REVIEW

[論文レビュー] Semantic Compositional Learning for Low-shot Scene Graph Generation

Tao He, Lianli Gao|arXiv (Cornell University)|Aug 19, 2021
Multimodal Machine Learning Applications参考文献 31被引用数 4
ひとこと要約

本論文は、関係トリプルを本質的および非本質的成分に分解し、意味的または視覚的に類似したオブジェクトを用いて新しい現実的なトリプルを構成することで、低ショットおよびゼロショットのシーングラフ生成を改善する意味的構成学習戦略を提案する。この手法は、3つのSGGベンチマークで著しく性能を向上させ、検索指標において現在の最先端モデルを平均で約50%向上させる。

ABSTRACT

Scene graphs provide valuable information to many downstream tasks. Many scene graph generation (SGG) models solely use the limited annotated relation triples for training, leading to their underperformance on low-shot (few and zero) scenarios, especially on the rare predicates. To address this problem, we propose a novel semantic compositional learning strategy that makes it possible to construct additional, realistic relation triples with objects from different images. Specifically, our strategy decomposes a relation triple by identifying and removing the unessential component and composes a new relation triple by fusing with a semantically or visually similar object from a visual components dictionary, whilst ensuring the realisticity of the newly composed triple. Notably, our strategy is generic and can be combined with existing SGG models to significantly improve their performance. We performed a comprehensive evaluation on the benchmark dataset Visual Genome. For three recent SGG models, adding our strategy improves their performance by close to 50\%, and all of them substantially exceed the current state-of-the-art.

研究の動機と目的

  • 低ショットおよびゼロショットの状況において、希少で未観測の動詞が含まれるシーングラフ生成におけるデータ不足問題に対処すること。
  • 既存のモデルがアノテート済みのトレーニングトリプルにのみ依存し、希少な関係で失敗することを克服すること。
  • 追加のアノテーションを必要とせず、希少で未観測の関係トリプルに対して効果的な学習を可能にすること。
  • 既存のSGGフレームワークと統合可能で、汎用的かつモデルに依存しない戦略を開発すること。
  • 意味的および視覚的類似性を用いて新しい現実的な関係トリプルを構成することで、ゼロショット関係検出を向上させること。

提案手法

  • 関係トリプル $<$s, p, o$>$ を、動詞に与える相対的影響に基づき、本質的成分(例:主語および動詞)と非本質的成分(例:目的語)に分解する。
  • 多様なオブジェクトカテゴリのインスタンスを含む視覚的コンポonents辞書を構築し、構成の候補とする。
  • 類似度測定を用いて、辞書内から意味的または視覚的に類似したオブジェクトを選択して非本質的成分を置き換える。
  • 類似度に基づく選択により現実性を保証しつつ、本質的成分と選択されたオブジェクトインスタンスを統合して新しい関係トリプルを構成する。
  • 主なSGGモデルの特徴学習メカニズムとは独立して動作するデータ拡張技術として、構成戦略を統合する。
  • 同じカテゴリ内(イントラクラス)および意味的に類似したカテゴリ間(インタラクラス)の両方の構成を適用し、希少および未観測の関係用の多様で現実的なトレーニングサンプルを生成する。

実験結果

リサーチクエスチョン

  • RQ1モデルに依存しない戦略が、現実的で追加のトレーニングトリプルを生成することで、低ショットおよびゼロショットのシーングラフ生成を改善できるか?
  • RQ2意味的および視覚的構成は、シーングラフ生成における希少な動詞のデータ不足をどの程度軽減できるか?
  • RQ3従来の手法と比較して、構成学習は、少データおよびゼロデータの関係検索タスクの性能をどの程度向上させられるか?
  • RQ4提案された類似度ベースの置換オブジェクト選択は、現実性を保ちつつ、未観測の関係状況での一般化を向上させるか?
  • RQ5この構成戦略は、既存のSGGモデルとシームレスに統合可能で、異なるアーキテクチャにおいて一貫した性能向上をもたらすか?

主な発見

  • 提案されたDeC(意味的構成学習)戦略は、現在の最先端モデルと比較して、3つのSGGベンチマーク(RR, FR, ZR)で平均で約50%の性能向上を達成した。
  • 希少な動詞タスク(PredCls)において、Motifsに適用した場合、mR@50/100が35.7/38.6に達し、以前の最良モデルTDE(13.2/17.1)を著しく上回った。
  • ゼロショット関係検索(ZR)において、最良のベースライン(TDE)をmR@50/100で13.2/17.1から13.6/16.5に向上させ、未観測関係への強い一般化能力を示した。
  • アブレーションスタディの結果、イントラクラスおよびインタラクラスの両方の構成が肯定的な寄与を示し、少データ設定ではイントラクラス、ゼロデータ設定ではインタラクラスがより効果的であることが判明した。
  • 類似度ベースの選択をランダム選択に置き換えると、すべてのタスクで性能が低下し、提案された類似度測定の必要性を裏付けた。
  • 本手法は、3つの最近のSGGモデルにおいて、関係検索(RR)、少データ関係検索(FR)、ゼロショット関係検索(ZR)の全3タスクで最先端の性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。