Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-augmented Few-shot Visual Relation Detection

Tianyu Yu, Yangning Li|arXiv (Cornell University)|Mar 9, 2023
Multimodal Machine Learning Applications被引用数 5
ひとこと要約

本稿では、テキスト的知識に事前学習された言語モデル(PLM)を活用し、自動的に構築された視覚的関係知識グラフを視覚的関係事実に用いる、知識拡張型少数ショット視覚的関係検出フレームワークを提案する。これにより、希少な関係の一般化性能が顕著に向上する。本手法は、3つのVisual Genomeベンチマークで最先端の性能を達成し、動的で知識強化型の関係表現により、先行モデルを大きく上回る。

ABSTRACT

Visual Relation Detection (VRD) aims to detect relationships between objects for image understanding. Most existing VRD methods rely on thousands of training samples of each relationship to achieve satisfactory performance. Some recent papers tackle this problem by few-shot learning with elaborately designed pipelines and pre-trained word vectors. However, the performance of existing few-shot VRD models is severely hampered by the poor generalization capability, as they struggle to handle the vast semantic diversity of visual relationships. Nonetheless, humans have the ability to learn new relationships with just few examples based on their knowledge. Inspired by this, we devise a knowledge-augmented, few-shot VRD framework leveraging both textual knowledge and visual relation knowledge to improve the generalization ability of few-shot VRD. The textual knowledge and visual relation knowledge are acquired from a pre-trained language model and an automatically constructed visual relation knowledge graph, respectively. We extensively validate the effectiveness of our framework. Experiments conducted on three benchmarks from the commonly used Visual Genome dataset show that our performance surpasses existing state-of-the-art models with a large improvement.

研究の動機と目的

  • 関係の長尾分布および意味的多様性の影響により、少数ショット視覚的関係検出(VRD)モデルの一般化性能が低い問題に対処すること。
  • 事前学習された言語モデルからのテキスト的知識と、自己構築した知識グラフからの視覚的関係知識を統合することで、少数ショットVRDの性能を向上させること。
  • 大規模なアノテーションデータへの依存を減らし、外部知識を活用して少数の例から一般化できるようにすること。
  • テキスト的知識と視覚的関係知識を統合する手法の有効性と広範な適用可能性を実証すること。

提案手法

  • 事前学習された言語モデルとプロンプトテンプレートを用いて、主語-述語-目的語のトリプルの知識強化型表現を動的に生成し、意味的多様性を捉える。
  • ルールベースのパーサーを用いてオープンドメインの画像キャプションから抽出し、共通する視覚的関係を表現する視覚的関係知識グラフを構築する。
  • 類似する関係トリプルを埋め込み空間で近づけるメトリクス学習フレームワークを通じて、テキスト的知識と視覚的関係知識を統合する。
  • メッセージパッシング機構を用いて、視覚的関係知識グラフ内のノード間で知識を伝搬させ、関係表現を豊かにする。
  • 対照的損失を用いてファインチューニングを行い、サポート例とクエリサンプル間の類似性を最適化することで、少数ショット一般化性能を向上させる。
  • 既存のVRDモデル(例:MotifNet や IMP)に知識拡張フレームワークを適用し、移行可能性と性能向上を示す。

実験結果

リサーチクエスチョン

  • RQ1事前学習された言語モデルからのテキスト的知識と、知識グラフからの視覚的関係知識を統合することで、少数ショットVRDの一般化性能が向上するか?
  • RQ2外部知識の統合は、VRDにおけるリソースが限られた希少な関係の性能にどのように影響するか?
  • RQ3知識グラフの粒度(例:0ホップ vs. 1ホップ vs. 全体グラフ)の異なる水準が、モデル性能に与える影響は何か?
  • RQ4提案された知識拡張フレームワークは、既存の最先端VRDモデルの性能向上に効果的に応用可能か?

主な発見

  • 提案フレームワークは、Visual Genomeデータセットの3つのベンチマークで最先端の性能を達成し、既存のSOTAモデルを上回る。
  • 1ホップの視覚的関係知識を用いることで、モデル性能が顕著に向上(62.3 psR, 37.7 puR)し、全グラフの統合によるノイズの影響で性能が低下するまでピークに達する。
  • 知識グラフ内の50番目に頻出する関係のみを用いると、全関係を用いた場合より性能が低くなるため、多様性が一般化性能を向上させることを示している。
  • 視覚的関係知識グラフはベースラインモデルを改善する:MotifNetは+4.0 psRおよび+5.7 puR、IMPは+8.2 psRおよび+6.0 puRの向上を達成。
  • 定性的な結果から、訓練データに存在しない組み合わせ(例:'cat-eating-food' や 'giraffe-lying-on-tree')に対しても、モデルが正しく関係を予測していることが示された。
  • アブレーションスタディにより、テキスト的知識と視覚的関係知識の両方が不可欠であり、併用することで最高の性能が得られることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。