Skip to main content
QUICK REVIEW

[論文レビュー] Relation Transformer Network

Rajat Koner, Shit, Suprosanna|arXiv (Cornell University)|Apr 13, 2020
Multimodal Machine Learning Applications参考文献 58被引用数 5
ひとこと要約

本稿では、エンコーダーで自己注意機構を用いて対象同士の相互作用をモデル化し、デコーダーでクロス注意機構を用いて対象から関係への相互作用をモデル化する、シーングラフ生成のための新しいトランスフォーマー基盤アーキテクチャ「関係トランスフォーマー・ネットワーク(RTN)」を提案する。本稿ではエッジ用の新しい位置エンコーディングを導入し、Visual GenomeとGQAの両ベンチマークで最先端性能を達成し、平均リCALLをそれぞれ4.85%、3.1%向上させた。

ABSTRACT

The extraction of a scene graph with objects as nodes and mutual relationships as edges is the basis for a deep understanding of image content. Despite recent advances, such as message passing and joint classification, the detection of visual relationships remains a challenging task due to sub-optimal exploration of the mutual interaction among the visual objects. In this work, we propose a novel transformer formulation for scene graph generation and relation prediction. We leverage the encoder-decoder architecture of the transformer for rich feature embedding of nodes and edges. Specifically, we model the node-to-node interaction with the self-attention of the transformer encoder and the edge-to-node interaction with the cross-attention of the transformer decoder. Further, we introduce a novel positional embedding suitable to handle edges in the decoder. Finally, our relation prediction module classifies the directed relation from the learned node and edge embedding. We name this architecture as Relation Transformer Network (RTN). On the Visual Genome and GQA dataset, we have achieved an overall mean of 4.85% and 3.1% point improvement in comparison with state-of-the-art methods. Our experiments show that Relation Transformer can efficiently model context across various datasets with small, medium, and large-scale relation classification.

研究の動機と目的

  • シーングラフ生成における視覚的対象同士の相互作用の最適でないモデル化という課題に対処すること。
  • 構造的トランスフォーマー・アーキテクチャを活用してグローバルおよびローカルな文脈を統合することで、視覚的関係予測を改善すること。
  • トランスフォーマー・デコーダーにおけるエッジ用の新しい位置エンコーディングを設計し、ローカルな文脈を保持すると同時にグローバルなシーン情報を蓄積すること。
  • 専用の関係予測モジュールを用いて文脈化されたノードおよびエッジ表現を統合することで、関係分類を向上させること。
  • 予測ヘッドにおける頻度バイアスを用いて、視覚的関係検出におけるクラス不均衡問題を軽減すること。

提案手法

  • ノード同士(N2N)の相互作用を自己注意によりモデル化するトランスフォーマー・エンコーダーを用い、対象間のグローバルな文脈を捉える。
  • エッジからノードへの(E2N)相互作用をクロス注意によりモデル化するトランスフォーマー・デコーダーを採用し、文脈に配慮した関係予測を可能にする。
  • 出発ノードの識別子と空間的近接性をエンコードする、エッジ用の新しい位置エンコーディングを導入し、グローバル集約の過程でローカルな文脈を保持する。
  • オブジェクト特徴(空間的および意味的埋め込み)と学習済みの位置エンコーディングを組み合わせ、トランスフォーマー・エンコーダーおよびデコーダーの入力として使用する。
  • グローバル平均プーリングと頻度バイアスを用いて、融合されたノードおよびエッジ表現から有向述語を分類する関係予測モジュール(RPM)を適用する。
  • シーングラフにおけるトリプレット分類を最適化する標準的なクロスエントロピー損失を用いて、エンドツーエンドで訓練する。

実験結果

リサーチクエスチョン

  • RQ1トランスフォーマー基盤のアーキテクチャは、視覚的関係予測のためのノード同士およびエッジからノードへの相互作用を効果的にモデル化できるか?
  • RQ2エッジ用の新しい位置エンコーディングは、シーングラフ生成モデルの性能にどのように影響を与えるか?
  • RQ3グローバルな文脈とローカルなノード情報の統合は、関係分類の正確性をどの程度向上させるか?
  • RQ4デコーダーにおける自己注意機構や予測ヘッドにおける頻度バイアスといったアーキテクチャ的要因は、長尾分布のデータセットにおける性能にどのように影響を与えるか?
  • RQ5提案された関係トランスフォーマー・ネットワーク(RTN)は、スケールや関係の複雑さが異なるデータセット間で一般化可能か?

主な発見

  • RTNは、最先端手法と比較してVisual Genomeデータセットで平均リCALLを4.85%絶対値で向上させた。
  • GQAデータセットでは、前回の最先端手法と比較して平均リCALLを3.1%向上させた。
  • アブレーションスタディの結果、提案されたエッジ用位置エンコーディングを削除すると性能が低下し、ローカルおよびグローバルな文脈の保持に有効であることが確認された。
  • 語彙埋め込みの削除により、リCALLが50で0.6%低下した。これは、語彙埋め込みからの意味的ヒントが関係予測において重要であることを示している。
  • 頻度バイアスを欠如させると、リCALLが50で顕著に1.6%低下した。これは、長尾分布のデータセットにおけるクラス不均衡の緩和に頻度バイアスが重要であることを示している。
  • 語彙埋め込み、空間的埋め込み、グローバル平均プーリング、頻度バイアスのすべてのコンポONENTが使用された場合、RTNはVisual Genomeで100でのリCALLが68.7%に達し、最も高い性能を発揮した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。