[論文レビュー] Bridging Knowledge Graphs to Generate Scene Graphs
本稿では、視覚的シーングラフと常識的知識グラフを統合することで、シーングラフ生成の性能を向上させるグラフベースのニューラルネットワーク、GB-Netを提案する。2つのグラフ間で繰り返しメッセージを伝達し、インスタンスレベルのエンティティと一般概念クラスを結ぶ動的「ブリッジ」を段階的に最適化することで、GB-Netは、6.1%のmR@50および7.3%のmR@100を達成し、両方の指標で先行手法を顕著に上回る、最先端の性能を実現した。
Scene graphs are powerful representations that parse images into their abstract semantic elements, i.e., objects and their interactions, which facilitates visual comprehension and explainable reasoning. On the other hand, commonsense knowledge graphs are rich repositories that encode how the world is structured, and how general concepts interact. In this paper, we present a unified formulation of these two constructs, where a scene graph is seen as an image-conditioned instantiation of a commonsense knowledge graph. Based on this new perspective, we re-formulate scene graph generation as the inference of a bridge between the scene and commonsense graphs, where each entity or predicate instance in the scene graph has to be linked to its corresponding entity or predicate class in the commonsense graph. To this end, we propose a novel graph-based neural network that iteratively propagates information between the two graphs, as well as within each of them, while gradually refining their bridge in each iteration. Our Graph Bridging Network, GB-Net, successively infers edges and nodes, allowing to simultaneously exploit and refine the rich, heterogeneous structure of the interconnected scene and commonsense graphs. Through extensive experimentation, we showcase the superior accuracy of GB-Net compared to the most recent methods, resulting in a new state of the art. We publicly release the source code of our method.
研究の動機と目的
- 世界知識の不足と希少な動詞の処理が不十分であることが原因で生じる、シーングラフ生成(SGG)における一般化性能の低さとリコールの低さを是正すること。
- シーングラフと常識的知識グラフを、2種類の知識グラフとして統合し、視覚的表現と記号的表現の間で構造的推論を可能にすること。
- 視覚的インスタンスと概念クラスの間のノード表現とブリッジエッジを同時に最適化する、動的で反復的なメッセージパッシング機構を開発すること。
- 外部の知識グラフが持つ豊富で多様な構造的特徴を活用することで、ゼロショットおよびフェイシュット一般化を向上させること。
- 原理的かつグラフ構造に基づいた方法で常識的知識を統合することで、SGGベンチマークで最先端の性能を達成すること。
提案手法
- GB-Netは、視覚的シーングラフと常識的知識グラフの間で、各インスタンスノードが対応する概念クラスに学習可能なブリッジエッジで接続される、ブリッジ推論問題としてシーングラフ生成を定式化する。
- モデルは、シーングラフ内、常識的知識グラフ内、およびブリッジ経由でグラフ間のメッセージ伝達を繰り返し実行し、各ステップでノード表現とブリッジ重みを段階的に最適化する。
- ノードおよびエッジ特徴量は、近隣ノードからの情報を集約するGNN層を経由して更新され、異なるグラフタイプからの寄与度を重みづけるためのアテンション機構が用いられる。
- 各イテレーションで、グラフ間のノード特徴量を比較することで、ブリッジエッジが動的に最適化され、視覚的インスタンスと一般概念の間の整合性が向上する。
- 2段階の推論を採用する:まず、シーングラフ内の潜在的なエンティティと動詞を初期化し、次に、常識的知識グラフ内の最も関連性の高い概念クラスにリンクすることで分類を実行する。
- 頻度の高い動詞に偏りが生じるのを抑えるために、クラスバランスを考慮した変種、GB-Net-βを導入し、全体のリコールを損なわず平均リコールを向上させた。
実験結果
リサーチクエスチョン
- RQ1統一されたグラフベースのフレームワークは、視覚的シーングラフと常識的知識グラフを効果的に統合し、シーングラフ生成の性能を向上させることができるか?
- RQ22つの相互接続されたグラフ間および内部で繰り返し実行されるメッセージパッシングは、ノード分類および動詞予測の性能をどのように向上させるか?
- RQ3構造的な常識的知識を統合することで、SGGにおけるゼロショットおよびフェイシュット一般化はどの程度向上するか?
- RQ4ブリッジの最適化とメッセージパッシングの深さが、モデルの性能と収束性に与える影響は何か?
- RQ5ノード表現とグラフ間ブリッジを同時に最適化するGNNは、知識を静的またはヒューリスティックに利用する手法を上回る性能を発揮できるか?
主な発見
- GB-Netは、Visual GenomeのSGGenベンチマークで、mR@50が6.1%、mR@100が7.3%を達成し、先行手法が報告した5.5%および6.6%を顕著に上回った。
- クラスバランスを考慮した変種、GB-Net-βは、平均で2.7パーセンテージポイントのリコール向上を達成しながらも、高い全体的なリコールを維持しており、頻度の高い動詞へのバイアス低減が有効に機能していることを示した。
- アブレーションスタディの結果、常識的知識グラフを削除すると性能は5.5% mR@50に低下し、外部知識が一般化性能向上に果たす重要性を裏付けた。
- メッセージパッシングのイテレーション数を3から1または2に減少させると、性能が顕著に低下したため、反復的最適化がモデル効果性の根幹をなしていることが示された。
- FREQ、SMN、KERNといった強力なベースラインと比較して、特にリコール性能で優れており、希少かつ未学習の動詞クラスの処理において優位性を示した。
- SGGenスプリットでは100件の予測トリプルに対して67.0%のリコールを達成し、希少クラスへの監視情報が限られている中でも、全トリプルの性能が優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。