Skip to main content
QUICK REVIEW

[論文レビュー] Graph Edit Distance Reward: Learning to Edit Scene Graph

Lichang Chen, Guosheng Lin|arXiv (Cornell University)|Aug 15, 2020
Multimodal Machine Learning Applications参考文献 32被引用数 4
ひとこと要約

本稿では、テキスト編集画像検索における自然言語指示に従ってシーングラフを編集するためのニューラル記号モデルを学習するため、グラフ編集距離(GED)報酬メカニズムを提案する。GEDに基づく密度の高い報酬を用いた方策勾配最適化により、本モデルはCSSおよび新たに提案されたCRIRデータセットの両方で既存手法を上回り、複雑でマルチホップの推論状況において優れた汎化性能と正確性を示した。

ABSTRACT

Scene Graph, as a vital tool to bridge the gap between language domain and image domain, has been widely adopted in the cross-modality task like VQA. In this paper, we propose a new method to edit the scene graph according to the user instructions, which has never been explored. To be specific, in order to learn editing scene graphs as the semantics given by texts, we propose a Graph Edit Distance Reward, which is based on the Policy Gradient and Graph Matching algorithm, to optimize neural symbolic model. In the context of text-editing image retrieval, we validate the effectiveness of our method in CSS and CRIR dataset. Besides, CRIR is a new synthetic dataset generated by us, which we will publish it soon for future use.

研究の動機と目的

  • クロスモodal画像検索におけるユーザーが提供するテキスト指示に従ってシーングラフを編集する学習のギャップを埋める。
  • ニューラル記号モデルにおける粗い0/1報酬の改善を図り、グラフ編集距離(GED)に基づくより正確な密度の高い報酬信号を導入する。
  • 正確な空間的位置制約に依存しない複雑なマルチホップ推論をサポートする新しい合成データセットCRIRを構築する。
  • ニューラルプログラム生成を用いて画像編集を記号的シーングラフ編集に変換することで、より汎用的で説明可能な画像検索を実現する。
  • GEDに基づく報酬が単純および複雑なクエリタイプの両方でモデル性能を向上させることを検証する。

提案手法

  • 予測されたシーングラフとターゲットシーングラフの差を測定するグラフ編集距離(GED)報酬関数を提案し、ノードの挿入/削除および属性・エッジの置換コストを組み込む。
  • GED報酬を方策勾配フレームワークに統合し、シーングラフ上で記号的編集操作(例:追加、削除、変更)を生成するニューラルプログラムジェネレータを微調整する。
  • 画像をノード(オブジェクト)とエッジ(関係)を有する記号的表現に変換するシーングラフ生成エンジンを設計し、構造的推論を可能にする。
  • プログラム出力を適用してシーングラフを更新する編集エンジンを実装し、完全なエッジ接続を持つ擬似ノードの追加や、すべての接続エッジを含むノードの削除を含む。
  • 入力テキストから潜在的プログラムを予測するseq2seqプログラムジェネレータを実装し、長さ正規化のためのパディングを用いて可変長の指示を処理する。
  • 60,000イテレーションにわたりバッチサイズ64の固定バッチで早期停止とバッチ学習を適用し、GED報酬を用いてプログラムジェネレータを最適化する。

実験結果

リサーチクエスチョン

  • RQ1グラフ編集距離(GED)に基づく密度の高い微分可能な報酬は、0/1報酬と比較してシーングラフ編集の学習を改善できるか?
  • RQ2正確な空間的位置に依存しない複雑でマルチホップの推論クエリを処理する本手法の有効性はいかがなものか?
  • RQ3GEDに基づく報酬は、未観測の複雑な画像検索タスクにおける汎化性能と性能向上に寄与するか?
  • RQ4本モデルは、CSSのような厳密な空間制約を持つデータセットにとどまらず、より現実的で関係的シーングラフのシナリオにも汎用的に適用可能か?
  • RQ5提案されたCRIRデータセットは、テキスト編集画像検索における高度な推論および編集能力の評価をどの程度可能にするか?

主な発見

  • GED報酬を用いた本手法は、CSSおよびCRIRデータセットの両方で最先端の性能を達成し、TIRGおよびConcatモデルをすべてのクエリタイプで上回った。
  • CRIRデータセットでは、TIRGおよびConcatモデルが著しく失敗する3ホップの複雑なクエリに対しても、本モデルは高い性能を維持した。
  • GED報酬により、より効率的で正確な学習が実現され、表2の最後の2列の優れた性能が、ターゲットグラフとの整合性の高さを示している。
  • 関係的編集(例:あるオブジェクトの左にオブジェクトを追加)を含む定性的なケースでは、本モデルは正しく画像を検索できたが、TIRGは視覚的類似性に基づく検索にとどまり失敗した。
  • CLEVRツールキットを用いて生成されたCRIRデータセットは、正確な位置制約を排除することで、現実世界の複雑さを効果的にシミュレートし、マルチホップ推論を可能にした。
  • 本モデルは特に関係的編集タスクにおいて強力な汎化性能を示し、特徴レベルの統合や単純な報酬に依存するベースラインを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。