Skip to main content
QUICK REVIEW

[論文レビュー] TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning

Chiranjib Sur|arXiv (Cornell University)|Nov 22, 2019
Multimodal Machine Learning Applications参考文献 15被引用数 10
ひとこと要約

本稿では、画像キャプションの品質向上を目的として、位置的および関係的構造を組み込んだシーングラフトリプル(主語-述語-目的語)を表現する新規なニューラル記号的テンソル積表現、TPsgtRを提案する。テンソル積による文脈ベクトルと役割ベクトルの直交的合成を活用することで、より構造的で解釈可能かつ文脈的に正確なキャプションを生成でき、MS COCO上での自動指標および質的多様性の両面で先行モデルを上回る性能を示した。

ABSTRACT

Image captioning can be improved if the structure of the graphical representations can be formulated with conceptual positional binding. In this work, we have introduced a novel technique for caption generation using the neural-symbolic encoding of the scene-graphs, derived from regional visual information of the images and we call it Tensor Product Scene-Graph-Triplet Representation (TP$_{sgt}$R). While, most of the previous works concentrated on identification of the object features in images, we introduce a neuro-symbolic embedding that can embed identified relationships among different regions of the image into concrete forms, instead of relying on the model to compose for any/all combinations. These neural symbolic representation helps in better definition of the neural symbolic space for neuro-symbolic attention and can be transformed to better captions. With this approach, we introduced two novel architectures (TP$_{sgt}$R-TDBU and TP$_{sgt}$R-sTDBU) for comparison and experiment result demonstrates that our approaches outperformed the other models, and generated captions are more comprehensive and natural.

研究の動機と目的

  • オブジェクト関係と空間的位置の構造的で神経記号的な表現を組み込むことで、画像キャプションの性能を向上させること。
  • 共起統計に依存し、明示的な構造的推論を欠くエンドツーエンド学習モデルの限界を克服すること。
  • 意味的コンテンツと関係的構造(例:空間的役割を含む主語-述語-目的語)を微分可能で構成的(compositional)な方法で符号化する表現を開発すること。
  • 構造的で記号的認識を持つ表現が、より記述的で文法的に正しい、多様なキャプションを生成することを示すこと。
  • テンソル積表現が視覚的キャプションの文脈で関係的および位置的情報をモデリングする上で有効であることを検証すること。

提案手法

  • 本手法は、オブジェクト特徴(文脈)と空間的/関係的役割(役割ベクトル)をテンソル積演算によって統合する、テンソル積シーングラフトリプル表現(TPsgtR)を導入する。
  • TPsgtRは、直交的合成を用いて、位置的結合を伴う主語-述語-目的語トリプルを連続的ベクトル空間に埋め込み、構造的関係を保持する。
  • 2つのアーキテクチャを提案する:TPsgtR-TDBU(トップダウンボトムアップ)とTPsgtR-sTDBU(セマンティックトップダウンボトムアップ)、両者ともアテンション機構を備えたトランスフォーマー型デコーダーにTPsgtRを統合する。
  • モデルは事前学習済みのシーングラフ生成器(例:[14] からのもの)を用いてSPOトリプルを抽出するが、生の特徴に対するモデル学習済みアテンションに依存するのではなく、直接的にテンソル積で合成する。
  • テンソル積演算により、表現が順序に依存せず、未観測の関係に対しても構成的一般化(compositional generalization)を実現できる。
  • 最終的なキャプション生成は、ニューロ記号的アテンションを備えた再帰的デコーダーを用いて行い、TPsgtRベクトルが文脈に配慮した語の予測をガイドする。

実験結果

リサーチクエスチョン

  • RQ1神経記号的テンソル積表現は、画像のシーングラフにおける関係的および位置的構造を、キャプションの品質向上に寄与する形で効果的に符号化できるか?
  • RQ2テンソル積による明示的な構造的合成を組み込むことで、エンドツーエンド学習済みアテンション機構と比較して、より優れた一般化性能と性能が得られるか?
  • RQ3TPsgtR表現は、従来の視覚的特徴統合手法と比較して、キャプションの品質および多様性においてどのように異なるか?
  • RQ4主語・目的語などのセマンティックロール情報の組み込みが、キャプションの整合性および文法的正しさをどの程度向上させるか?
  • RQ5シーングラフ生成器が異なるデータ分布で学習された場合でも、TPsgtRは異なるデータセットに一般化できるか?

主な発見

  • TPsgtR-sTDBUアーキテクチャは、MS COCOテストセットでBLEU-4スコア34.9%を達成し、[4]の36に比べて平均8〜9個の領域提案しか使用しなくても、複数の最先端モデルを上回った。
  • TPsgtR-sTDBUモデルはCIDEr-Dスコア0.554を達成し、意味的コンテンツと多様性の面で人間がアノテートしたキャプションと強い一致を示した。
  • 図4の定性的分析では、ベースラインモデルと比較して、TPsgtR-sTDBUがより記述的で文法的に正しい、文脈的に豊かなキャプションを生成していることが示された。
  • モデルはTPsgtR-TDBUよりも優れた性能を示し、セマンティックに注意を向けるトップダウンアテンションがキャプション品質を向上させることを確認した。
  • シーングラフ生成器が非MSCOCOデータで学習された(検出精度28%)にもかかわらず、依然として競争力のある結果を達成しており、特徴のソース分布のずれに対しても頑健であることが示された。
  • 結果から、純粋にエンドツーエンドで学習された表現よりも、構造的で記号的認識を持つ表現(例:TPsgtR)が、長距離依存関係や関係的推論をより良く捉えられると示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。