[論文レビュー] ReFormer: The Relational Transformer for Image Captioning
ReFormerは、関係性中心の損失を介してエンコーダーに直接関係情報を埋め込むことで、画像キャプション生成とシーングラフ生成を統合的に最適化するTransformerベースのアーキテクチャを導入する。キャプション生成の過程でオブジェクト関係を予測するようにエンコーダーを訓練することにより、COCO上での画像キャプション生成(CIDEr: 131.2)およびシーングラフ生成の両分野で最先端の性能を達成し、精度とモデルの説明可能性が向上する。
Image captioning is shown to be able to achieve a better performance by using scene graphs to represent the relations of objects in the image. The current captioning encoders generally use a Graph Convolutional Net (GCN) to represent the relation information and merge it with the object region features via concatenation or convolution to get the final input for sentence decoding. However, the GCN-based encoders in the existing methods are less effective for captioning due to two reasons. First, using the image captioning as the objective (i.e., Maximum Likelihood Estimation) rather than a relation-centric loss cannot fully explore the potential of the encoder. Second, using a pre-trained model instead of the encoder itself to extract the relationships is not flexible and cannot contribute to the explainability of the model. To improve the quality of image captioning, we propose a novel architecture ReFormer -- a RElational transFORMER to generate features with relation information embedded and to explicitly express the pair-wise relationships between objects in the image. ReFormer incorporates the objective of scene graph generation with that of image captioning using one modified Transformer model. This design allows ReFormer to generate not only better image captions with the bene-fit of extracting strong relational image features, but also scene graphs to explicitly describe the pair-wise relation-ships. Experiments on publicly available datasets show that our model significantly outperforms state-of-the-art methods on image captioning and scene graph generation
研究の動機と目的
- オブジェクト領域と関係予測の間の不整合により、従来の画像キャプションモデルがオブジェクト関係を効果的に学習・利用できないという限界を解消すること。
- 事前学習済みの関係抽出器に依存する現在のモデルが、エンドツーエンドで関係を学習しないことによる説明可能性の欠如を克服すること。
- エンコーダーの学習中にシーングラフ生成の目的関数を組み込むことで、関係特徴が明示的に学習され、埋め込まれることを保証し、キャプション品質の向上を図ること。
- モデルが正確なキャプションと解釈可能なシーングラフを生成できるようにし、モデルの透明性と言語的表現力の向上を実現すること。
- 画像キャプション生成とシーングラフ生成の共同最適化が、逐次的または独立した学習アプローチよりも優れた性能をもたらすことを示すこと。
提案手法
- 画像キャプション生成とシーングラフ生成を同時に学習できる、単一の変更済みTransformerエンコーダーを用いた新しいReFormerアーキテクチャを提案する。
- 順次学習戦略を導入:まず関係性中心の損失($\mathcal{L}_r$)を用いてエンコーダーをシーングラフ生成で事前学習し、その後最大尤度推定($\mathcal{L}_c$)を用いて画像キャプション生成で微調整する。
- Transformerの自己注意機構内でペアワイズのオブジェクト相互作用をモデル化することで、関係情報を視覚的特徴に直接埋め込む。
- 局所的なオブジェクト特徴とグローバルな関係的文脈の両方を捉える多頭部アテンション機構を採用し、オブジェクト関係に関する推論を可能にする。
- 自然言語キャプションの生成用と、シーングラフ内の主語-動詞-目的語トリプレットの予測用の2つのヘッドを持つデュアルヘッドデコーダーを設計する。
- 視覚的表現と予測された関係を一致させるための対照的学習損失を適用し、汎化性とロバスト性の向上を図る。

実験結果
リサーチクエスチョン
- RQ1画像キャプション生成とシーングラフ生成を共同で最適化することで、別個の学習に比べて生成キャプションの品質が向上するか?
- RQ2エンコーダー学習時に関係性中心の損失を組み込むことで、画像特徴内のより正確で解釈可能な関係的表現が得られるか?
- RQ3統合されたTransformerアーキテクチャが、キャプション生成とシーングラフ生成の両方の要件を性能の低下を伴わずに効果的にバランスできるか?
- RQ4モデルが明示的なシーングラフを生成できることで、キャプションの説明可能性と言語的豊かさがどの程度向上するか?
- RQ5ReFormerは、画像キャプション生成およびシーングラフ生成のベンチマークにおいて、最先端のモデルと比較してどのように差をつけるか?
主な発見
- ReFormerはCOCOデータセットでCIDErスコア131.2を達成し、画像キャプション生成分野で既存の最先端モデルを顕著に上回る性能を示した。
- Visual Genomeデータセットでは、3つのシーングラフ評価プロトコル(SGGen: 25.4 R@20、SGCls: 36.6 R@20、PredCls: 60.5 R@20)ですべてSOTA結果を達成した。
- アブレーションスタディの結果、関係性中心の損失($\mathcal{L}_r$)を削除するとCIDErスコアが131.2から128.9に低下し、その重要性が裏付けられた。
- モデルは「男がラケットをもっている」といった明確な関係的コンテンツを含む、より正確で詳細なキャプションを生成しており、生成されたシーングラフによって裏付けられている。
- 定性的な結果から、ReFormerのシーングラフが追加の説明可能性を提供し、キャプションからは特定できないオブジェクトの属性や相互作用を明らかにしている。
- 順次学習戦略は、シーングラフ生成からキャプション生成への関係的知識の転送を効果的に行い、エンコーダーがより意味論的に根拠のある表現を学習できるようにした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。