Skip to main content
QUICK REVIEW

[論文レビュー] Classification by Attention: Scene Graph Classification with Prior Knowledge

Sahand Sharifzadeh, Sina Moayed Baharlou|arXiv (Cornell University)|Nov 19, 2020
Advanced Graph Neural Networks被引用数 4
ひとこと要約

本論文は、注意メカニズムに基づく分類層を介して視覚的認識と一般的常識の知識を統合するマルチタスク学習フレームワークを提案する。これにより、対象間の関係に対する反復的推論が可能になる。分類を注意メカニズムとして扱うことで、モデルは視覚的表現に事前知識を統合するよう学習し、自己教師あり事前学習と組み合わせることで、アノテート済みデータの1%しか使用しない状況でも、シーングラフ分類の精度が26%向上し、述語予測の精度が36%向上した。

ABSTRACT

A major challenge in scene graph classification is that the appearance of objects and relations can be significantly different from one image to another. Previous works have addressed this by relational reasoning over all objects in an image or incorporating prior knowledge into classification. Unlike previous works, we do not consider separate models for perception and prior knowledge. Instead, we take a multi-task learning approach, where we implement the classification as an attention layer. This allows for the prior knowledge to emerge and propagate within the perception model. By enforcing the model also to represent the prior, we achieve a strong inductive bias. We show that our model can accurately generate commonsense knowledge and that the iterative injection of this knowledge to scene representations leads to significantly higher classification performance. Additionally, our model can be fine-tuned on external knowledge given as triples. When combined with self-supervised learning and with 1% of annotated images only, this gives more than 3% improvement in object classification, 26% in scene graph classification, and 36% in predicate prediction accuracy.

研究の動機と目的

  • 画像内の対象および関係の外見に見られる視覚的変動の課題に対処すること。これは、シーングラフ分類を困難にする要因である。
  • 従来のモデルが認識と事前知識を別個で独立したコンponentsとして扱うという限界を乗り越えること。
  • 視覚的特徴と関係性に関する一般的常識知識の間で相互に知識を共有するため、共通のエンドツーエンド学習を可能にすること。
  • 注意による事前知識の統合が、特にデータが少ない状況下でも一般化性能を向上させることを示すこと。
  • 外部の知識トリプルに微調整可能なモデルが、最小限の監視のもとでも高い性能を発揮できることを示すこと。

提案手法

  • 分類を全結合層ではなく注意層として再定式化することで、認識モデル内での事前知識の伝搬を可能にする。
  • マルチタスク学習を用いて、視覚的表現学習と事前知識統合を同時に最適化し、両タスク間でパラメータを共有する。
  • 知識グラフ(埋め込みを介して)からの事前知識を、反復的統合によって画像ベースの表現に統合する。
  • 自己教師あり事前学習(例:BYOL)でモデルを初期化し、視覚グラフの限られたアノテーションデータで微調整する。
  • スケーマを共通の埋め込みとして表現し、画像ベースの知識と関係性に関する知識を同時に符号化することで、学習済みトリプルを超えた一般化を可能にする。
  • 視覚的入力なしで、スケーマ表現に対するリンク予測を実行し、モデルの関係的一般的常識理解度を評価する。

実験結果

リサーチクエスチョン

  • RQ1注意ベースの分類は、別個のモデル化を必要とせずに、事前知識を視覚的表現に統合できるか?
  • RQ2反復的な事前知識の統合は、データが少ない状況下でシーングラフ分類の性能を向上させるか?
  • RQ3視覚的手がかりが弱い状況下でも、モデルは一般的常識の関係的知識(例:「果物はボウルの中にある」)を学習し、一般化できるか?
  • RQ4外部の知識トリプルに微調整した場合、特に最小限の監視のもとで、モデルの有効性はどの程度か?
  • RQ5モデルの内部表現が意味的・関係的構造をどの程度正確に反映しているか?

主な発見

  • アノテート済み画像の1%しか使用しない状況でも、ベースラインモデルと比較してシーングラフ分類の精度が26%向上した。
  • 同じ低データ環境下で、述語予測の精度が36%向上し、未学習の関係に対しても強い一般化性能を示した。
  • 事前学習済みのスケーマと外部の知識トリプルを使用した場合、視覚的入力がなくても述語予測の精度がほぼ完全に達成された。
  • t-SNE可視化により、事前知識を統合した後、対象の表現がより分離可能になっていることが確認され、意味的クラスタリングの向上が示された。
  • スケーマ表現に対するリンク予測が有意義な精度を達成したため、モデルが関係的一般的常識知識を内部に統合していることが示された。
  • すべての指標においてベースラインを上回り、特に低データ環境下での性能が顕著に優れており、複数のランダムシードにわたる統計的安定性も確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。