Skip to main content
QUICK REVIEW

[論文レビュー] Learning Visual Commonsense for Robust Scene Graph Generation

Alireza Zareian, Zhecan Wang|arXiv (Cornell University)|Jun 17, 2020
Multimodal Machine Learning Applications参考文献 34被引用数 10
ひとこと要約

本論文は、外部知識を一切用いずに、シーングラフデータから視覚的共通知識(たとえば、物体の機能的特性や直感的物理法則)を自動で学習するための新規手法、Global-Local Attention Transformer (GLAT) を提案する。認識と共通知識を別々のモデルに分離し、それぞれの出力を信頼度に基づいて統合することで、シーングラフ生成における非論理的な予測を是正し、Visual Genome データセット上で特にレアな状況やゼロショット状況において顕著に精度を向上させる。

ABSTRACT

Scene graph generation models understand the scene through object and predicate recognition, but are prone to mistakes due to the challenges of perception in the wild. Perception errors often lead to nonsensical compositions in the output scene graph, which do not follow real-world rules and patterns, and can be corrected using commonsense knowledge. We propose the first method to acquire visual commonsense such as affordance and intuitive physics automatically from data, and use that to improve the robustness of scene understanding. To this end, we extend Transformer models to incorporate the structure of scene graphs, and train our Global-Local Attention Transformer on a scene graph corpus. Once trained, our model can be applied on any scene graph generation model and correct its obvious mistakes, resulting in more semantically plausible scene graphs. Through extensive experiments, we show our model learns commonsense better than any alternative, and improves the accuracy of state-of-the-art scene graph generation methods.

研究の動機と目的

  • 現存するシーングラフ生成(SGG)モデルが現実世界の視覚的課題に起因する認識誤りに起因して脆弱であるという限界に対処する。
  • SGG において不完全または偏りのある外部共通知識ベースや単純な共起統計に依存する問題を克服する。
  • アノテート済みシーングラフコーパスから直接構造的な視覚的共通知識を学ぶ自己教師あり手法を開発する。
  • モデルの信頼度に基づいて認識と共通知識の出力を知的に統合する統合機構を設計し、ロバスト性を向上させる。
  • 共通知識学習においてデータセットバイアスを回避することで、レアケースやゼロショット状況への一般化を保証する。

提案手法

  • マスクされたエンティティや述語を文脈から予測するように、シーングラフのマスク自己符号化に基づく自己教師あり事前学習フレームワークを提案する。
  • トランスフォーマー構造を拡張し、局所的アテンションヘッドを追加することで、シーングラフ内の構造的依存関係を明示的にモデル化し、グラフに配慮した表現学習を向上させる。
  • GLAT を、物体の機能的特性(たとえば、椅子は座るために使う)や直感的物理法則(たとえば、物体は浮かばない)といった視覚的共通知識パターンを学ぶために、大規模なアノテート済みシーングラフコーパス上で学習する。
  • SGG パipラインを二つのモデルに分離する:認識モデル(例:IMP, SNM, KERN)と共通知識モデル(GLAT)、それぞれを独立して学習する。
  • 信頼度に応じた統合モジュールを設計し、各トリプレットについて信頼度が高い出力をより重みづけして両モデルの予測を統合する。
  • 認識が不確実な場合(例:低照度条件下)に共通知識推論を活用することで、誤って分類された物体や非現実的な関係といった非論理的予測を、統合モジュールによって是正する。

実験結果

リサーチクエスチョン

  • RQ1外部知識を一切用いずに、シーングラフデータから視覚的共通知識(たとえば、物体の機能的特性や直感的物理法則)を直接学習可能か?
  • RQ2構造的な共通知識を用いて、シーングラフ生成における認識誤りを認識・是正できるモデルをどのように訓練できるか?
  • RQ3共通知識モデルがデータセットバイアスを引き継がないように、レアケースやゼロショットインスタンスにどの程度一般化できるか?
  • RQ4認識と共通知識を、不確実性を尊重しながらどのように統合すれば、全体のロバスト性が向上するか?
  • RQ5信頼度ベースの統合機構は、単純な平均化や固定ルール統合よりも、SGG誤りの是正において優れているか?

主な発見

  • マスク予測精度を指標として測定したところ、GLAT は従来のトランスフォーマーおよびグラフベースのモデルを上回り、視覚的共通知識の学習において優れている。
  • Visual Genome データセット上で、最良のベースライン(KERN)に比べ、mR@50 で最大 1.4 ポints、mR@100 で 0.9 ポイントの平均リCALL向上を達成した。
  • GLAT は、物体の機能的特性(例:椅子は座るために使う)や直感的物理法則(例:物体は浮かない)といった、標準的な SGG モデルに欠落している複雑な共通知識パターンを学習している。
  • 本手法はデータセットバイアスに対してロバストであることが示された:たとえば、誤って分類された鳥や鳥に被せられた帽子といったレアケースやゼロショット状況でも、誤りを正しく是正している。
  • 統合機構は信頼度スコアを効果的に活用しており、認識が不確実な場合(例:低照度)には共通知識を優先し、認識が信頼できる場合には認識の出力を優先する。
  • アブレーションスタディでは、GLAT と統合モジュールを追加することで、すべての SGG モデル(IMP, SNM, KERN)で一貫して性能向上が確認され、一般化可能性と有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。