Skip to main content
QUICK REVIEW

[論文レビュー] Deep Structured Scene Parsing by Learning with Image Descriptions

Liang Lin, Guangrun Wang|arXiv (Cornell University)|Apr 8, 2016
Advanced Image and Video Retrieval Techniques参考文献 33被引用数 7
ひとこと要約

本論文は、手動アノテーションを一切用いずに階層的オブジェクト構造とオブジェクト間関係を学習する弱教師付きの深層CNN-RNNフレームワークを提案する。画像の説明文を活用することで、文における意味木とシーン構成を期待最大化(EM)トレーニング戦略で一致させ、PASCAL VOC 2012で最先端の性能を達成した。エンドツーエンドの共同学習により、64.2%の構造正解率と62.8%の関係正解率を達成した。

ABSTRACT

This paper addresses a fundamental problem of scene understanding: How to parse the scene image into a structured configuration (i.e., a semantic object hierarchy with object interaction relations) that finely accords with human perception. We propose a deep architecture consisting of two networks: i) a convolutional neural network (CNN) extracting the image representation for pixelwise object labeling and ii) a recursive neural network (RNN) discovering the hierarchical object structure and the inter-object relations. Rather than relying on elaborative user annotations (e.g., manually labeling semantic maps and relations), we train our deep model in a weakly-supervised manner by leveraging the descriptive sentences of the training images. Specifically, we decompose each sentence into a semantic tree consisting of nouns and verb phrases, and facilitate these trees discovering the configurations of the training images. Once these scene configurations are determined, then the parameters of both the CNN and RNN are updated accordingly by back propagation. The entire model training is accomplished through an Expectation-Maximization method. Extensive experiments suggest that our model is capable of producing meaningful and structured scene configurations and achieving more favorable scene labeling performance on PASCAL VOC 2012 over other state-of-the-art weakly-supervised methods.

研究の動機と目的

  • 手動アノテーションに費やす高コストな作業を伴わずに、人間が直感的に理解できる構造的シーン構成を画像から生成する課題に取り組む。
  • 画像レベルの記述文による弱教師付きのアプローチにより、階層的オブジェクト構造とオブジェクト間関係を学習する。
  • CNNによる特徴抽出とRNNによる構造的推論を弱教師付きで統合する共同トレーニングフレームワークを開発する。
  • セマンティックセグメンテーションと構成的シーン構造を同時にモデル化することで、シーンパースニングの性能を向上させる。

提案手法

  • 2本のブランチからなる深層アーキテクチャで、畳み込みニューラルネットワーク(CNN)がピクセル単位の特徴抽出を、再帰的ニューラルネットワーク(RNN)が階層的オブジェクト構造と関係をモデル化する。
  • 画像の説明文は標準的なパーサーとWordNetを用いて意味木に解析され、名詞がオブジェクトカテゴリを、動詞句が関係を表す。
  • 期待最大化(EM)型のトレーニング手順を採用し、意味木から潜在的なシーン構成を推定し、バックプロパゲーションによりCNN/RNNのパラメータを更新する。
  • 学習目的は、CNNによるオブジェクトラベルの正しさと、RNNによるシーン階層の構造的整合性を、文から導出された意味木に従って同時に最適化する。
  • CNNとRNNのエンドツーエンドの共同学習を実施し、固定、別個、共同のトレーニング戦略をアブレーションスタディで比較した。

実験結果

リサーチクエスチョン

  • RQ1画像の説明文による弱教師付き学習が、手動アノテーションなしに構造的シーン構成を効果的に学習できるか。
  • RQ2CNNとRNNのエンドツーエンド共同学習は、別個学習や固定学習と比較して、構造的シーンパースニングにどのように向上をもたらすか。
  • RQ3画像の説明文から導出された意味木が、現実のシーンにおける階層的・関係的構造をどの程度正確に反映できるか。
  • RQ4RNNを用いた構造的推論の統合は、標準的なセマンティックセグメンテーションを上回るパフォーマンスを実現するか。

主な発見

  • エンドツーエンドの共同学習を用いた本手法は、PASCAL VOC 2012の検証セットで64.2%の構造正解率と62.8%の関係正解率を達成し、すべてのアブレーション設定を上回った。
  • 固定されたRNNを用いたモデルは、固定されたCNNを用いたモデルよりも顕著に性能が低く、RNNが構造的推論においてより重要な役割を果たしていることを示した。
  • CNNとRNNを別個に学習する戦略は、一方を固定するよりも優れた結果を出したが、依然としてエンドツーエンドの共同学習には大きな差をつけていた。
  • 共同学習における統合的監視戦略は、ウォールフォールト戦略に比べてIoUで10.2%の向上を示し、共同最適化の有効性を裏付けた。
  • 本手法は、PASCAL VOC 2012で他の最先端の弱教師付き手法を上回る良好なセマンティックセグメンテーション性能を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。