Skip to main content
QUICK REVIEW

[論文レビュー] Multi-level Contextual RNNs with Attention Model for Scene Labeling

Heng Fan, Xue Mei|arXiv (Cornell University)|Jul 8, 2016
Advanced Image and Video Retrieval Techniques参考文献 34被引用数 13
ひとこと要約

本稿では、シーンラベル付けのためのマルチレベルコンテキスト再帰ニューラルネットワーク(ML-CRNN)を提案する。アテンション機構を備え、局所的・グローバル的・画像トピックのコンテキストを階層的CNNに統合し、長距離の空間的および意味的依存関係をモデル化する。本手法は、CamVid、SiftFlow、Stanford-backgroundデータセットで最先端の性能を達成しており、アテンションベースの特徴統合が平均および最大プーリング戦略を上回っている。

ABSTRACT

Context in image is crucial for scene labeling while existing methods only exploit local context generated from a small surrounding area of an image patch or a pixel, by contrast long-range and global contextual information is ignored. To handle this issue, we in this work propose a novel approach for scene labeling by exploring multi-level contextual recurrent neural networks (ML-CRNNs). Specifically, we encode three kinds of contextual cues, i.e., local context, global context and image topic context in structural recurrent neural networks (RNNs) to model long-range local and global dependencies in image. In this way, our method is able to `see' the image in terms of both long-range local and holistic views, and make a more reliable inference for image labeling. Besides, we integrate the proposed contextual RNNs into hierarchical convolutional neural networks (CNNs), and exploit dependence relationships in multiple levels to provide rich spatial and semantic information. Moreover, we novelly adopt an attention model to effectively merge multiple levels and show that it outperforms average- or max-pooling fusion strategies. Extensive experiments demonstrate that the proposed approach achieves new state-of-the-art results on the CamVid, SiftFlow and Stanford-background datasets.

研究の動機と目的

  • 既存のシーンラベル付け手法が局所的コンテキストに依存するため、視覚的に類似したピクセルが誤分類されてしまうという限界を解消すること。
  • 長距離の局所的・グローバル的・画像トピックコンテキストを統合的なRNNフレームワークでモデル化し、意味的理解を向上させること。
  • 階層的CNNにコンテキストRNNを統合し、マルチレベルの空間的および意味的依存関係を活用すること。
  • 複数レベルの特徴を統合する際、平均および最大プーリング戦略を上回る性能を示すアテンションベースの統合メカニズムを開発すること。
  • CRFなどの後処理を用いずに最先端の性能を達成することで、提案アーキテクチャの頑健性を示すこと。

提案手法

  • 本手法は、局所的(8近傍ピクセル)、グローバル的(画像全体)、画像トピック(画像レベルの意味)の3種類のコンテキスト手がかりを、構造的RNNにエンコードして長距離依存関係をモデル化する。
  • 局所的コンテキストは、ラベル類似度に基づいて学習される重みを備えた重み付きRNNでモデル化され、一貫性のある近傍の影響が強化される。
  • RNNは、3番目、4番目、5番目のプーリング層からの特徴マップに適用され、階層的な空間的および意味的表現を捉える。
  • アテンション機構を用いて、異なるレベルからの寄与を動的に重み付けし、最適な特徴統合の重みを学習する。
  • アップサンプリング層を用いたエンドツーエンドの学習パイプラインを構築し、密度のあるピクセル単位の予測を生成することで、完全な監視を可能にする。

実験結果

リサーチクエスチョン

  • RQ1局所的・グローバル的・トピックコンテキストのマルチレベル情報(RNNでモデル化)を統合することで、局所的コンテキストのみに依存する手法と比較して、シーンラベル付けの精度が向上するか?
  • RQ2階層的CNN特徴とコンテキストRNNを統合することで、シーンラベル付けにおける空間的および意味的特徴表現がどのように向上するか?
  • RQ3アテンションベースの統合メカニズムは、従来のプーリング戦略(平均または最大)に比べて、複数レベルの特徴統合において優れているか?
  • RQ4グローバルおよびトピックコンテキストは、レアクラスや視覚的に曖昧なクラスの性能向上にどの程度寄与するか?
  • RQ5提案されたML-CRNNは、CRFなどの後処理技術を用いずに最先端の結果を達成できるか?

主な発見

  • CamVidデータセットでは、アテンション付きのML-CRNNがピクセル精度86.9%、クラス精度57.7%を達成し、以前の最先端手法を上回った。
  • SiftFlowデータセットでは、ピクセル精度86.9%、クラス精度57.7%を達成し、以前の最高値85.3%および55.7%を上回った。
  • Stanford-backgroundデータセットでは、ピクセル精度87.2%、クラス精度78.4%を達成し、以前の最先端の84.6%および77.3%を上回った。
  • アテンションベースの統合戦略は、平均および最大プーリング統合を著しく上回り、最適な特徴統合を学習する有効性が示された。
  • CRFの後処理を一切行わずに、最先端の結果を達成したため、マルチレベルコンテキストRNN設計の頑健性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。