Skip to main content
QUICK REVIEW

[論文レビュー] On the Importance of Visual Context for Data Augmentation in Scene Understanding

Nikita Dvornik, Julien Mairal|arXiv (Cornell University)|Sep 6, 2018
Advanced Neural Network Applications参考文献 61被引用数 7
ひとこと要約

本論文は、物体検出やセマンティックセグメンテーションなどのシーン理解タスク向けに、文脈に配慮したデータ拡張手法を提案する。CNNベースの文脈モデルを用いて、シーン内の物体の適切な配置位置を予測することで、特にデータが少ない状況下でもモデルの一般化性能が顕著に向上し、PASCAL VOCおよびCOCOベンチマークで最先端の性能向上を達成する。これは、弱教師付きマスク生成にbounding boxのみを用いる場合でも成立する。

ABSTRACT

Performing data augmentation for learning deep neural networks is known to be important for training visual recognition systems. By artificially increasing the number of training examples, it helps reducing overfitting and improves generalization. While simple image transformations can already improve predictive performance in most vision tasks, larger gains can be obtained by leveraging task-specific prior knowledge. In this work, we consider object detection, semantic and instance segmentation and augment the training images by blending objects in existing scenes, using instance segmentation annotations. We observe that randomly pasting objects on images hurts the performance, unless the object is placed in the right context. To resolve this issue, we propose an explicit context model by using a convolutional neural network, which predicts whether an image region is suitable for placing a given object or not. In our experiments, we show that our approach is able to improve object detection, semantic and instance segmentation on the PASCAL VOC12 and COCO datasets, with significant gains in a limited annotation scenario, i.e. when only one category is annotated. We also show that the method is not limited to datasets that come with expensive pixel-wise instance annotations and can be used when only bounding boxes are available, by employing weakly-supervised learning for instance masks approximation.

研究の動機と目的

  • データ拡張におけるランダムな物体配置の限界を是正すること。これは、物体検出やセグメンテーションのような細分化されたシーン理解タスクの性能を損なう要因となる。
  • 視覚的文脈を活用して、より現実的なトレーニングサンプルを生成する手法を開発し、モデルの一般化性能を向上させること。
  • 低データ環境下において、明示的な文脈モデリングが有効であることを示すこと。
  • 高価なピクセル単位のアノテーションが不要であることを示し、bounding boxアノテーションからの弱教師付きマスク近似によっても、本手法が効果的に機能することを実証すること。

提案手法

  • 特定の画像領域に与えられた物体カテゴリを配置する確率を、その周囲の視覚的文脈に基づいて予測するための畳み込みニューラルネットワーク(文脈モデル)を訓練する。
  • 文脈モデルは、周囲のシーンが物体に対して意味的に適切かどうかを評価することで、物体配置候補を評価する。
  • 文脈モデルが適切と判断した場所でのみ物体が画像に貼り付けられ、空間的および意味的妥当性が保証される。
  • ピクセルレベルのアノテーションが利用できない場合には、bounding boxアノテーションから弱教師付き学習を用いてマスクを近似する。
  • 既存のトレーニングパイプラインに統合可能であり、現実的な物体配置を持つ合成トレーニング画像を生成する。
  • 本手法は、BlitzNet300を含む複数のアーキテクチャを用いて、PASCAL VOC12およびCOCOデータセットで評価される。

実験結果

リサーチクエスチョン

  • RQ1ランダムな配置と比較して、視覚的文脈を明示的にモデリングすることは、物体検出およびセグメンテーションのデータ拡張性能を向上させるか?
  • RQ2注釈付き例が少数しかない状況でも、本手法は顕著な性能向上を達成できるか?
  • RQ3高価なピクセル単位のインスタンスアノテーションが不要である場合、効果的な文脈に配慮したデータ拡張が可能か?
  • RQ4文脈モデルの学習に使用するデータ量が、物体検出およびセグメンテーションモデルの最終的性能に与える影響は何か?
  • RQ5bounding boxから弱教師付きマスク生成が可能であり、それが効果的な文脈に配慮したデータ拡張を可能にするか?

主な発見

  • PASCAL VOC12データセットでは、文脈モデルの学習にトレーニングデータの10%しか使用しなくても、検出のmAPが66.1%、セグメンテーションのmIoUが65.1%に達し、限られた監視情報でも高い性能を示す。
  • 文脈モデリングに使用するデータ量が約75%に達すると、性能の上昇が鈍り始めることが示され、ある閾値を超えると利得が減少する。
  • 特に1つのカテゴリしかアノテートされていない状況下でも顕著な性能向上が得られ、少サンプル学習のシナリオにおいて有効であることが実証された。
  • COCO上でも物体検出およびセグメンテーションの性能が向上し、PASCAL VOCベンチマークにとどまらない有効性が確認された。
  • データの5%しか使用しない場合、性能はほぼベースライン水準にまで低下し、文脈モデリングが効果を発揮するには十分なデータ量が必要であることが確認された。
  • 弱教師付き設定においても良好な一般化性能を示し、マスク近似にbounding boxアノテーションのみを用いても、性能向上が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。