Skip to main content
QUICK REVIEW

[論文レビュー] How hard can it be? Estimating the difficulty of visual search in an image

Radu Tudor Ionescu, Bogdan Alexe|arXiv (Cornell University)|May 23, 2017
Multimodal Machine Learning Applications参考文献 40被引用数 6
ひとこと要約

本論文は、画像内の物体検出タスクにおける人的反応時間の推定に基づき、視覚的探索の難易度を予測する深層学習ベースの手法を提案する。PASCAL VOC 2012におけるクラウドソーシングによるアノテーションを用い、CNNからの深層特徴を用いて回帰モデルを学習し、画像ペアの難易度順序付けにおいて75%の正確性を達成。弱教師付きオブジェクトロケーションの性能が8%向上し、半教師付き分類の性能が1%向上した。

ABSTRACT

We address the problem of estimating image difficulty defined as the human response time for solving a visual search task. We collect human annotations of image difficulty for the PASCAL VOC 2012 data set through a crowd-sourcing platform. We then analyze what human interpretable image properties can have an impact on visual search difficulty, and how accurate are those properties for predicting difficulty. Next, we build a regression model based on deep features learned with state of the art convolutional neural networks and show better results for predicting the ground-truth visual search difficulty scores produced by human annotators. Our model is able to correctly rank about 75% image pairs according to their difficulty score. We also show that our difficulty predictor generalizes well to new classes not seen during training. Finally, we demonstrate that our predicted difficulty scores are useful for weakly supervised object localization (8% improvement) and semi-supervised object classification (1% improvement).

研究の動機と目的

  • 画像内の物体検出タスクにおける視覚的探索の難易度を人的反応時間として定量化すること。
  • 視覚的探索難易度と相関する人間が解釈可能な画像的性質を同定すること。
  • CNN特徴を用いて難易度を予測する深層学習モデルを開発し、未学習のオブジェクトクラスに一般化できること。
  • 予測された難易度スコアが弱教師付きおよび半教師付きオブジェクト認識の性能向上に寄与するかを評価すること。
  • 人的にアノテートされた難易度スコアと、難易度予測のための公開ツールを含むデータセットを公開すること。

提案手法

  • クラウドソーシングプラットフォームを用いて、PASCAL VOC 2012の10,000枚以上の画像に対して人的反応時間のアノテーションを収集した。
  • 反応時間を難易度スコアに変換し、低レベルおよび高レベルの画像的性質との相関を分析した。
  • 最先端の畳み込みニューラルネットワーク(CNN)からの深層特徴を用いて、難易度を予測する回帰モデルを訓練した。
  • 画像ペアの難易度順序付けの正しさを測るランク正確性を用いて、モデルの性能を評価した。
  • 予測された難易度スコアを用いて、アクティブラーニングのヒューリスティクスを適用し、弱教師付きオブジェクトロケーション(WSOL)と半教師付きオブジェクト分類の性能を向上させた。
  • カリキュラム学習に類似した戦略を用い、予測された難易度に基づいて画像を選択し、モデルの学習をガイドした。

実験結果

リサーチクエスチョン

  • RQ1低レベルの画像的性質と高レベルの画像的性質のうち、どの性質が人的視覚的探索難易度と最も強く相関しているか?
  • RQ2事前学習済みCNNからの深層特徴は、人的に推定された視覚的探索難易度を効果的に予測できるか?
  • RQ3本手法で開発された難易度予測モデルは、学習時に見られなかった新しいオブジェクトクラスに対しても、どれほど一般化できるか?
  • RQ4予測された難易度スコアは、弱教師付きオブジェクトロケーションの性能向上に寄与するか?
  • RQ5難易度に配慮したサンプリング戦略は、半教師付きオブジェクト分類の正確性向上に寄与するか?

主な発見

  • モデルは、画像ペアの視覚的探索難易度を正しく順序付けするという点で75%の正確性を達成した。
  • CNNからの深層特徴は、低レベルの画像的性質よりも難易度予測に優れており、高レベルの認知的プロセスと関連していることを示している。
  • 難易度予測モデルは、PASCAL VOC 2007で重複する画像が一切ない状況でも強く性能を発揮し、新しいオブジェクトクラスへの一般化が良好であることが示された。
  • 弱教師付きオブジェクトロケーションでは、予測された難易度スコアを統合することで、CorLoc性能が8%向上した。
  • 半教師付きオブジェクト分類では、予測された難易度を用いてサンプル選択をガイドすることで、mAPが1%向上した。
  • 最も効果的な半教師付き学習戦略は、最も確信のない例と予測された難易度を組み合わせたものであり、88.1%のmAPを達成し、ランダム選択や信頼度のみに基づく選択を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。