Skip to main content
QUICK REVIEW

[論文レビュー] Multiple Instance Reinforcement Learning for Efficient Weakly-Supervised Detection in Images

Stefan Mathe, Cristian Sminchisescu|arXiv (Cornell University)|Nov 29, 2014
Advanced Vision and Imaging参考文献 20被引用数 12
ひとこと要約

本稿では、画像ラベルと眼球運動データのみを用いてバウンディングボックスのアノテーションを必要とせず、画像内での効率的なオブジェクト検出を実現する弱教師付き複数インスタンス強化学習フレームワークを提案する。複数インスタンス学習におけるトポロジカル制約と強化学習を用いた逐次的探索戦略を組み合わせることで、網羅的なスライディングウィンドウ法と同等の検出精度を達成しながら、計算コストを最大50%まで削減する。

ABSTRACT

State-of-the-art visual recognition and detection systems increasingly rely on large amounts of training data and complex classifiers. Therefore it becomes increasingly expensive both to manually annotate datasets and to keep running times at levels acceptable for practical applications. In this paper, we propose two solutions to address these issues. First, we introduce a weakly supervised, segmentation-based approach to learn accurate detectors and image classifiers from weak supervisory signals that provide only approximate constraints on target localization. We illustrate our system on the problem of action detection in static images (Pascal VOC Actions 2012), using human visual search patterns as our training signal. Second, inspired from the saccade-and-fixate operating principle of the human visual system, we use reinforcement learning techniques to train efficient search models for detection. Our sequential method is weakly supervised and general (it does not require eye movements), finds optimal search strategies for any given detection confidence function and achieves performance similar to exhaustive sliding window search at a fraction of its computational cost.

研究の動機と目的

  • 大規模オブジェクト検出における手動アノテーションの高コストを解消するため、画像ラベルや人間の眼球運動データといった弱教師信号を活用すること。
  • 正例バウンディングボックスやセグメンテーションを必要としない、セグメンテーションベースの複数インスタンス学習モデルを構築し、正確な検出器を推定すること。
  • 人間のサッカード(急な視線移動)と固定のメカニズムを模倣した強化学習に基づく逐次的探索戦略を設計し、計算コストを低減しながら検出精度を維持すること。
  • 眼球運動データが、弱教師付き設定において検出モデルおよび分類モデルの学習に強力でありながらも未だ十分に活用されていない教師信号として機能することを実証すること。

提案手法

  • 画像ラベルと眼球運動データのみを用いて、局所化精度を向上させるためにトポロジカル制約を組み込んだ制約付き複数インスタンス学習(CMI)モデルを定式化する。
  • CPMC(コンテキストに配慮したプロポーザルマイニング)を用いたセグメンテーションベースのアプローチにより候補領域を生成し、弱教師信号で訓練された信頼度関数によりスコア付けを行う。
  • 強化学習を用いて、人間の視覚走査を模倣する最適な逐次的探索ポリシーを学習する。エージェントは信頼度スコアと期待報酬に基づいて、評価すべき領域を選択する。
  • BFGSに基づくアルゴリズムを用いて探索ポリシーを最適化し、期待報酬を最大化する。過学習を防ぐために正則化を施す。
  • 正例バウンディングボックスを一切必要とせず、画像ラベルと眼球運動パターンのみを用いて、検出信頼度関数と探索ポリシーを同時に学習する。
  • 学習済みの探索ポリシーをCPMCベースのプロポーザル生成パイプラインと統合し、推論時における評価対象領域数を削減しながらも高い精度を維持する。

実験結果

リサーチクエスチョン

  • RQ1バウンディングボックスのアノテーションを一切必要とせず、眼球運動データを有効に活用することで、正確なオブジェクト検出器を学習できるか?
  • RQ2複数インスタンス学習におけるトポロジカル制約は、弱教師付き検出において局所化精度をどのように向上させるか?
  • RQ3強化学習に基づく逐次的探索戦略は、計算コストを削減しつつ、網羅的スライディングウィンドウ探索と同等の性能をどの程度達成できるか?
  • RQ4検出信頼度と探索ポリシーを統合的に最適化するフレームワークは、検出と探索を別々に学習する二段階的手法を上回る性能を示すか?
  • RQ5画像ラベルと眼球運動データのみを用いる弱教師付き検出の性能は、完全に教師ありのベースラインと比べてどの程度の水準に達するか?

主な発見

  • 提案手法CMI-EYE-DETは、正例バウンディングボックスが存在しない状況下でも、完全に教師ありのベースラインと同等の検出平均適合率を達成する。
  • 複数インスタンス学習フレームワークにトポロジカル制約を組み込むことで、すべての評価指標において局所化精度が顕著に向上する。
  • 眼球運動データにより、バウンディングボックスアノテーションで学習された完全教師ありモデルに近い画像分類性能が達成できる。
  • 強化学習に基づく探索戦略(CMI-EYE-SEQ)は、網羅的探索と比較して候補セグメントの約50%しか評価しなくても、検出および分類精度はほぼ同等を維持する。
  • 計算時間は顕著に短縮され、CPMCによるセグメンテーション抽出を含めても、平均して網羅的評価と比較して2倍以上の高速化が達成される。
  • すべての指標において、標準的な複数インスタンス学習および眼球運動データのみのベースラインを上回り、検出信頼度と探索戦略の共同最適化の有効性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。