Skip to main content
QUICK REVIEW

[論文レビュー] Training object class detectors with click supervision

Dim P. Papadopoulos, Jasper Uijlings|arXiv (Cornell University)|Apr 20, 2017
Domain Adaptation and Few-Shot Learning参考文献 64被引用数 15
ひとこと要約

本論文は、オブジェクト検出器をトレーニングするためのバウンディングボックスアノテーションの代わりに、オブジェクトの中心をクリックする中心クリックアノテーションを提案する。この方法により、アノテーションにかかる時間を9倍から18倍短縮しつつ、完全に教師ありのモデルに近い検出器性能を達成する。中心クリックを複数インスタンス学習(MIL)フレームワークに統合することで実現される。

ABSTRACT

Training object class detectors typically requires a large set of images with objects annotated by bounding boxes. However, manually drawing bounding boxes is very time consuming. In this paper we greatly reduce annotation time by proposing center-click annotations: we ask annotators to click on the center of an imaginary bounding box which tightly encloses the object instance. We then incorporate these clicks into existing Multiple Instance Learning techniques for weakly supervised object localization, to jointly localize object bounding boxes over all training images. Extensive experiments on PASCAL VOC 2007 and MS COCO show that: (1) our scheme delivers high-quality detectors, performing substantially better than those produced by weakly supervised techniques, with a modest extra annotation effort; (2) these detectors in fact perform in a range close to those trained from manually drawn bounding boxes; (3) as the center-click task is very fast, our scheme reduces total annotation time by 9x to 18x.

研究の動機と目的

  • オブジェクト検出器をトレーニングする際の高いアノテーションコストを低減するため、時間のかかるバウンディングボックスラベリングに代わって、より速く簡単な中心クリックアノテーションを導入すること。
  • 弱教師ありと完全に教師ありのオブジェクト検出の性能ギャップを埋めるために、中心クリックによるより情報量の多い弱教師信号を導入すること。
  • 最小限のトレーニングで高い正確性を達成できる、アマゾン・メカニカル・ターキュなどクラウドソーシングプラットフォームを用いた効率的でスケーラブルなデータ収集を可能にすること。
  • クリックによるオブジェクト中心とサイズの推定を活用することで、弱教師ありオブジェクト検出における局所化精度を向上させること。
  • 同等のアノテーション予算下で、中心クリックによる弱教師あり学習が、既存の弱教師あり手法(例えば、提案領域の人の確認を含む)を上回ることを示すこと。

提案手法

  • クラウドワーカーに、各オブジェクトインスタンスを包む仮想のバウンディングボックスの中心をクリックするように指示し、中心クリックアノテーションを収集する。
  • 訓練フェーズで合成ポリゴンを用いて、実際のアノテーターの誤差やモデルの誤差分布を模擬し、真のボックスラベルが不要となるようにする。
  • 2つの独立したクリック中心間の距離からオブジェクトサイズを推定し、クリック誤差とオブジェクトサイズの相関関係を活用する。
  • 中心クリックを複数インスタンス学習(MIL)フレームワークに統合し、すべてのトレーニング画像においてオブジェクトバウンディングボックスを同時に局所化する。
  • MILの再局所化フェーズ中に、クリックから推定したオブジェクト中心とサイズを事前分布として活用し、より正確なバウンディングボックスの選択を支援する。
  • 合成データから学習した誤差モデルを活用し、MS COCOに実際のクリック収集なしでリアルなクリックノイズをシミュレートできるようにする。

実験結果

リサーチクエスチョン

  • RQ1中心クリックアノテーションは、オブジェクト検出における高い検出器性能を維持しつつ、著しくアノテーション時間を短縮できるか?
  • RQ2画像ラベルのみを用いる弱教師あり手法と比較して、中心クリックによる弱教師あり学習は、局所化および検出精度においてどのように異なるか?
  • RQ32つの独立したクリック中心間の距離は、オブジェクトサイズを信頼性高く推定できるか?また、真のボックスラベルが存在しない状況でも、その推定が局所化精度を向上させるか?
  • RQ4同じアノテーション予算下で、中心クリックによる弱教師あり学習は、最近の人の確認に基づく弱教師あり手法を上回るか?
  • RQ5合成ポリゴンに基づく誤差モデルは、実世界のクリックデータに一般化できる程度まで、トレーニングおよび評価に応用可能か?

主な発見

  • 中心クリックアノテーションは、手動のバウンディングボックスラベリングと比較して、合計で9倍から18倍のアノテーション時間を短縮し、オブジェクト1つあたりの中央値アノテーション時間は1.9秒である。
  • PASCAL VOC 2007では、67.2%のCorLocを達成し、弱教師ありMILの11.7%上回り、完全に教師ありの検出器に近い性能を示した。
  • MS COCOでは、シミュレートされた2クリックアプローチが58.6%のCorLocと19.3%のmAPを達成し、同じ250時間のアノテーション予算下で、人による提案確認手法[46]を+16%のCorLocと+4%のmAPで上回った。
  • ベースラインの弱教師あり手法と比較すると、ランダムクリックでは43.4%のCorLoc、'どこでもクリック'では55.5%のCorLocにとどまるが、中心クリックではVOC 2007で67.2%のCorLocを達成した。
  • 同じ人手の労力で中心クリックによる弱教師あり学習は、標準的な弱教師あり学習と比較して、CorLocで10%以上も性能を向上させた。
  • 中心クリックによる弱教師あり学習の性能は、ロバストで汎用的であり、COCOにおけるシミュレートされたクリックでは、1クリックで51.8%のCorLoc、2クリックで58.6%のCorLocを達成し、ベースラインMIL(24.2%のCorLoc)を著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。