Skip to main content
QUICK REVIEW

[論文レビュー] Detector Discovery in the Wild: Joint Multiple Instance and Representation Learning

Judy Hoffman, Deepak Pathak|arXiv (Cornell University)|Dec 2, 2014
Domain Adaptation and Few-Shot Learning参考文献 33被引用数 7
ひとこと要約

本論文は、補助カテゴリからの強力なアノテーションを活用することで、弱ラベル付き画像においてオブジェクト検出器の表現を同時に最適化し、オブジェクトを検出するための共同学習フレームワークを提案する。複数インスタンス学習とクロスドメイン表現転送を組み合わせることで、従来の弱教師あり手法に比べ200%のmAP向上を達成し、ImageNet-200検出ベンチマークにおいてドメイン適応ベースラインに比べ12%の向上を示した。

ABSTRACT

We develop methods for detector learning which exploit joint training over both weak and strong labels and which transfer learned perceptual representations from strongly-labeled auxiliary tasks. Previous methods for weak-label learning often learn detector models independently using latent variable optimization, but fail to share deep representation knowledge across classes and usually require strong initialization. Other previous methods transfer deep representations from domains with strong labels to those with only weak labels, but do not optimize over individual latent boxes, and thus may miss specific salient structures for a particular category. We propose a model that subsumes these previous approaches, and simultaneously trains a representation and detectors for categories with either weak or strong labels present. We provide a novel formulation of a joint multiple instance learning method that includes examples from classification-style data when available, and also performs domain transfer learning to improve the underlying detector representation. Our model outperforms known methods on ImageNet-200 detection with weak labels.

研究の動機と目的

  • ターゲットカテゴリに対して画像レベルタグなどの弱ラベルしか入手できない状況下で、正確なオブジェクト検出器を訓練する課題に対処すること。
  • 従来の手法が補助的な強ラベルデータを無視するか、表現と検出器の最適化を同時に実行できないという限界を克服すること。
  • 強ラベル付き補助カテゴリから学習した知覚的表現を、弱ラベル付きターゲットカテゴリに転送することで、検出器の性能を向上させること。
  • 最小限のバウンディングボックスアノテーションで、特にレアまたは代表されていないカテゴリにおいても、実環境での有効な検出を可能にすること。

提案手法

  • 弱ラベル付き画像と強ラベル付き補助データの両方を領域のバッグとして扱う、新規な共同複数インスタンス学習(MIL)フレームワークを定式化し、潜在的なオブジェクト候補の上での共同最適化を可能にする。
  • ImageNet-100などの強ラベル付き補助カテゴリで訓練された検出モデルから得られる深層特徴表現を、弱ラベル付きターゲットカテゴリ(例:ImageNet-200)の初期化と一般化性能の向上に転送する。
  • 二段階のトレーニングプロセスを採用する:第一段階ではMILを用いて弱ラベル付き画像内の陽性オブジェクトパッチを発見し、第二段階では発見されたパッチと強ラベルを用いて特徴表現と検出器重みを共同で微調整する。
  • すべての全結合層を再トレーニング中に微調整可能なCNNアーキテクチャを活用し、特徴と検出ヘッドの両方を精緻化することで、局所化と分類の正確性を向上させる。
  • 分類スタイルのデータ(弱ラベル)と検出スタイルのデータ(強ラベル)を統合した最適化目的関数を設計し、カテゴリ間で表現知識を共有する。
  • ドメイン適応の原則を適用して、ソース(補助)ドメインとターゲット(ターゲット)ドメインの特徴分布を一致させ、未学習カテゴリへの一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1検出器の最適化と表現の最適化を別々に行うのではなく、共同で最適化することで、弱教師ありオブジェクト検出の性能が向上するか?
  • RQ2補助カテゴリからの強ラベルが、弱ラベルしか入手できないターゲットカテゴリの検出性能にどの程度寄与するか?
  • RQ3陽性パッチの発見後に、特徴表現と検出器重みを共同で微調整することで、分類と局所化の両面で、別々の再トレーニングに比べて性能が向上するか?
  • RQ4提案手法は、弱ラベル付き検出ベンチマークにおけるSOTAのMILベースおよびドメイン適応ベースの手法と比較して、mAPの観点でどの程度優れているか?

主な発見

  • 提案手法は、弱ラベル付きのImageNet-200検出ベンチマークにおいて、従来のSOTAのMILベース手法(LCL)に比べ、平均平均精度(mAP)で200%の向上を達成した。
  • 同じベンチマークで、従来の最良のドメイン適応手法(LSDA)に比べ12%のmAP向上を示し、共同MILと表現学習の有効性を裏付けた。
  • 陽性パッチの発見後に特徴表現と検出ヘッドを共同で微調整することで、最高の性能が得られ、ILSVRC13のval2セットでmAPが22.74%に達した。
  • 定量的比較により、共起するか類似するカテゴリ(例:スポーツシーンでプレーヤーではなくボールを検出してしまう)との混同を著しく低減し、局所化誤りも削減された。
  • 従来の手法が、大きな顕著な前景オブジェクトに混乱して失敗する中で、複雑なシーンにおける小さなオブジェクト(例:ヘルメットやボール)の発見に効果的に機能した。
  • 訓練データに含まれない新しいカテゴリに対しても、良好な一般化性能を示し、最小限または一切のバウンディングボックスアノテーションで検出器の発見が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。