Skip to main content
QUICK REVIEW

[論文レビュー] Zero-Annotation Object Detection with Web Knowledge Transfer

Qingyi Tao, Hao Yang|arXiv (Cornell University)|Nov 16, 2017
Domain Adaptation and Few-Shot Learning参考文献 28被引用数 4
ひとこと要約

本論文は、ターゲットデータセットに人為的バウンディングボックスを一切使用せずに、Web画像からターゲットデータに知識を転送するゼロアノテーションオブジェクト検出フレームワークを提案する。インスタンスレベルの敵対的ドメイン適応ネットワークにフォアグラウンドアテンションを導入し、疑似ラベル生成のための同時転送機構を組み合わせることで、VOC 2007およびVOC 2012で最先端の性能を達成し、ベースラインの弱教師付き検出法よりも平均でmAPが3.7%向上した。

ABSTRACT

Object detection is one of the major problems in computer vision, and has been extensively studied. Most of the existing detection works rely on labor-intensive supervision, such as ground truth bounding boxes of objects or at least image-level annotations. On the contrary, we propose an object detection method that does not require any form of human annotation on target tasks, by exploiting freely available web images. In order to facilitate effective knowledge transfer from web images, we introduce a multi-instance multi-label domain adaption learning framework with two key innovations. First of all, we propose an instance-level adversarial domain adaptation network with attention on foreground objects to transfer the object appearances from web domain to target domain. Second, to preserve the class-specific semantic structure of transferred object features, we propose a simultaneous transfer mechanism to transfer the supervision across domains through pseudo strong label generation. With our end-to-end framework that simultaneously learns a weakly supervised detector and transfers knowledge across domains, we achieved significant improvements over baseline methods on the benchmark datasets.

研究の動機と目的

  • ターゲットタスクにおいて人為的バウンディングボックスを一切必要としないオブジェクト検出手法の開発。
  • Web画像(単純でクリアな画像)とターゲット画像(ごちゃついており、隠蔽がある)の間のドメインシフトを、効果的な知識転送によって解消すること。
  • クロスドメイン特徴転送中にクラス固有の意味的構造を保持し、正確な検出を実現すること。
  • Web画像からの画像レベルラベルのみを用いて弱教師付き検出を可能にすること。
  • 疑似ラベル最適化を伴う共同学習により、検出とドメイン適応を同時に学習すること。

提案手法

  • 弱教師付き検出(WSD)、インスタンスレベルの敵対的ドメイン適応(DA)、および同時転送(ST)の3つのストリームを統合したマルチストリームエンドツーエンドフレームワークを提案。
  • ドメイン識別器と特徴生成器を用いて、オブジェクトプロポーザルレベルでドメイン差を最小化するインスタンスレベルの敵対的DAネットワークを導入。
  • 特徴統合時に背景領域よりもオブジェクトプロポーザルを優先するため、DAストリームにフォアグラウンドアテンションを統合。
  • Webで学習されたWSDモデルを用いて、ターゲットドメインのサンプルに対して疑似ストロングラベルを生成する同時転送ストリームを採用。
  • WSDとSTストリーム間で特徴と重みを共有することで、共同学習を可能にし、分布シフトを防止。
  • t-SNE可視化とアブレーションスタディを用いて、ドメイン適応およびアテンション機構の有効性を検証。

実験結果

リサーチクエスチョン

  • RQ1ターゲットデータセットに対して人為的バウンディングボックスを一切使用せずに、オブジェクト検出を効果的に行うことは可能か?
  • RQ2自由に入手可能なWeb画像からの知識を、ドメインシフトが生じる実世界のターゲットデータセットに効果的に転送する方法は何か?
  • RQ3フォアグラウンドアテンションを備えたインスタンスレベルドメイン適応は、オブジェクト検出におけるドメイン差を低減するために果たす役割は何か?
  • RQ4同時的疑似ラベル転送は、ゼロアノテーション検出において、クラス間の意味的構造をどのように保持するか?
  • RQ5検出とドメイン適応を共同で学習することは、分離した事前学習と微調整よりも効果的か?

主な発見

  • 提案手法は、VOC 2007のテストセットでmAP 24.6%を達成し、ベースラインのWSDオンリーメソッド(23.5%)と比較して顕著な向上を示した。
  • フォアグラウンドアテンションを備えたDAストリームを追加することで、ベースライン比でmAPが1.1ポイント向上し、ドメインシフト低減の有効性が裏付けられた。
  • アブレーションスタディの結果、DAにおけるフォアグラウンドアテンション機構を削除すると、DAなしの状態(23.5%)よりも性能が悪化(23.3%)することが判明し、プロポーザルを区別せずに処理すると学習に悪影響を及ぼすことが示された。
  • VOC 2012データセットでは、ベースライン比でmAPが3.8%(VGG_M)および3.7%(VGG16)向上し、データセット間での一般化性能が確認された。
  • WSDとSTストリームの同時学習は、分離した二段階アプローチ(mAP 22.5%)を上回る性能を示し、共有特徴学習の重要性を証明した。
  • t-SNE可視化により、DAおよびSTストリームが共にクロスドメイン特徴を整列させ、ターゲットドメインにおけるクラス分離性を向上させていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。