Skip to main content
QUICK REVIEW

[論文レビュー] Target Driven Instance Detection

Phil Ammirato, Cheng-Yang Fu|arXiv (Cornell University)|Mar 13, 2018
Advanced Neural Network Applications参考文献 48被引用数 17
ひとこと要約

本稿では、シーン内の特徴とターゲットオブジェクト画像を比較するための共同埋め込みを学習することで、インスタンスレベル認識のための最先端オブジェクト検出器を向上させる、新しい手法であるTarget Driven Instance Detection (TDID) を提案する。TDID は再訓練なしに未学習のインスタンスに対しても強力な性能を発揮し、AVD や GMU Kitchens といった困難なデータセットにおいて、一般化検出器や従来の認識手法を上回る性能を示す。

ABSTRACT

While state-of-the-art general object detectors are getting better and better, there are not many systems specifically designed to take advantage of the instance detection problem. For many applications, such as household robotics, a system may need to recognize a few very specific instances at a time. Speed can be critical in these applications, as can the need to recognize previously unseen instances. We introduce a Target Driven Instance Detector(TDID), which modifies existing general object detectors for the instance recognition setting. TDID not only improves performance on instances seen during training, with a fast runtime, but is also able to generalize to detect novel instances.

研究の動機と目的

  • 少数のトレーニング例しか利用できない実世界のロボットアプリケーションにおける特定オブジェクトインスタンスの検出という課題に対処すること。
  • ファインチューニングや再トレーニングなしに、新しい未学習のオブジェクトインスタンスへの一般化を可能にすること。
  • 家庭およびロボット環境における小規模、部分的遮蔽、またはごみだらけのインスタンスの検出性能を向上させること。
  • リアルタイムのロボット用途に適した高速推論を維持しながら、ディープラーニングを用いてインスタンス検出を改善すること。
  • 直接的にインスタンス固有性をモデル化することで、カテゴリレベル検出とインスタンスレベル認識のギャップを埋めること。

提案手法

  • TDID は、Faster R-CNN バックボーンにターゲット駆動型埋め込みモジュールを統合し、シーンとターゲットの特徴抽出器間で重みを共有する。
  • 本手法は、シーン画像からの特徴とターゲット画像からの特徴の間の共同埋め込みを計算し、各空間的位置で類似度を評価する。
  • 検出ヘッドは、埋め込み類似度スコアを用いてバウンディングボックスを予測し、検出をターゲット対非ターゲットの二値マッチングタスクとして扱う。
  • トレーニングデータは、実世界のデータセット(AVD、NYUD2、BigBird、RGB-D Objects)を用い、合成オブジェクト配置によるデータオーグメンテーションを介して合成される。
  • マルチソース事前学習戦略により、AVD、BigBird、RGB-D Objects、RGB-D Scenes、ImageNet VID のデータを統合し、一般化性能を向上させる。
  • モデルはエンドツーエンドで学習され、150,000 イテレーションにわたり学習率 0.0005 を使用し、データオーグメンテーションおよびターゲット画像とシーン画像ペアのランダムサンプリングを用いる。

実験結果

リサーチクエスチョン

  • RQ1ディープラーニングベースの検出器は、ファインチューニングや再トレーニングなしに、新しいオブジェクトインスタンスを検出できるか?
  • RQ2ターゲット駆動型埋め込みの性能は、従来のカテゴリレベル検出器やハンドクラフト特徴手法と比較して、インスタンス検出タスクにおいてどうなるか?
  • RQ3多様な家庭用オブジェクトでトレーニングされた検出器は、実世界のごみだらけの環境における未学習インスタンスにどの程度一般化できるか?
  • RQ4ターゲットとシーン特徴間の類似度ベースの比較を学習することで、小規模または遮蔽されたインスタンスの検出精度が向上するか?
  • RQ5最小限のアーキテクチャ変更で、一般検出からインスタンス固有検出への知識転送を効果的に実現できる統一アーキテクチャは存在するか?

主な発見

  • TDID は、1オブジェクトあたり2枚の例画像のみを用いた少サンプルインスタンス検出において、GMU Kitchens データセットで 48.2 mAP を達成し、再トレーニングなしに未学習インスタンスに一般化する。
  • Active Vision Dataset (AVD) において、TDID は標準の Faster R-CNN や従来のテンプレートマッチング手法を上回り、特に小規模で部分的に遮蔽されたインスタンスにおいて顕著な優位性を示す。
  • TDID はワンショット分類タスクにおいて、ハンドエンジニアド特徴やワンショット学習ベースラインを含む多数の先行手法を上回る優れた性能を発揮する。
  • モデルはさまざまなオブジェクトスケールにおいても強固な性能を維持するが、非常に小さなバウンディングボックスではやや精度が低下する傾向を示し、これは小オブジェクト検出の課題と整合的である。
  • TDID は同じドメイン(例:家庭用品/食料品)のオブジェクトに対しては効果的に一般化するが、まったく異なるドメインへの一般化は限定的である。
  • 本手法は高速な推論を達成し、オンライン適応を必要としないため、リアルタイムのロボットアプリケーションに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。