Skip to main content
QUICK REVIEW

[論文レビュー] Instance Search via Instance Level Segmentation and Feature Representation

Zhan Yu, Wan‐Lei Zhao|arXiv (Cornell University)|Jun 10, 2018
Advanced Image and Video Retrieval Techniques参考文献 39被引用数 6
ひとこと要約

本稿では、完全畳み込みインスタンス認識セマンティックセグメンテーション(FCIS)とROIプーリングを用いて、分類されたインスタンスから均一長さの深層特徴を抽出することで、インスタンス検索用のインスタンスレベル特徴表現を提案する。可変リーフォームブロックを組み込むことで、特徴の特徴的でスケーラブルな性能が向上し、背景の変化に強い性能を示し、新たに構築されたInstance-160ベンチマークで最先端の手法を上回った。

ABSTRACT

Instance search is an interesting task as well as a challenging issue due to the lack of effective feature representation. In this paper, an instance level feature representation built upon fully convolutional instance-aware segmentation is proposed. The feature is ROI-pooled from the segmented instance region. So that instances in various sizes and layouts are represented by deep features in uniform length. This representation is further enhanced by the use of deformable ResNeXt blocks. Superior performance is observed in terms of its distinctiveness and scalability on a challenging evaluation dataset built by ourselves. In addition, the proposed enhancement on the network structure also shows superior performance on the instance segmentation task.

研究の動機と目的

  • 従来のグローバルまたはローカル特徴が背景の汚染や変換に敏感であるという課題に対処するため、インスタンス検索における有効な特徴表現を確立すること。
  • 大規模な参照セットと多様な背景を伴う状況でも、特徴の特徴的でスケーラブルな表現を実現すること。
  • 画像レベルや粗い領域レベルの特徴ではなく、ピクセルレベルのインスタンスセグメンテーションを活用することで、インスタンスの局所化と特徴品質を向上させること。
  • インスタンス検索手法の公平で挑戦的な評価を可能にするために、新しいベンチマークデータセットInstance-160を構築すること。
  • 複雑でごみだらけの環境下で、画像レベルや領域レベルの表現よりもインスタンスレベル特徴学習が優れていることを実証すること。

提案手法

  • 完全畳み込みインスタンス認識セマンティックセグメンテーション(FCIS)を用いて、個々のインスタンスのピクセルレベルマスクを生成し、正確な局所化を可能にする。
  • FCISネットワークの特徴マップからROIプーリングを用いてインスタンスレベル特徴を抽出することで、インスタンスのサイズやレイアウトにかかわらず均一長さの表現を保証する。
  • FLOPsやパラメータ数を増加させずに、特徴学習能力を向上させるためにバックボーンネットワークをResNeXt-101に置き換える。
  • ResNeXt-101の最終段階に可変リーフォーム畳み込みブロックを統合し、不規則な物体形状に適応的に受容 field を調整する。
  • 特徴は1,536次元のベクトルとして表現され、コサイン距離を用いた効率的な類似度計算が可能になる。
  • インスタンス検索性能の評価を現実的条件下で行うために、視覚的オブジェクトトラッキングベンチマークの動画から新しいデータセットInstance-160を構築した。

実験結果

リサーチクエスチョン

  • RQ1ピクセル単位のセグメンテーションから得られるインスタンスレベル特徴表現は、画像レベルや領域レベルの特徴と比較して、インスタンス検索の検索性能を向上させることができるか?
  • RQ2画像レベル特徴に依存する手法が失敗しやすい、顕著な背景の変化下でも、本手法はどの程度の性能を示すか?
  • RQ3可変リーフォーム畳み込みブロックの統合が、インスタンス検索およびセグメンテーションタスクにおける特徴表現をどの程度向上させるか?
  • RQ4参照セットが100万枚の画像にまで拡大した場合、本手法のスケーラビリティはどの程度か?
  • RQ5トラッキング動画から構築された新しいベンチマークデータセットは、インスタンス検索の評価に現実的で挑戦的な設定を提供できるか?

主な発見

  • Instance-160ベンチマークにおいて、提案手法FCIS+XDはトップ100での平均平均精度(mAP)が0.7366を達成し、Deepvision(DV-Vgg)を大きく上回った。
  • 重度の背景変化下では、Deepvisionの性能は画像特徴に依存するため急激に低下するが、FCIS+XDは高い精度を維持し、優れたロバストネスを示した。
  • 背景変化が著しい40件のクエリにおいて、FCIS+XDのmAPはトップ50で0.6467に達し、背景のごみによる影響に強く、耐性があることが確認された。
  • 100万枚の誤検出画像を含むスケーラビリティテストでは、FCIS+XDがトップ50でのmAPで最も高く、Deepvisionや他のベースラインを一貫して上回った。
  • Deepvisionは不正確な特徴表現のため、局所化が不正確であるのに対し、本手法はより正確なインスタンスバウンディングボックスを生成した。
  • 可変リーフォーム畳み込みブロックの使用により、特徴表現が向上し、インスタンス検索およびインスタンスセグメンテーションの両タスクで性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。