Skip to main content
QUICK REVIEW

[論文レビュー] Expanding Low-Density Latent Regions for Open-Set Object Detection

Jiaming Han, Yuqiang Ren|arXiv (Cornell University)|Mar 28, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、潜在空間内の低密度領域を拡張することで未知オブジェクトの識別を向上させる、新しいオープンセットオブジェクト検出フレームワークOpenDetを提案する。インスタンスレベルの対照的学習と不確実性を考慮した未知確率推定を組み合わせることで、6つのベンチマークで絶対的オープンセット誤差(AOSE)を25%〜35%低減し、クローズドセットの精度を損なわずに実現した。

ABSTRACT

Modern object detectors have achieved impressive progress under the close-set setup. However, open-set object detection (OSOD) remains challenging since objects of unknown categories are often misclassified to existing known classes. In this work, we propose to identify unknown objects by separating high/low-density regions in the latent space, based on the consensus that unknown objects are usually distributed in low-density latent regions. As traditional threshold-based methods only maintain limited low-density regions, which cannot cover all unknown objects, we present a novel Open-set Detector (OpenDet) with expanded low-density regions. To this aim, we equip OpenDet with two learners, Contrastive Feature Learner (CFL) and Unknown Probability Learner (UPL). CFL performs instance-level contrastive learning to encourage compact features of known classes, leaving more low-density regions for unknown classes; UPL optimizes unknown probability based on the uncertainty of predictions, which further divides more low-density regions around the cluster of known classes. Thus, unknown objects in low-density regions can be easily identified with the learned unknown probability. Extensive experiments demonstrate that our method can significantly improve the OSOD performance, e.g., OpenDet reduces the Absolute Open-Set Errors by 25%-35% on six OSOD benchmarks. Code is available at: https://github.com/csuhan/opendet2.

研究の動機と目的

  • クローズドセットの仮定のもとで未知のカテゴリが既知のクラスとして誤分類される、オープンセットオブジェクト検出(OSOD)の課題に対処すること。
  • 従来のしきい値ベース手法が限定的な低密度領域しか維持しないため、すべての未知オブジェクトをカバーできないという限界を克服すること。
  • 追加の訓練データや複雑な後処理を必要とせず、潜在空間内の低密度領域を拡張することで未知オブジェクトを同定する手法を開発すること。
  • 高いクローズドセット検出精度を維持しながら、オープンセット一般化性能を著しく向上させること。
  • クローズドセットデータで訓練された検出器を最小限の修正でオープンセット環境に直接展開可能にすること。

提案手法

  • 既知クラスのクラス内コンパクト性とクラス間分離性を向上させるための2教師フレームワークを導入:対照的特徴学習者(CFL)は、未知オブジェクトの低密度潜在空間を拡張する。
  • 未知確率学習者(UPL)を用いてインスタンスレベルの不確実性を推定し、予測の信頼度に基づいて未知確率を割り当て、未知検出のための動的しきい値を可能にする。
  • インスタンスレベルの対照的学習を活用し、既知クラス内での特徴の分散を最小化することで、未知オブジェクトの低密度領域の体積が自然に増加する。
  • UPLを最適化することで、クローズドセット精度を保持しつつ、潜在空間の多くを低密度領域に分割するしきい値に類似した未知確率を学習する。
  • 推論時、未知確率がすべての既知クラスのそれより高い場合にオブジェクトを未知と分類することで、直接的なオープンセット検出を実現する。
  • 未知クラスデータや複雑な後処理を必要とせず、クローズドセットのアノテーションのみでエンドツーエンドにモデルを訓練する。
Figure 1: Trained on close-set images, (a) threshold-based methods , e.g. , Faster R-CNN, usually misclassify unknown objects (black triangles, e.g. zebra) into known classes (colored dots, e.g. horse) due to limited low-density regions (in gray color). (b) Our method identifies unknown objects by e
Figure 1: Trained on close-set images, (a) threshold-based methods , e.g. , Faster R-CNN, usually misclassify unknown objects (black triangles, e.g. zebra) into known classes (colored dots, e.g. horse) due to limited low-density regions (in gray color). (b) Our method identifies unknown objects by e

実験結果

リサーチクエスチョン

  • RQ1潜在空間内の低密度領域を拡張することで、オープンセットオブジェクト検出における未知オブジェクト検出が向上するか?
  • RQ2追加の未知クラスアノテーションや複雑な後処理に依存せずに、未知オブジェクトを効果的に同定できるか?
  • RQ3インスタンスレベルの対照的学習と不確実性に基づく確率推定は、既知クラスと未知クラスの分離をどの程度向上できるか?
  • RQ4提案手法は、オープンセット一般化性能を著しく向上させながらも、高いクローズドセット検出精度を維持できるか?
  • RQ5未知クラスデータや複雑な訓練手順を必要とする最先端のベースラインと比較して、提案手法の性能はどの程度か?

主な発見

  • OpenDetは、6つのオープンセットオブジェクト検出ベンチマークで、先行手法と比較して絶対的オープンセット誤差(AOSE)を25%〜35%低減した。
  • PASCAL VOCおよびCOCOベースのオープンセット設定において、ResNet-50を用いたOpenDetは14.95 WIと11,286 AOSEを達成し、FR-CNN(18.39 WI、15,118 AOSE)を上回った。
  • Swin-Tバックボーンを用いた場合、OpenDetは12.51 WIと9,875 AOSEを達成し、ベースライン検出器と比較して一貫した改善を示した。
  • 未知クラスアノテーションにアクセスしない状況でもOpenDetはOREやDSを上回り、オープンワールド検出で59.01 mAP Kと5,781 AOSEを達成し、Oracleと同等の性能を示した。
  • アブレーションスタディの結果、CFLとUPLの両方が性能向上に顕著な寄与をしており、特にUPLが広範な低密度領域の拡張を可能にしていることが確認された。
  • 定性的な結果では、OpenDetが従来誤分類されていた未知オブジェクトを正常に検出できており、失敗事例は主にオブジェクトが密集しているシーンや背景の誤分類に起因している。
Figure 2: t-SNE visualization of latent features. We take VOC classes as known classes (colored dots), and non-VOC classes in COCO as unknown classes (black triangles). Our method learns a clear separation between known and unknown classes.
Figure 2: t-SNE visualization of latent features. We take VOC classes as known classes (colored dots), and non-VOC classes in COCO as unknown classes (black triangles). Our method learns a clear separation between known and unknown classes.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。