Skip to main content
QUICK REVIEW

[論文レビュー] HASSOD: Hierarchical Adaptive Self-Supervised Object Detection

Shengcao Cao, Dhiraj Joshi|arXiv (Cornell University)|Feb 5, 2024
Video Surveillance and Tracking Methods被引用数 4
ひとこと要約

HASSODは、階層的適応的クラスタリングを用いて1枚の画像に可変数のオブジェクトを発見し、カバレッジに基づくツリー構造を通じて部分から全体へのオブジェクト構成を学習する自己教師付きオブジェクト検出フレームワークを提案する。複数ラウンドの自己トレーニングに代えてMean Teacherフレームワークを採用することで、より滑らかなトレーニングと最先端の性能を達成し、LVISではMask APを20.2から22.5へ、SA-1Bでは17.0から26.0へ向上させた。

ABSTRACT

The human visual perception system demonstrates exceptional capabilities in learning without explicit supervision and understanding the part-to-whole composition of objects. Drawing inspiration from these two abilities, we propose Hierarchical Adaptive Self-Supervised Object Detection (HASSOD), a novel approach that learns to detect objects and understand their compositions without human supervision. HASSOD employs a hierarchical adaptive clustering strategy to group regions into object masks based on self-supervised visual representations, adaptively determining the number of objects per image. Furthermore, HASSOD identifies the hierarchical levels of objects in terms of composition, by analyzing coverage relations between masks and constructing tree structures. This additional self-supervised learning task leads to improved detection performance and enhanced interpretability. Lastly, we abandon the inefficient multi-round self-training process utilized in prior methods and instead adapt the Mean Teacher framework from semi-supervised learning, which leads to a smoother and more efficient training process. Through extensive experiments on prevalent image datasets, we demonstrate the superiority of HASSOD over existing methods, thereby advancing the state of the art in self-supervised object detection. Notably, we improve Mask AR from 20.2 to 22.5 on LVIS, and from 17.0 to 26.0 on SA-1B. Project page: https://HASSOD-NeurIPS23.github.io.

研究の動機と目的

  • 1枚の画像に1つまたは数個のオブジェクトに限定された先行の自己教師付きオブジェクト検出手法の限界、特にオブジェクトカバレッジが狭いことへの対処。
  • 全体、部分、サブパーツのオブジェクトの階層的構成を学習可能にすることで、解釈可能性と検出性能の向上。
  • 複数ラウンドの自己トレーニングの非効率性を解消し、Mean Teacherフレームワークにインspiredされた滑らかで適応的なトレーニングプロセスを導入。
  • オブジェクトマスクとその構成的関係を同時に学習することで、自己教師付き検出における一般化性能とロバスト性の向上。

提案手法

  • HASSODは、自己教師付きの視覚表現を用いて画像領域をオブジェクトマスクにグループ化する階層的適応的クラスタリング戦略を採用し、動的にクラスタリング閾値を調整することで、1枚の画像あたりのオブジェクト数を決定する。
  • オブジェクトマスク間のカバレッジ関係を分析してツリー構造を構築し、全体オブジェクト、部分、サブパーツの階層的レベルに分類する。
  • 検出性能と解釈可能性を向上させるために、新しい自己教師付きタスクとして階層的レベル予測を導入する。
  • 複数ラウンドの自己トレーニングに代えて、生徒モデルが教師モデルの予測から学ぶMean Teacherフレームワークを採用し、最適化を滑らかにするために学習ターゲットに適応的重み付けを行う。
  • 初期の疑似ラベル生成には固定されたDINOバックボーンを用い、トレーニング中に特徴量と検出ヘッドをエンドツーエンドで適応させる。
  • 初期の疑似ラベルと教師の予測の両方を適応的損失重み付けでバランスさせ、ノイズの影響を時間経過とともに低減するカリキュラム学習を可能にする。
Figure 1 : Fully self-supervised object detection and instance segmentation on prevalent image datasets. Our approach, HASSOD, demonstrates a significant improvement over the previous state-of-the-art method, CutLER [ 38 ] , by discovering a more comprehensive range of objects. Moreover, HASSOD unde
Figure 1 : Fully self-supervised object detection and instance segmentation on prevalent image datasets. Our approach, HASSOD, demonstrates a significant improvement over the previous state-of-the-art method, CutLER [ 38 ] , by discovering a more comprehensive range of objects. Moreover, HASSOD unde

実験結果

リサーチクエスチョン

  • RQ11枚の画像に1つまたは数個の顕著なオブジェクトに限定せず、複数のオブジェクトを発見することで、自己教師付きオブジェクト検出の性能を向上させられるか?
  • RQ2全体、部分、サブパーツのオブジェクトの階層的構成を自己教師的に学習可能であり、検出性能と解釈可能性の向上に寄与するか?
  • RQ3複数ラウンドの自己トレーニングをMean Teacherベースのフレームワークに置き換えることで、自己教師付きオブジェクト検出におけるトレーニングの効率性と安定性が向上するか?
  • RQ4複数のマージ閾値(0.1, 0.2, 0.4)を用いたアンサンブルクラスタリングにより、初期の疑似ラベルの品質が向上するか?
  • RQ5階層的レベル予測と適応的カリキュラム学習は、オープンボリュームベンチマークにおける検出性能をどの程度向上させるか?

主な発見

  • LVISデータセットでは、HASSODがMask APを20.2から22.5へ向上させ、自己教師付きオブジェクト検出分野における顕著な最先端の進展を示した。
  • SA-1Bデータセットでは、Mask APを17.0から26.0へ向上させ、大規模でオープンボリュームのベンチマークへの強い一般化性能を示した。
  • 階層的適応的クラスタリング、階層的レベル予測、Mean Teacherトレーニングの組み合わせが最良の性能を達成し、各コンポーネントが0.3~0.5のMask AR向上に寄与した。
  • クラスタリングに複数のマージ閾値(0.1, 0.2, 0.4)を用いることで疑似ラベルの品質が向上し、APは1.7から6.1へ上昇したが、高いリCALLを維持した。
  • Mean Teacherフレームワークにより、進化する教師の予測を通じて疑似ラベルの精錬が効果的に行われ、初期のノイズの多いラベルへの依存が軽減され、最終的な検出性能が向上した。
  • HASSODは、より広範なオブジェクトを発見し、その構成的構造を理解できるため、CutLERなどの先行手法よりも優れた検出性能を達成した。
Figure 2 : Two-stage discover-and-learn process in HASSOD. Stage 1 uses a frozen, self-supervised DINO [ 5 ] ViT backbone to discover initial pseudo-labels from unlabeled images. Stage 2 learns an object detector to improve over the pre-trained features and initial pseudo-labels.
Figure 2 : Two-stage discover-and-learn process in HASSOD. Stage 1 uses a frozen, self-supervised DINO [ 5 ] ViT backbone to discover initial pseudo-labels from unlabeled images. Stage 2 learns an object detector to improve over the pre-trained features and initial pseudo-labels.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。