[논문 리뷰] HASSOD: Hierarchical Adaptive Self-Supervised Object Detection
HASSOD는 계층적 적응형 클러스터링을 사용하여 이미지당 변동 가능한 수의 객체를 탐지하고, 커버리지 기반 트리 구조를 통해 부분-전체 객체 조합을 학습하는 자기지도 객체 탐지 프레임워크를 제안한다. 다중 라운드 자기지도 학습을 Mean Teacher 프레임워크로 대체함으로써 더 스무스한 학습과 최신 기술 수준의 성능을 달성하였으며, LVIS에서 Mask AP를 20.2에서 22.5로, SA-1B에서 17.0에서 26.0으로 향상시켰다.
The human visual perception system demonstrates exceptional capabilities in learning without explicit supervision and understanding the part-to-whole composition of objects. Drawing inspiration from these two abilities, we propose Hierarchical Adaptive Self-Supervised Object Detection (HASSOD), a novel approach that learns to detect objects and understand their compositions without human supervision. HASSOD employs a hierarchical adaptive clustering strategy to group regions into object masks based on self-supervised visual representations, adaptively determining the number of objects per image. Furthermore, HASSOD identifies the hierarchical levels of objects in terms of composition, by analyzing coverage relations between masks and constructing tree structures. This additional self-supervised learning task leads to improved detection performance and enhanced interpretability. Lastly, we abandon the inefficient multi-round self-training process utilized in prior methods and instead adapt the Mean Teacher framework from semi-supervised learning, which leads to a smoother and more efficient training process. Through extensive experiments on prevalent image datasets, we demonstrate the superiority of HASSOD over existing methods, thereby advancing the state of the art in self-supervised object detection. Notably, we improve Mask AR from 20.2 to 22.5 on LVIS, and from 17.0 to 26.0 on SA-1B. Project page: https://HASSOD-NeurIPS23.github.io.
연구 동기 및 목표
- 이전 자기지도 객체 탐지 방법이 이미지당 하나 또는 몇 개의 객체에만 집중하여 객체 커버리지가 좁다는 한계를 해결하기 위해.
- 전체, 부분, 하위 부분 객체로 구성된 계층적 객체 조합을 탐지함으로써 이해 가능성과 탐지 성능을 향상시키기 위해.
- 다중 라운드 자기지도 학습의 비효율성을 제거하기 위해 Mean Teacher 프레임워크를 기반으로 한 스무스하고 적응형 학습 과정을 도입하기 위해.
- 객체 마스크와 그 구성 관계를 동시에 학습시킴으로써 자기지도 탐지의 일반화 능력과 강건성을 향상시키기 위해.
제안 방법
- HASSOD는 자기지도 시각적 표현을 사용하여 이미지 영역을 객체 마스크로 군집화하는 계층적 적응형 클러스터링 전략을 적용하며, 이미지당 객체 수를 결정하기 위해 클러스터링 임계치를 동적으로 조정한다.
- 객체 마스크 간의 커버리지 관계를 분석하여 트리 구조를 구성함으로써 전체 객체, 부분, 하위 부분 객체로 계층 수준을 분류한다.
- 탐지 성능과 이해 가능성 향상을 위해 새로운 자기지도 작업인 계층 수준 예측을 도입한다.
- 다중 라운드 자기지도 학습을 Mean Teacher 프레임워크로 대체하여, 학생 모델이 교사 모델의 예측을 기반으로 학습하고, 학습 목표에 대해 적응형 가중치를 적용함으로써 최적화를 더욱 스무스하게 한다.
- 초기 가짜 라벨 생성을 위해 고정된 DINO 백본을 사용하고, 학습 중에는 특징과 탐지 헤드를 종합적으로 적응시킨다.
- 초기 가짜 라벨과 교사 예측 간의 적응형 손실 가중치를 통해, 시간이 지남에 따라 노이즈 영향을 줄이는 커리큘럼 학습이 가능하도록 한다.
![Figure 1 : Fully self-supervised object detection and instance segmentation on prevalent image datasets. Our approach, HASSOD, demonstrates a significant improvement over the previous state-of-the-art method, CutLER [ 38 ] , by discovering a more comprehensive range of objects. Moreover, HASSOD unde](https://ar5iv.labs.arxiv.org/html/2402.03311/assets/x1.png)
실험 결과
연구 질문
- RQ1이미지당 하나 또는 몇 개의 두드러진 객체에만 집중하는 것 대신, 여러 개의 객체를 탐지함으로써 자기지도 객체 탐지 성능을 향상시킬 수 있는가?
- RQ2전체, 부분, 하위 부분 객체로 구성된 계층적 객체 조합을 자기지도 방식으로 학습시켜 탐지 성능과 이해 가능성 향상을 이룰 수 있는가?
- RQ3다중 라운드 자기지도 학습을 Mean Teacher 기반 프레임워크로 대체할 경우, 자기지도 객체 탐지에서 더 효율적이고 안정적인 학습이 이루어지는가?
- RQ4다중 융합 임계치(0.1, 0.2, 0.4)를 사용한 앙상블 클러스터링을 통해 초깃값 가짜 라벨의 품질을 향상시킬 수 있는가?
- RQ5계층 수준 예측과 적응형 커리큘럼 학습이 개방형 어휘 벤치마크에서 탐지 성능 향상에 얼마나 기여하는가?
주요 결과
- HASSOD는 LVIS 데이터셋에서 Mask AP를 20.2에서 22.5로 향상시켜 자기지도 객체 탐지 분야에서 중요한 최신 기술 수준의 성과를 달성했다.
- SA-1B 데이터셋에서는 Mask AP를 17.0에서 26.0으로 상승시켜 대규모 개방형 어휘 벤치마크에 대한 강력한 일반화 능력을 입증했다.
- 계층적 적응형 클러스터링, 계층 수준 예측, Mean Teacher 학습의 조합이 최고의 성능을 이끌었으며, 각 구성 요소가 0.3~0.5의 Mask AR 향상에 기여했다.
- 클러스터링 시 다중 융합 임계치(0.1, 0.2, 0.4)를 사용하면 가짜 라벨 품질이 향상되어 AP는 1.7에서 6.1로 상승했고, 높은 재현율을 유지했다.
- Mean Teacher 프레임워크는 진화하는 교사 예측을 통해 가짜 라벨를 효과적으로 개선함으로써 초기 높은 노이즈 라벨에 대한 의존도를 줄이고 최종 탐지 성능을 향상시켰다.
- HASSOD는 객체의 범위를 더 넓게 탐지하고 구성 구조를 이해함으로써 기존 방법인 CutLER보다 뛰어난 탐지 성능을 달성했다.
![Figure 2 : Two-stage discover-and-learn process in HASSOD. Stage 1 uses a frozen, self-supervised DINO [ 5 ] ViT backbone to discover initial pseudo-labels from unlabeled images. Stage 2 learns an object detector to improve over the pre-trained features and initial pseudo-labels.](https://ar5iv.labs.arxiv.org/html/2402.03311/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.