Skip to main content
QUICK REVIEW

[논문 리뷰] Co-mining: Self-Supervised Learning for Sparsely Annotated Object Detection

Tiancai Wang, Tong Yang|arXiv (Cornell University)|2020. 12. 03.
Advanced Neural Network Applications참고 문헌 53인용 수 6
한 줄 요약

이 논문은 희소하게 애너테이션된 객체 검출을 위한 자기지도 학습 프레임워크인 Co-mining을 제안한다. 이는 시아미즈 네트워크를 사용해 미애너테이션된 인스턴스에 대해 의사 레이블을 생성하고, 이를 양성 지도로 간주함으로써 모델 성능을 향상시킨다. 이 방법은 MS COCO에서 희소 애너테이션 설정 하에 기준 모델 대비 1.4–2.1%의 AP 향상을 달성하며, 기존 방법들을 능가한다.

ABSTRACT

Object detectors usually achieve promising results with the supervision of complete instance annotations. However, their performance is far from satisfactory with sparse instance annotations. Most existing methods for sparsely annotated object detection either re-weight the loss of hard negative samples or convert the unlabeled instances into ignored regions to reduce the interference of false negatives. We argue that these strategies are insufficient since they can at most alleviate the negative effect caused by missing annotations. In this paper, we propose a simple but effective mechanism, called Co-mining, for sparsely annotated object detection. In our Co-mining, two branches of a Siamese network predict the pseudo-label sets for each other. To enhance multi-view learning and better mine unlabeled instances, the original image and corresponding augmented image are used as the inputs of two branches of the Siamese network, respectively. Co-mining can serve as a general training mechanism applied to most of modern object detectors. Experiments are performed on MS COCO dataset with three different sparsely annotated settings using two typical frameworks: anchor-based detector RetinaNet and anchor-free detector FCOS. Experimental results show that our Co-mining with RetinaNet achieves 1.4%~2.1% improvements compared with different baselines and surpasses existing methods under the same sparsely annotated setting. Code is available at https://github.com/megvii-research/Co-mining.

연구 동기 및 목표

  • 대규모 데이터셋에서 인스턴스의 일부만 애너테이션된 경우 발생하는 성능 저하 문제를 해결하기 위해.
  • 기존 방법들이 어려운 음성 예외를 재가중하거나 무시하는 데 그치며, 미애너테이션된 인스턴스에서 유용한 정보를 활용하지 못하는 한계를 극복하기 위해.
  • 앵커 기반 및 앵커리스 검출기 모두에 적용 가능한 일반화 가능한 훈련 메커니즘을 개발하기 위해.
  • 자기지도 학습을 통해 미애너테이션된 인스턴스에서 양성 지도 신호를 채굴함으로써 검출 성능을 향상시키기 위해.

제안 방법

  • 두 개의 브랜치가 가중치를 공유하며, 원본 이미지와 그 변형된 버전을 처리하는 시아미즈 네트워크 아키텍처를 사용한다.
  • 공동 생성 모듈은 한 브랜치의 예측 결과를 이용해 다른 브랜치의 이미지 브랜치에 대해 의사 레이블 세트를 생성함으로써 상호 지도 학습을 가능하게 한다.
  • 의사 레이블은 점수 임계값 τ를 통해 필터링되어 가짜 양성과 빠진 양성 간의 균형을 유지한다.
  • 한 브랜치에 대해 데이터 증강(예: 색상 왜곡)을 적용하여 다양한 고도의 의사 레이블 생성을 유도한다.
  • 의사 레이블은 희소 진짜 애너테이션과 융합되어 훈련 중 복합 지도 신호를 형성한다.
  • 이 방법은 앵커 기반(예: RetinaNet) 및 앵커리스(예: FCOS) 검출기 모두와 호환된다.

실험 결과

연구 질문

  • RQ1희소하게 애너테이션된 데이터셋의 미애너테이션된 인스턴스가 양성 지도 신호로 효과적으로 활용될 수 있는가?
  • RQ2시아미즈 네트워크를 통한 공유 생성 의사 레이블링이 손실 재가중 또는 무시 전략을 초월해 검출 성능을 향상시키는가?
  • RQ3제안된 Co-mining 메커니즘이 앵커리스 및 앵커 기반 모델을 포함한 다양한 검출기 아키텍처에 일반화 가능한가?
  • RQ4점수 임계값과 데이터 증강의 선택이 의사 레이블의 품질과 영향력에 어떤 영향을 미치는가?

주요 결과

  • RetinaNet를 사용한 Co-mining은 COCO-50miss 세트에서 33.9 AP를 달성하여 이전 최고 성능 기준 BRL 방법보다 1.2% 높고, 파트 인식 샘플링보다 5.5% 높다.
  • 동일한 벤치마크에서 Co-mining은 BRL 대비 $AP_{50}$를 2.2% 향상시켜 분류 일반화 능력 향상이 뚜렷하다.
  • FCOS를 사용할 경우, Co-mining은 COCO-2017의 모든 희소 애너테이션 설정에서 일관된 성능 향상을 보이며, 앵커리스 검출기로의 일반화 능력을 입증한다.
  • 점수 임계값 0.6이 최적의 성능을 낸다; 낮은 임계값(예: 0.4)은 노이즈가 많은 의사 레이블로 인해 손실 폭발을 유발하고, 높은 임계값(예: 0.8)은 유용한 인스턴스를 놓친다.
  • 색상 왜곡이 블러나 증강 없음보다 우수한 성능을 보이며, 이는 외관 변화가 의사 레이블의 다양성과 품질을 향상시킨다는 것을 시사한다.
  • 의사 레이블링에서 실패 케이스(오분류 및 국소화 오류)가 존재하지만, 진짜 양성 의사 레이블의 우세함으로 인해 그 영향은 제한적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.