[논문 리뷰] DetCo: Unsupervised Contrastive Learning for Object Detection
DetCo는 다중 수준의 감독과 글로벌-로컬 대비 학습을 통해 개체 수준 검출 및 이미지 분류 성능을 향상시키는 자기지도 대비 학습 프레임워크를 제안한다. 이는 이전 방법보다 COCO에서 46.5 AP를 기록하며 전이 성능를 최고 수준으로 향상시켰고, ImageNet 분류에서 6.9%의 상위-1 정확도 향상을 달성하였다.
Unsupervised contrastive learning achieves great success in learning image representations with CNN. Unlike most recent methods that focused on improving accuracy of image classification, we present a novel contrastive learning approach, named DetCo, which fully explores the contrasts between global image and local image patches to learn discriminative representations for object detection. DetCo has several appealing benefits. (1) It is carefully designed by investigating the weaknesses of current self-supervised methods, which discard important representations for object detection. (2) DetCo builds hierarchical intermediate contrastive losses between global image and local patches to improve object detection, while maintaining global representations for image recognition. Theoretical analysis shows that the local patches actually remove the contextual information of an image, improving the lower bound of mutual information for better contrastive learning. (3) Extensive experiments on PASCAL VOC, COCO and Cityscapes demonstrate that DetCo not only outperforms state-of-the-art methods on object detection, but also on segmentation, pose estimation, and 3D shape prediction, while it is still competitive on image classification. For example, on PASCAL VOC, DetCo-100ep achieves 57.4 mAP, which is on par with the result of MoCov2-800ep. Moreover, DetCo consistently outperforms supervised method by 1.6/1.2/1.0 AP on Mask RCNN-C4/FPN/RetinaNet with 1x schedule. Code will be released at \href{https://github.com/xieenze/DetCo}{\color{blue}{ t github.com/xieenze/DetCo}}.
연구 동기 및 목표
- 자기지도 표현 학습에서 개체 수준 검출 및 이미지 분류 성능를 동시에 향상시키는 과제를 해결하기 위해.
- 밀도 높은 예측 작업에 강력한 전이 성능를 제공하면서도 이미지 수준 분류 정확도를 희생시키지 않는 프리텍스트 작업을 설계하기 위해.
- 대비 학습을 통해 다중 해상도 특징 피라미드의 특징 간 분별성과 일관성을 향상시키기 위해.
- 전체 이미지 수준 표현과 국소 패치 수준 표현 간 격차를 줄여 검출 및 분류 성능를 향상시키기 위해.
- 최근의 검출 중심 자기지도 방법보다 검출 및 분류 벤치마크 양쪽에서 모두 뛰어난 성능를 보이는 단순하면서도 효과적인 사전 훈련 프레임워크를 개발하기 위해.
제안 방법
- 백본 네트워크의 각 스테이지에서 특징을 최적화하여 특징 피라미드의 모든 수준에서 분별성을 향상시키는 다중 수준 감독을 도입한다.
- 전체 이미지와 자르기로 생성한 국소 패치 간 표현을 정렬하기 위해 글로벌 및 로컬 대비 학습(Goal-Local Contrastive Learning, GLC)을 활용하여 스케일 간 일관성을 증진시킨다.
- 동일한 이미지의 변형(양면) 간의 거리를 최소화하고, 다른 이미지 간의 거리를 최대화하기 위해 대비 손실을 적용한다.
- 글로벌 이미지 특징과 국소 패치 특징 양쪽에 대비 손실를 적용하여 글로벌 및 로컬 표현의 공동 최적화를 가능하게 한다.
- 다중 수준 감독과 GLC를 결합하여 특징 피라미드의 모든 스테이지에서 특징 품질을 향상시키고, 다중 해상도 검출 성능를 향상시킨다.
- 추가적인 감독 없이도 표준 데이터 증강 기법(예: 자르기, 색상 왜곡 등)을 사용해 대비 학습을 위한 양면(positive views)을 생성한다.
실험 결과
연구 질문
- RQ1자기지도 방법이 동시에 개체 검출 및 이미지 분류에서 최고 성능를 달성할 수 있는가?
- RQ2특징 피라미드 스테이지에 대한 다중 수준 감독이 검출 및 분류 성능에 어떤 영향을 미치는가?
- RQ3글로벌-로컬 대비 학습이 표현의 일관성과 분별성 향상에 어느 정도 기여하는가?
- RQ4통합된 프리텍스트 작업이 개체 수준 검출과 이미지 수준 분류 양쪽에 효과적으로 기여할 수 있는가?
- RQ5DetCo는 동시다발적으로 개발된 검출 중심 자기지도 방법들과 비교해 전이 성능에서 어떻게 다른가?
주요 결과
- ImageNet 분류에서 DetCo는 68.6%의 상위-1 정확도를 기록하여 DenseCL(+6.9%) 및 InsLoc(+5.0%)를 앞서 성능가치를 입증하였다.
- COCO 개체 검출에서 DetCo는 SwAV를 기반으로 한 Mask R-CNN C4의 성능을 6.9 AP 향상시켰고, Sparse R-CNN의 성능도 45.0 AP에서 46.5 AP로 향상시켜 새로운 SOTA를 수립하였다.
- 다중 수준 감독과 글로벌-로컬 대비 학습의 조합이 압축 실험에서 모든 백본 스테이지에서 일관된 성능 향상을 이끌어냈다.
- 압축 실험 결과, 다중 수준 감독과 글로벌-로컬 대비 학습이 모두 필수적임을 확인하였다. 둘 중 하나를 제거하면 성능가치가 크게 하락하였다.
- 정합성 세그멘테이션 및 DensePose 작업에서도 경쟁적인 성능를 유지하여 다수의 예측 작업으로의 넓은 전이 가능성을 입증하였다.
- 검출 및 분류 성능 간 최적의 트레이드오프를 달성하였으며, DenseCL, InsLoc, PatchReID와 같은 동시다발적 검출 중심 방법들보다 두 성능 지표에서 모두 뛰어난 성능를 기록하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.