[논문 리뷰] Instant-Teaching: An End-to-End Semi-Supervised Object Detection Framework
Instant-Teaching은 확장된 약-강 데이터 증강과 공동 수정(co-rectify) 체계를 활용한 즉시 의사 라벨링을 갖춘 엔드-투-엔드 반지도 학습 객체 탐지 프레임워크를 도입하여 MS-COCO 및 PASCAL VOC에서 최신 결과를 달성합니다.
Supervised learning based object detection frameworks demand plenty of laborious manual annotations, which may not be practical in real applications. Semi-supervised object detection (SSOD) can effectively leverage unlabeled data to improve the model performance, which is of great significance for the application of object detection models. In this paper, we revisit SSOD and propose Instant-Teaching, a completely end-to-end and effective SSOD framework, which uses instant pseudo labeling with extended weak-strong data augmentations for teaching during each training iteration. To alleviate the confirmation bias problem and improve the quality of pseudo annotations, we further propose a co-rectify scheme based on Instant-Teaching, denoted as Instant-Teaching$^*$. Extensive experiments on both MS-COCO and PASCAL VOC datasets substantiate the superiority of our framework. Specifically, our method surpasses state-of-the-art methods by 4.2 mAP on MS-COCO when using $2\%$ labeled data. Even with full supervised information of MS-COCO, the proposed method still outperforms state-of-the-art methods by about 1.0 mAP. On PASCAL VOC, we can achieve more than 5 mAP improvement by applying VOC07 as labeled data and VOC12 as unlabeled data.
연구 동기 및 목표
- 객체 탐지를 위한 대규모 라벨링 데이터 의존도를 줄이고 비지도 학습 데이터를 활용하기 위해 semi-supervised learning을 이용한다.
- 학습 중에 실시간으로 의사 라벨을 업데이트하는 엔드-투-엔드 SSOD 프레임워크를 개발한다.
- augmentation 전략 및 모델 협력을 통해 의사 라벨의 품질을 개선하고 확인 편향을 줄인다.
- 다양한 라벨링 체계에서 MS-COCO와 PASCAL VOC에서의 확장성 및 효과를 입증한다.
제안 방법
- Instant-Teaching을 제안하며, 약한 증강을 사용해 각 학습 반복에서 비라벨 데이터에 대한 의사 주석을 생성한다.
- Mixup 및 Mosaic를 포함한 강한 증강을 비라벨 데이터에 적용해 의사 라벨에서 학습한다.
- 감독 학습 탐지 손실과 의사 라벨로부터의 비지도 손실을 포함하는 결합 손실을 최소화한다.
- 공동 정정(co-rectify) 체계(Instant-Teaching *)를 도입해 서로 다른 가중치를 가진 두 모델을 공유 구조로 학습시켜 잘못된 예측을 정정한다.
- 의사 라벨링 단계에서 신뢰도 기반 필터링(tau) 및 NMS를 사용해 의사 주석을 선별한다.
- 강한 증강에 추가 증강을 도입해 STAC 스타일의 약한-강한 증강을 확장해 강건성과 의사 라벨 품질을 개선한다.

실험 결과
연구 질문
- RQ1끝-to-end SSOD 프레임워크가 함께 라벨링되지 않은 데이터를 이용해 학습을 개선하기 위해 즉석에서 의사 라벨을 업데이트할 수 있는가?
- RQ2Mixup 및 Mosaic를 포함한 확장된 약한-강한 증강이 반지도 학습에 도움이 되는가?
- RQ3Co-rectify는 SSOD에서 확인 편향을 완화하고 탐지 정확도를 더 향상시키는가?
- RQ4Instant-Teaching가 다양한 라벨링 체계에서 MS-COCO와 PASCAL VOC에 대해 STAC 및 기타 SSOD 방법과 비교해 어떤 차이가 있는가?
주요 결과
- Instant-Teaching은 MS-COCO 프로토콜 전반에서 STAC을 크게 능가한다(예: 1% 라벨 데이터: 18.05 mAP vs 13.97; 2%: 22.45 vs 18.25).
- Instant-Teaching ∗ (co-rectify와 함께)는 1%–2% COCO 프로토콜에서 18.05에서 22.45 mAP를 달성하고 10% COCO에서 최대 30.40 mAP, 전체 COCO에서 40.20 mAP에 이른다.
- VOC07에서 Instant-Teaching ∗은 VOC07에 라벨링된 데이터와 VOC12 비라벨링 데이터를 사용할 때 44.64에서 50.00 mAP로 개선되며 MS-COCO 비라벨링 데이터로도 50.80 mAP에 도달한다.
- Mixup과 Mosaic을 포함한 강한 증강 확장은 STAC(23.14 mAP)보다 5% COCO에서 최고의 결과인 25.60 mAP를 낳는다.
- Co-rectify는 두 모델이 서로의 예측을 개선하도록 함으로써 학습 속도를 높이고 의사 주석의 품질을 향상시켜 확인 편향을 줄인다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.