[논문 리뷰] OMNIA Faster R-CNN: Detection in the wild through dataset merging and soft distillation
이 논문은 자기 훈련과 소프트 디스티illation을 통해 카테고리가 겹치지 않는 여러 데이터셋을 통합함으로써 추가 애너테이션 없이도 강건한 객체 검출기를 훈련시키는 방법인 OMNIA Faster R-CNN을 제안한다. 이는 도메인 적응에서 최고 성능(44.9 mAP on Cityscapes)을 달성하고, COCO와 Modanet를 융합하여 패션 검출의 mAP를 45.5%에서 57.4%로 향상시킨다.
Object detectors tend to perform poorly in new or open domains, and require exhaustive yet costly annotations from fully labeled datasets. We aim at benefiting from several datasets with different categories but without additional labelling, not only to increase the number of categories detected, but also to take advantage from transfer learning and to enhance domain independence. Our dataset merging procedure starts with training several initial Faster R-CNN on the different datasets while considering the complementary datasets' images for domain adaptation. Similarly to self-training methods, the predictions of these initial detectors mitigate the missing annotations on the complementary datasets. The final OMNIA Faster R-CNN is trained with all categories on the union of the datasets enriched by predictions. The joint training handles unsafe targets with a new classification loss called SoftSig in a softly supervised way. Experimental results show that in the case of fashion detection for images in the wild, merging Modanet with COCO increases the final performance from 45.5% to 57.4% in mAP. Applying our soft distillation to the task of detection with domain shift between GTA and Cityscapes enables to beat the state-of-the-art by 5.3 points. Our methodology could unlock object detection for real-world applications without immense datasets.
연구 동기 및 목표
- 카테고리가 겹치지 않는 데이터셋과 제한된 애너테이션을 가진 개방형 또는 개방 도메인 환경에서 강건한 객체 검출기를 훈련하는 데 도전한다.
- 초기 검출기의 예측을 약한 감독으로 활용하여 수동 인스턴스 애너테이션의 높은 비용을 줄이고, 데이터셋 간의 누락된 애너테이션을 메운다.
- 모델 예측된 바운딩 박스로 풍부해진 융합된 데이터셋에서 공동 훈련을 통해 도메인 일반화 능력과 검출기의 강건성을 향상시켜, 도메인 이동이 발생하는 상황에서도 성능을 높인다.
- 예측의 불확실성을 다루기 위한 새로운 소프트 분류 손실(SoftSig)을 개발하여, 훈련 중에 고신뢰도(안전한) 및 저신뢰도(위험한) 검출을 구분한다.
- 기본적인 재애너테이션 또는 전체 도메인 전용 데이터셋이 필요 없이, 실세계 응용(예: 패션 인식 및 자율주행)에 검출기를 실용적으로 구현할 수 있도록 한다.
제안 방법
- COCO, Modanet 등의 각 소스 데이터셋에서 별도로 초기 Faster R-CNN 검출기를 훈련하면서, 도메인 적응을 위해 보완 데이터셋의 이미지도 활용한다.
- 각 초기 검출기의 예측 결과를 가짜 레이블로 사용하여 보완 데이터셋을 풍부하게 하며, 원래 존재하지 않는 카테고리의 누락 애너테이션을 메운다.
- 모든 데이터셋의 유니온(진짜 애너테이션과 예측된 애너테이션 포함)에서 최종 OMNIA Faster R-CNN을 훈련하며, 불확실성을 다루기 위해 새로운 분류 손실인 SoftSig를 사용한다.
- SoftSig 손실은 고신뢰도 예측을 신뢰할 수 있는 타겟으로 간주하고, 저신뢰도 예측은 불확실한 것으로 간주하여 노이즈가 많은 가짜 레이블의 영향을 줄이는 소프트 감독을 가능하게 한다.
- 훈련 중 소프트 디스티illation을 적용하여 초기 검출기의 지식을 최종 모델로 전이함으로써 일반화 능력과 도메인 이동에 대한 강건성을 향상시킨다.
- 반복적인 자기 훈련을 적용: 업데이트된 예측 결과를 포함한 융합된 데이터셋에서 검출기를 재훈련하여, 추가 레이블 없이 점진적으로 성능을 향상시킨다.
실험 결과
연구 질문
- RQ1추가 수동 애너테이션 없이도 카테고리가 겹치지 않는 여러 데이터셋에서 효과적으로 객체 검출기를 훈련시킬 수 있는가?
- RQ2모델 예측을 약한 감독으로 활용하여 데이터셋 융합 시 누락된 애너테이션을 어떻게 보완할 수 있는가?
- RQ3불확실하거나 저신뢰도 예측을 다룰 때 소프트 분류 손실(SoftSig)이 검출기 성능 향상에 얼마나 기여하는가?
- RQ4제안된 방법이 특히 합성 데이터에서 실세계 데이터로의 전이가 이루어지는 경우, 도메인 적응 과제에서 최고 성능을 달성할 수 있는가?
- RQ5보완적인 카테고리를 가진 데이터셋을 융합하면, 개방 집합 검출 상황에서 검출기의 일반화 능력과 배경 이해 능력이 향상되는가?
주요 결과
- COCO와 Modanet를 OMNIA Faster R-CNN를 통해 융합함으로써 OpenImages에서 패션 의류 검출의 mAP가 45.5%에서 57.4%로 상승하여 뚜렷한 성능 향상을 보였다.
- SIM10k에서 Cityscapes로의 도메인 적응 벤치마크에서 새로운 SOTA를 달성하여, 자동차 검출에서 44.9 mAP를 기록했으며 이는 이전 SOTA보다 5.3 포인트 높다.
- SoftSig 손실은 하드 디스티illation 및 기준 방법보다 우수한 성능을 보였으며, Cityscapes에서 44.9 mAP, KITTI에서 65.4 mAP를 기록하여 강건성이 향상됨을 시사한다.
- OMNIA SoftSig를 사용한 반복적 자기 훈련은 최고의 성능(42.2 mAP)을 기록했으며, 전체 애너테이션이 가용할 경우의 오라클 성능(59.6 mAP)에 가까워졌다.
- 모델은 새로운 도메인으로도 잘 일반화된다: KITTI에서 OMNIA 모델은 자동차 검출에서 69.9 mAP를 기록했으며, 오라클 성능(72.1 mAP)과 유사하여 강력한 도메인 불변성(도메인 불변성)을 보였다.
- 배경 이해 능력 향상으로 인해 오진 검출(false positives)이 감소하였다: 보조 카테고리(예: 트럭)의 검출 성능 향상이 주요 타겟(예: 자동차)의 성능 향상에 기여하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.