[논문 리뷰] Cross-dataset Training for Class Increasing Object Detection
이 논문은 COCO, VOC, WIDER Face, WIDER Pedestrian와 같은 서로 독립적으로 레이블이 지정된 다수의 데이터셋에서의 클래스를 동시에 탐지할 수 있도록 하는 일반적인 교차 데이터셋 훈련 프레임워크를 제안한다. 이 프레임워크는 정확도 손실이 크지 않게 유지하면서도 단일 객체 검출기로도 기능한다. 의미적으로 동일한 레이블을 통합하고, 데이터셋의 분할을 유지하며, 충돌하는 양성/음성 샘플 간의 회피 관계를 강제함으로써, 모든 데이터셋에서 동시에 최신 기술 수준의 성능을 달성한다. 이는 최소한의 재레이블링으로 지속적인 학습을 가능하게 한다.
We present a conceptually simple, flexible and general framework for cross-dataset training in object detection. Given two or more already labeled datasets that target for different object classes, cross-dataset training aims to detect the union of the different classes, so that we do not have to label all the classes for all the datasets. By cross-dataset training, existing datasets can be utilized to detect the merged object classes with a single model. Further more, in industrial applications, the object classes usually increase on demand. So when adding new classes, it is quite time-consuming if we label the new classes on all the existing datasets. While using cross-dataset training, we only need to label the new classes on the new dataset. We experiment on PASCAL VOC, COCO, WIDER FACE and WIDER Pedestrian with both solo and cross-dataset settings. Results show that our cross-dataset pipeline can achieve similar impressive performance simultaneously on these datasets compared with training independently.
연구 동기 및 목표
- 산업 및 연구 환경에서 새로운 객체 클래스가 추가될 경우 기존 데이터셋의 재레이블링 비용을 줄이기 위해.
- 다른 클래스 레이블을 가진 다수의 데이터셋으로부터 객체 클래스를 동시에 인식할 수 있는 단일 검출기를 가능하게 하기 위해.
- 충돌하는 양성/음성 샘플이 포함된 데이터셋을 결합할 경우 성능 저하를 방지하는 일반적이고 유연한 훈련 파이프라인을 개발하기 위해.
- 기존 데이터는 재레이블링 없이 점진적으로 새로운 클래스가 도착하는 지속적인 학습 시나리오를 지원하기 위해.
제안 방법
- 의미적으로 동일한 클래스(예: 'person'과 'pedestrian')를 데이터셋 간에 통합하여 모호성을 줄이고 훈련의 안정성을 향상시키기 위해.
- 원본 이미지 분할 및 데이터셋 경계를 유지하면서 레이블을 연결하여 하이브리드 데이터셋을 구성하기 위해.
- 한 데이터셋의 양성 샘플과 다른 데이터셋의 음성 샘플 간의 회피 관계를 정의하기 위해(예: WIDER Face의 face-negative와 COCO의 person-positive 간의 혼동 방지).
- 역전파 과정에서 이러한 회피 관계를 강제하는 수정된 분류 손실을 사용하여 검출기를 훈련하기 위해.
- 일반화 성능를 평가하기 위해 RetinaNet과 같은 표준 객체 검출 프레임워크를 사용하고, ResNet-50 또는 MobileNetV2를 백본으로 적용하기 위해.
- 모든 데이터셋 간에 일관된 앵커 스케일과 비율을 적용하여 공정한 비교와 안정적인 훈련을 보장하기 위해.
실험 결과
연구 질문
- RQ1서로 다른 레이블이 부여된 독립적인 데이터셋에서의 객체 클래스의 합집합을 탐지할 수 있는 단일 검출기를 훈련시킬 수 있을까? 성능 저하가 크지 않은가?
- RQ2의미적으로 유사한 클래스(예: person/pedestrian)의 레이블을 통합하면 교차 데이터셋 검출 성능에 어떤 영향을 미치는가?
- RQ3충돌하는 양성 및 음성 샘플(예: face-negative 대 person-positive)은 교차 데이터셋 훈련에 어떤 영향을 미치며, 이를 어떻게 완화할 수 있는가?
- RQ4제안된 방법은 다양한 백본과 데이터셋 도메인(스케일 분포가 다른 경우 포함)으로 일반화되는가?
- RQ5교차 데이터셋 훈련은 새로운 클래스가 점진적으로 추가되는 실제 응용 환경에서 지속적인 학습을 지원할 수 있는가?
주요 결과
- 레이블을 통합한 교차 데이터셋 훈련은 COCO와 VOC를 함께 훈련할 경우 VOC에서 87.5 mAP, COCO에서 35.4 mAP를 달성하여 각각 단일 데이터셋 기준선과 유사하거나 약간 낮은 성능을 보였다.
- WIDER Face에서 48.32% AP, WIDER Pedestrian에서 43.86% AP를 유지하며 공동 훈련을 수행함으로써 단일 데이터셋 기준선과 비교해 유의미한 정확도 손실이 없음을 확인했다.
- 의미적으로 유사한 클래스(예: person과 pedestrian)를 통합하면 약 0.5 AP 향상이 이루어져 분류의 모호성이 감소함을 시사한다.
- 백본 간 일반화 성능가 확인되었으며, ResNet-50과 MobileNetV2 모두 유사한 성능를 기록함으로써 모델 용량에 의존하지 않는다는 점을 입증했다.
- 모든 데이터셋 간 앵커 스케일 일관성이 성능 유지에 기여함을 보여주었으며, 공정한 실험 설정 하에서도 효과적으로 작동함을 입증했다.
- 방향성을 클래스로 간주함으로써 360도 얼굴 검출이 가능해졌으며, 이는 표준 검출 외의 새로운 응용 가능성을 보여주는 바이다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.