[논문 리뷰] GOOD: Exploring Geometric Cues for Detecting Objects in an Open World
GOOD는 사전 훈련된 단안 추정기로부터 취득한 깊이 맵과 노멀 맵을 활용하여 새로운 객체 카테고리의 검출 성능을 향상시키는 기하학적 지도(open-world) 객체 검출 프레임워크를 제안한다. 훈련 중에 미라벨링된 객체에 대해 기하학적 피처를 이용해 가짜 레이블을 생성함으로써, COCO에서 단 한 개의 기본 클래스(예: 'person')만을 사용해도 SOTA 방법 대비 AR@100에서 5.0%의 절대적 향상을 달성한다.
We address the task of open-world class-agnostic object detection, i.e., detecting every object in an image by learning from a limited number of base object classes. State-of-the-art RGB-based models suffer from overfitting the training classes and often fail at detecting novel-looking objects. This is because RGB-based models primarily rely on appearance similarity to detect novel objects and are also prone to overfitting short-cut cues such as textures and discriminative parts. To address these shortcomings of RGB-based object detectors, we propose incorporating geometric cues such as depth and normals, predicted by general-purpose monocular estimators. Specifically, we use the geometric cues to train an object proposal network for pseudo-labeling unannotated novel objects in the training set. Our resulting Geometry-guided Open-world Object Detector (GOOD) significantly improves detection recall for novel object categories and already performs well with only a few training classes. Using a single "person" class for training on the COCO dataset, GOOD surpasses SOTA methods by 5.0% AR@100, a relative improvement of 24%.
연구 동기 및 목표
- 기본 클래스가 몇 개 밖에 없는 상황에서도 장면 내 모든 객체를 검출해야 하는 개방형 월드 클래스 무관 객체 검출 문제에 대응한다.
- 훈련 클래스에 과적합하고 새로운 외관을 가진 객체로의 일반화 성능이 떨어지는 RGB 기반 검출기의 한계를 극복한다.
- 사전 훈련된 단안 추정기로부터 확보한 기하학적 피처(깊이, 노멀)를 활용하여 미관측 객체 카테고리의 검출 재현율을 향상시킨다.
- 표면 무늬나 특징적인 부분에 대한 단순한 학습 경로에 기인하는 외관 기반 피처에 대한 의존도를 줄여, 소수의 샘플이 있는 개방형 월드 설정에서의 일반화 성능을 향상시킨다.
제안 방법
- 튜닝 없이도 사용 가능한 오프더샘이 단안 깊이 및 노멀 추정기들을 활용하여 RGB 이미지에서 기하학적 피처를 추론한다.
- 예측된 기하학적 맵을 기반으로 훈련 세트 내에서 라벨이 지정되지 않은 새로운 객체를 식별하기 위해 객체 제안 네트워크를 훈련시킨다.
- 기하학적 기반 제안 네트워크의 상위 예측 결과로부터 가짜 바운딩 박스를 생성하여 최종 RGB 기반 객체 검출기의 훈련에 활용한다.
- 가짜 레이블링된 새로운 객체를 사용하여 RGB 기반 검출기를 미세조정함으로써, 새로운 카테고리로의 일반화 성능을 향상시킨다.
- 가짜 레이블의 노이즈를 완화하고 내성성을 향상시키기 위해 검출기 훈련 중 AutoAugment 데이터 증강 기법을 적용한다.
- 이중 단계 훈련 파이프라인을 사용한다: 첫 번째 단계에서는 기하학적 피처 기반으로 제안 네트워크를 훈련하고, 두 번째 단계에서는 생성된 가짜 레이블을 사용해 RGB 입력 기반 검출기를 훈련시킨다.
실험 결과
연구 질문
- RQ1깊이 및 노멀과 같은 기하학적 피처가 개방형 월드 객체 검출에서 새로운 객체 카테고리의 검출 재현율 향상에 기여하는가?
- RQ2기하학적 피처를 통합함으로써 기본 클래스에 대한 과적합이 감소하고, 새로운 객체 카테고리로의 일반화 성능이 향상되는가?
- RQ3소수의 샘플이 있는 개방형 월드 검출에서, 기하학적 피처 기반의 가짜 레이블링이 순수한 RGB 기반 방법보다 얼마나 효과적인가?
- RQ4기하학적 피처는 데이터 증강 기법과 형태 편향(Shape bias)에 비해 얼마나 더 효과적으로 새로운 객체의 검출 성능을 향상시키는가?
- RQ5기본 클래스의 수가 개방형 월드 검출에서 GOOD와 SOTA 방법 간의 성능 격차에 미치는 영향은 어느 정도인가?
주요 결과
- COCO에서 단 한 개의 기본 클래스('person')만을 사용해도 GOOD는 SOTA 방법 대비 AR@100에서 5.0%의 절대적 향상을 달성하였으며, 이는 상대적 향상률 24%에 해당한다.
- 기본 클래스가 하나일 때 GOOD는 ADE20K 검증 세트에서 18개의 참 양성 예측을 기록하여 OLN(13개), GGN(14개)를 초월하며, 새로운 카테고리로의 일반화 성능이 뛰어나다는 것을 입증한다.
- 기하학적 피처 기반으로 훈련된 객체 제안 네트워크는 높은 품질의 상위 예측 결과(AR N @k ≤ 5)를 도출하여 깊이 및 노멀 맵이 새로운 객체 식별에 효과적이라는 것을 시사한다.
- AutoAugment를 통한 데이터 증강은 가짜 레이블링과 함께 사용될 경우 새로운 클래스의 성능 향상을 이끌지만, 진짜 레이블만을 대상으로 적용할 경우 일반화 성능 향상에 실패한다.
- GOOD는 OLN 대비 기존의 80개의 기본 클래스 대비 절반 수준인 39개의 기본 클래스만으로도 유사한 성능을 달성하여, 더 높은 샘플 효율성과 과적합 감소를 보여준다.
- GOOD는 기본 클래스와 새로운 클래스 간의 AR 격차를 크게 줄여, 기하학적 피처가 다양한 객체 카테고리 간의 일반화 격차를 해소하는 데 기여한다는 점을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.