[논문 리뷰] Forest R-CNN: Large-Vocabulary Long-Tailed Object Detection and Instance Segmentation
Forest R-CNN는 대용량 어휘, 긴 꼬리 분포를 가진 객체 검출 및 인스턴스 세그멘테이션 문제를 해결하기 위해 분류 숲과 NMS 재표본화 방법을 제안한다. 계층적 트리 구조를 통해 세분화된 클래스를 더 넓은 부모 클래스로 군집화함으로써 세분화된 분류에서 노이즈가 많은 로짓을 억제하고, 다수의 트리가 숲을 이뤄 투표를 수행한다. 이 방법은 LVIS v0.5에서 희귀 카테고리에 대해 11.5%의 AP 향상을 기록했으며, Mask R-CNN 대비 전체 AP에서도 3.9% 향상되었다.
Despite the previous success of object analysis, detecting and segmenting a large number of object categories with a long-tailed data distribution remains a challenging problem and is less investigated. For a large-vocabulary classifier, the chance of obtaining noisy logits is much higher, which can easily lead to a wrong recognition. In this paper, we exploit prior knowledge of the relations among object categories to cluster fine-grained classes into coarser parent classes, and construct a classification tree that is responsible for parsing an object instance into a fine-grained category via its parent class. In the classification tree, as the number of parent class nodes are significantly less, their logits are less noisy and can be utilized to suppress the wrong/noisy logits existed in the fine-grained class nodes. As the way to construct the parent class is not unique, we further build multiple trees to form a classification forest where each tree contributes its vote to the fine-grained classification. To alleviate the imbalanced learning caused by the long-tail phenomena, we propose a simple yet effective resampling method, NMS Resampling, to re-balance the data distribution. Our method, termed as Forest R-CNN, can serve as a plug-and-play module being applied to most object recognition models for recognizing more than 1000 categories. Extensive experiments are performed on the large vocabulary dataset LVIS. Compared with the Mask R-CNN baseline, the Forest R-CNN significantly boosts the performance with 11.5% and 3.9% AP improvements on the rare categories and overall categories, respectively. Moreover, we achieve state-of-the-art results on the LVIS dataset. Code is available at https://github.com/JialianW/Forest_RCNN.
연구 동기 및 목표
- 긴 꼬리 분포를 가진 대량의 객체 카테고리를 검출하고 세그멘테이션하는 문제에 대응한다.
- 계층적 부모-자식 클래스 관계를 활용해 세분화된 분류기에서 노이즈가 많은 로짓을 감소시킨다.
- 학습 데이터에서 부족하게 표현되는 희귀(꼬리) 클래스의 인식 성능을 향상시킨다.
- 기존 객체 인식 모델과의 호환성을 고려해 확장 가능한 배포를 위한 플러그-인 모듈을 개발한다.
- 희귀 카테고리의 학습을 향상시키기 위해 새로운 재표본화 전략을 사용해 긴 꼬리 데이터 분포를 재균형화한다.
제안 방법
- 카테고리 관계의 사전 지식을 활용해 세분화된 클래스를 더 넓은 부모 클래스로 군집화하여 분류 트리를 구축한다.
- 부모 클래스의 확률을 사용해 세분화된 분류기에서 노이즈가 많은 로짓을 억제함으로써 신뢰도 캘리브레이션을 향상시킨다.
- 다양한 종류의 사전 지식을 기반으로 여러 트리를 생성하여 분류 숲을 구성하고, 각 트리가 최종 세분화된 예측에 투표하도록 한다.
- 각 카테고리별로 NMS 임계값을 적응적으로 조정하는 재표본화 전략인 NMS Resampling을 제안한다.
- 분류 숲과 NMS Resampling을 Mask R-CNN와 같은 기존의 이단계 검출기와 통합하여 플러그인 모듈로 구현한다.
- 트리 구조의 지도를 활용해 부모 클래스와 세분화된 클래스 양쪽에 교차 엔트로피 손실을 적용하여 모델을 엔드 투 엔드로 훈련시킨다.
실험 결과
연구 질문
- RQ1어떻게 계층적 클래스 관계를 활용해 대용량 어휘 분류에서 노이즈가 많은 로짓을 줄일 수 있는가?
- RQ2단일 트리 대비 다수의 분류 트리(숲)를 사용할 경우 분류의 정교함에 어떤 영향을 미치는가?
- RQ3NMS Resampling을 통한 적응적 재표본화가 객체 검출 및 인스턴스 세그멘테이션에서 긴 꼬리 데이터 불균형 문제를 효과적으로 완화할 수 있는가?
- RQ4최신 기준 모델 대비 제안된 방법이 희귀 카테고리에서 성능을 얼마나 향상시키는가?
- RQ5Forest R-CNN는 LVIS 벤치마크에서 다양한 백본 아키텍처와 훈련 설정에 대해 얼마나 일반화되는가?
주요 결과
- LVIS v0.5 검증 세트에서 Forest R-CNN는 희귀 카테고리에 대해 11.5%의 AP 향상을 기록했고, Mask R-CNN 기준으로 전체 AP도 3.9% 향상되었다.
- LVIS v1.0에서 Forest R-CNN는 전체 AP를 4% 향상시키고, 희귀 카테고리 AP를 14.2% 향상시켰다.
- ResNet-50-FPN 백본을 사용함에도 불구하고, Forest R-CNN는 EQL 및 De-confound과 같은 복잡한 모델들보다도 더 뛰어난 성능을 기록하며 LVIS v0.5에서 최고 성능을 달성했다.
- 분류 숲 설계는 예측을 안정화시킨다: 정확한 예측의 신뢰도 점수는 증가하고, 잘못된 예측의 점수는 억제된다.
- NMS Resampling은 데이터 분포를 효과적으로 재균형화하며, 아키텍처 변경 없이도 꼬리 클래스의 학습을 향상시킨다.
- 모델은 하이퍼파라미터 선택에 대해 강건하다: 1000개의 세분화된 클래스를 25~50개의 부모 클래스로 군집화하더라도 성능이 안정적으로 유지된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.