[논문 리뷰] The Devil is in Classification: A Simple Framework for Long-tail Object Detection and Instance Segmentation
이 논문은 Mask R-CNN와 같은 이단계 모델에서 분류 헤드의 편향을 교정함으로써 장꼬리 분류 문제를 해결하기 위해 단순하면서도 효과적인 校정 프레임워크인 SimCal을 제안한다. 이는 이중 수준의 클래스 균형 샘플링을 사용하여 부족하게 표현된 클래스에서 분류 헤드를 재학습하고, 원본 헤드와 校정된 헤드의 예측을 새로운 앙상블 전략을 통해 조합함으로써, LVIS 및 COCO-LT에서 최신 기준 성능을 달성하며, 헤드 클래스 성능을 손상시키지 않은 채 꼬리 클래스의 AP를 크게 향상시킨다.
Most existing object instance detection and segmentation models only work well on fairly balanced benchmarks where per-category training sample numbers are comparable, such as COCO. They tend to suffer performance drop on realistic datasets that are usually long-tailed. This work aims to study and address such open challenges. Specifically, we systematically investigate performance drop of the state-of-the-art two-stage instance segmentation model Mask R-CNN on the recent long-tail LVIS dataset, and unveil that a major cause is the inaccurate classification of object proposals. Based on such an observation, we first consider various techniques for improving long-tail classification performance which indeed enhance instance segmentation results. We then propose a simple calibration framework to more effectively alleviate classification head bias with a bi-level class balanced sampling approach. Without bells and whistles, it significantly boosts the performance of instance segmentation for tail classes on the recent LVIS dataset and our sampled COCO-LT dataset. Our analysis provides useful insights for solving long-tail instance detection and segmentation problems, and the straightforward \emph{SimCal} method can serve as a simple but strong baseline. With the method we have won the 2019 LVIS challenge. Codes and models are available at https://github.com/twangnh/SimCal.
연구 동기 및 목표
- Mask R-CNN와 같은 최신 기술의 이단계 인스턴스 세그멘테이션 모델이 LVIS와 같은 장꼬리 데이터셋에서 성능이 떨어지는 이유를 탐구하기 위해.
- 꼬리 클래스에서의 성능 저하의 주요 원인이 객체 제안 분류의 정확도 부족임을 규명하기 위해.
- 모델 전체를 재학습하지 않고도 분류 헤드 성능을 향상시키는 단순하고 효과적인 校정 프레임워크를 개발하기 위해.
- 헤드 클래스에서의 높은 성능를 유지하면서도 장꼬리(꼬리) 클래스에서의 성능를 크게 향상시키기 위해.
- 기존 모델에 쉽게 통합할 수 있는 강력하고 실용적인 장꼬리 인스턴스 세그멘테이션 기준 성능를 제공하기 위해.
제안 방법
- 표준 학습 후 이중 수준의 샘플링 전략을 사용하여 분류 헤드를 별도로 校정하는 분리 학습 기반 설계를 제안하며, 이는 이미지 수준과 인스턴스 수준의 샘플링을 조합하여 클래스 분포를 균형 잡는다.
- 모든 카테고리에 걸쳐 클래스 균형을 이루는 제안 샘플을 수집하기 위해 새로운 이중 수준 샘플링 방법을 사용하며, 특히 꼬리 클래스의 표현을 향상시킨다.
- 표준 교차 엔트로피 손실을 사용하여 균형 잡힌 제안 세트에서 분류 헤드만 재학습함으로써 검출 및 마스크 헤드에 미치는 간섭을 최소화한다.
- 원본 및 校정된 분류 헤드의 예측을 조합하는 이중 헤드 추론 전략을 도입하며, 새로운 출력 조합 방법(sel)을 사용하여 평균화나 NMS 기반 융합보다 우수한 성능을 내는 방법을 제안한다.
- 원본 헤드와 校정된 헤드 간의 신뢰도 점수를 정렬하기 위해 스케일링 및 정규화 전략(sel-scale, sel-norm)을 적용하여 검출 품질을 향상시킨다.
- 교정 과정에서 간단한 고정 학습률(0.01)을 사용하며, 이는 표준 학습과 일치하여 철저한 초모수 튜닝이 필요 없음을 시사한다.
실험 결과
연구 질문
- RQ1최신 기술의 이단계 인스턴스 세그멘테이션 모델이 LVIS와 같은 장꼬리 데이터셋에서 실패하는 이유는 무엇인가요?
- RQ2불균형한 학습 샘플로 인해 발생하는 분류 헤드의 편향이 꼬리 클래스에서의 성능 저하에 얼마나 기여하는가요?
- RQ3모델 전체를 재학습하지 않고도 분류 헤드의 단순한 후처리 校정이 장꼬리 인스턴스 세그멘테이션 성능을 크게 향상시킬 수 있는가요?
- RQ4원본 및 校정된 분류 헤드의 예측을 조합하는 데 최적의 전략은 무엇인가요? 모든 클래스에서 성능을 극대화하기 위해.
- RQ5교정으로 얻는 성능 향상은 분류 헤드의 어떤 층을 피니팅하는지에 따라 달라지나요?
주요 결과
- 장꼬리 데이터셋에서의 성능 저하의 주요 원인은 영역 제안 네트워크(RPN)의 품질이 아니라, 객체 제안의 분류 정확도 부족이다.
- ResNet-50-FPN를 사용하여 LVIS 데이터셋에서 SimCal은 23.4 AP를 달성하였으며, 기준 모델의 18.0 AP 대비 5.4점 향상되었고, 꼬리 클래스의 AP_f는 16.4에서 22.5로 6.1점 상승하였다.
- 제안된 조합 방법(sel)은 21.1 AP를 기록하여 평균화(20.3 AP)와 NMS 기반 융합(19.8 AP)보다 뛰어난 성능을 보였다.
- 3층 모두를 校정하는 것이 가장 우수한 성능(22.2 AP)을 내며, 마지막 2개 또는 1개의 레이어만 교정하는 것보다 우수하다.
- 교정에 최적의 학습률은 0.01이며, 표준 학습과 일치하여 일반적인 피니팅에서 요구하는 낮은 학습률이 필요하지 않음을 시사한다.
- 꼬리 클래스의 성능 변동성이 훨씬 크며(예: AP_f의 표준편차 1.3), 장꼬리 학습의 과제를 확인하며, 풍부한 학습 데이터 덕분에 헤드 클래스는 낮은 변동성을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.