[논문 리뷰] Overcoming Classifier Imbalance for Long-tail Object Detection with Balanced Group Softmax
이 논문은 장꼬리 객체 검출에서 분류기 불균형을 완화하기 위해 유사한 인스턴스 수를 가진 카테고리들을 그룹화하고 그룹별 소프트맥스 교차엔트로피 손실을 적용하는 새로운 모듈인 Balanced Group Softmax (BAGS)을 제안한다. 추가적인 샘플링 없이 헤드 클래스와 테일 클래스 간의 학습 역학을 암묵적으로 균형 잡음으로써 COCO-LT에서 mAP를 2% 이상 향상시키며, LVIS에서 새로운 최고 성능을 달성하여 이전 방법들과 LVIS 2019 우승자들을 크게 앞서간다.
Solving long-tail large vocabulary object detection with deep learning based models is a challenging and demanding task, which is however under-explored.In this work, we provide the first systematic analysis on the underperformance of state-of-the-art models in front of long-tail distribution. We find existing detection methods are unable to model few-shot classes when the dataset is extremely skewed, which can result in classifier imbalance in terms of parameter magnitude. Directly adapting long-tail classification models to detection frameworks can not solve this problem due to the intrinsic difference between detection and classification.In this work, we propose a novel balanced group softmax (BAGS) module for balancing the classifiers within the detection frameworks through group-wise training. It implicitly modulates the training process for the head and tail classes and ensures they are both sufficiently trained, without requiring any extra sampling for the instances from the tail classes.Extensive experiments on the very recent long-tail large vocabulary object recognition benchmark LVIS show that our proposed BAGS significantly improves the performance of detectors with various backbones and frameworks on both object detection and instance segmentation. It beats all state-of-the-art methods transferred from long-tail image classification and establishes new state-of-the-art.Code is available at https://github.com/FishYuLi/BalancedGroupSoftmax.
연구 동기 및 목표
- LVIS와 같은 장꼬리 데이터셋에서 최신 기술 검출기의 성능 저하 원인을 체계적으로 분석하기 위해.
- 헤드 클래스와 테일 클래스의 성능 저하의 핵심 요인으로서 분류기 헤드 내의 파라미터 크기 불균형이 발생하는 이유를 규명하기 위해.
- 기존 장꼬리 분류 기법이 아키텍처 및 학습 방식의 차이로 인해 객체 검출 프레임워크에선 실패하기 때문에, 이를 해결하기 위해 검출 프레임워크 내에서 불균형을 다루기 위해.
- 데이터 샘플링이나 손실 가중치 조정 없이도 효과적인 헤드 및 테일 클래스의 공동 학습을 가능하게 하는 플러그 앤 플레이 모듈인 BAGS를 제안하기 위해.
- LVIS와 구축된 COCO-LT 데이터셋에서 다양한 백본과 검출 프레임워크에 걸쳐 BAGS의 일반화 능력과 강건성을 입증하기 위해.
제안 방법
- 학습 인스턴스 수에 따라 카테고리를 그룹으로 나누어 균형 잡힌 학습 그룹을 형성하기 위해.
- 각 그룹 내에서 독립적으로 그룹별 소프트맥스 교차엔트로피 손실을 적용하여 최적화 과정에서 헤드 클래스의 지배를 줄이기 위해.
- 각 그룹 내에서 '기타 카테고리' 토큰을 도입하여 다양한 부정 예시를 제공하고 가짜 양성 예측을 줄이기 위해.
- 배경 클래스를 별도의 그룹으로 간주하여 강력한 부정 참조 역할을 유지하기 위해.
- 특징 추출기 고정 및 분류기 가중치와 편향만 미세조정하는 분리 전략을 사용하여 분류기 헤드를 BAGS로 학습하기 위해.
- 이중 단계 학습 프rotocol를 사용: 먼저 무작위 초기화 상태에서 분류기 헤드만 학습하고, 이후 전체 헤드 또는 백본을 미세조정하여 수렴을 향상시키기 위해.
실험 결과
연구 질문
- RQ1왜 최신 기술 검출기는 COCO와 같은 균형 잡힌 데이터셋에선 뛰어난 성능을 보이지만, LVIS와 같은 장꼬리 데이터셋에선 실패하는가?
- RQ2장꼬리 데이터셋의 데이터 불균형은 검출 헤드 내의 분류기 파라미터 크기 불균형을 어떻게 유도하는가?
- RQ3기존의 장꼬리 분류 기법(예: 재가중 또는 재샘플링)이 객체 검출 프레임워크에 직접 적용되었을 때 효과가 없는 이유는 무엇인가?
- RQ4데이터 증강이나 샘플링 없이도 수정된 소프트맥스 손실을 사용한 그룹별 학습이 헤드 클래스와 테일 클래스 간의 학습 균형을 효과적으로 맞출 수 있는가?
- RQ5제안된 BAGS 모듈은 다양한 검출 아키텍처와 데이터셋, 심지어 합성 장꼬리 분포에도 일반화되는가?
주요 결과
- COCO-LT 데이터셋에서 훈련된 Faster R-CNN 기반 모델에서 BAGS는 mAP를 2.2%p 향상시키며, Mask R-CNN 기반 모델에선 2.4%p 향상시켰다.
- LVIS 검증 세트에서 ResNet-50-FPN 기반 BAGS는 26.25% mAP를 기록하여 LVIS 2019 우승자(lvlvisis)보다 2.29%p 높고, 다른 우승자(strangeturtle)보다도 2.35%p 높았다.
- 희귀 카테고리(AP r)에서 17.97%의 AP를 기록하여 strangeturtle의 11.70%를 크게 앞서며, 테일 클래스의 일반화 능력 향상이 뚜렷하게 나타났다.
- 제거 실험 결과, 전체 헤드나 백본을 미세조정하는 것보다 분류기 헤드만 학습하는 것보다도 미미한 성능 향상이 있었으며, 이는 경량 학습 프rotocol의 타당성을 뒷받침한다.
- BAGS는 장꼬리 이미지 분류에서 이전 최고 성능 기술을 그대로 가져다 써도 성능을 뛰어넘어, 추가 기능 없이도 LVIS에서 새로운 최고 성능을 달성했다.
- BAGS를 적용한 모델은 헤드 클래스와 테일 클래스 모두에서 강력한 성능 유지를 보이며, 모든 AP 임계값에서 균형 잡힌 향상이 이루어져 분류기 불균형의 효과적인 완화가 이루어졌음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.