Skip to main content
QUICK REVIEW

[논문 리뷰] Classification Calibration for Long-tail Instance Segmentation

Tao Wang, Yu Li|arXiv (Cornell University)|2019. 10. 29.
Advanced Neural Network Applications참고 문헌 9인용 수 9
한 줄 요약

이 논문은 LVIS와 같은 장꼬리 데이터셋에서의 인스턴스 세그멘테이션 성능을 향상시키기 위해 분류 보정 방법을 제안한다. 클래스 균형 샘플링을 사용해 분류 헤드를 재학습함으로써 아키텍처 변경 없이도 희귀 클래스의 인식을 크게 향상시킨다. 지도 학습 제안어절 레이블을 사용할 경우 (0,10) 꼬리 클래스 박스의 mAP가 0.0에서 39.7로 상승하고, 앙상블 및 다중 해상도 추론을 적용한 결과 LVIS 테스트 세트에서 37.05 AP를 달성하여 희귀 클래스에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

Remarkable progress has been made in object instance detection and segmentation in recent years. However, existing state-of-the-art methods are mostly evaluated with fairly balanced and class-limited benchmarks, such as Microsoft COCO dataset [8]. In this report, we investigate the performance drop phenomenon of state-of-the-art two-stage instance segmentation models when processing extreme long-tail training data based on the LVIS [5] dataset, and find a major cause is the inaccurate classification of object proposals. Based on this observation, we propose to calibrate the prediction of classification head to improve recognition performance for the tail classes. Without much additional cost and modification of the detection model architecture, our calibration method improves the performance of the baseline by a large margin on the tail classes. Codes will be available. Importantly, after the submission, we find significant improvement can be further achieved by modifying the calibration head, which we will update later.

연구 동기 및 목표

  • LVIS와 같은 장꼬리 데이터셋에서 최신 두 단계형 인스턴스 세그멘테이션 모델의 성능 저하 문제를 해결하기 위해.
  • 희귀 클래스 인식이 열악한 근본 원인을 특정하고 이를 완화하기 위해, 특히 제안 영역의 분류 정확도 부족을 중심으로 분석하기 위해.
  • 검출 모델 아키텍처를 수정하지 않고도 희귀 클래스(예: 학습 인스턴스 수가 10개 미만)의 인식을 향상시키기 위해.
  • 장꼬리 데이터에 적합한 가벼운 효과적인 보정 방법을 개발하여 제안 영역 분류 정확도를 향상시키기 위해.
  • 희귀 및 장꼬리 클래스에서 기존의 이미지 수준 반복 샘플링 베이스라인을 능가하면서도 빈도 높은 클래스의 성능 유지를 유지하기 위해.

제안 방법

  • 희귀 카테고리에 대한 학습을 향상시키기 위해 배치당 16개 클래스와 각 클래스당 1개의 이미지를 균형 잡힌 샘플링 방식으로 선택하여 분류 헤드를 재학습한다.
  • 모델 아키텍처를 변경하지 않고 원본 및 재학습된 분류 헤드의 예측을 조합하여 최종 예측을 보정한다.
  • 성능 저하의 원인이 제안 영역 생성이 아니라 분류 오류임을 확인하기 위해 평가 시 제안 영역에 진짜 레이블을 사용한다.
  • 보정 방법의 일반화 능력을 검증하기 위해 Mask R-CNN와 더 복잡한 하이브리드 태스크 캐스케이드(HTC) 모델에 모두 적용한다.
  • 전체 성능 향상을 위해 외부 데이터(COCO 및 COCO-Stuff)를 활용해 사전 학습 및 시맨틱 헤드 감독을 수행한다.
  • LVIS 테스트 세트에서 최종 성능을 추가로 향상시키기 위해 앙상블 및 다중 해상도 추론을 적용한다.

실험 결과

연구 질문

  • RQ1최신 인스턴스 세그멘테이션 모델이 LVIS와 같은 장꼬리 데이터셋에서 성능이 떨어지는 이유는 무엇인가?
  • RQ2성능 저하의 주요 원인이 제안 영역 생성의 열악함인지, 아니면 제안 영역 분류의 정확도 부족인가?
  • RQ3균형 잡힌 샘플링으로 분류 헤드를 재학습하면 희귀 클래스의 인식 성능이 크게 향상되는가?
  • RQ4꼬리 클래스 성능 측면에서 제안된 보정 방법은 이미지 수준 반복 샘플링과 비교해 어떻게 성능을 내는가?
  • RQ5복잡한 다단계 모델인 HTC에 이 보정 방법을 적용해도 빈도 높은 클래스의 성능 저하 없이 효과적으로 적용될 수 있는가?

주요 결과

  • 기본 모델인 Mask R-CNN는 (0,10) 꼬리 클래스 박스에서 mAP가 0.0에 불과하여 희귀 객체 인식에 심각한 실패를 보였다.
  • LVIS에서 제안 영역의 리콜은 COCO 대비 8.8% 감소했고, AP는 45.1% 감소하여 분류 정확도가 주요 성능 저하 요인임을 확인했다.
  • 제안 영역에 진짜 레이블을 사용할 경우 (0,10) 박스의 mAP가 39.7로 상승하여 핵심 문제점이 제안 생성이 아니라 분류 오류임을 입증했다.
  • 제안된 보정 방법은 Mask R-CNN에서 (0,10) 박스의 mAP를 0.0에서 8.6으로, HTC에서는 0.0에서 12.7로 상승시켜 희귀 클래스에서 뚜렷한 성능 향상을 보였다.
  • 앙상블 및 다중 해상도 추론을 적용한 최종 모델은 LVIS 테스트 세트에서 39.21 AP를 달성하여 최고의 베이스라인(30.0 AP)보다 뚜렷한 향상을 보였다.
  • 희귀 클래스에서 이미지 수준 반복 샘플링을 능가하고 많은 샘플 클래스에서의 성능 저하가 적어 더 우수한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.