Skip to main content
QUICK REVIEW

[논문 리뷰] Seesaw Loss for Long-Tailed Instance Segmentation

Jiaqi Wang, Wenwei Zhang|arXiv (Cornell University)|2020. 08. 23.
Advanced Neural Network Applications참고 문헌 57인용 수 5
한 줄 요약

이 논문은 장기적 분포에서의 기울기 불균형을 동적으로 보정하기 위해, 꼬리 클래스의 과잉 처벌을 줄이기 위한 완화 요소와 잠재적 오진 억제를 위한 보상 요소를 적용하는 동적이고 자기 캘리브레이션 가능한 손실 함수인 Seesaw Loss를 제안한다. 이는 복잡한 사전 데이터 분포 계산 없이 실시간 클래스 샘플 누적 및 오분류 패atters를 기반으로 기울기를 동적으로 조정하며, 별도의 데이터 샘플링 전략이나 복잡한 트레이닝 파ipeline 없이도 Mask R-CNN 기반으로 Cross-Entropy Loss 대비 6.0% 향상된 AP 성능과 Cascade Mask R-CNN 기반으로 6.4% 향상된 성능을 달성한다. 이는 간단한 엔드 투 엔드 트레이닝 파이프라인을 통해 달성되었다.

ABSTRACT

Instance segmentation has witnessed a remarkable progress on class-balanced benchmarks. However, they fail to perform as accurately in real-world scenarios, where the category distribution of objects naturally comes with a long tail. Instances of head classes dominate a long-tailed dataset and they serve as negative samples of tail categories. The overwhelming gradients of negative samples on tail classes lead to a biased learning process for classifiers. Consequently, objects of tail categories are more likely to be misclassified as backgrounds or head categories. To tackle this problem, we propose Seesaw Loss to dynamically re-balance gradients of positive and negative samples for each category, with two complementary factors, i.e., mitigation factor and compensation factor. The mitigation factor reduces punishments to tail categories w.r.t. the ratio of cumulative training instances between different categories. Meanwhile, the compensation factor increases the penalty of misclassified instances to avoid false positives of tail categories. We conduct extensive experiments on Seesaw Loss with mainstream frameworks and different data sampling strategies. With a simple end-to-end training pipeline, Seesaw Loss obtains significant gains over Cross-Entropy Loss, and achieves state-of-the-art performance on LVIS dataset without bells and whistles. Code is available at https://github.com/open-mmlab/mmdetection.

연구 동기 및 목표

  • 장기적 분포 데이터셋에서 헤드 클래스가 지배적으로 작용하여 꼬리 클래스를 배경 또는 헤드 클래스로 잘못 분류하는 문제를 해결한다.
  • 헤드 클래스에서 유래한 지배적인 음성 샘플로 인해 꼬리 클래스에 기인한 기울기 불균형 문제를 해결한다.
  • 사전에 계산된 데이터 분포에 의존하지 않고 실시간 클래스 샘플 누적 및 오분류 패턴을 기반으로 기울기를 동적으로 조정하는 손실 함수를 개발한다.
  • 복잡한 데이터 샘플링 또는 분리된 트레이닝 파이프라인 없이도 장기적 분포 벤치마크(예: LVIS)에서 최고 성능을 달성한다.
  • 모든 데이터 샘플러 및 주류 인스턴스 세그멘테이션 프레임워크와 호환되며 분포에 관계없이 적용 가능한 메서드를 확보한다.

제안 방법

  • 두 가지 상호보완적인 요소인 완화 및 보상 요소를 사용해 각 카테고리의 기울기를 동적으로 재균형화하는 Seesaw Loss를 도입한다.
  • 실시간 누적된 클래스 간 샘플 비율을 기반으로 꼬리 클래스의 음성 샘플에 대한 손실 기울기를 감소시키는 완화 요소를 적용한다.
  • 꼬리 클래스의 잘못 분류된 인스턴스에 대한 페널티를 증가시켜 오진 억제를 위한 보상 요소를 적용한다.
  • 실시간 누적 샘플 수를 사용해 진정한 데이터 분포를 근사함으로써 동적이고 자기 캘리브레이션 가능한 균형 조정을 가능하게 한다.
  • Mask R-CNN 및 Cascade Mask R-CNN와 같은 객체 검출기의 분류 브랜치에 Seesaw Loss를 아키텍처 변경 없이 통합한다.
  • TSD, CARAFE, 향상된 넹, 듀얼 헤드 분류와 같은 강력한 트레이닝 구성 요소와 결합하여 성능 향상을 추가로 달성한다.

실험 결과

연구 질문

  • RQ1정적 재가중 기반이 아닌, 장기적 분포 데이터로 인한 기울기 불균형 문제를 인스턴스 세그멘테이션에서 효과적으로 완화할 수 있는 방법은 무엇인가?
  • RQ2실시간 트레이닝 통계에 적응하는 동적 손실 함수가 오진 수를 증가시키지 않으면서도 꼬리 클래스의 성능 향상을 이룰 수 있는가?
  • RQ3Seesaw Loss는 기존의 Cross-Entropy Loss 대비 LVIS와 같은 장기적 분포 벤치마크에서 얼마나 높은 인스턴스 세그멘테이션 정확도 향상을 이룰 수 있는가?
  • RQ4Seesaw Loss는 랜덤 샘플링 및 반복 요소 샘플링을 포함한 다양한 검출 프레임워크 및 데이터 샘플링 전략에서 효과적인가?
  • RQ5Seesaw Loss는 장기적 학습에서 복잡한 분리된 트레이닝 파이프라인의 필요성을 제거할 수 있는가?

주요 결과

  • Seesaw Loss는 랜덤 샘플링을 사용한 Mask R-CNN 기반에서 LVIS v1 검증 세트에서 Cross-Entropy Loss 대비 6.0%의 절대 AP 향상을 달성한다.
  • 반복 요소 샘플러를 사용할 경우, 동일한 Mask R-CNN 설정에서 Seesaw Loss는 Cross-Entropy Loss 대비 2.1%의 AP 향상을 기록한다.
  • Cascade Mask R-CNN 기반에서 랜덤 샘플링을 사용할 경우 Seesaw Loss는 6.4%의 AP 향상을 기록하고, 반복 요소 샘플링을 사용할 경우 2.3%의 향상을 기록함으로써 뛰어난 일반화 성능을 입증한다.
  • 외부 데이터나 ImageNet-1k 사전 학습 외 추가 애너테이션 없이도 단일 HTC-Lite 모델로 LVIS 테스트-디브 세트에서 38.92%의 AP를 달성한다.
  • Seesaw Loss는 장기적 분포 이미지 분류 벤치마크인 ImageNet-LT에서 분류 정확도를 6% 향상시켜 인스턴스 세그멘테이션 외 응용 분야에서도 유연성을 입증한다.
  • 제거 분석 결과, TSD, CARAFE, 듀얼 헤드 분류와 같은 강력한 구성 요소와 조합하더라도 Seesaw Loss가 기존 방법을 능가함을 확인하여, 플러그인 모듈로서의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.