Skip to main content
QUICK REVIEW

[논문 리뷰] 1st Place Solution of LVIS Challenge 2020: A Good Box is not a Guarantee of a Good Mask

Jingru Tan, Gang Zhang|arXiv (Cornell University)|2020. 09. 03.
Central Venous Catheters and Hemodialysis참고 문헌 17인용 수 13
한 줄 요약

이 논문은 장기 꼬리 분포를 보이는 LVIS 데이터셋에서 인스턴스 세그멘테이션을 위한 이단계 학습 방법을 제안하며, 클래스 불균형과 고품질 마스크 예측 문제를 동시에 해결한다. 경계 상자 크기와 마스크-경계 상자 면적 비율에 기반한 새로운 제안 할당 전략과, 딱힌 손실과 가중치가 부여된 교차 엔트로피를 조합한 균형 잡힌 마스크 손실을 도입하여, LVIS v1.0 검증 세트에서 41.5 AP, 테스트-디브 세트에서 41.2 AP를 달성하며 기준 모델을 크게 능가한다.

ABSTRACT

This article introduces the solutions of the team lvisTraveler for LVIS Challenge 2020. In this work, two characteristics of LVIS dataset are mainly considered: the long-tailed distribution and high quality instance segmentation mask. We adopt a two-stage training pipeline. In the first stage, we incorporate EQL and self-training to learn generalized representation. In the second stage, we utilize Balanced GroupSoftmax to promote the classifier, and propose a novel proposal assignment strategy and a new balanced mask loss for mask head to get more precise mask predictions. Finally, we achieve 41.5 and 41.2 AP on LVIS v1.0 val and test-dev splits respectively, outperforming the baseline based on X101-FPN-MaskRCNN by a large margin.

연구 동기 및 목표

  • 희귀 카테고리가 일반 카테고리보다 훨씬 적은 애너테이션을 가지는 LVIS 데이터셋의 극심한 장기 꼬리 분포를 해결한다.
  • 경계 상자에 비해 얇은 마스크를 가진 카테고리의 인스턴스 세그멘테이션 마스크 품질을 향상시킨다.
  • 특징 맵 해상도 불일치로 인해 잘 정렬된 경계 상자도 정확한 마스크 예측을 보장하지 못하는 한계를 극복한다.
  • 표준 검출기에서 LVIS에서 관찰되는 바와 같이 경계 상자 AP와 마스크 AP 사이의 성능 격차를 줄인다.
  • 표현 학습과 타겟 헤드 최적화를 조합하여 LVIS v1.0에서 최신 기술 성능을 달성한다.

제안 방법

  • 표현 학습 단계에서 상호 클래스 불균형을 완화하기 위해 Equalization Loss (EQL)와 Repeat Factor Sampling (RFS)를 적용한다.
  • Mosaic, 회전, 스케일 저자극 데이터 증강을 사용하고, Open Images 및 LVIS에서의 의사 레이블을 활용한 자기학습을 통해 표현을 향상시킨다.
  • 경계 상자 크기와 마스크-경계 상자 면적 비율을 기반으로 마스크 특징을 할당하는 새로운 제안 할당 전략을 제안하며, Eq. (1)을 사용해 특징 맵 수준을 선택한다.
  • 딱힌 손실과 가중치가 부여된 이진 교차 엔트로피를 조합한 균형 잡힌 마스크 손실을 도입하며, 면적 비율에 기반한 동적 배경 가중치를 적용한다. 이는 Eq. (2)에 정의되어 있다.
  • 미세 조정 단계에서 Balanced GroupSoftmax를 적용하여 희귀 및 일반 카테고리 간 분류기 가중치를 균형 잡는다.
  • 테스트 시 시간 증강을 통해 스케일 인식 경계 상자 필터링, 희귀 카테고리에 대한 점수 재가중치, 상자 크기 및 면적 비율에 기반한 마스크 예측 선택을 수행한다.

실험 결과

연구 질문

  • RQ1희귀 애너테이션이 많은 LVIS에서 오픈-보기 데이터셋의 의사 레이블을 활용한 자기학습이 표현 학습을 향상시킬 수 있는가?
  • RQ2제안 할당 시 마스크-경계 상자 면적 비율을 고려함으로써 얇은 마스크 인스턴스의 마스크 품질이 향상되는가?
  • RQ3얇은 마스크에서 배경-전경 픽셀 불균형을 고려한 균형 잡힌 마스크 손실이 세그멘테이션 정확도를 향상시킬 수 있는가?
  • RQ4표현 학습 후 헤드 전용 미세 조정을 수행하는 이단계 학습 파이프라인은 경계 상자와 마스크 예측 간 AP 격차를 어느 정도 줄일 수 있는가?
  • RQ5EQL, RFS, 자기학습 및 새로운 헤드 구성 요소의 조합이 장기 꼬리 분포를 가진 LVIS 벤치마크에서 최신 기술 성능을 달성하는 데 얼마나 효과적인가?

주요 결과

  • 제안된 방법은 LVIS v1.0 검증 세트에서 41.5 AP를 달성하였으며, ResNeXt-101 기반 기준 모델인 Mask-RCNN의 27.26 AP보다 뚜렷한 향상이 있었다.
  • 테스트-디브 세트에서의 성능은 41.23 AP를 기록하였으며, 주최자가 제공한 기준 모델보다 14점 이상 높게 나타났다.
  • 마스크 AP와 경계 상자 AP 간 격차는 기준 모델의 2.9에서 2.3으로 감소하여 마스크 품질 향상이 확인되었다.
  • 절단 실험 결과, Balanced GroupSoftmax, 새로운 제안 할당 전략, 균형 잡힌 마스크 손실을 조합하면 AP가 33.2에서 38.8로 5.6점 향상되었다.
  • Open Images 의사 레이블을 활용한 자기학습과 instaboost 증강이 최종 모델의 AP를 2.5점 향상시켰다.
  • 스케일 인식 필터링과 희귀 카테고리에 대한 점수 재가중치를 포함한 테스트 시 시간 증강이 성능을 0.3~0.5 AP 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.