Skip to main content
QUICK REVIEW

[논문 리뷰] RefineMask: Towards High-Quality Instance Segmentation with Fine-Grained Features

Gang Zhang, Xin Lu|arXiv (Cornell University)|2021. 04. 17.
Advanced Neural Network Applications참고 문헌 30인용 수 5
한 줄 요약

RefineMask는 마스크 예측 과정에 세분화된 특징을 반복적으로 통합함으로써 경계 정확도를 크게 향상시키는 다단계 정련 프레임워크를 제안한다. 점진적인 업샘플링과 경계 인식 정련을 통해 고해상도 의미 특징을 RoI 정렬 특징과 융합함으로써, RefineMask는 COCO, LVIS, Cityscapes에서 Mask R-CNN보다 2.6–3.8 AP 향상으로 최신 기술 수준을 달성하였으며, 테스트-디브 세트에서 LVIS 2020 도전 대회 수상자보다 1.3 AP 높은 성능을 기록하였다.

ABSTRACT

The two-stage methods for instance segmentation, e.g. Mask R-CNN, have achieved excellent performance recently. However, the segmented masks are still very coarse due to the downsampling operations in both the feature pyramid and the instance-wise pooling process, especially for large objects. In this work, we propose a new method called RefineMask for high-quality instance segmentation of objects and scenes, which incorporates fine-grained features during the instance-wise segmenting process in a multi-stage manner. Through fusing more detailed information stage by stage, RefineMask is able to refine high-quality masks consistently. RefineMask succeeds in segmenting hard cases such as bent parts of objects that are over-smoothed by most previous methods and outputs accurate boundaries. Without bells and whistles, RefineMask yields significant gains of 2.6, 3.4, 3.8 AP over Mask R-CNN on COCO, LVIS, and Cityscapes benchmarks respectively at a small amount of additional computational cost. Furthermore, our single-model result outperforms the winner of the LVIS Challenge 2020 by 1.3 points on the LVIS test-dev set and establishes a new state-of-the-art. Code will be available at https://github.com/zhanggang001/RefineMask.

연구 동기 및 목표

  • Mask R-CNN와 같은 이단계 마스크 세분화 방법에서의 해상도가 낮은 마스크 품질 문제를 해결하기 위해, 다운샘플링과 RoI 풀링으로 인해 세부 정보가 손실되는 문제를 해결한다.
  • 마스크 예측 과정 중 고해상도 특징을 유지하고 통합함으로써 마스크 세분화의 경계 정확도를 향상시키는 것을 목표로 한다.
  • 추가 데이터나 복잡한 아키텍처에 의존하지 않고도 마스크 품질을 향상시키는 경량의 다단계 정련 메커니즘을 개발하는 것.
  • LVIS와 Cityscapes와 같은 도전적인 벤치마크에서 마스크 세분화의 새로운 최신 기술 수준을 확립하는 것.

제안 방법

  • FPN의 최고해상도 특징 맵에서 유래한 세분화된 특징을 점진적인 업샘플링과 함께 사용하여, 저해상도 특징 맵에서의 마스크 예측을 다단계로 정련하는 다단계 정련 헤드를 도입한다.
  • 경계에 민감한 특징에 주목함으로써 경계 영역의 마스크 정확도를 향상시키는 경계 인식 정련 전략을 사용한다.
  • 각 정련 단계에서 스킵 연결과 병합을 통해 FPN의 P2 수준에서 유래한 고해상도 의미 특징을 개별 인스턴스 특징과 융합한다.
  • 각 단계에서 맥락적 인스턴스 특징과 세분화된 공간 세부 정보를 모두 사용하여 마스크 예측를 정련하는 수정된 마스크 헤드를 활용한다.
  • 초기 특징 추출에는 RoIAlign을 활용하지만, 각 정련 단계에서 고해상도 특징을 통합함으로써 조기 다운샘플링을 피한다.
  • 표준 교차 엔트로피 손실과 딱스 손실을 함께 사용하여 엔드 투 엔드로 모델을 훈련시키며, 마스크 품질과 경계 정밀도를 동시에 최적화한다.

실험 결과

연구 질문

  • RQ1세분화된 특징을 반복적으로 정련함으로써 이단계 마스크 세분화에서 마스크 품질을 크게 향상시킬 수 있는가?
  • RQ2여러 단계에서 고해상도 의미 특징을 통합할 경우, 표준 RoI 기반 방법과 비교해 경계 정확도에 어떤 영향을 미치는가?
  • RQ3추가 데이터나 복잡한 검출 헤드 없이도 다단계 정련 헤드가 PointRend 및 HTC와 같은 최신 기술 수준의 방법을 초월할 수 있는가?
  • RQ4경계 인식 정련 전략은 LVIS와 Cityscapes와 같이 세밀한 애너테이션을 제공하는 데이터셋에서 측정 가능한 성능 향상을 이끌 수 있는가?
  • RQ5단일 모델인 RefineMask는 추가로 인간 애너테이션된 데이터를 사용하지 않고도 LVIS 챌린지 2020 수상자보다 뛰어난 성능을 낼 수 있는가?

주요 결과

  • COCO val2017에서 RefineMask는 Mask R-CNN 대비 2.6 AP 향상을 기록하였으며, LVIS와 Cityscapes에서는 각각 3.4와 3.8 AP 향상으로, 다양한 데이터셋에서 일관된 성능 향상을 입증하였다.
  • LVISv1.0 테스트-디브 세트에서 RefineMask는 LVIS 챌린지 2020 수상자보다 1.3 AP 높은 성능을 기록하여 새로운 최신 기술 수준을 확립하였다.
  • LVIS에서 대형 객체에 대해 RefineMask는 Mask R-CNN 대비 6.0 AP 향상을 기록하였으며, 이는 복잡하고 세밀한 영역을 효과적으로 처리할 수 있음을 시사한다.
  • Cityscapes에서 RefineMask는 Mask R-CNN 대비 3.8 AP 향상을 기록하였으며, 특히 세밀한 객체 부분과 경계 영역에서 뛰어난 성능을 보였다.
  • 정성적 결과에서는 일부 경우에서 RefineMask가 지도 데이터보다 더 높은 품질의 마스크를 생성하는 것으로 나타났으며, 특히 날카운 경계에서 두드러진 성능을 보였다. 이는 평가 지표를 더욱 엄격하게 설정할 필요가 있음을 시사한다.
  • 이러한 성과는 계산 비용의 미미한 증가만으로 달성되었으며, 실세계 적용에 실용적임을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.