Skip to main content
QUICK REVIEW

[논문 리뷰] 1st Place Solution for the UVO Challenge on Image-based Open-World Segmentation 2021

Yuming Du, W. Guo|arXiv (Cornell University)|2021. 10. 19.
Advanced Neural Network Applications참고 문헌 23인용 수 5
한 줄 요약

이 논문은 먼저 클래스 무관, 앵커 기반 검출기(카스케이드 RPN, SimOTA 레이블 할당, Swin-L 백본 포함)를 사용해 객체를 검출한 후, 추출된 바운딩 박스를 기반으로 클래스 무관 세그멘테이션 네트워크를 적용하는 이단계(instance segmentation) 프레임워크를 제안한다. 이 방법은 COCO에서 AR@1000이 77.4이고 UVO-Sparse 테스트 세트에서 61.77인 2021 UVO 챌린지에서 1등을 기록했다.

ABSTRACT

We describe our two-stage instance segmentation framework we use to compete in the challenge. The first stage of our framework consists of an object detector, which generates object proposals in the format of bounding boxes. Then, the images and the detected bounding boxes are fed to the second stage, where a segmentation network is applied to segment the objects in the bounding boxes. We train all our networks in a class-agnostic way. Our approach achieves the first place in the UVO 2021 Image-based Open-World Segmentation Challenge.

연구 동기 및 목표

  • 실세계 이미지에서 이전에 본 적 없는 객체 카테고리까지 검출하고 세그멘테이션할 수 있도록 오픈월드 인스턴스 세그멘테이션 문제를 해결하기 위해.
  • 운동 흐림, 가림, 극단적인 자세 등 복잡한 상황에서 검출의 재현율과 정렬 정확도를 향상시키기 위해.
  • 다양한 데이터셋에서 훈련된 강력한 검출기 및 세그멘테이션 컴포넌트를 조합하여 UVO 2021 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.
  • 오픈월드 환경에서 객체 검출에 있어 분리된 헤드, 적응형 컨볼루션, 고도의 레이블 할당 기법의 효과를 입증하기 위해.

제안 방법

  • 이 방법은 이단계 파이프라인을 사용한다: 먼저 앵커 기반 객체 검출기가 Swin-L 트랜스포머 백본과 FPN, CARAFE를 활용해 특징 업샘플링을 수행하며 바운딩 박스 제안을 생성한다.
  • 검출 네트워크는 탈리스커블 RPN, 변형 가능한 컨볼루션(DCNv2), 분리된 분류 및 회귀 헤드, 제안 품질을 개선하기 위한 IoU 브랜치를 활용한다.
  • SimOTA 레이블 할당은 분류 및 회귀 헤드 각각에 별도로 적용되며, 서로 다른 top-K 설정을 사용해 양호한 샘플 선택을 향상시킨다.
  • 세그멘테이션 단계는 UperNet 기반 아키텍처를 사용하며, 예측된 바운딩 박스로부터 원본 이미지의 영역을 잘라내어 처리한다. 백본은 Swin-L을 사용한다.
  • 모든 모델는 클래스 무관 방식으로 훈련되어, 이미 본 카테고리에 대한 편향을 줄이고 오픈월드 객체로의 일반화 능력을 향상시킨다.
  • 추론 시에는 플립을 활용한 테스트 시간 증강을 사용하며, ImageNet-22k에서 미세조정된 모델을 COCO, OpenImages, PASCAL VOC, UVO 데이터셋에서 훈련 및 미세조정한다.

실험 결과

연구 질문

  • RQ1고도의 가림, 흐림, 희귀한 객체 형태가 존재하는 오픈월드 환경에서 어떻게 객체 검출 성능을 향상시킬 수 있는가?
  • RQ2카스케이드 RPN, SimOTA, 분리된 헤드와 같은 고도의 검출 컴포넌트가 오픈월드 인스턴스 세그멘테이션에서 재현율과 정렬 정확도 향상에 얼마나 기여하는가?
  • RQ3다양한 데이터셋에서 훈련된 이중단계 검출-세그멘테이션 파이프라인은 엔드 투 엔드 방법보다 오픈월드 세그멘테이션에서 더 우수한 성능을 낼 수 있는가?
  • RQ4실세계 벤치마크인 UVO에서 예측되지 않은 객체 카테고리로의 일반화를 가능하게 하기 위해 클래스 무관 훈련이 얼마나 효과적인가?

주요 결과

  • 모든 컴포넌트를 추가한 후 최종 검출기는 COCO val2017에서 AR@1000이 77.4를 기록하며, 베이스라인(58.3)을 크게 앞서는 성능을 보였다.
  • Swin-L 트랜스포머 백본을 사용함으로써 AR@1000이 ResNet-50를 사용한 경우(73.9)에서 77.4로 향상되어 오픈월드 검출에 효과적임을 입증했다.
  • 전체 방법은 UVO-Sparse 테스트 세트에서 AR@100에 61.77을 기록하여 2위 팀(58.06)을 크게 앞서는 성과를 냈다.
  • 제거 실험 결과, SimOTA와 IoU 브랜치를 추가함으로써 AR@1000이 2.5점 향상되었으며, 분리된 헤드와 CARAFE는 각각 1.5점, 0.3점의 기여를 하였다.
  • COCO, OpenImages, PASCAL VOC에서 훈련된 세그멘테이션 네트워크는 운동 흐림과 강한 가림 조건에서도 고품질 마스크를 생성했으며, 정성적 결과에서 이를 확인할 수 있었다.
  • UVO-Sparse 및 UVO-Dense 데이터셋에서 6 에포크 동안 미세조정함으로써 검출 성능 향상이 관찰되어 도메인 특화 적응의 가치를 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.