[논문 리뷰] ContrastMask: Contrastive Learning to Segment Every Thing
ContrastMask는 기본 카테고리에서의 마스크 주석과 신규 카테고리에서의 의사 마스크를 활용하여 클래스에 관계없이 마스크 세그멘테이션 모델을 훈련하는 통합적인 픽셀 수준의 대비 학습 프레임워크를 제안한다. 기본 카테고리와 신규 카테고리 간에 배경 및 전경 쿼리를 공유하고, 쿼리 공유 대비 손실을 사용함으로써 전경-배경 특징 간의 구분 능력을 향상시켜 COCO에서 부분적 감독 하에 39.8 mAP의 최신 기술 수준 성능을 달성한다.
Partially-supervised instance segmentation is a task which requests segmenting objects from novel unseen categories via learning on limited seen categories with annotated masks thus eliminating demands of heavy annotation burden. The key to addressing this task is to build an effective class-agnostic mask segmentation model. Unlike previous methods that learn such models only on seen categories, in this paper, we propose a new method, named ContrastMask, which learns a mask segmentation model on both seen and unseen categories under a unified pixel-level contrastive learning framework. In this framework, annotated masks of seen categories and pseudo masks of unseen categories serve as a prior for contrastive learning, where features from the mask regions (foreground) are pulled together, and are contrasted against those from the background, and vice versa. Through this framework, feature discrimination between foreground and background is largely improved, facilitating learning of the class-agnostic mask segmentation model. Exhaustive experiments on the COCO dataset demonstrate the superiority of our method, which outperforms previous state-of-the-arts.
연구 동기 및 목표
- 기본 카테고리에만 마스크 주석이 존재하고, 신규 카테고리에는 상자 수준의 주석만 존재하는 부분적 감독 하의 인스턴스 세그멘테이션 문제를 해결하기 위해.
- 훈련 중에 기본 카테고리와 신규 카테고리 데이터를 모두 활용하여 전경과 배경 간의 특징 구분 능력을 향상시키기 위해.
- 기본 카테고리와 신규 카테고리 간의 일반화 격차를 해소하기 위해 두 카테고리 모두에 걸쳐 통합된 대비 학습을 구현하기 위해.
- 제한된 마스크 주석과 신규 카테고리에서 생성된 의사 마스크를 통해 효과적인 모델 학습을 가능하게 하여 주석 부담을 줄이기 위해.
- 미리 보지 않은 객체 카테고리로도 잘 일반화되는 강력한 클래스에 관계없는 마스크 세그멘테이션 모델을 개발하기 위해.
제안 방법
- 기본 카테고리와 신규 카테고리의 마스크 영역 내외에서 특징을 평균화하여 전경 및 배경 쿼리를 공유하는 픽셀 수준의 대비 손실을 도입한다.
- 신규 카테고리의 의사 마스크는 클래스 활성화 맵(CAM)을 사용하여 생성되며, 이는 양성 및 음성 키를 정의하는 영역 사전 정보로 기능한다.
- 특수한 샘플링 전략을 통해 마스크 영역 내외에서 키를 선택하여, 동일한 영역의 특징이 서로 가까워지고 반대 영역의 특징과 대비되도록 한다.
- 대비 손실은 각 제안 영역에 대해 적용되며, 공유 쿼리를 통해 기본 카테고리와 신규 카테고리 간에 일관된 특징 학습이 가능하다.
- 대비 학습 헤드에서 유도된 특징은 클래스에 관계없는 마스크 헤드에 융합되어 최종 인스턴스 세그멘테이션을 수행한다.
- 고신뢰도 CAM 영역을 사전 정보로 사용하여 노이즈가 있는 의사 마스크에 대한 저항력을 향상시킨다.
실험 결과
연구 질문
- RQ1기본 카테고리와 신규 카테고리에서 함께 훈련하는 통합된 대비 학습 프레임워크가 마스크 세그멘테이션 성능 향상에 기여할 수 있는가?
- RQ2기본 카테고리와 신규 카테고리 간에 전경 및 배경 쿼리를 공유함으로써 전경-배경 특징 간의 구분 능력이 향상되는가?
- RQ3실제 마스크가 없는 신규 카테고리의 경우, CAM에서 유도된 의사 마스크가 대비 학습의 사전 정보로 효과적으로 기능할 수 있는가?
- RQ4제안 영역별 쿼리 학습 대비 쿼리 공유 전략은 세그멘테이션 성능 측면에서 어떻게 비교되는가?
- RQ5기본 카테고리와 신규 카테고리 데이터를 모두 사용할 경우, 신규 카테고리로의 일반화 능력 향상 정도는 어느 정도인가?
주요 결과
- ContrastMask는 백본으로 ResNeXt-101-FPN을 사용하여 신규 카테고리에서 39.8 mAP를 달성하며, 이는 이전 최신 기술 수준의 방법들을 크게 능가한다.
- 제거 실험 결과, 쿼리 공유가 필수적임을 확인하였으며, 이를 제거하면 mAP가 35.1에서 32.7로 감소하여 특징 정렬에 있어 핵심적인 역할을 한다는 것을 입증한다.
- 기본 카테고리만을 사용해 대비 학습을 수행할 경우 33.5 mAP를 기록하지만, 모든 카테고리(기본 + 신규)를 사용할 경우 35.1 mAP로 향상되어 신규 카테고리 데이터의 포함이 유의미한 이점을 제공함을 보여준다.
- 실제 마스크를 사용할 경우 CAM 기반 의사 마스크 대비 mAP가 1.4점 향상되며, 이는 의사 마스크의 품질이 성능을 제한하는 주요 원인임을 시사한다.
- 쿼리 공유 전략은 노이즈가 있는 CAM에 의해 악영향을 받는 것을 줄여주며, 완벽하지 않은 의사 마스크 조건에서도 강력한 성능을 유지한다.
- 추가 마스크 주석 없이도 신규 카테고리로 효과적으로 일반화되므로, 실세계의 자원이 제한된 환경에 적합한 솔루션을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.