Skip to main content
QUICK REVIEW

[논문 리뷰] BoxTeacher: Exploring High-Quality Pseudo Labels for Weakly Supervised Instance Segmentation

Tianheng Cheng, Xinggang Wang|arXiv (Cornell University)|2022. 10. 11.
Advanced Neural Network Applications인용 수 4
한 줄 요약

BoxTeacher는 박스 감독 모델에서 유도한 고품질의 가짜 마스크를 활용하는 엔드 투 엔드, 자기학습 프레임워크를 제안한다. 마스크 인식 신뢰도 점수와 노이즈 인식 손실을 도입하여 신뢰할 수 있는 가짜 마스크를 선택적으로 사용함으로써 학생 모델 성능을 향상시킨다. ResNet-50를 사용할 경우 COCO에서 35.0 mask AP를 달성하고, ResNet-101을 사용할 경우 36.5를 기록하여 이전의 최고 성능 방법들을 크게 능가하며, 완전 감독 학습 접근법과의 격차를 좁히고 있다.

ABSTRACT

Labeling objects with pixel-wise segmentation requires a huge amount of human labor compared to bounding boxes. Most existing methods for weakly supervised instance segmentation focus on designing heuristic losses with priors from bounding boxes. While, we find that box-supervised methods can produce some fine segmentation masks and we wonder whether the detectors could learn from these fine masks while ignoring low-quality masks. To answer this question, we present BoxTeacher, an efficient and end-to-end training framework for high-performance weakly supervised instance segmentation, which leverages a sophisticated teacher to generate high-quality masks as pseudo labels. Considering the massive noisy masks hurt the training, we present a mask-aware confidence score to estimate the quality of pseudo masks and propose the noise-aware pixel loss and noise-reduced affinity loss to adaptively optimize the student with pseudo masks. Extensive experiments can demonstrate the effectiveness of the proposed BoxTeacher. Without bells and whistles, BoxTeacher remarkably achieves 35.0 mask AP and 36.5 mask AP with ResNet-50 and ResNet-101 respectively on the challenging COCO dataset, which outperforms the previous state-of-the-art methods by a significant margin and bridges the gap between box-supervised and mask-supervised methods. The code and models will be available at https://github.com/hustvl/BoxTeacher.

연구 동기 및 목표

  • 박스 감독 모델에서 유도한 고품질의 가짜 세그멘테이션 마스크가 약한 감독 기반 인스턴스 세그멘테이션에 효과적으로 활용될 수 있는지 조사하는 것.
  • 노이즈가 많은 가짜 마스크와 낮은 일반화 능력으로 인해 제한되는 단순 자기학습의 한계를 해결하는 것.
  • 선생-학생 간 상호 보완적 개선을 통해 모델 성능을 향상시키는 견고한 엔드 투 엔드 학습 프레임워크를 개발하는 것.
  • 새로운 마스크 인식 신뢰도 점수와 노이즈 인식 손실 함수를 통해 저품질 가짜 마스크의 영향을 최소화하는 것.

제안 방법

  • 선생 네트워크는 박스 기반 가짜 마스크 할당 전략을 사용하여 고품질의 가짜 인스턴스 마스크를 생성하고, 이를 진짜 박스에 할당한다.
  • 각 가짜 마스크의 품질을 추정하기 위해 마스크 인식 신뢰도 점수가 도입되어 저품질 예측을 걸러낸다.
  • 학생 네트워크는 진짜 박스와 가짜 마스크를 모두 사용하여 노이즈 인식 픽셀 손실과 노이즈 감소된 유사도 손실을 통해 학습된다.
  • 학생의 진화하는 가중치를 기반으로 선생 네트워크를 점진적으로 업데이트하기 위해 지수 이동 평균(EMA)이 적용된다.
  • 학생의 입력 이미지에 강력한 데이터 증강 기법을 적용하여 일관성과 내구성을 향상시킨다.
  • 이 프레임워크는 엔드 투 엔드이며, 기반 인스턴스 세그멘테이션 아키텍처에 종속되지 않아 광범위한 적용 가능성을 가진다.

실험 결과

연구 질문

  • RQ1박스 감독 모델에서 유도한 고품질의 가짜 세그멘테이션 마스크가 약한 감독 기반 인스턴스 세그멘테이션 향상에 효과적으로 활용될 수 있는가?
  • RQ2고품질 마스크가 존재하는 상황에서도 단순 자기학습이 큰 성과 향상을 이룰 수 없는 이유는 무엇인가?
  • RQ3약한 감독 기반 인스턴스 세그멘테이션의 자기학습 과정에서 노이즈가 많은 가짜 마스크의 영향을 어떻게 최소화할 수 있는가?
  • RQ4신뢰도 점수와 노이즈 인식 손실 함수를 갖춘 협업형 선생-학생 프레임워크가 표준 자기학습 방식을 뛰어넘어 성능 향상을 이룰 수 있는가?
  • RQ5데이터 증강을 통한 일관성 정규화가 노이즈가 많은 가짜 레이블로부터의 학습을 얼마나 향상시키는가?

주요 결과

  • BoxTeacher는 ResNet-50를 사용할 경우 COCO에서 35.0 mask AP를 달성하고, ResNet-101을 사용할 경우 36.5를 기록하여 이전의 최고 성능 방법들을 크게 능가한다.
  • 제안된 마스크 인식 신뢰도 점수가 IoU, 평균 엔트로피, IoU 기반 신뢰도와 같은 다른 품질 추정 방법보다 더 뛰어난 성능을 내는 것으로 나타났다.
  • 가짜 마스크를 사용한 단순 자기학습은 박스만 사용한 학습보다 성능이 열 劣하므로, 노이즈 인식 학습 전략의 필요성이 부각된다.
  • BoxTeacher는 표준 학습 방식보다 강력한 데이터 증강에 더 견고하며, 특히 장기간의 학습 스케줄에서 두드러진다.
  • 강력한 증강 기법의 사용은 약한 감독 기반 성능을 +0.6 AP 향상시키지만, 완전 감독 기반 검출에는 거의 영향을 주지 않아, 이 기법이 노이즈가 많은 가짜 레이블을 다루는 데서 중요한 역할을 한다는 점을 시사한다.
  • 지수 이동 평균(EMA)은 성능에 거의 영향을 주지 않아, BoxTeacher의 성능 향상 요인이 주로 가짜 레이블링에서 비롯되며, 모델 평균화에서 비롯되지 않는다는 점을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.