Skip to main content
QUICK REVIEW

[논문 리뷰] Dynamic Feature Regularized Loss for Weakly Supervised Semantic Segmentation

Bingfeng Zhang, Jimin Xiao|arXiv (Cornell University)|2021. 08. 03.
Advanced Neural Network Applications참고 문헌 40인용 수 12
한 줄 요약

이 논문은 스크래치(annotation)를 사용한 약한 지도 학습 세그멘테이션을 위한 동적 특징 정규화(Dynamic Feature Regularized, DFR) 손실을 제안한다. 이 방법은 정적 얕은 특징(RGB, 공간 위치)과 시각 트랜스포머 백본에서 유도된 동적으로 업데이트되는 깊은 특징을 결합하며, 특징 일致성 헤드를 통해 특징을 정규화한다. 제안된 방법은 후처리나 외부 데이터셋 없이 엔드 투 엔드 학습을 통해 기존 최고 성능(SOTA) 대비 6.1% mIoU 향상을 달성하여 최신 기준을 초월한다.

ABSTRACT

We focus on tackling weakly supervised semantic segmentation with scribble-level annotation. The regularized loss has been proven to be an effective solution for this task. However, most existing regularized losses only leverage static shallow features (color, spatial information) to compute the regularized kernel, which limits its final performance since such static shallow features fail to describe pair-wise pixel relationship in complicated cases. In this paper, we propose a new regularized loss which utilizes both shallow and deep features that are dynamically updated in order to aggregate sufficient information to represent the relationship of different pixels. Moreover, in order to provide accurate deep features, we adopt vision transformer as the backbone and design a feature consistency head to train the pair-wise feature relationship. Unlike most approaches that adopt multi-stage training strategy with many bells and whistles, our approach can be directly trained in an end-to-end manner, in which the feature consistency head and our regularized loss can benefit from each other. Extensive experiments show that our approach achieves new state-of-the-art performances, outperforming other approaches by a significant margin with more than 6\% mIoU increase.

연구 동기 및 목표

  • 기존 정규화 손실이 정적 얕은 특징(예: 색상 및 공간 위치)에만 의존하여 복잡한 시나리오에서 픽셀 간 정확한 의미 관계를 포착하지 못하는 한계를 해결한다.
  • 유사 색상, 인접한 객체 등 모호한 경우에서 얕은 특징의 일반화 능력 부족을 보완하기 위해 학습 과정에서 변화하는 동적 깊은 특징을 통합한다.
  • 다중 단계 프로세스나 외부 데이터셋 없이도 엔드 투 엔드 학습을 가능하게 하기 위해 세그멘테이션 헤드와 특징 일치성 헤드를 동시에 최적화한다.
  • 동일한 클래스에 属하는 픽셀 간 특징 일치를 강제하고, 다른 클래스 간 거리를 넓히는 방식으로 특징의 구분 능력을 향상시키며, 확신 있는 예측 결과를 감독으로 사용한다.
  • 스크래치 지도를 사용한 PASCAL VOC 2012에서 최신 기준 성능을 달성하며, 후처리 없이도 이전 방법들에 비해 크게 뛰어나다.

제안 방법

  • 정적 얕은 특징(RGB 및 공간 위치)과 특징 일치성 헤드에서 유도된 동적 깊은 특징을 모두 사용하는 새로운 정규화 손실 함수인 DFR 손실을 제안한다.
  • 동일한 의미 분류에 属하는 픽셀 간의 L2 거리를 최소화하고, 다른 분류 간 거리를 최대화하는 특징 일치성 헤드를 도입하며, 세그멘테이션 헤드의 확신 있는 예측 결과를 감독으로 사용한다.
  • 세그멘테이션 헤드의 정확도 향상을 위해 시각 트랜스포머 백본을 활용해 전역적이고 고수준의 표현을 추출한다.
  • 세그멘테이션 헤드와 특징 일치성 헤드 간 상호 강화를 실현: 정확한 세그멘테이션 예측은 특징 품질을 향상시키며, 더 나은 특징은 DFR 손실을 통해 세그멘테이션 성능을 향상시킨다.
  • 계산 효율성을 유지하면서도 전역적 맥락을 유지하기 위해 DFR 손실 계산을 국소 윈도우로 제한한다.
  • 다중 단계 학습, 후처리(예: 밀도 높은 CRF), 외부 데이터셋 없이 전체 모델을 엔드 투 엔드로 학습한다.

실험 결과

연구 질문

  • RQ1정적 얕은 특징에 비해 동적 깊은 특징을 활용할 경우, 약한 지도 학습 세그멘테이션에서 정규화 손실의 정확도가 향상되는가?
  • RQ2세그멘테이션 헤드와 특징 일치성 헤드 간 공동 학습 전략이 더 나은 특징 표현과 세그멘테이션 성능을 이끌어내는가?
  • RQ3지표 픽셀 수준 레이블이 없는 상황에서 세그멘테이션 헤드의 확신 있는 예측 결과가 분류 가능한 깊은 특징 학습에 효과적인 감독으로 기능하는가?
  • RQ4시각 트랜스포머 백본의 다양한 레이어에서 유도된 깊은 특징의 통합이 최종 세그멘테이션 성능에 어떤 영향을 미치는가?
  • RQ5제안된 방법이 외부 데이터셋이나 후처리에 의존하지 않고 단일 단계, 엔드 투 엔드 학습 파이프라인으로 최신 기준 성능을 달성할 수 있는가?

주요 결과

  • 정적 얕은 특징과 동적 깊은 특징을 모두 사용한 제안된 DFR 손실은 PASCAL VOC 2012 검증 세트에서 81.5% mIoU를 달성했으며, 이는 이전 SOTA 방법 대비 6.1% 향상된 성능이다.
  • 특징 일치성 헤드 없이 깊은 특징만 사용할 경우 성능은 80.8%에서 81.0%로 향상되어, 명시적 일치 감독 없이도 깊은 특징이 긍정적인 영향을 미친다는 것을 보여준다.
  • 특징 일치성 헤드의 기여가 뚜렷하다: 단지 지표 스크래치만을 사용할 경우 mIoU는 80.6%에 머물렀지만, 세그멘테이션 헤드의 확신 있는 예측(M)을 사용하면 81.5%로 상승한다.
  • 시각 트랜스포머의 블록(Block-1에서 Block-4까지)에서 유도된 특징을 통합할 경우 최고 성능(81.5%)을 기록했으며, 이는 다중 해상도 표현이 정확한 픽셀 관계 모델링에 필수적임을 시사한다.
  • 지표와 확신 있는 예측 결과를 함께 사용할 경우 성능이 저하된다(81.1% mIoU): 이는 M에 포함된 노이즈 있는 예측이 잘못된 음성 쌍을 생성해 학습을 악화시킴을 의미한다.
  • 제거 실험 결과 RGB 특징이 필수적임을 확인: RGB 특징을 제거하면 mIoU가 81.5%에서 72.8%로 급격히 감소하여 색상 정보가 정규화 커널에서 중요한 역할을 한다는 점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.