Skip to main content
QUICK REVIEW

[논문 리뷰] Reliability Does Matter: An End-to-End Weakly Supervised Semantic Segmentation Approach

Bingfeng Zhang, Jimin Xiao|arXiv (Cornell University)|2019. 11. 19.
Advanced Neural Network Applications참고 문헌 38인용 수 22
한 줄 요약

이 논문은 이미지 레벨 라벨을 사용하여 클래스 활성화 맵(CAMs)에서 신뢰도가 높고 고신뢰도의 픽셀 영역을 추출하는 단일 단계(end-to-end)의 간단하면서도 효과적인 약한 지도 학습 세그멘테이션 방법인 신뢰성 있는 영역 마이닝(Reliable Region Mining, RRM)을 제안한다. 이 방법은 새로운 밀도 에너지 손실을 사용하여 이들 정제된 신뢰 영역에 직접 세그멘테이션 브랜치를 훈련시킴으로써, 복잡한 이중 단계 방법들과 비교해도 뛰어난 성능(Validation VOC에서 62.6 mIoU, 테스트에서 62.9 mIoU)을 달성하며, 이는 기존의 복잡한 이중 단계 방법들을 능가하며, 이중 단계 훈련으로 확장했을 때는 새로운 SOTA 성능(Validation에서 66.3 mIoU, 테스트에서 66.5 mIoU)을 수립한다.

ABSTRACT

Weakly supervised semantic segmentation is a challenging task as it only takes image-level information as supervision for training but produces pixel-level predictions for testing. To address such a challenging task, most recent state-of-the-art approaches propose to adopt two-step solutions, \emph{i.e. } 1) learn to generate pseudo pixel-level masks, and 2) engage FCNs to train the semantic segmentation networks with the pseudo masks. However, the two-step solutions usually employ many bells and whistles in producing high-quality pseudo masks, making this kind of methods complicated and inelegant. In this work, we harness the image-level labels to produce reliable pixel-level annotations and design a fully end-to-end network to learn to predict segmentation maps. Concretely, we firstly leverage an image classification branch to generate class activation maps for the annotated categories, which are further pruned into confident yet tiny object/background regions. Such reliable regions are then directly served as ground-truth labels for the parallel segmentation branch, where a newly designed dense energy loss function is adopted for optimization. Despite its apparent simplicity, our one-step solution achieves competitive mIoU scores (\emph{val}: 62.6, \emph{test}: 62.9) on Pascal VOC compared with those two-step state-of-the-arts. By extending our one-step method to two-step, we get a new state-of-the-art performance on the Pascal VOC (\emph{val}: 66.3, \emph{test}: 66.5).

연구 동기 및 목표

  • 다양한 보조 구성 요소를 사용해 의사 마스크를 생성하는 데 의존하는 기존의 이중 단계 약한 지도 학습 세그멘테이션 방법들이 가지는 복잡성과 비효율성 문제를 해결하고자 한다.
  • 기존의 종단 간 방법에서 관찰되는 성능 격차를 피하기 위해, 단순한 최소 지도 학습 전략을 도입하여 단일 단계 접근법의 성능을 향상시키고자 한다.
  • 단지 이미지 레벨 라벨만을 사용하여 더 단순하고 직접적인 훈련 파이프라인으로도 고품질의 세그멘테이션을 달성할 수 있음을 보여주고자 한다.
  • 클래스 활성화 맵에서 작은 크기이지만 높은 반응을 보이는 영역을 마이닝하는 것이 전체 객체 또는 조밀한 의사 마스크 생성보다 더 나은 지도 학습을 이끌 수 있음을 보여주고자 한다.
  • 추가 데이터나 복잡한 보조 기능 없이도 이미지 레벨 약한 지도 학습 세그멘테이션 분야에서 새로운 SOTA 성능을 확립하고자 한다.

제안 방법

  • 이 방법은 이중 브랜치 네트워크를 사용한다: 하나의 브랜치는 클래스 활성화 맵(CAMs)을 생성하기 위한 이미지 분류를 담당하고, 다른 브랜치는 픽셀 수준의 예측을 수행하는 세그멘테이션 브랜치이다.
  • CAMs에서 객체 또는 배경에 해당하는 높은 반응을 보이는 조밀한 영역(종종 매우 작은 영역)을 식별하며, 이들은 높은 활성화 점수로 인해 신뢰할 수 있다고 간주된다.
  • 이러한 신뢰 영역은 노이즈를 제거하고 정확도를 향상시키기 위해 조건부 랜덤 필드(CRF)를 사용하여 추가로 정제된다.
  • 정제된 신뢰 영역은 전체 의사 마스크가 필요 없이 세그멘테이션 브랜치의 직접적인 지도 학습 타겟으로 사용된다.
  • 새로운 밀도 에너지 손실이 도입되며, 이는 픽셀 단위의 교차 엔트로피와 저수준 특징(RGB 및 공간적 맥락)을 활용하는 정규화 항을 조합하여 특징 학습을 향상시킨다.
  • 전체 네트워크는 교차 엔트로피 손실과 밀도 에너지 손실을 조합한 복합 손실을 사용하여 이미지 레벨 라벨에서 직접 세그멘테이션 성능을 최적화할 수 있도록 종단 간(end-to-end)으로 훈련된다.

실험 결과

연구 질문

  • RQ1복잡한 이중 단계 의사 마스크 생성 파이프라인에 의존하지 않고도 단일 단계 종단 간 약한 지도 학습 세그멘테이션 방법이 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ2클래스 활성화 맵에서 가장 신뢰도가 높고 활성도가 높은 영역만을 마이닝하는 것이 전체 객체나 조밀한 의사 마스크 생성보다 더 나은 세그멘테이션 성능을 이끌 수 있는가?
  • RQ3단지 몇 개의 고신뢰도 픽셀만을 사용하는 단순한 최소 지도 학습 전략이, 광범위한 보조 신호와 복잡한 보조 기능을 사용하는 더 복잡한 방법들을 능가할 수 있는가?
  • RQ4저수준 특징을 통합한 제안된 밀도 에너지 손실이 기존의 표준 교차 엔트로피 손실에 비해 약한 지도 학습 환경에서 세그멘테이션 품질을 어떻게 향상시키는가?
  • RQ5제안된 단일 단계 방법을 이중 단계 프레임워크로 확장하여 성능을 더욱 향상시킬 수 있으며, 이는 새로운 SOTA 결과를 달성하는가?

주요 결과

  • 단일 단계 RRM 방법은 Pascal VOC 검증 세트에서 62.6 mIoU, 테스트 세트에서 62.9 mIoU를 기록하여 EM-Adapt와 같은 기존 종단 간 방법들을 능가하며, 단일 단계 접근법 중에서 새로운 SOTA를 수립한다.
  • 동일한 RRM 네트워크를 사용해 의사 마스크를 생성하는 이중 단계 프레임워크로 확장했을 때, 검증 세트에서 66.3 mIoU, 테스트 세트에서 66.5 mIoU를 달성하여 이전의 SOTA(FickleNet: 64.9/65.3)와 AffinityNet을 뛰어넘었으며, 추가 데이터나 보조 신호 없이도 성능을 확보했다.
  • 세 개의 별도의 딥 네트워크와 ResNet-38(ResNet-101보다 강력한 백본)을 사용하는 AffinityNet보다도 성능이 뛰어나, 단일 종단 간 네트워크로 구성된 RRM 설계의 효과성을 입증한다.
  • 정성적 결과 분석에서 RRM는 특히 작은 객체나 복잡한 객체에서 EM-Adapt보다 더 정확하고 경계를 명확히 반영하는 세그멘테이션 결과를 도출한다.
  • 제거 분석(ablation study)을 통해 밀도 에너지 손실이 저수준 특징을 활용함으로써 성능 향상에 기여하며, CRF 정제 과정이 마이닝된 영역의 신뢰도를 향상시킨다는 것이 확인되었다.
  • 현재의 이중 단계 SOTA 방법들이 객체 제안, 시각적 중요도 맵, 또는 다수의 네트워크에 의존하는 데 비해, RRM는 더 단순하고 우아하며, 더 적은 구성 요소로 더 뛰어난 성능을 달성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.