Skip to main content
QUICK REVIEW

[논문 리뷰] Tree Energy Loss: Towards Sparsely Annotated Semantic Segmentation

Zhiyuan Liang, Tiancai Wang|arXiv (Cornell University)|2022. 03. 21.
Advanced Neural Network Applications인용 수 4
한 줄 요약

이 논문은 희박하게 애너테이션된 세분화 분석을 위한 새로운 손실 함수인 트리 에너지 손실(Tree Energy Loss, TEL)을 제안한다. TEL은 최소 스패닝 트리(MST)를 사용하여 저수준(색상) 및 고수준(특징) 유사도를 모델링하고, 미리 정의된 비용 함수 없이도 비정상적인 픽셀에 대해 동적이고 굵기에서 세밀한 순서로 소프트 가짜 레이블을 생성한다. TEL은 다단계 학습, 추가 데이터 또는 후처리 없이도 점, 스크래치, 블록 기반 애너테이션 설정에서 최신 기술 수준의 성능을 달성하며, 이전 방법보다 최대 7.3%의 mIoU 향상을 보였다.

ABSTRACT

Sparsely annotated semantic segmentation (SASS) aims to train a segmentation network with coarse-grained (i.e., point-, scribble-, and block-wise) supervisions, where only a small proportion of pixels are labeled in each image. In this paper, we propose a novel tree energy loss for SASS by providing semantic guidance for unlabeled pixels. The tree energy loss represents images as minimum spanning trees to model both low-level and high-level pair-wise affinities. By sequentially applying these affinities to the network prediction, soft pseudo labels for unlabeled pixels are generated in a coarse-to-fine manner, achieving dynamic online self-training. The tree energy loss is effective and easy to be incorporated into existing frameworks by combining it with a traditional segmentation loss. Compared with previous SASS methods, our method requires no multistage training strategies, alternating optimization procedures, additional supervised data, or time-consuming post-processing while outperforming them in all SASS settings. Code is available at https://github.com/megvii-research/TreeEnergyLoss.

연구 동기 및 목표

  • 점, 스크래치, 블록과 같은 최소한의 애너테이션으로 정확한 세분화 모델을 훈련하는 과제를 해결한다.
  • 기존의 SASS 방법의 한계를 극복한다. 즉, 보조 작업 의존성, 시간이 오래 소요되는 제안, 일관성 학습 및 정규화의 불일치성 문제를 해결한다.
  • 비반복 최적화 또는 외부 감독 없이도, 비정상적인 픽셀을 활용한 동적 온라인 자기학습을 가능하게 하는 통합형 엔드 투 엔드 프레임워크를 제공한다.
  • 다양한 애너테이션 희박성 수준에서 성능 평가 및 평가를 더 잘 하기 위해 블록 기반 애너테이션 설정을 도입한다.

제안 방법

  • 이미지 색상(RGB)과 딥 컨볼루션 신경망 특징에서 각각 최소 스패닝 트리(MST)를 구성하여 저수준 및 고수준 픽셀 유사도를 모델링한다.
  • MST의 구조를 활용해 유사도가 높지 않은 간선을 반복적으로 제거함으로써 필수적인 픽셀 관계를 유지하고, 유사도 행렬의 구조적 일관성을 확보한다.
  • MST 경로를 따라 간선 가중치를 누적하여 유사도 행렬을 생성함으로써 국소적 및 전역적 맥락적 관계를 포괄한다.
  • 계단식 필터링 메커니즘을 적용한다: 먼저 저수준 유사도로 예측을 정제하고, 그 다음 고수준 유사도로 추가로 정제하여 점점 더 정확한 소프트 가짜 레이블을 생성한다.
  • 단일 단계 학습 설정에서 표준 교차 엔트로피 세분화 손실과 함께 트리 에너지 손실을 결합하여 온라인 자기학습을 가능하게 한다.
  • 기존의 세분화 네트워크에 최소한의 수정으로 TEL를 통합하여 즉시 적용 가능하고 계산적으로 효율적인 구조를 확보한다.

실험 결과

연구 질문

  • RQ1최소 스패닝 트리(MST)가 희박한 세분화 분석에서 저수준 및 고수준 유사도를 효과적으로 모델링하여 가짜 레이블 생성을 이끌 수 있는가?
  • RQ2MST 기반 유사도를 활용한 계단식, 굵기에서 세밀한 순서의 가짜 레이블 정제 방식이 동시에 또는 순차적 대안보다 분류 성능을 향상시키는가?
  • RQ3다단계 학습, 추가 감독 데이터, 또는 복잡한 후처리 없이도 TEL이 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ4제안된 블록 기반 애너테이션 설정이 점 및 스크래치 기반 설정과 비교해 SASS 방법 평가에 어떻게 기여하는가?

주요 결과

  • TEL은 다단계 학습이나 외부 데이터 없이도 점, 스크래치, 블록 애너테이션 설정 전반에서 최신 기술 수준의 성능을 달성한다.
  • Pascal VOC 2012 데이터셋에서 TEL는 훈련 중 기준 모델 대비 mIoU를 7.3% 향상시켜 비정상적인 데이터로부터의 지식 전이 능력을 입증한다.
  • 비국소 기반 고수준 유사도보다 1.7% 높은 mIoU 성능을 기록하여 특징 수준의 유사도 모델링 능력이 뛰어나다는 것을 보여준다.
  • 계단식 집계 전략(LH-C)은 병렬 및 다른 계단식 변형보다 뛰어난 성능을 보이며, 굵기에서 세밀한 순서로 예측을 정제하는 것이 유의미한 이점을 제공한다는 것을 확인한다.
  • 초기 설정 값 민감도 분석 결과, λ = 0.4 및 σ = 0.02에서 최적의 성능을 기록하며, σ 값에 대해 거의 민감하지 않음을 확인했다.
  • 훈련 초반에 가짜 레이블의 정밀도가 네트워크 예측 정밀도를 초월하여 효과적이고 신뢰할 수 있는 자기지도 학습이 이루어지고 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.