Skip to main content
QUICK REVIEW

[논문 리뷰] A Network Structure to Explicitly Reduce Confusion Errors in Semantic Segmentation

Qichuan Geng, Xinyu Huang|arXiv (Cornell University)|2018. 08. 01.
Anomaly Detection Techniques and Applications참고 문헌 33인용 수 5
한 줄 요약

이 논문은 심층 학습 아키텍처를 새롭게 제안하며, 유사한 시각적 패턴과 학습 유도 요인(예: 특징 해상도 감소, 클래스 불균형)으로 인한 혼동 오류를 명시적으로 줄이는 데 초점을 맞춘다. 이는 혼동되는 클래스 그룹(예: 도로와 보도, 건물과 울타리)을 기반으로 한 하위넷을 앙상블하고, 혼동 클래스에 대한 오진 양성 및 오진 음성에 모두 페널티를 주는 수정된 교차 엔트로피 손실 함수를 도입함으로써 달성된다. 이 방법은 백본 또는 후처리를 수정하지 않아도 Cityscapes와 PASCAL VOC에서 일관되고 뚜렷한 mIoU 향상을 이끌어내며, ResNet-101 기준 최대 3.05% 향상, ResNet-38 기준 최대 1.30% 향상 달성.

ABSTRACT

Confusing classes that are ubiquitous in real world often degrade performance for many vision related applications like object detection, classification, and segmentation. The confusion errors are not only caused by similar visual patterns but also amplified by various factors during the training of our designed models, such as reduced feature resolution in the encoding process or imbalanced data distributions. A large amount of deep learning based network structures has been proposed in recent years to deal with these individual factors and improve network performance. However, to our knowledge, no existing work in semantic image segmentation is designed to tackle confusion errors explicitly. In this paper, we present a novel and general network structure that reduces confusion errors in more direct manner and apply the network for semantic segmentation. There are two major contributions in our network structure: 1) We ensemble subnets with heterogeneous output spaces based on the discriminative confusing groups. The training for each subnet can distinguish confusing classes within the group without affecting unrelated classes outside the group. 2) We propose an improved cross-entropy loss function that maximizes the probability assigned to the correct class and penalizes the probabilities assigned to the confusing classes at the same time. Our network structure is a general structure and can be easily adapted to any other networks to further reduce confusion errors. Without any changes in the feature encoder and post-processing steps, our experiments demonstrate consistent and significant improvements on different baseline models on Cityscapes and PASCAL VOC datasets (e.g., 3.05% over ResNet-101 and 1.30% over ResNet-38).

연구 동기 및 목표

  • 유사한 시각적 패턴과 학습 유도 요인(예: 특징 해상도 감소, 클래스 불균형)으로 인한 세분화에서의 혼동 오류를 해결하기 위해.
  • 도로와 보도, 건물과 울타리 등 의미적으로 유사한 클래스 간의 혼동을 부작용으로 간주하는 것이 아니라 명시적으로 줄이기 위해.
  • 백본 또는 후처리를 변경하지 않고도 기존 세분화 네트워크에 통합 가능한 일반 목적의 프레임워크를 개발하기 위해.
  • 새로운 손실 함수를 통해 혼동 클래스의 잘못된 분류에 직접 페널티를 주어 모델의 강건성과 정확도를 향상시키기 위해.

제안 방법

  • 사전 학습된 모델의 정규화된 혼동 행렬에서 식별된 분류가 잘 되는 혼동 그룹을 기반으로 하위넷을 구성한다.
  • 각 하위넷은 그룹 내 혼동 클래스 간의 분리도를 극대화하면서도 관련이 없는 클래스에 대한 성능 유지를 위해 훈련된다.
  • 혼동 클래스에 대한 잘못된 예측에 페널티 항을 추가하는 수정된 교차 엔트로피 손실 함수를 도입하며, 혼동 행렬 값에 기반한 재가중치가 적용된다.
  • 손실 함수는 혼동 클래스 쌍에 대해 오진 음성과 오진 양성을 동시에 최소화하도록 설계되어, 분류의 구별 능력을 향상시킨다.
  • 최종 예측은 메인 네트워크와 모든 하위넷의 출력을 앙상블 평균하여 도출되며, 더 나은 일반화를 가능하게 한다.
  • 이 방법은 Cityscapes와 PASCAL VOC에서 ResNet-101 및 ResNet-38 백본에 적용되었으며, 특징 인코더나 디코딩 헤드에 변화 없이 수행되었다.

실험 결과

연구 질문

  • RQ1클래스 불균형이나 해상도 손실과 같은 개별 요인을 해결하는 것 이상으로, 세분화에서 혼동 오류를 명시적으로 줄일 수 있는 일반적인 네트워크 아키텍처를 설계할 수 있는가?
  • RQ2다양한 출력 공간을 가진 하위넷을 사용하는 것이 혼동되는 클래스 쌍 간의 분류 능력을 향상시키는 데 얼마나 효과적인가?
  • RQ3혼동 클래스에 대해 오진 양성과 오진 음성 모두에 페널티를 주는 수정된 교차 엔트로피 손실 함수는 세분화 정확도 향상에 어느 정도 기여하는가?
  • RQ4이 방법은 기존 네트워크에 아키텍처 변경 없이 일반적으로 적용 가능하며, 다양한 데이터셋에서 일관된 성능 향상을 이끌어내는가?

주요 결과

  • 제안된 방법은 Cityscapes 검증 세트에서 기준 ResNet-101 대비 3.05%의 mIoU 향상을 달성했다.
  • PASCAL VOC 2012 데이터셋에서 이 방법은 ResNet-38 기준 1.30%의 mIoU 향상을 이끌었으며, 최종 정확도는 79.38%에 도달했다.
  • 하위넷과 향상된 손실 함수의 조합이 가장 높은 성능 향상을 이끌었으며, 손실 함수 자체가 성능 향상에 기여하는 데 중요한 역할을 했다.
  • 다양한 백본 아키텍처와 데이터셋에서 일관된 향상을 보이며 강력한 일반화 능력을 입증했다.
  • 시각적 결과에서는 트럭과 버스, 울타리와 건물, 라이더와 사람 간의 혼동이 감소한 것으로 나타났다.
  • 혼동 행렬 분석을 통해 알려진 혼동 클래스 그룹 간의 잘못된 분류가 효과적으로 감소한 것으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.