Skip to main content
QUICK REVIEW

[논문 리뷰] ObjectAug: Object-level Data Augmentation for Semantic Image Segmentation

Jiawei Zhang, Yanchun Zhang|arXiv (Cornell University)|2021. 01. 30.
Advanced Neural Network Applications참고 문헌 38인용 수 5
한 줄 요약

ObjectAug는 세그멘테이션 마스크를 사용해 이미지를 객체와 배경으로 분리하고, 스케일링, 회전, 이동과 같은 변환을 개별 객체에 독립적으로 적용함으로써 객체 수준의 데이터 증강을 제안한다. 이후 이미지 인painting을 통해 잔상 요소를 복원함으로써 성능을 햖थ하고, 경계 일반화 능력을 향상시키고 카테고리 인식 증강을 가능하게 하여, 기존의 이미지 수준 증강 방법(CutMix, CutOut 등)보다 최대 0.9% mIoU 향상을 달성한다.

ABSTRACT

Semantic image segmentation aims to obtain object labels with precise boundaries, which usually suffers from overfitting. Recently, various data augmentation strategies like regional dropout and mix strategies have been proposed to address the problem. These strategies have proved to be effective for guiding the model to attend on less discriminative parts. However, current strategies operate at the image level, and objects and the background are coupled. Thus, the boundaries are not well augmented due to the fixed semantic scenario. In this paper, we propose ObjectAug to perform object-level augmentation for semantic image segmentation. ObjectAug first decouples the image into individual objects and the background using the semantic labels. Next, each object is augmented individually with commonly used augmentation methods (e.g., scaling, shifting, and rotation). Then, the black area brought by object augmentation is further restored using image inpainting. Finally, the augmented objects and background are assembled as an augmented image. In this way, the boundaries can be fully explored in the various semantic scenarios. In addition, ObjectAug can support category-aware augmentation that gives various possibilities to objects in each category, and can be easily combined with existing image-level augmentation methods to further boost performance. Comprehensive experiments are conducted on both natural image and medical image datasets. Experiment results demonstrate that our ObjectAug can evidently improve segmentation performance.

연구 동기 및 목표

  • 고정된 객체-배경 결합으로 인해 경계 일반화 능력이 떨어지는 이미지 수준 증강의 한계를 해결하기 위해.
  • 개별 객체를 독립적으로 증강함으로써 의미 일관성을 유지하면서 분할 성능의 내구성을 향상시키기 위해.
  • 학습 데이터의 클래스 불균형 문제를 완화하기 위해 카테고리 인식 증강을 지원하기 위해.
  • 기존의 이미지 수준 증강 기법과 원활하게 통합되어 성능 향상을 추가로 달성하기 위해.

제안 방법

  • 정답 세그멘테이션 마스크를 사용해 입력 이미지를 개별 객체와 배경으로 분해한다.
  • 스케일링, 회전, 이동 등의 표준 증강 기법을 객체의 의미 클래스를 유지하면서 각 객체에 독립적으로 적용한다.
  • 객체 증강으로 인해 발생하는 픽셀 수준의 잔상 요소를 복원하기 위해 이미지 인painting을 사용하여 视覚 일관성을 확보한다.
  • 증강된 객체와 배경을 새로운 의미 일관성 있는 이미지로 재조합하며, 다양한 공간 배치를 구현한다.
  • 특정 객체 카테고리에만 변환을 선택적으로 적용함으로써 카테고리 인식 증강을 지원한다.
  • 기존의 이미지 수준 증강 기법(CutOut, CutMix 등)과 ObjectAug를 결합하여 모델의 일반화 능력을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1이미지 수준 증강 대비 객체 수준 증강이 객체 경계의 일반화 능력을 향상시켜 분할 성능을 향상시킬 수 있는가?
  • RQ2카테고리 인식 증강이 희귀하거나 분할이 어려운 클래스에 대한 모델 성능에 미치는 영향은 어떠한가?
  • RQ3ObjectAug는 기존의 이미지 수준 증강 전략과 얼마나 잘 통합되어 추가로 분할 정확도를 향상시킬 수 있는가?
  • RQ4스케일링 비율, 회전 각도, 이동 거리와 같은 하이퍼파라미터가 ObjectAug의 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • Cityscapes 데이터셋에서 DeepLab V3+에 적용했을 때, ObjectAug는 MobileNet 기반 모델에서 1.5% mIoU 향상, ResNet-50 기반에서는 1.3%, ResNet-101 기반에서는 0.9% 향상시켰다.
  • CRAG 의료 영상 데이터셋에서는 다양한 아키텍처(Fast-SCNN, U-Net, PSPNet, DeepLab V3)에 대해 2.6–3.3%의 mIoU 향상을 기록했다.
  • Cityscapes에서 ObjectAug는 CutOut보다 0.8% 향상, CutMix보다 0.6% 향상되어 각각의 성능 향상 효과를 거의 두 배로 끌어올렸다.
  • CRAG 데이터셋에서 ObjectAug는 CutOut 대비 0.9% mIoU 향상, CutMix 대비 0.7% 향상하여 다양한 도메인에 걸쳐 강력한 일반화 능력을 입증했다.
  • 하이퍼파라미터 분석 결과 최적의 성능는 스케일링 비율 M_z=1.2, 회전 각도 M_r=15°, 이동 거리 M_s=5이며, 확률 값은 [0.2, 0.2, 0.1]로 나타났다.
  • 어려운 케이스 순위 기반의 카테고리 인식 증강이 희귀성 기반 순위보다 0.8% 더 높은 성능 향상을 이끌어내어 어려운 영역에 더 큰 영향을 미친다는 점을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.