[논문 리뷰] FreeMask: Synthetic Images with Dense Annotations Make Stronger Segmentation Models
FreeMask는 확산 모델에서 생성한 고품질, 고밀도 애너테이션을 가진 합성 이미지를 활용하여 완전히 지도 학습된 세분화 성능을 크게 향상시키는 방법을 제안한다. 합성 과정 중에 노이즈가 많은 영역을 필터링하고 학습하기 어려운 세분화 마스크를 우선시함으로써, 실제 데이터 학습과 비교할 만한 성능(예: ADE20K에서 52.0 mIoU)을 달성하며, 사전 학습 또는 공동 학습을 통해 실제 데이터 기반 모델의 성능을 향상시킨다.
Semantic segmentation has witnessed tremendous progress due to the proposal of various advanced network architectures. However, they are extremely hungry for delicate annotations to train, and the acquisition is laborious and unaffordable. Therefore, we present FreeMask in this work, which resorts to synthetic images from generative models to ease the burden of both data collection and annotation procedures. Concretely, we first synthesize abundant training images conditioned on the semantic masks provided by realistic datasets. This yields extra well-aligned image-mask training pairs for semantic segmentation models. We surprisingly observe that, solely trained with synthetic images, we already achieve comparable performance with real ones (e.g., 48.3 vs. 48.5 mIoU on ADE20K, and 49.3 vs. 50.5 on COCO-Stuff). Then, we investigate the role of synthetic images by joint training with real images, or pre-training for real images. Meantime, we design a robust filtering principle to suppress incorrectly synthesized regions. In addition, we propose to inequally treat different semantic masks to prioritize those harder ones and sample more corresponding synthetic images for them. As a result, either jointly trained or pre-trained with our filtered and re-sampled synthesized images, segmentation models can be greatly enhanced, e.g., from 48.7 to 52.0 on ADE20K. Code is available at https://github.com/LiheYoung/FreeMask.
연구 동기 및 목표
- 실제로 밀도 높은 애너테이션을 얻는 데 드는 비용을 줄이기 위해 합성 데이터를 활용함으로써, 세분화에서의 의존도를 감소시키는 것.
- 실제로 수집된 데이터가 아닌, 합성된 마스크 조건 기반 이미지만을 사용하여 완전히 지도 학습된 세분화 성능을 향상시키는 것.
- 픽셀 수준과 클래스 수준에서의 자기 적응형 필터링 전략을 통해 합성 데이터의 도메인 이탈 및 오류를 해결하는 것.
- 학습하기 어려운 세분화 카테고리의 합성에 우선순위를 두어 모델의 일반화 능력을 향상시키는 것.
- 사전 학습 및 공동 학습 파라다임에서 합성 데이터의 효과성을 실증하는 것.
제안 방법
- 사전 훈련 및 미세조정된 FreestyleNet 기반 확산 모델을 사용하여 실제 세분화 마스크를 조건으로 하여 합성 이미지를 생성함으로써 도메인 일치를 확보한다.
- 자기 적응형 픽셀 수준 필터링 전략을 적용: 실제 이미지 사전 훈련 모델을 사용해 평균 손실보다 큰 마진을 초과하는 영역을 식별하고 억제한다.
- 어려움 인식 기반 데이터 합성 구현: 클래스별 손실 분포를 기반으로 학습하기 어려운 마스크에 대해 더 많은 합성 이미지를 재표본화한다.
- 필터링 및 재표본화된 합성 이미지를 사용하여 실제 이미지와 함께 사전 학습 또는 공동 학습을 수행하며, 동일한 훈련 프로토콜을 유지한다.
- MMSegmentation을 활용하여 구현하고, 동기화 배치 샘플링과 데이터 증강을 적용하여 8× V100 GPU에서 훈련한다.
- 합성 데이터에서 사전 학습하고, 기본 학습률의 절반으로 조정하여 미세조정함으로써 전체 훈련 스케줄을 유지한다.
실험 결과
연구 질문
- RQ1확산 모델에서 생성한 합성, 고밀도 애너테이션 이미지는 완전히 지도 학습된 세분화에서 실제 데이터 학습과 비교해 유사한 성능을 달성할 수 있는가?
- RQ2합성 데이터 내에서 노이즈가 많거나 잘못 생성된 영역을 효과적으로 필터링하여 훈련에 악영향을 주지 않도록 할 수 있는가?
- RQ3학습하기 어려운 세분화 카테고리의 합성에 우선순위를 두면 분류 정확도 향상에 유의미한 영향을 미치는가?
- RQ4합성 데이터를 통한 사전 학습 또는 실제 데이터와의 공동 학습이 완전히 지도 학습된 세분화 모델의 성능을 크게 향상시킬 수 있는가?
- RQ5합성 이미지 생성 과정에서 발생하는 도메인 이탈 및 일치 오류가 최종 세분화 성능에 어떤 영향을 미치는가?
주요 결과
- 합성 이미지만으로 ADE20K에서 48.3 mIoU, COCO-Stuff에서 49.3 mIoU를 기록하여 실제 데이터 기반 기준선(각각 48.5 및 50.5 mIoU)과 유사한 성능을 달성한다.
- 실제 데이터와 필터링된 합성 데이터를 함께 학습함으로써 ADE20K mIoU가 48.7에서 52.0으로 향상되어 뚜렷한 성능 향상을 입증한다.
- ADE20K에서 가장 향상된 클래스로는 선박(+68.19 IoU), 전자레인지(+48.72), 아케이드 기계(+45.85) 등 희귀하거나 복잡한 물체에서 뚜렷한 성능 향상이 관찰된다.
- 필터링 메커니즘이 경계선 및 희귀/작은 물체에서 노이즈 영역을 효과적으로 억제하여 훈련의 안정성과 정확도를 향상시킨다.
- 필터링된 합성 데이터에서 사전 학습한 후 미세조정을 수행하면 일관된 성능 향상이 나타나, 이 방법의 확장성과 내구성을 검증한다.
- 단일 이미지의 합성에 약 5.8초가 소요되며, 24개의 GPU를 사용하면 ADE20K 및 COCO-Stuff 합성 데이터셋 전체를 2일 내로 생성할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.