[논문 리뷰] Feature-based Style Randomization for Domain Generalization
이 논문은 특징 기반 스타일 랜덤라이제이션(FSR)을 제안하며, 훈련 중에 특징 표현에 무작위 노이즈를 주입하여 다양한 보이지 않는 스타일의 특징을 생성함으로써 모델의 강건성을 향상시키는 도메인 일반화 방법이다. 이미지 수준의 증강과는 달리, FSR는 인코더-디코더 네트워크를 통해 특징 공간에서 작동하여 더 많은 샘플 다양성과 목표 지향적인 데이터 증강을 가능하게 하며, PACS, VLCS, Office-Home 벤치마크에서 최신 기술(SOTA) 성능을 달성한다.
As a recent noticeable topic, domain generalization (DG) aims to first learn a generic model on multiple source domains and then directly generalize to an arbitrary unseen target domain without any additional adaption. In previous DG models, by generating virtual data to supplement observed source domains, the data augmentation based methods have shown its effectiveness. To simulate the possible unseen domains, most of them enrich the diversity of original data via image-level style transformation. However, we argue that the potential styles are hard to be exhaustively illustrated and fully augmented due to the limited referred styles, leading the diversity could not be always guaranteed. Unlike image-level augmentation, we in this paper develop a simple yet effective feature-based style randomization module to achieve feature-level augmentation, which can produce random styles via integrating random noise into the original style. Compared with existing image-level augmentation, our feature-level augmentation favors a more goal-oriented and sample-diverse way. Furthermore, to sufficiently explore the efficacy of the proposed module, we design a novel progressive training strategy to enable all parameters of the network to be fully trained. Extensive experiments on three standard benchmark datasets, i.e., PACS, VLCS and Office-Home, highlight the superiority of our method compared to the state-of-the-art methods.
연구 동기 및 목표
- 이미지 수준의 데이터 증강이 보이지 않는 도메인의 다양성을 충분히 포괄하지 못하는 한계를 해결하기 위해, 제한된 기준 스타일에 의존하는 경향이 있는 도메인 일반화에서의 문제를 해결한다.
- 이미지 공간이 아닌 특징 공간에서 더 다양한 추상적 스타일 변형을 생성함으로써 모델의 일반화 능력을 향상시키기 위해 노력한다.
- 생성 모델이나 고정된 스타일 전이 작업이 필요 없는, 학습 가능한 적응형 증강 메커니즘을 개발한다.
- 제안된 FSR 모듈을 사용할 때 모든 네트워크 파라미터를 최적화할 수 있도록 점진적인 훈련 전략을 설계한다.
- 일般 이미지 분류와 피부 병변 분류와 같은 의료 영상 작업을 포함한 두 가지 과제에서 특징 수준의 증강이 효과적인지 검증한다.
제안 방법
- 기본 특징 표현에 학습 가능한 노이즈를 주입하여 무작위 스타일을 가진 새로운 특징으로 변환하는 특징 기반 스타일 랜덤라이제이션(FSR) 모듈을 제안한다.
- 기본 특징을 잠재 공간으로 매핑하기 위해 인코더-디코더 아키텍처를 사용하며, 여기서 노이즈가 스타일 통계와 통합되어 다양한 스타일 변환을 가능하게 한다.
- FSR 모듈의 강도를 점차 증가시켜 전체 네트워크 최적화와 안정적 수렴을 가능하게 하는 점진적 훈련 전략을 도입한다.
- 합성곱 백본 이후의 특징 공간에서 작동하므로, 무작위 스타일 변형을 통해 도메인 불변 표현을 학습할 수 있다.
- 스타일 표현으로 인스턴스 정규화 통계를 사용하고, 훈련 중에 노이즈 조절을 적용하여 새로운 스타일 벡터를 생성한다.
- 네트워크의 여러 단계에 FSR 모듈을 적용하여 특징 다양성과 일반화에 미치는 영향을 탐색한다.
실험 결과
연구 질문
- RQ1특징 수준의 데이터 증강이 더 다양한 추상적 스타일 변형을 생성함으로써 도메인 일반화에서 이미지 수준의 증강을 능가할 수 있는가?
- RQ2기존의 스타일 혼합 또는 변환 방법과 비교해 특징 표현에 학습 가능한 노이즈를 주입함으로써 모델의 보이지 않는 도메인으로의 일반화 능력이 향상되는가?
- RQ3FSR 모듈의 배치와 훈련 스케줄이 모델 성능과 수렴에 어떤 영향을 미치는가?
- RQ4스스로가 매우 다양하고 비선형적인 도메인 이동을 보이는 의료 영상과 같은 고도로 변동성이 큰 도메인에도 효과적으로 일반화될 수 있는가?
- RQ5FSR 모듈이 소스 도메인에서의 성능를 향상시키면서 동시에 보이지 않는 도메인으로의 제로샷 일반화 능력을 향상시키는가?
주요 결과
- PACS 데이터셋에서 제안된 방법은 모든 타겟 도메인에서 평균 정확도 88.7%를 달성하여 이전 최신 기술(SOTA) 방법보다 1.2% 높은 성능를 기록했다.
- VLCS 데이터셋에서 방법은 평균 정확도 83.4%를 달성했으며, 모든 도메인 일반화 설정에서 베이스라인 및 기존 최신 기술 방법을 초월했다.
- Office-Home 데이터셋에서 방법은 평균 정확도 73.8%를 달성하여 다양한 시각적 도메인 간 강력한 일반화 능력을 보였다.
- 여섯 개인 의료 데이터셋을 사용한 피부 병변 분류 과제에서 방법은 평균 정확도 81.31%를 기록했으며, 베이스라인 대비 2.33% 향상되었고, MixStyle 대비 2.93% 향상되었다.
- 제거 실험 결과 FSR가 소스 도메인과 타겟 도메인 양쪽에서 성능 향상을 이끌어내며, 소스 도메인 성능를 희생시키지 않고도 일반화 능력을 향상시킨다는 점을 확인했다.
- 점진적 훈련 전략은 모델 수렴과 성능 향상에 크게 기여하였으며, FSR의 이점을 극대화하기 위해 전체 네트워크 최적화가 필수적임을 보여주었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.