Skip to main content
QUICK REVIEW

[논문 리뷰] MixStyle Neural Networks for Domain Generalization and Adaptation

Kaiyang Zhou, Yongxin Yang|arXiv (Cornell University)|2021. 07. 05.
Domain Adaptation and Few-Shot Learning참고 문헌 59인용 수 15
한 줄 요약

MixStyle은 훈련 중에 랜덤한 인스턴스 간의 특징 통계(평균과 표준편차)를 혼합함으로써 도메인 일반화를 향상시키는 간단하고 즉시 사용 가능한, 파라미터가 없는 모듈을 제안한다. 이미지 스타일과 특징 통계 간의 관계를 활용하여, 훈련 목표나 모델 용량을 수정하지 않고도 데이터 증강을 통해 새로운 도메인을 효율적으로 합성한다. 이는 다양한 시각 작업에서 분포 외 일반화 성능을 크게 향상시킨다.

ABSTRACT

Neural networks do not generalize well to unseen data with domain shifts -- a longstanding problem in machine learning and AI. To overcome the problem, we propose MixStyle, a simple plug-and-play, parameter-free module that can improve domain generalization performance without the need to collect more data or increase model capacity. The design of MixStyle is simple: it mixes the feature statistics of two random instances in a single forward pass during training. The idea is grounded by the finding from recent style transfer research that feature statistics capture image style information, which essentially defines visual domains. Therefore, mixing feature statistics can be seen as an efficient way to synthesize new domains in the feature space, thus achieving data augmentation. MixStyle is easy to implement with a few lines of code, does not require modification to training objectives, and can fit a variety of learning paradigms including supervised domain generalization, semi-supervised domain generalization, and unsupervised domain adaptation. Our experiments show that MixStyle can significantly boost out-of-distribution generalization performance across a wide range of tasks including image recognition, instance retrieval and reinforcement learning.

연구 동기 및 목표

  • 도메인 이동 상황에서 신경망의 분포 외 일반화 성능이 열 劣하는 문제를 해결하기 위해.
  • 추가 데이터나 증가된 모델 용량이 필요 없는 도메인 일반화를 향상시키는 데이터 증강 방법을 개발하기 위해.
  • 모델 아키텍처에 종속되지 않는 즉시 사용 가능한 모듈을 만들기 위해, 감독, 준감독, 비감독 도메인 일반화 설정 전반에서 작동하도록 하기 위해.
  • 얕은 컨볼루션 네트워크 레이어에서 시각적 도메인 이동과 인스턴스 수준의 특징 통계 간의 연결 고리를 설정하기 위해.

제안 방법

  • MixStyle은 한 번의 순방향 전파 동안 두 개의 랜덤으로 샘플된 훈련 인스턴스 간의 특징맵 평균과 표준편차를 혼합한다.
  • 혼합은 두 인스턴스의 통계 간 선형 보간을 제어하는 데 사용되는 베타 분포를 통해 샘플된 볼륨 가중치 λ를 사용하여 수행된다.
  • 네트워크 아키텍처나 훈련 목표를 수정하지 않고도, 다수의 얕은 컨볼루션 레이어에 적용하여 스타일 변동을 효과적으로 포착한다.
  • 부분적으로 레이블이 붙은 데이터를 다룰 수 있도록, 레이블이 붙은 인스턴스와 의사 레이블이 붙은 인스턴스 간의 통계를 혼합하는 준감독 확장 기법을 도입하였다.
  • 미니배치 훈련과도 호환되며, 구현에 몇 줄의 코드만 필요하다.
  • 통계 혼합을 통해 다양한 시각적 스타일을 시뮬레이션함으로써, 도메인에 강인한 표현을 암묵적으로 학습한다.

실험 결과

연구 질문

  • RQ1랜덤 인스턴스 간 특징 통계 혼합이 볼 수 없는 도메인으로의 일반화 성능 향상에 기여하는가?
  • RQ2MixStyle은 감독, 준감독, 비감독 도메인 일반화와 같은 다양한 학습 철학에서 어떻게 성능을 발휘하는가?
  • RQ3MixStyle의 성능는 베타 분포의 α 값과 같은 하이퍼파라미터의 선택에 따라 달라지는가?
  • RQ4MixStyle은 볼 수 있는 도메인의 성능를 향상시키면서도 볼 수 없는 도메인으로의 일반화 성능를 향상시킬 수 있는가?
  • RQ5기하학적 변형과는 대비하여, 색상, 질감, 조명과 관련된 도메인 이동에 대해 MixStyle은 얼마나 효과적인가?

주요 결과

  • MixStyle은 이미지 인식, 인물 재식별, 강화학습 작업 전반에서 분포 외 일반화 성능 향상에 뚜렷한 개선 효과를 보였다.
  • PACS 데이터셋에서 α=0.1일 때 테스트 정확도가 82.8%로 상승하여 표준 ERM 및 다른 도메인 일반화 기준선을 초월하였다.
  • 원본 도메인에서의 성능는 유지되거나 약간 향상되어, 본문 도메인 성능에 부정적인 영향를 미치지 않았다.
  • 제거 실험 결과, 같은 클래스 내에서의 혼합은 효과적이지 않음을 확인하여, 도메인 일반화를 위해 상호 클래스 스타일 혼합이 필수적임을 입증하였다.
  • 성능는 α 값에 대해 상대적으로 민감하지 않으며, α=0.1이 여러 작업에서 강력한 기본 설정임을 확인하였다.
  • MixStyle은 높은 전이 가능성과 함께 다양한 응용 분야에 성공적으로 적용되었으며, 의료 영상, 3D 포인트 클라우드 처리, 음성 인식 등에 포함된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.