Skip to main content
QUICK REVIEW

[논문 리뷰] DRANet: Disentangling Representation and Adaptation Networks for Unsupervised Cross-Domain Adaptation

Seunghun Lee, Sunghyun Cho|arXiv (Cornell University)|2021. 03. 24.
Generative Adversarial Networks and Image Synthesis참고 문헌 40인용 수 4
한 줄 요약

DRANet는 비지도 학습 기반의 새로운 교차 도메인 적응 프레임워크를 제안하며, 비선형 잠재 공간에서 이미지 표현을 내용과 스타일 요소로 분리하여, 레이블이 전혀 필요 없는 이중 방향 도메인 전이를 가능하게 한다. 콘텐츠 적응형 도메인 전이 모듈과 도메인 특화 스케일링을 사용함으로써, 레이블이 없는 데이터를 사용하여 숫자 분류 및 의미 분할 작업에서 최신 기술 수준(SOTA)의 성능을 달성하며, 더 나은 특징 분리와 현실적인 이미지 합성을 실현한다.

ABSTRACT

In this paper, we present DRANet, a network architecture that disentangles image representations and transfers the visual attributes in a latent space for unsupervised cross-domain adaptation. Unlike the existing domain adaptation methods that learn associated features sharing a domain, DRANet preserves the distinctiveness of each domain's characteristics. Our model encodes individual representations of content (scene structure) and style (artistic appearance) from both source and target images. Then, it adapts the domain by incorporating the transferred style factor into the content factor along with learnable weights specified for each domain. This learning framework allows bi-/multi-directional domain adaptation with a single encoder-decoder network and aligns their domain shift. Additionally, we propose a content-adaptive domain transfer module that helps retain scene structure while transferring style. Extensive experiments show our model successfully separates content-style factors and synthesizes visually pleasing domain-transferred images. The proposed method demonstrates state-of-the-art performance on standard digit classification tasks as well as semantic segmentation tasks.

연구 동기 및 목표

  • 공유된 특징 공간과 관련된 도메인 특징에 의존하는 기존 도메인 적응 방법의 한계를 해결하기 위해.
  • 비선형 잠재 공간에서 내용과 스타일 표현을 분리함으로써 도메인 특화 특징를 유지하기 위해.
  • 지상 진술 클래스 레이블이 필요 없이 단일 인코더-디코더 네트워크를 사용하여 이중 방향 도메인 적응을 가능하게 하기 위해.
  • 콘텐츠-적응형 도메인 전이 모듈을 통해 시티스케이프와 GTA5와 같은 복잡한 환경에서의 이미지 합성 품질을 향상시키기 위해.
  • 레이블이 없는 데이터만을 사용하여 분류 및 의미 분할 벤치마크에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 비선형 분리기(nonlinear separator)를 사용하여 잠재 공간에서 이미지 표현을 내용(장면 구조)과 스타일(예술적 외관) 요소로 분리한다.
  • 도메인 특화 학습 가능한 스케일 매개변수를 적용하여 한 도메인의 스타일을 다른 도메인의 내용에 전이함으로써 다중 방향 적응을 가능하게 한다.
  • 콘텐츠 유사도에 따라 스타일 전이를 동적으로 조정하는 콘텐츠-적응형 도메인 전이(CADT) 모듈을 도입하여 잡음 요소를 방지한다.
  • 생성적 적대적 손실과 도메인 혼동을 사용하여 엔드 투 엔드로 모델을 훈련시키며, 분리된 표현을 유지하면서 특징을 정렬한다.
  • 단일 인코더-디코더 아키텍처를 사용하여 소스-타겟 및 타겟-소스 도메인 적응을 모두 수행함으로써 별도의 전용 네트워크가 필요 없도록 한다.
  • 분리기에서 비선형 매핑 함수와 정규화를 활용하여 표현의 분리도 및 도메인 이동 보정을 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 딥 네트워크가 레이블이 없는 데이터에 의존하지 않고 이중 방향 비지도 도메인 적응을 수행할 수 있는가?
  • RQ2선형 방법 대비 비선형적인 콘텐츠-스타일 분리가 도메인 적응 성능 향상에 얼마나 효과적인가?
  • RQ3콘텐츠-적응형 도메인 전이 모듈이 초기 학습 단계에서 잡음 요소를 얼마나 줄이고 이미지의 현실감을 향상시키는가?
  • RQ4분리된 표현이 비지도 도메인 적응 하에서 분류 및 의미 분할 작업 모두에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ5도메인 특화 스케일링 요소와 비선형성은 함께 어떻게 더 나은 특징 분리도 및 도메인 정렬을 달성하는가?

주요 결과

  • DRANet는 MNIST-to-USPS 및 USPS-to-MNIST 적응 작업에서 각각 98.2% 및 97.8%의 정확도를 기록하여 이전 방법들을 능가한다.
  • MNIST-M 벤치마크에서 DRANet는 98.7%의 정확도를 달성하여 심각한 도메인 이동 상황에서도 뛰어난 일반화 능력을 보였다.
  • 제거 분석 결과, 분리기에서 비선형성과 정규화가 모두 필수적임을 확인하였으며, 전체 모델은 MNIST-to-MNIST-M 작업에서 99.3%의 정확도를 기록했다.
  • 콘텐츠-적응형 도메인 전이(CADT) 모듈은 초기 학습 단계에서 잡음 요소를 크게 줄였으며, 소스와 타겟 콘텐츠가 상이하더라도 시각적으로 일관된 이미지를 생성했다.
  • 시티스케이프와 GTA5 의미 분할 작업에서 DRANet는 베이스라인 방법 대비 성능을 향상시켰으며, 이는 복잡한 환경에서의 적응 효과를 확인한다.
  • 적응 과정에서 레이블이 없는 데이터만을 사용했음에도 불구하고, 표준 숫자 분류 및 의미 분할 벤치마크에서 최신 기술 수준의 성능을 달성했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.