Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Pixel and Feature-level Domain Adaptation in the Wild.

Luan Tran, Kihyuk Sohn|arXiv (Cornell University)|2018. 02. 28.
Domain Adaptation and Few-Shot Learning참고 문헌 11인용 수 3
한 줄 요약

이 논문은 특징 수준에서 도메인 적대적 엔트로피 최소화와 3D 기하학적 인식 이미지 합성 및 속성 조건 기반 CycleGAN을 통해 픽셀 수준에서의 도메인 적응을 결합하는 통합 픽셀 및 특징 수준의 도메인 적응 프레임워크를 제안한다. 이 방법은 명시적 요인(예: 자세, 조명)을 명시적으로 모델링하고, 보완적인 적응 전략을 통해 알려지지 않은 요인을 암묵적으로 처리함으로써, 레이블이 없는 감시 영상에서 자동차 인식 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Recent developments in deep domain adaptation have allowed knowledge transfer from a labeled source domain to an unlabeled target domain at the level of intermediate features or input pixels. We propose that advantages may be derived by combining them, in the form of different insights that lead to a novel design and complementary properties that result in better performance. At the feature level, inspired by insights from semi-supervised learning in a domain adversarial neural network, we propose a novel regularization in the form of domain adversarial entropy minimization. Next, we posit that insights from computer vision are more amenable to injection at the pixel level and specifically address the key challenge of adaptation across different semantic levels. In particular, we use 3D geometry and image synthesization based on a generalized appearance flow to preserve identity across higher-level pose transformations, while using an attribute-conditioned CycleGAN to translate a single source into multiple target images that differ in lower-level properties such as lighting. We validate on a novel problem of car recognition in unlabeled surveillance images using labeled images from the web, handling explicitly specified, nameable factors of variation through pixel-level and implicit, unspecified factors through feature-level adaptation. Extensive experiments achieve state-of-the-art results, demonstrating the effectiveness of complementing feature and pixel-level information via our proposed domain adaptation method.

연구 동기 및 목표

  • 웹 이미지 등 레이블이 있는 소스 데이터와 감시 영상 등 레이블이 없는 타겟 데이터 간에 상당한 차이가 나는 실제 환경에서의 도메인 적응을 향상시키기 위해.
  • 명시적이고 이름이 지정된 요인(예: 자세, 조명)과 암묵적이고 특정되지 않은 요인을 보완적인 적응 전략을 통해 다루는 도전 과제를 해결하기 위해.
  • 픽셀 수준과 특징 수준의 적응을 모두 활용하여 교차 도메인 인식에서 일반화 능력을 향상시키는 통합 프레임워크를 개발하기 위해.
  • 기하학적 이미지 합성과 도메인 적대적 학습을 조합한 것이 실제 인식 작업에서 효과적인지 검증하기 위해.

제안 방법

  • 반감독 학습과 도메인 적대적 네트워크를 영감으로 삼아, 특징 수준에서 도메인 적대적 엔트로피 최소화를 새로운 정규화 기법으로 도입한다.
  • 3D 기하학과 일반화된 외관 흐름을 사용하여 다양한 자세에서 신원을 유지하는 이미지를 합성함으로써 의미 수준의 변형에 대한 강건한 적응을 가능하게 한다.
  • 조명과 색상과 같은 저수준 특성의 변형을 갖는 다양한 타겟 도메인 이미지를 생성하기 위해 속성 조건 기반 CycleGAN을 활용한다.
  • 픽셀 수준과 특징 수준의 적응 모듈의 출력을 결합하여 도메인 정렬과 특징 분리 최적화를 동시에 수행한다.
  • 명시적인 제어를 통해 이름이 지정된 요인(예: 자세, 조명)과 도메인 적대적 훈련을 통한 알려지지 않은 요인의 암묵적 모델링을 모두 활용한다.
  • 쌍체 데이터가 필요 없이, 레이블이 있는 소스 이미지와 레이블이 없는 타겟 이미지를 사용하여 모델을 종단 간(end-to-end)으로 훈련한다.

실험 결과

연구 질문

  • RQ1픽셀 수준과 특징 수준의 도메인 적응을 조합하면 실제 제약이 많은 인식 작업에서 성능을 향상시킬 수 있는가?
  • RQ23D 기하학과 외관 흐름을 사용할 때, 도메인 적응을 위한 이미지 합성에서 자세와 시점 변화가 있을 때 신원을 얼마나 효과적으로 유지할 수 있는가?
  • RQ3명시적 지도 없이 도메인 적대적 엔트로피 최소화가 특징 수준의 도메인 정렬에 얼마나 효과적으로 기여하는가?
  • RQ4속성 조건 기반 이미지 번역이 조명과 색상 변화와 같은 저수준 도메인 이동을 효과적으로 모델링할 수 있는가?
  • RQ5명시적 및 암묵적 적응 전략을 함께 사용할 경우, 단일 수준의 접근 방식에 비해 교차 도메인 자동차 인식에서 어떤 정도로 더 우수한 성능을 내는가?

주요 결과

  • 제안된 방법은 웹에서 확보한 레이블이 있는 이미지와 레이블이 없는 감시 영상으로 구성된 새로운 자동차 인식 벤치마크에서 최신 기술 수준의 성능을 달성한다.
  • 픽셀 수준과 특징 수준에서의 통합 적응은 단지 픽셀 수준 또는 특징 수준의 적응에 의존하는 방법보다 현저히 뛰어난 성능을 보인다.
  • 3D 기하학과 외관 흐름을 사용함으로써, 합성된 타겟 이미지에서 큰 자세 변화가 있을 때도 신원 유지가 효과적으로 이루어진다.
  • 속성 조건 기반 CycleGAN은 조명과 색상의 제어된 변형을 갖는 다양한 실제적인 타겟 도메인 이미지를 성공적으로 생성한다.
  • 도메인 적대적 엔트로피 최소화는 중간 특징에서 도메인 이동을 효과적으로 감소시켜, 알려지지 않은 타겟 도메인으로의 일반화 능력을 향상시킨다.
  • 이 방법은 실제 감시 환경에서 이름이 지정된(예: 자세, 조명) 및 이름이 지정되지 않은 요인의 변동성에 대해 강력한 내성적 저항력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.