[논문 리뷰] Cross-Domain Cascaded Deep Feature Translation
이 논문은 사전 훈련된 VGG-19 네트워크의 깊이 있는 특징을 계단식으로, 깊이에서 浅으로 번역함으로써 상당한 기하학적 형태 변형을 가능하게 하면서도 의미 일致성을 유지하는 교차 도메인 이미지 간 번역 방법을 제안한다. 사전 훈련된 의미 특징과 특징 맵에서의 적대적 훈련을 활용하여, 제브라-기린 및 코끼리-제브라 번역과 같은 도전적인 형태 변형 작업에서 FID 점수에서 CycleGAN, MUNIT, DRIT를 능가하는 최신 기술 수준의 성능을 달성한다.
In recent years we have witnessed tremendous progress in unpaired image-to-image translation methods, propelled by the emergence of DNNs and adversarial training strategies. However, most existing methods focus on transfer of style and appearance, rather than on shape translation. The latter task is challenging, due to its intricate non-local nature, which calls for additional supervision. We mitigate this by descending the deep layers of a pre-trained network, where the deep features contain more semantics, and applying the translation from and between these deep features. Specifically, we leverage VGG, which is a classification network, pre-trained with large-scale semantic supervision. Our translation is performed in a cascaded, deep-to-shallow, fashion, along the deep feature hierarchy: we first translate between the deepest layers that encode the higher-level semantic content of the image, proceeding to translate the shallower layers, conditioned on the deeper ones. We show that our method is able to translate between different domains, which exhibit significantly different shapes. We evaluate our method both qualitatively and quantitatively and compare it to state-of-the-art image-to-image translation methods. Our code and trained models will be made available.
연구 동기 및 목표
- 모양과 외관이 극명하게 다른 도메인 간에 쌍이 없는 이미지 간 번역 과제를 해결하기 위해.
- 개체 수준의 감독이나 복잡한 아키텍처 수정 없이도 이미지 번역에서 상당한 기하학적 변형을 가능하게 하기 위해.
- 분류 네트워크(VGG-19)에서 사전 훈련된 깊이 특징을 활용하여 더 일관된 형태 번역을 위한 고수준 의미 정보를 인코딩하기 위해.
- 깊은 층에서 얕은 층으로 번역하는 계단식, 계층적 개선을 위한 피이드포워드 번역 파이프라인 개발하기 위해.
- 객체 자세, 개체 수, 부분적 가림 등을 유지하는 의미적으로 일관된 번역을 달성하기 위해.
제안 방법
- 소스 도메인 및 타겟 도메인 이미지의 여러 층에서 사전 훈련된 VGG-19 네트워크로부터 깊이 특징 맵을 추출한다.
- 가장 깊은(의미가 가장 강한) 층부터 시작하여, 계단식으로, 거친 것에서부터 세밀한 것으로 특징 층 간에 적대적 번역을 수행한다.
- 각 번역 네트워크는 이전 층의 번역 출력을 조건으로 하여 현실적인 타겟 도메인 특징을 생성하도록 적대적으로 훈련된다.
- 최종 이미지는 Dosovitskiy와 Brox(2016)의 방법을 따르며, 사전 훈련된 VGG-19 특징 복원 네트워크를 사용해 번역된 깊이 특징을 역으로 복원함으로써 재구성된다.
- 각 층의 번역 네트워크를 순차적으로 훈련하는 다단계 훈련 전략을 사용하며, 더 깊은 층의 결과가 얕은 층의 훈련에 영향을 준다.
- 특징 복원은 번역된 깊이 특징에서 생성된 이미지를 시각화하기 위해 적용되며, 정성적 및 정량적 평가를 가능하게 한다.
실험 결과
연구 질문
- RQ1사전 훈련된 분류 네트워크에서 유도된 깊이 특징이 대규모 기하학적 변형을 수반하는 효과적인 교차 도메인 이미지 번역을 가능하게 할 수 있는가?
- RQ2깊이 특징에 대해 계단식으로, 깊이에서 얕은 측면으로 번역 전략을 적용할 경우, 객체 자세나 개체 수와 같은 의미 일치성이 유지되는가?
- RQ3특징 수준의 번역은 종래의 엔드 투 엔드 이미지 간 번역과 비교해 형태 변형 작업에서 FID 점수와 시각적 품질 측면에서 어떻게 성능을 내는가?
- RQ4VGG-19에서 유도된 사전 훈련된 특징이 추가 감독 없이도 교차 도메인 번역을 지원하는 의미적으로 유의미한 표현을 얼마나 잘 포괄하는가?
- RQ5이 방법은 제브라에서 기린, 또는 코끼리에서 제브라와 같이 극단적인 형태 차이를 보이는 쌍이 없는 도메인 쌍에 일반화될 수 있는가?
주요 결과
- 제안된 방법은 여섯 개의 교차 도메인 번역 작업 중 다섯 개에서 최고의 FID 점수를 기록했으며, 고양이 ↔ 강아지 번역에서 67.58 / 46.02, 제브라 ↔ 기린 번역에서 67.41 / 39.38의 점수를 기록했다.
- 제브라 ↔ 코끼리 번역 작업에서 FID 점수는 68.45 / 47.86을 기록했으며, CycleGAN(86.55 / 68.44)과 MUNIT(109.56 / 80.1)를 크게 능가했다.
- 정성적 결과에서는, 코끼리의 목을 연장하거나 제브라의 머리를 축소하는 등 극단적인 기하학적 변형을 성공적으로 수행했으며, 객체 자세와 구성은 유지되었다.
- 최종 완전 연결 층 특징의 t-SNE 시각화 결과, 번역된 특징이 타겟 도메인 분포에 가장 가까이 위치해 있음을 확인하여 의미 일치성을 확인했다.
- 높은 형태의 이질성과 함께 어려운 도메인 쌍에 대해서도 잘 일반화되며, 부분적 가림이나 자르기 조건에서도 개체 수준의 의미 정보를 유지한다.
- 성공에도 불구하고, VGG-19의 비가역성과 특징 수준의 오차 증폭으로 인해 배경 콘텐츠나 작은 객체 부분의 유지가 종종 실패한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.