Skip to main content
QUICK REVIEW

[논문 리뷰] Arbitrary Video Style Transfer via Multi-Channel Correlation

Yingying Deng, Fan Tang|arXiv (Cornell University)|2020. 09. 17.
Generative Adversarial Networks and Image Synthesis인용 수 8
한 줄 요약

이 논문은 광학 흐름을 사용하지 않고 시간적으로 일관된 스타일 전이를 구현하기 위해 콘텐츠 및 스타일 특징 간의 다중 채널 상관관계를 사용하는 프레임 기반 영상 스타일 전이 방법인 MCCNet을 제안한다. 입력 콘텐츠에 특징을 정렬하고 밝기 손실을 도입함으로써 MCCNet은 안정적이고 고화질의 스타일 전환 영상을 생성하며, 뚜렷한 질감과 유지된 콘텐츠 구조를 확보한다. 이는 정량적 지표와 사용자 연구 모두에서 이전 방법들을 능가한다.

ABSTRACT

Video style transfer is getting more attention in AI community for its numerous applications such as augmented reality and animation productions. Compared with traditional image style transfer, performing this task on video presents new challenges: how to effectively generate satisfactory stylized results for any specified style, and maintain temporal coherence across frames at the same time. Towards this end, we propose Multi-Channel Correction network (MCCNet), which can be trained to fuse the exemplar style features and input content features for efficient style transfer while naturally maintaining the coherence of input videos. Specifically, MCCNet works directly on the feature space of style and content domain where it learns to rearrange and fuse style features based on their similarity with content features. The outputs generated by MCC are features containing the desired style patterns which can further be decoded into images with vivid style textures. Moreover, MCCNet is also designed to explicitly align the features to input which ensures the output maintains the content structures as well as the temporal continuity. To further improve the performance of MCCNet under complex light conditions, we also introduce the illumination loss during training. Qualitative and quantitative evaluations demonstrate that MCCNet performs well in both arbitrary video and image style transfer tasks.

연구 동기 및 목표

  • 프레임 간 시간적 비일관성으로 인한 번짐 현상과 불안정성을 해결하기 위해.
  • 광학 흐름에 의존하지 않고도 어떤 콘텐츠 영상과 스타일 이미지도 임의의 스타일 전이를 가능하게 하기 위해.
  • 시간적 일관성을 확보하면서도 프레임 간 강력한 콘텐츠 구조와 뚜렷한 스타일 패턴을 유지하기 위해.
  • 새로운 밝기 손실을 통해 복잡한 조명 조건에서도 강건성을 향상시키기 위해.
  • 흐름 기반 또는 종단 간 영상 모델의 복잡성 없이 경량의 프레임 기반 접근법을 개발하기 위해.

제안 방법

  • MCCNet은 콘텐츠 및 스타일 이미지의 특징 맵에 직접 작용하여, 콘텐츠 구조와 스타일 특징 간의 다중 채널 상관관계를 계산함으로써 스타일 특징을 콘텐츠 구조에 정렬한다.
  • 네트워크는 콘텐츠 특징과 유사도에 기반해 스타일 특징을 재배열하고 융합하여 콘텐츠 레이아웃을 유지하는 스타일 전환 특징을 생성한다.
  • 특징 정렬이 명시적으로 강제되어 프레임 간 소규모 콘텐츠 변화가 출력에서 번짐 현상이 발생하지 않도록 보장된다.
  • 훈련 중에 콘텐츠 특징에 무작위 가우시안 노이즈를 추가함으로써 밝기 손실을 도입하여 조명 변화를 시뮬레이션하고 강건성을 향상시킨다.
  • 디코더 네트워크는 풍부한 스타일 전환 패턴을 생성하면서도 시간적 일관성을 유지할 수 있도록 충분한 깊이를 갖추고 설계되었다.
  • 광학 흐름이나 마스크 추정이 필요 없이, 인지적 손실과 재구성 손실을 사용해 종단 간으로 훈련된다.

실험 결과

연구 질문

  • RQ1콘텐츠 및 스타일 특징 간의 다중 채널 상관관계가 광학 흐름 없이 영상 스타일 전이의 시간적 일관성에 기여하는가?
  • RQ2입력 콘텐츠에 특징을 정렬하는 것이 스타일 전환 영상 시퀀스의 번짐과 안정성에 어떤 영향을 미치는가?
  • RQ3밝기 손실이 영상 스타일 전이에서 다양한 조명 조건에 대해 강건성을 얼마나 향상시키는가?
  • RQ4프레임 기반 접근법이 스타일 전환 품질과 일관성 면에서 흐름 기반 또는 종단 간 영상 모델과 비교해 유사한 성능을 달성할 수 있는가?
  • RQ5디코더 네트워크의 깊이가 스타일 전환 패턴의 뚜렷함과 시간적 일관성에 어떤 영향을 미치는가?

주요 결과

  • MCCNet은 스타일 전환 영상에서 인접 프레임 간 평균 차이(0.0189)와 분산(0.0007)이 가장 낮아, 시간적 일관성 면에서 SOTA 방법을 능가한다.
  • 제거 실험 결과 다중 채널 상관관계가 필수적임을 확인—이를 생략할 경우 스타일 전환 결과에서 핵심 스타일 패턴이 손실되고 원본 색상 분포가 유지된다.
  • 밝기 손실을 제거하면 프레임 간 평균 차이가 0.0317로 증가하여, 이는 조명 변화에 대응하는 데서의 핵심적 역할을 입증한다.
  • 더 깊은 디코더(relu4-1까지)는 얕은 디코더(relu3-1까지)보다 특히 털이나 원형 요소와 같은 복잡한 질감에서 더 뚜렷한 스타일 전환 패턴을 생성한다.
  • 50명의 참가자와 700표를 기반으로 한 사용자 연구에서 MCCNet은 스타일 전환 품질과 영상 안정성 면에서 SOTA 방법을 모두 우수하게 평가받았다.
  • Sintel 영상 시퀀스와 다양한 이미지 스타일을 포함한 다양한 스타일과 콘텐츠 도메인에서 일관된 결과를 유지하며 높은 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.