[논문 리뷰] Joint Bilateral Learning for Real-time Universal Photorealistic Style Transfer
이 논문은 이중 공간에서 국소적 에지 인식형 애핀 변환을 학습하는 피드포워드 신경망을 사용하여 실시간, 포토 realism 스타일 전이 방법을 제안한다. 이는 포토 realism을 보장한다. 이 방법은 모바일 기기에서 4K 실시간 성능을 달성하며, 이는 이전 방법보다 3개 주문 수준 빠르다. 날카럽고 아티팩트가 없는 결과를 만들어내며, 예측할 수 없는 입력에 대해서도 부드럽게 성능이 떨어지게 된다.
Photorealistic style transfer is the task of transferring the artistic style of an image onto a content target, producing a result that is plausibly taken with a camera. Recent approaches, based on deep neural networks, produce impressive results but are either too slow to run at practical resolutions, or still contain objectionable artifacts. We propose a new end-to-end model for photorealistic style transfer that is both fast and inherently generates photorealistic results. The core of our approach is a feed-forward neural network that learns local edge-aware affine transforms that automatically obey the photorealism constraint. When trained on a diverse set of images and a variety of styles, our model can robustly apply style transfer to an arbitrary pair of input images. Compared to the state of the art, our method produces visually superior results and is three orders of magnitude faster, enabling real-time performance at 4K on a mobile phone. We validate our method with ablation and user studies.
연구 동기 및 목표
- 모바일 기기에서 실시간으로 작동하는 빠르고 종합적인 신경망을 개발하여 보편적인 포토 realism 스타일 전이를 구현하는 것.
- 색상 공간 내 국소적 애핀 변환을 학습하여 에지 구조와 색상 일관성을 유지함으로써 포토 realism을 강제하는 것.
- 그리드 기반 스타일 전이 방법에서 흔히 발생하는 공간 그리드 아티팩트를 제거하는 것.
- 분포 외부 또는 악성 입력에 대해 강건성과 부드러운 성능 저하를 보장하는 것.
- 추론 시 후처리 또는 최적화 없이 높은 성능을 달성하는 것.
제안 방법
- 모델은 이중 공간에서 각 픽셀의 변환이 국소적으로 애핀이고 에지 인식형인 변환을 예측하는 피드포워드 딥 신경망을 사용한다.
- 네트워크는 입력 이미지를 스타일링된 출력으로 매핑하기 위해 이중 그리드의 계수를 예측함으로써 국소적 애핀 변환을 학습한다.
- 그리드 아티팩트를 억제하고 공간의 매끄러움을 향상시키기 위해 이중 공간 라플라시안 정규화 기법을 도입한다.
- 포토 realism 제약 조건을 색상 공간 내 국소적 애핀 매핑을 통해 강제하기 위해 다양한 이미지 쌍으로 엔드 투 엔드로 훈련한다.
- 추론 시 저해상도 특징 추출 헤드(256×256)를 사용해 계수를 예측한 후, 전체 해상도에서 하드웨어 가속된 삼선형 보간을 수행한다.
- 모델은 모바일 GPU에서 효율적인 배포를 위해 16비트 부동소수점으로 정량화된다.
실험 결과
연구 질문
- RQ1피드포워드 신경망이 모바일 하드웨어에서 4K 해상도에서 실시간 포토 realism 스타일 전이를 달성할 수 있는가?
- RQ2이중 공간 내 국소적 애핀 변환은 최적화 또는 후처리 없이 본질적으로 포토 realism을 강제할 수 있는가?
- RQ3기존 최고 수준의 방법들과 비교해 본다면, 모델은 예측 불가능하거나 악성 입력에서 어떻게 성능을 내는가?
- RQ4모델은 추가 정규화 없이도 동영상 시퀀스에 일반화되어 시간적 일관성과 스타일 일관성을 유지할 수 있는가?
- RQ5기존 방법들과 비교해 볼 때, 포토 realism, 스타일링 충실도, 시각적 품질 간의 상호 교환 관계는 어떠한가?
주요 결과
- 이 방법은 16비트 정량화를 사용하여 스마트폰에서 4K 해상도에서 실시간 성능을 달성하며, 30Hz 이상으로 작동한다.
- 기존 최고 수준의 방법보다 3개 주문 수준 더 빠르며, 추론 시간이 해상도에 거의 영향을 받지 않는다.
- 사용자 연구 결과, 이 방법은 PhotoWCT, LST, WCT 2를 모두 능가하는 종합적인 이미지 품질과 스타일링 충실도를 보이며, WCT 2 수준의 포토 realism을 확보한다.
- 모델은 날카롭고 아티팩트가 없는 결과를 생성하며, 초상화나 단색 이미지와 같은 예측 불가능한 입력에 대해서도 부드럽게 성능이 떨어진다.
- 추가 정규화 없이도 비디오 스타일링이 시간적으로 일관되며, 동적 콘텐츠에 대한 강력한 일반화 능력을 보여준다.
- 이중 공간의 라플라시안 정규화 기법은 그리드 기반 방법에서 흔히 발생하는 공간 그리드 아티팩트를 성공적으로 제거한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.