Skip to main content
QUICK REVIEW

[논문 리뷰] BiSTNet: Semantic Image Prior Guided Bidirectional Temporal Feature Fusion for Deep Exemplar-based Video Colorization

Yixin Yang, Zhongzheng Peng|arXiv (Cornell University)|2022. 12. 05.
melanin and skin pigmentation인용 수 4
한 줄 요약

BiSTNet는 예시 기반 영상 색상화를 위한 의미적 이미지 사전 지식을 기반으로 하는 이중 방향 시간 특징 융합 네트워크를 제안한다. 깊이 있는 의미적 대응과 다중 척도 순환 아키텍처를 활용하여 색상 전파를 향상시키고 잡음을 줄인다. 의미 지도 및 이중 방향 시간 융합을 통합함으로써 프레임 수준의 정확성과 시간적 일관성을 향상시켜 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

How to effectively explore the colors of reference exemplars and propagate them to colorize each frame is vital for exemplar-based video colorization. In this paper, we present an effective BiSTNet to explore colors of reference exemplars and utilize them to help video colorization by a bidirectional temporal feature fusion with the guidance of semantic image prior. We first establish the semantic correspondence between each frame and the reference exemplars in deep feature space to explore color information from reference exemplars. Then, to better propagate the colors of reference exemplars into each frame and avoid the inaccurate matches colors from exemplars we develop a simple yet effective bidirectional temporal feature fusion module to better colorize each frame. We note that there usually exist color-bleeding artifacts around the boundaries of the important objects in videos. To overcome this problem, we further develop a mixed expert block to extract semantic information for modeling the object boundaries of frames so that the semantic image prior can better guide the colorization process for better performance. In addition, we develop a multi-scale recurrent block to progressively colorize frames in a coarse-to-fine manner. Extensive experimental results demonstrate that the proposed BiSTNet performs favorably against state-of-the-art methods on the benchmark datasets. Our code will be made available at \url{https://yyang181.github.io/BiSTNet/}

연구 동기 및 목표

  • 예시 기반 영상 색상화에서 시간적 일관성 결여와 색상 번짐 잡음 문제를 해결하기 위해.
  • 깊이 있는 특징 공간에서 의미적 대응을 활용해 참조 예시에서 색상을 효과적으로 전달하여 프레임 수준의 색상화 정확도를 향상시키기 위해.
  • 참조 예시에서 정확하지 않은 색상 매칭의 영향을 이중 방향 시간 특징 융합을 통해 줄이기 위해.
  • 혼합 전문가 블록을 사용해 객체 의미와 윤곽선을 모델링하여 경계 인식 색상화를 향상시키기 위해.
  • 다중 척도 순환 블록을 통해 군집에서 세밀한 단계로 점진적으로 색상화를 개선함으로써 정확성을 높이기 위해.

제안 방법

  • 입력 프레임과 참조 예시 사이의 의미적 대응을 깊이 있는 특징 공간에서 설정하여 관련된 색상 정보를 전달한다.
  • 앞서와 뒤로의 시간 방향에서 특징을 융합하는 이중 방향 시간 특징 융합 블록(BTFB)을 도입하여 정확하지 않은 색상 전파를 억제한다.
  • 의미 분할 맵과 윤곽선 맵을 융합하여 객체 경계에서 색상화를 안내하고 색상 번짐을 줄이는 혼합 전문가 블록(MEB)을 활용한다.
  • 다중 척도 순환 블록(MSRB)을 사용해 군집에서 세밀한 단계로 점진적으로 색상화를 개선함으로써 국소적 및 전역적 색상 일관성을 향상시킨다.
  • 경계 정확도 향상과 도전적인 영역에 대한 강건성을 높이기 위해 윤곽선 손실과 하드 예제 마이닝 손실을 활용한다.
  • L1, 인지적, 그리고 적대적 손실의 조합을 통해 엔드 투 엔드로 모델을 훈련시켜 고품질이고 자연스러운 결과를 도출한다.

실험 결과

연구 질문

  • RQ1이중 방향 시간 특징 융합은 예시에서 정확하지 않은 색상 매칭의 영향을 영상 색상화에서 줄일 수 있는가?
  • RQ2의미적 이미지 사전 지식을 통합하면 경계 인식 색상화가 어떻게 향상되고 색상 번짐 잡음이 줄어드는가?
  • RQ3군집에서 세밀한 단계로 진행되는 다중 척도 순환 아키텍처는 프레임 수준의 색상화 품질과 시간적 일관성을 어느 정도 향상시키는가?
  • RQ4최신 기술 수준의 예시 기반 및 자동 영상 색상화 방법과 비교해 본다면 제안된 방법은 얼마나 효과적인가?
  • RQ5복잡한 실생활 장면에서 두 개의 참조 예시를 사용하면 단일 참조 프레임보다 성능이 향상되는가?

주요 결과

  • BiSTNet는 DAVIS 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하였으며, 정량적 지표와 시각적 품질 모두 기존의 예시 기반 및 자동 색상화 방법을 능가한다.
  • 절단 실험을 통해 이중 방향 시간 융합 블록을 제거할 경우 성능이 크게 하락함을 확인하여, 이 블록이 정확하지 않은 색상 전파를 억제하는 데 효과적임을 입증한다.
  • 혼합 전문가 블록은 색상 번짐 잡음을 감소시킨다: 의미 또는 윤곽선 마스크 없이 결과를 도출할 경우 심한 색상 누출(예: 셔츠 색상이 팔로 퍼짐)이 발생하지만, 전체 MEB를 사용할 경우 정확한 경계 색상화가 이루어진다.
  • 다중 척도 순환 블록은 전역적 색상 일관성을 향상시킨다; 이 블록이 없을 경우 색상 오염이 발생함(예: 屋根 색상이 울타리로 번짐), 이는 MSRB에 의해 완화된다.
  • 윤곽선 손실과 하드 예제 마이닝 손실은 성능 향상에 기여하며, 이들을 제거할 경우 경계 정확도와 전반적인 품질에 뚜렷한 열화가 발생한다.
  • 두 개의 참조 예시를 사용할 경우 단일 참조 프레임보다 더 좋은 결과를 얻을 수 있으나, 심지어 단일 참조 기반 베이스라인도 이전의 최신 기술 수준 방법을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.