Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Joint Spatial-Temporal Transformations for Video Inpainting

Yanhong Zeng, Jianlong Fu|arXiv (Cornell University)|2020. 07. 20.
Generative Adversarial Networks and Image Synthesis참고 문헌 23인용 수 18
한 줄 요약

이 논문은 다중 척도 패치 기반 자기주의를 사용하여 모든 입력 프레임에서 결손 영역을 동시에 보완하는 연합 공간-시간 트랜스포머 네트워크인 STTN을 제안한다. 공간-시간 적대적 손실을 최적화함으로써 STTN은 도전적인 마스크에서 이전 방법 대비 PSNR 2.4% 향상 및 VFID 19.7% 향상으로 최신 기술 수준을 달성한다.

ABSTRACT

High-quality video inpainting that completes missing regions in video frames is a promising yet challenging task. State-of-the-art approaches adopt attention models to complete a frame by searching missing contents from reference frames, and further complete whole videos frame by frame. However, these approaches can suffer from inconsistent attention results along spatial and temporal dimensions, which often leads to blurriness and temporal artifacts in videos. In this paper, we propose to learn a joint Spatial-Temporal Transformer Network (STTN) for video inpainting. Specifically, we simultaneously fill missing regions in all input frames by self-attention, and propose to optimize STTN by a spatial-temporal adversarial loss. To show the superiority of the proposed model, we conduct both quantitative and qualitative evaluations by using standard stationary masks and more realistic moving object masks. Demo videos are available at https://github.com/researchmm/STTN.

연구 동기 및 목표

  • 프레임 단위 영상 복구에서의 시간적 불일치성과 흐림 문제를 해결하기 위해 공간적 및 시간적 종속성을 동시에 모델링한다.
  • 복잡한 운동 및 외관 변화 상황에서 실패하는 프레임별 또는 단계별 주의 메커니즘의 한계를 극복한다.
  • 통합 트랜스포머 아키텍처를 통해 모든 입력 프레임을 동시에 보완함으로써 영상 복구 품질을 향상시킨다.
  • 새로운 공간-시간 적대적 손실을 통해 인지적 품질과 시간적 일관성을 향상시킨다.
  • 트랜스포머 내에서 다중 척도, 겹치지 않는 패치 표현을 통해 빠른 훈련 및 추론을 가능하게 한다.

제안 방법

  • 다양한 크기의 겹치지 않는 패치를 모든 프레임에서 추출하여 다양한 운동 패턴을 포착하는 다중 척도 패치 기반 주의 모듈을 제안한다.
  • 다중 헤드 트랜스포머를 활용해 다양한 척도의 공간적 패치 간 유사도를 계산하고, 주의 결과를 집계하여 일관된 콘텐츠 생성을 달성한다.
  • 업데이트된 컨텍스트를 사용해 결손 영역 특징을 반복적으로 개선하기 위해 연속된 공간-시간 트랜스포머 레이어를 스택한다.
  • 시간적 일관성과 인지적 품질을 동시에 최적화하는 공간-시간 적대적 손실을 도입한다.
  • 모든 입력 프레임을 순차적으로 처리하는 대신 동시에 처리하는 '다중 대 다수' 작업으로 영상 복구를 간주한다.
  • STTN 아키텍처를 가진 생성자 네트워크를 사용해 완성된 프레임을 생성하며, 적대적 손실과 함께 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1프레임 단위 방법과 비교해 연합 공간-시간 트랜스포머 아키텍처가 영상 복구의 시간적 일관성 향상과 흐림 감소에 기여하는가?
  • RQ2다중 척도 패치 기반 주의는 복잡한 운동과 외관 변화를 프레임 간에 효과적으로 모델링하는 데 얼마나 유용한가?
  • RQ3여러 트랜스포머 레이어를 스택함으로써 영상 복구 성능 향상이 지속적으로 이루어지는가?
  • RQ4공간-시간 적대적 손실이 생성된 영상의 인지적 품질 향상과 시간적 아티팩트 감소에 기여하는가?
  • RQ5이동하는 물체 또는 큰 가림막과 같은 현실적인 자유형 마스크 상황에서 제안된 방법은 어떻게 성능을 발휘하는가?

주요 결과

  • DAVIS 및 YouTube-VOS 데이터셋에서 자유형 마스크 상황에서 최신 기술 수준의 방법 대비 STTN은 PSNR 2.4% 상승 및 VFID 19.7% 상승을 달성한다.
  • 절단 분석 결과, 다중 척도 패치 표현이 성능 향상에 크게 기여하며, 108×60, 36×20, 18×10, 9×5 크기의 패치 조합이 가장 뛰어난 성능을 보였다.
  • 여덟 개의 트랜스포머 레이어 스택이 최고의 성능을 보였으며, 깊이가 증가할수록 지속적인 성능 향상이 나타나 반복적 개선의 이점이 있음을 시사한다.
  • 사용자 연구 결과, 정적 및 이동 마스크 모두에서 80%의 시험에서 STTN이 가장 뛰어난 성능을 기록했으며, 뛰어난 인지적 품질을 확인했다.
  • 강력한 성능에도 불구하고, 큰 마스크 상황에서 빠르고 연속적인 운동(예: 춤추는 동작)을 포착하지 못해 2D 패치 주의만으로는 3D 시간적 모델링이 부족해 흐림이 발생한다.
  • 비교적 효율적인 겹치지 않는 다중 척도 패치 표현 덕분에 빠른 훈련 및 추론 성능을 보이며, 실시간 영상 이해 작업에 적합하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.