Skip to main content
QUICK REVIEW

[논문 리뷰] Deficiency-Aware Masked Transformer for Video Inpainting

Yongsheng Yu, Heng Fan|arXiv (Cornell University)|2023. 07. 17.
Generative Adversarial Networks and Image Synthesis인용 수 5
한 줄 요약

이 논문은 결함 상황(모든 프레임에서 가려진 콘텐츠가 존재하지 않는 경우)에서의 화면 복구 성능을 햖थ기 위해 결함 인식형 마스킹 트랜스포머(Deficiency-Aware Masked Transformer, DMT)를 제안한다. DMT는 미리 훈련된 이미지 복구 모델(DMT$_{\text{img}}$)을 사전 지식으로 활용하여 이러한 상황에서의 환영(홀로지)을 향상시킨다. 토큰 선택, 마스크 활성화, 그리고 수신 필드 컨텍스트라이저를 통합함으로써 DMT는 계산 비용을 줄이고 특징 학습을 향상시키며, DAVIS에서 0.81 dB, YouTube-VOS에서 0.56 dB의 PSNR 향상을 달성하여 최신 기술 수준(SOTA)을 확립한다.

ABSTRACT

Recent video inpainting methods have made remarkable progress by utilizing explicit guidance, such as optical flow, to propagate cross-frame pixels. However, there are cases where cross-frame recurrence of the masked video is not available, resulting in a deficiency. In such situation, instead of borrowing pixels from other frames, the focus of the model shifts towards addressing the inverse problem. In this paper, we introduce a dual-modality-compatible inpainting framework called Deficiency-aware Masked Transformer (DMT), which offers three key advantages. Firstly, we pretrain a image inpainting model DMT_img serve as a prior for distilling the video model DMT_vid, thereby benefiting the hallucination of deficiency cases. Secondly, the self-attention module selectively incorporates spatiotemporal tokens to accelerate inference and remove noise signals. Thirdly, a simple yet effective Receptive Field Contextualizer is integrated into DMT, further improving performance. Extensive experiments conducted on YouTube-VOS and DAVIS datasets demonstrate that DMT_vid significantly outperforms previous solutions. The code and video demonstrations can be found at github.com/yeates/DMT.

연구 동기 및 목표

  • 모든 프레임에서 가려진 콘텐츠가 존재하지 않아서 프레임 간 전파가 실패하는 결함 상황에서의 영상 복구 과제를 해결한다.
  • 이미지 복구와 영상 복구 간 도메인 갭을 극복하기 위해 사전 훈련된 이미지 복구 모델의 지식을 영상 생성으로 이관한다.
  • 유효한 시공간 토큰만 선택적으로 처리하고, 히우리스틱 기반 메커니즘으로 유효하지 않은 토큰을 활성화함으로써 추론 효율성과 강인성을 향상시킨다.
  • 고주파 신호를 포착할 수 있는 새로운 수신 필드 컨텍스트라이저(RFC)를 도입하여 수신 필드를 확장함으로써 특징 표현을 향상시킨다.
  • 화면 단위 마스크 없이 텍스트나 스트로크 입력으로만 한 번에 객체를 제거할 수 있도록 모델을 적응시켜 실제 적용 가능성 향상.

제안 방법

  • 결함 상황에서의 영상 복구를 위한 사전 지식으로 사용하기 위해 독립적인 이미지 복구 모델(DMT$_{\text{img}}$)을 사전 훈련한다.
  • 지속적 학습 손실을 사용하여 DMT$_{\text{img}}$에서 지식을 전이하면서 유연성과 안정성을 균형 잡는 방식으로 영상 모델(DMT$_{\text{vid}}$)을 처음부터 훈련한다.
  • 모든 내부 픽셀이 마스킹된 시공간 토큰을 폐기하는 토큰 선택 메커니즘을 도입하여 노이즈와 계산 비용을 감소시킨다.
  • 자기 주의 및 컨볼루션 연산 중에 반복적으로 유효하지 않은 토큰을 활성화함으로써 특징 학습을 향상시키는 마스크 활성화 알고리즘을 제안한다.
  • 큰 커널 크기(K=13)를 가진 수신 필드 컨텍스트라이저(RFC)를 통합하여 수신 필드를 확장하고 고주파 세부 정보를 포착한다.
  • 이미지 데이터셋에 접근할 필요 없이 생성 전이 지식을 전달하기 위해 이동 정규화(식 5)를 적용한다.

실험 결과

연구 질문

  • RQ1사전 훈련된 이미지 복구 모델이 결함 상황에서 영상 복구 성능 향상에 효과적으로 사전 지식으로 기능할 수 있는가?
  • RQ2이미지 복구와 영상 복구 간 도메인 갭을 어떻게 극복하여 지식을 효과적으로 이관할 수 있는가?
  • RQ3성능을 유지하면서 영상 복구 트랜스포머의 계산 복잡도와 노이즈를 줄일 수 있는 메커니즘은 무엇인가?
  • RQ4수신 필드를 확장함으로써 특징 표현과 복구 품질은 어느 정도 향상되는가?
  • RQ5제안된 프레임워크는 화면 단위 마스크 없이도 일회성 객체 제거 작업에 일반화 가능한가?

주요 결과

  • DMT$_{\text{vid}}$는 DAVIS 데이터셋에서 이전 SOTA 대비 0.81 dB, YouTube-VOS에서 0.56 dB의 PSNR 향상을 달성하여 최신 기술 수준의 성능을 입증했다.
  • K=13인 수신 필드 컨텍스트라이저(RFC)가 최고의 성능을 기록했으며, RFC 없이 기준 모델 대비 0.48 dB 향상되었고, FFC 기반 대안 대비 0.14 dB 향상되었다.
  • 마스크 활성화 메커니즘을 생략할 경우 PSNR가 1.84 dB 감소하여 이 메커니즘이 유효하지 않은 토큰 복구에 핵심적인 역할을 한다는 점을 시사한다.
  • 토큰 선택은 완전히 마스킹된 토큰을 필터링함으로써 계산 비용을 줄이고 추론 효율성을 향상시키며, 이를 제거할 경우 PSNR가 0.08 dB 감소한다.
  • 이동 정규화는 이미지 모델에서 영상 모델로의 지식 전이를 가능하게 하여, 이를 생략할 경우 PSNR가 0.31 dB 향상된다.
  • 모델은 훈련 분포 외의 애니메이션 영상과 같은 실제 환경 상황에서도 잘 일반화되며, 텍스트나 스트로크 입력을 통해 일회성 객체 제거를 지원한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.