[논문 리뷰] FVC: A New Framework towards Deep Video Compression in Feature Space
이 논문은 변형 가능 컨볼루션과 다중 프레임 특징 융합을 사용하여 움직임 추정, 보정 및 잔여 압축을 모두 특징 공간에서 수행하는 새로운 딥 뷰어오 압축 프레임워크인 FVC를 제안한다. 동적 커널 정렬을 위한 학습된 오프셋 맵과 참조 특징 집합을 위한 비국소 주의 메커니즘을 활용함으로써, FVC는 HEVC, UVG, VTL 및 MCL-JCV 데이터셋에서 최신 기술 수준의 성능을 달성하여 기존 방법보다 PSNR 및 BD-레이트 효율성 측면에서 뛰어난 성능을 보였다.
Learning based video compression attracts increasing attention in the past few years. The previous hybrid coding approaches rely on pixel space operations to reduce spatial and temporal redundancy, which may suffer from inaccurate motion estimation or less effective motion compensation. In this work, we propose a feature-space video coding network (FVC) by performing all major operations (i.e., motion estimation, motion compression, motion compensation and residual compression) in the feature space. Specifically, in the proposed deformable compensation module, we first apply motion estimation in the feature space to produce motion information (i.e., the offset maps), which will be compressed by using the auto-encoder style network. Then we perform motion compensation by using deformable convolution and generate the predicted feature. After that, we compress the residual feature between the feature from the current frame and the predicted feature from our deformable compensation module. For better frame reconstruction, the reference features from multiple previous reconstructed frames are also fused by using the non-local attention mechanism in the multi-frame feature fusion module. Comprehensive experimental results demonstrate that the proposed framework achieves the state-of-the-art performance on four benchmark datasets including HEVC, UVG, VTL and MCL-JCV.
연구 동기 및 목표
- 복잡한 비정적 움직임에서 발생하는 정확도 결함으로 인해 기존의 픽셀 수준의 움직임 추정 및 보정 기법에 한계가 존재하는 문제를 해결하기 위해.
- 학습된 오프셋 맵을 활용한 변형 가능 컨볼루션을 통해 특징 공간에서의 연산을 수행하여 움직임 보정 정확도를 향상시키기 위해.
- 비국소 주의 메커니즘을 사용해 이전에 복원된 다수의 프레임에서 특징을 융합하여 프레임 재구성 품질을 향상시키기 위해.
- 특징 공간에서의 핵심 연산(움직임 추정, 보정, 잔여 압축)을 모두 수행하는 하이브리드 딥 뷰어오 압축 프레임워크를 종단 간(end-to-end)으로 훈련시킬 수 있도록 하기 위해.
- 기존의 학습 기반 뷰어오 코덱들과 비교해 더 뛰어난 압축 효율성과 재구성 품질을 달성하기 위해.
제안 방법
- 움직임 추정은 특징 공간에서 수행되어 변형 가능 컨볼루션을 위한 움직임 보정을 안내하는 오프셋 맵을 생성한다.
- 오프셋 맵은 자동에코더 스타일의 네트워크를 사용해 압축되고, 재구성되어 변형 가능 컨볼루션에서 현재 프레임의 특징을 예측하는 데 사용된다.
- 정답 특징과 예측 특징 간의 잔여 특징은 다른 자동에코더 스타일의 네트워크를 사용해 압축된다.
- 다중 프레임 특징 융합 모듈은 비국소 주의를 사용해 이전에 복원된 다수의 프레임에서 특징을 융합하여 초도 재구성을 개선한다.
- 모든 구성 요소는 종단 간 훈련이 가능하며, 전체 프레임워크는 비용-왜곡 성능 최적화를 위해 최적화된다.
- 프레임워크는 전통적인 뷰어오 코덱의 구조를 유지하면서 픽셀 수준의 연산을 특징 공간의 연산으로 대체하는 하이브리드 설계를 사용한다.
실험 결과
연구 질문
- RQ1특징 공간에서 변형 가능 컨볼루션을 사용한 움직임 보정이 기존의 픽셀 수준의 광학 흐름 기반 방법보다 뷰어오 압축에서 더 나은 성능을 내는가?
- RQ2특징 공간에서 학습된 오프셋 맵으로 움직임 정보를 압축하는 것이 픽셀 공간에서 광학 흐름을 압축하는 것보다 더 나은 비용-왜곡 성능을 제공하는가?
- RQ3비국소 주의를 사용한 다중 프레임 특징 융합이 이전 다수의 프레임에서 시간적 맥락을 활용하여 재구성 품질을 향상시킬 수 있는가?
- RQ4모든 핵심 연산(움직임 추정, 보정, 잔여 압축)이 특징 공간에서 수행되는 경우, 딥 뷰어오 압축 네트워크를 종단 간으로 훈련시키는 것이 가능한가?
- RQ5제안된 FVC 프레임워크가 HEVC, UVG, VTL 및 MCL-JCV를 포함한 다양한 벤치마크 데이터셋에서 최신 기술 수준의 성능을 달성하는가?
주요 결과
- DVC*와 비교할 때 HEVC Class C 데이터셋에서 0.017 bpp에서 1.75 dB의 PSNR 향상을 기록하여 특징 공간 움직임 보정의 효과를 입증하였다.
- 변형 가능 보정 모듈은 움직임 코딩 비트레이트를 65% 감소시켰고, RaceHorses 시퀀스의 줌 인 패치에서 0.27 dB의 PSNR 향상을 달성하였다.
- HEVC Class D 데이터셋에서 FVC는 H.265에 비해 BD-레이트 성능을 -18.39% 향상시켜 DVC 및 DVC*를 초월하였다.
- 더 가벼운 버전인 FVC-basic는 BD-레이트 성능을 -7.09% 향상시켰고, 1920×1080 영상에서 추론 시간을 201ms로 단축시켰다.
- 다중 프레임 특징 융합 모듈은 재구성 품질 향상에 기여했으며, 융합에 소요되는 시간은 347ms로 향후 최적화가 가능하다.
- 네 가지 벤치마크 데이터셋에 대한 종합적인 실험을 통해 FVC는 PSNR 및 BD-레이트 지표 모두에서 최신 기술 수준의 성능을 달성함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.