[논문 리뷰] DVC: An End-to-end Deep Video Compression Framework
이 논문은 신경망을 사용하여 운동 추정, 운동 압축, 잔여 압축을 종합적으로 최적화하는 최초의 엔드 투 엔드 딥 뷰잉 압축 프레임워크인 DVC를 제안한다. 학습된 광학 흐름과 통합된 비율-왜곡 손실을 사용하는 자동에코더 기반 압축을 통해 DVC는 비트레이트를 더 낮게 사용하면서도 PSNR에서 H.264를 능가하고 MS-SSIM에서 H.265와 동등한 성능을 달성한다.
Conventional video compression approaches use the predictive coding architecture and encode the corresponding motion information and residual information. In this paper, taking advantage of both classical architecture in the conventional video compression method and the powerful non-linear representation ability of neural networks, we propose the first end-to-end video compression deep model that jointly optimizes all the components for video compression. Specifically, learning based optical flow estimation is utilized to obtain the motion information and reconstruct the current frames. Then we employ two auto-encoder style neural networks to compress the corresponding motion and residual information. All the modules are jointly learned through a single loss function, in which they collaborate with each other by considering the trade-off between reducing the number of compression bits and improving quality of the decoded video. Experimental results show that the proposed approach can outperform the widely used video coding standard H.264 in terms of PSNR and be even on par with the latest standard H.265 in terms of MS-SSIM. Code is released at https://github.com/GuoLusjtu/DVC.
연구 동기 및 목표
- 기존 수작업으로 구성된 모듈의 한계를 극복하기 위해 모든 구성 요소를 종합적으로 최적화하는 엔드 투 엔드 딥 러닝 프레임워크를 개발하는 것.
- 영상 압축에 최적화된 운동 표현과 압축을 학습하는 데 도전하며, 정확도가 아닌 압축 효율성에 중점을 두는 것.
- 모든 네트워크 구성 요소에 걸쳐 통합된 비율-왜곡 손실 함수를 통해 비율-왜곡 최적화를 통합함으로써 압축 효율성을 향상시키는 것.
- 영상 압축, 컴퓨터 비전, 딥 러닝 간 격차를 해소하기 위해 모듈식이고 확장 가능한 프레임워크를 제공하는 것.
제안 방법
- 운동 보정을 위해 깊이 신경망을 사용하여 기존의 블록 기반 운동 추정을 대체하는 광학 흐름 추정을 수행한다.
- 운동 벡터와 잔여 프레임을 압축하기 위해 두 개의 자동에코더 스타일 신경망을 사용하며, 비트레이트 감소를 위한 압축된 표현을 학습한다.
- 모든 구성 요소—운동 추정, 압축, 양자화, 비트레이트 추정—은 단일 비율-왜곡 손실 함수를 사용해 함께 훈련된다.
- 손실 함수는 재구성 품질(왜곡)과 비트레이트(비율) 간의 균형을 맞추며, 개선된 효율성을 위한 엔드 투 엔드 최적화를 가능하게 한다.
- 더 나은 기울기 흐름과 성능을 확보하기 위해 운동 보정 및 압축 네트워크에서 잔여 블록과 사전 활성화 구조를 사용한다.
- 고급 광학 흐름 및 이미지 압축 모델의 플러그인 통합을 지원하여 모듈식 확장을 가능하게 한다.
실험 결과
연구 질문
- RQ1엔드 투 엔드 딥 러닝 프레임워크가 운동 추정, 운동 압축, 잔여 압축을 종합적으로 최적화할 수 있는가?
- RQ2수작업으로 구성된 운동 벡터 대신 신경망을 통해 운동 표현을 학습하면 압축 효율성이 향상되는가?
- RQ3모든 구성 요소에 걸쳐 통합된 비율-왜곡 손실 함수가 기존의 모듈식 영상 코덱(H.264, H.265)보다 우수한 성능을 낼 수 있는가?
- RQ4동일한 비트레이트에서 제안된 DVC 모델의 성능이 H.264 및 H.265의 PSNR 및 MS-SSIM 기준으로 어떻게 비교되는가?
주요 결과
- PSNR 기준으로 DVC는 H.264 대비 19.22%의 비트레이트 감소를 달성하여 뛰어난 성능을 보였다.
- MS-SSIM 기준으로 DVC는 H.264 대비 29% 이상의 비트레이트 감소를 기록했으며, 이는 이 측정 기준에서 H.265를 초월하는 성능이다.
- HEVC Class C 및 D 데이터셋에서 DVC는 H.264 대비 각각 3.88% 및 9.68%의 비트레이트 감소를 기록했다.
- Kinetics 데이터셋에서 훈련된 모델은 H.264 및 이전 연구의 베이스라인 방법보다 뛰어난 성능을 보였다.
- DVC는 H.265와 동일한 MS-SSIM 성능을 달성하면서도 더 낮은 비트레이트를 사용하여 비율-왜곡 효율성이 뛰어나다는 것을 입증했다.
- PSNR 기준으로 H.264 대비 BDBR(비율-왜곡 기반 비트레이트 감소율)가 19.22%이며, MS-SSIM 기준으로는 29.32%로 측정되어 DVC의 압축 우수성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.