[논문 리뷰] OpenDVC: An Open Source Implementation of the DVC Video Compression Method
OpenDVC는 PSNR 최적화 및 MS-SSIM 최적화 모델을 제공하는, 텐서플로우 기반의 오픈소스 딥 비디오 압축(DVC) 구현체이다. 원래 DVC보다 MS-SSIM 최적화 기준 모델을 제공하고, 인코딩된 엔트로피 모델을 활용하여 해상도 제약을 완화함으로써 x265와 유사한 성능을 달성하며, MS-SSIM 측면에서 더 뛰어난 성능을 보인다.
We introduce an open source Tensorflow implementation of the Deep Video Compression (DVC) method in this technical report. DVC is the first end-to-end optimized learned video compression method, achieving better MS-SSIM performance than the Low-Delay P (LDP) very fast setting of x265 and comparable PSNR performance with x265 (LDP very fast). At the time of writing this report, several learned video compression methods are superior to DVC, but currently none of them provides open source codes. We hope that our OpenDVC codes are able to provide a useful model for further development, and facilitate future researches on learned video compression. Different from the original DVC, which is only optimized for PSNR, we release not only the PSNR-optimized re-implementation, denoted by OpenDVC (PSNR), but also the MS-SSIM-optimized model OpenDVC (MS-SSIM). Our OpenDVC (MS-SSIM) model provides a more convincing baseline for MS-SSIM optimized methods, which can only compare with the PSNR optimized DVC in the past. The OpenDVC source codes and pre-trained models are publicly released at https://github.com/RenYang-home/OpenDVC.
연구 동기 및 목표
- 학습된 비디오 압축 분야의 후속 연구를 지원하기 위해 DVC 비디오 압축 방법의 오픈소스로 재현 가능한 구현체를 제공하는 것.
- 최신 학습된 비디오 압축 방법에 대한 공개된 소스 코드 부족 문제를 해결하여 비교 연구를 제약 없이 가능하게 하는 것.
- PSNR 최적화 및 MS-SSIM 최적화 모델을 모두 배포하여 MS-SSIM 중심의 접근 방식에 대한 공정한 벤치마킹을 가능하게 하는 것.
- 초기 하이퍼프리어 엔트로피 모델을 인덱스 기반 엔트로피 모델로 교체하여 입력 해상도 제약을 32의 배수에서 16의 배수로 감소시켜, 저해상도 입력과의 호환성을 향상시키는 것.
- 사전 학습된 모델과 함께 잘 문서화되고 재사용 가능한 코드베이스를 제공하여 향후 개발을 용이하게 하는 것.
제안 방법
- 5단계 구조와 7×7 커널을 사용하는 피라미드 네트워크를 활용해 연속 프레임 간의 운동 추정을 수행하는 DVC 프레임워크를 채택한다.
- 모든 레이어에 3×3 컨볼루션과 128개 필터를 사용하며, GDN 및 역방향 GDN 활성화 함수를 활용한 학습된 오토인코더를 사용해 운동 벡터를 압축한다.
- 기존 하이퍼프리어 엔트로피 모델을 인덱스 기반 엔트로피 모델로 교체하여 입력 해상도 제약을 32의 배수에서 16의 배수로 감소시킨다.
- 운동 보정 네트워크를 사용해 운동 보정 기반 참조 프레임을 생성하며, 3×3 컨볼루션과 스킵 연결을 활용한다.
- 잔여 데이터의 표현 능력을 향상시키기 위해 잔여 압축에 대해 5×5 커널을 사용하는 유사한 오토인코더를 적용한다.
- 진행적 파이프라인을 통해 모델을 학습한다: 먼저 운동 추정, 그 다음 운동 압축, 운동 보정, 마지막으로 가중치가 부여된 비용-왜곡 손실을 사용한 종단 간 공동 학습.
실험 결과
연구 질문
- RQ1DVC의 오픈소스 구현체는 학습된 비디오 압축 분야에서 더 접근성 있고 재현 가능한 연구를 가능하게 할 수 있는가?
- RQ2하이퍼프리어 엔트로피 모델을 인덱스 기반 엔트로피 모델로 교체할 경우 압축 성능과 입력 해상도의 유연성에 어떤 영향을 미치는가?
- RQ3MS-SSIM 최적화 버전의 DVC는 원래 PSNR 최적화 DVC보다 시각적 품질 측정 지표에서 뛰어나게 성능을 발휘할 수 있는가?
- RQ4OpenDVC의 성능가 x265의 PSNR 및 MS-SSIM 측정 기준과 비교했을 때 얼마나 유사하거나 뛰어나게 되는가?
- RQ5진행적 학습 스케줄링 전략은 종단 간 비디오 압축 파이프라인의 최적화에 효과적으로 기여하는가?
주요 결과
- OpenDVC (PSNR)는 원래 DVC와 동일한 PSNR 및 MS-SSIM 성능를 기록하며, x265(LDP very fast 설정)와 유사한 성능를 보인다.
- OpenDVC (MS-SSIM)는 MS-SSIM 측면에서 원래 DVC를 크게 뛰어넘으며, 시각적 최적화 비디오 압축 방법에 대한 더 적절한 기준 모델을 제공한다.
- 인덱스 기반 엔트로피 모델은 입력 해상도 제약을 32의 배수에서 16의 배수로 감소시켜 성능 손실 없이도 사용성 향상을 이룬다.
- MS-SSIM 최적화 모델은 PSNR 사전 학습 모델에서 시작하여 1 - MS-SSIM를 손실 함수로 사용해 미세조정함으로써 더 나은 시각적 품질을 달성한다.
- 후에 도입된 RLVC 접근 방식은 DVC 및 OpenDVC를 모두 초월하는 비용-왜곡 성능을 보이며, 학습된 비디오 압축 분야의 기준을 한층 높였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.