[논문 리뷰] Instance-Adaptive Video Compression: Improving Neural Codecs by Training on the Test Set
이 논문은 인스턴스 적응형(InstA) 비디오 압축을 제안한다. 여기서 사전 훈련된 신경 압축 코덱이 인코딩 시간에 각 테스트 비디오 시퀀스에서 미세조정된다. 미세조정된 모델 파라미터는 엔트로피 코딩되어 잠재 코드와 함께 전송되며, 이로 인해 기본 모델 대비 최대 27%의 BD-비트레이트 절감과 H.265 대비 44%의 절감을 이끌어내며, 더 작은 모델을 사용함으로써 디코더 복잡도를 70% 감소시킨다.
We introduce a video compression algorithm based on instance-adaptive learning. On each video sequence to be transmitted, we finetune a pretrained compression model. The optimal parameters are transmitted to the receiver along with the latent code. By entropy-coding the parameter updates under a suitable mixture model prior, we ensure that the network parameters can be encoded efficiently. This instance-adaptive compression algorithm is agnostic about the choice of base model and has the potential to improve any neural video codec. On UVG, HEVC, and Xiph datasets, our codec improves the performance of a scale-space flow model by between 21% and 27% BD-rate savings, and that of a state-of-the-art B-frame model by 17 to 20% BD-rate savings. We also demonstrate that instance-adaptive finetuning improves the robustness to domain shift. Finally, our approach reduces the capacity requirements of compression models. We show that it enables a competitive performance even after reducing the network size by 70%.
연구 동기 및 목표
- 도메인 이탈과 제한된 훈련 데이터 하에서 신경 비디오 코덱의 성능 격차를 해소하기 위해 일반화 요구 조건을 완화함으로써 문제를 해결한다.
- 아키텍처나 훈련 분포를 수정하지 않고도 신경 코덱의 비율-왜곡 성능을 향상시킨다.
- 더 작은, 인스턴스 최적화된 모델을 통해 디코더 측 계산 복잡도를 감소시킨다.
- 기존 코덱에서처럼 인코더 계산량과 압축 효율성 사이의 트레이드오프를 가능하게 하며, 인코딩 시간을 늘림으로써 유사한 효과를 달성한다.
- UVG, HEVC, Xiph-5N 등 다양한 비디오 데이터셋에서의 강건성과 효율성 향상을 입증한다.
제안 방법
- 테스트 시간에 각 개별 비디오 시퀀스에서 사전 훈련된 신경 비디오 코덱을 인스턴스 적응형 학습을 사용해 미세조정한다.
- 모델 파라미터의 비용을 최소화하기 위해 학습된 혼합 모델 사전 분포 하에서 엔트로피 코딩을 사용해 압축 및 전송한다.
- 각각 별도의 인코더, 사전, 디코더 네트워크를 갖는 변동형 오토인코더 프레임워크를 사용하며, 인코더와 사전는 각 비디오 인스턴스별로 업데이트된다.
- 기본 모델에서의 델타 업데이트만 전송함으로써 전체 가중치를 전송하지 않아 파라미터 전송 비용을 압축한다.
- 일반화성을 입증하기 위해 P-프레임(스케일-스페이스 플로우) 및 B-프레임(최신 기술) 아키텍처 모두에 이 방법을 적용한다.
- 미세조정이 몇 단계만 이루어져도 저비용이 되도록 파라미터 업데이트를 위한 엔트로피 모델을 최적화한다.
실험 결과
연구 질문
- RQ1고정된 글로벌 모델 대비 인스턴스 적응형 미세조정이 신경 비디오 코덱의 비율-왜곡 성능을 크게 향상시킬 수 있는가?
- RQ2자연 영상과 애니메이션 영상 간의 도메인 이탈에 대해 인스턴스 적응형 학습이 강건성을 향상시키는가?
- RQ3인스턴스 적응을 통해 신경 코덱의 모델 크기를 얼마나 줄일 수 있으며, 경쟁적인 성능를 유지할 수 있는가?
- RQ4실제 비디오 압축 환경에서 인코더 측 계산량과 압축 효율성 사이의 트레이드오프는 얼마나 효과적인가?
- RQ5미세조정된 파라미터 전송 오버헤드를 전체 비디오 시퀀스에 걸쳐 압축할 수 있는 정도는 어느 정도인가?
주요 결과
- UVG-1k, HEVC 클래스-B, Xiph-5N 데이터셋에서 InstA는 기본 스케일-스페이스 플로우 모델 대비 21%에서 27%의 BD-비트레이트 절감을 달성한다.
- 최신 기술의 B-프레임 모델에 대해 InstA는 기본 모델 대비 17%에서 20%의 BD-비트레이트 절감을 제공한다.
- 동일한 데이터셋에서 InstA는 ffmpeg(x265)의 H.265 구현보다 5%에서 44%의 BD-비트레이트 절감을 기록한다.
- 이 방법은 도메인 이탈에 대한 강건성을 향상시키며, 자연 영상에서 훈련된 모델을 사용해 애니메이션 시퀀스를 압축할 때 뚜렷한 성능 향상을 보인다.
- 네트워크 크기를 70% 감소시킨 후에도 InstA는 경쟁적인 성능를 유지하며, 표현력 요구 사항이 감소했음을 보여준다.
- 더 작은 모델을 사용함으로써 디코더 측 계산 비용은 70% 감소했으며, Tesla V100 GPU에서 초기 파라미터 디코딩 지연은 0.2초 이하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.