Skip to main content
QUICK REVIEW

[논문 리뷰] MuZero with Self-competition for Rate Control in VP9 Video Compression

Amol Mandhane, Anton Zhernov|arXiv (Cornell University)|2022. 02. 14.
Advanced Wireless Network Optimization인용 수 13
한 줄 요약

이 논문은 VP9 영상 압축을 위한 강화학습 기반 비트레이트 제어 시스템인 MuZero-RC를 제안하며, 영상 품질과 비트레이트 제약 조건 간의 트레이드오프를 최적화하기 위해 새로운 자기 경쟁 보상 메커니즘을 사용한다. libvpx의 표준 이중패ass VBR 비트레이트 제어 대비 평균적으로 6.28%의 비트레이트 감소(PSNR BD-rate 기준)를 달성하였으며, 제약 조건 준수 능력이 향상되고 다양한 영상 콘텐츠에서 개선된 계획 수립 능력을 보였다.

ABSTRACT

Video streaming usage has seen a significant rise as entertainment, education, and business increasingly rely on online video. Optimizing video compression has the potential to increase access and quality of content to users, and reduce energy use and costs overall. In this paper, we present an application of the MuZero algorithm to the challenge of video compression. Specifically, we target the problem of learning a rate control policy to select the quantization parameters (QP) in the encoding process of libvpx, an open source VP9 video compression library widely used by popular video-on-demand (VOD) services. We treat this as a sequential decision making problem to maximize the video quality with an episodic constraint imposed by the target bitrate. Notably, we introduce a novel self-competition based reward mechanism to solve constrained RL with variable constraint satisfaction difficulty, which is challenging for existing constrained RL methods. We demonstrate that the MuZero-based rate control achieves an average 6.28% reduction in size of the compressed videos for the same delivered video quality level (measured as PSNR BD-rate) compared to libvpx's two-pass VBR rate control policy, while having better constraint satisfaction behavior.

연구 동기 및 목표

  • 고정된 비트레이트 예산 내에서 영상 품질을 최대화하기 위해 양자화 파라미터(QPs)를 선택하는 데 있어 VP9 인코딩에서 최적의 비트레이트 제어 정책을 학습하는 데 도전하는 것.
  • 다양한 영상 콘텐츠에서 복잡하고 비선형적인 비트레이트-왜곡 트레이드오프를 다루기 어려운 수동으로 설정된 모델에 의존하는传통적인 히우리스틱 비트레이트 제어 방법의 한계를 극복하는 것.
  • 에피소드 기반 제약 조건이 존재하는 블랙박스 영상 인코더 환경에서 순차적 결정을 내릴 수 있는 강화학습 프레임워크를 개발하는 것.
  • libvpx의 결정론적 VBR 정책이 종종 목표 비트레이트를 초과하는 경향이 있기 때문에, 이에 비해 비트레이트 제약 조건 준수 능력을 향상시키는 것.
  • 코덱 전용 세부 정보에 의존하지 않는 방법 설계를 통해 다른 코덱, 품질 측정 지표 또는 제약 유형(예: 최소 품질 목표)으로의 일반화를 가능하게 하는 것.

제안 방법

  • 비트레이트 제어 문제를 순차적 결정 문제로 공식화하여, 에이전트가 각 프레임에 대해 QP 값을 선택하여 비트레이트 제약 조건 하에서 영상 품질을 최대화하도록 한다.
  • 환경이 미분 가능하지 않아도 되는, 세계 모델과 계획 정책을 동시에 학습하는 MuZero 알고리즘을 적용한다.
  • 새로운 자기 경쟁 보상 메커니즘을 도입: 동일한 영상-목표 비트레이트 쌍에 대해 에이전트가 자신의 과거 성능과 경쟁함으로써 보상 형상화를 위한 동적이고 적응적인 기준을 생성한다.
  • 보상은 동일한 영상-목표 비트레이트 쌍에서 현재 성능(PSNR)과 이력 평균 성능의 차이로 계산되며, 시간이 지남에 따라 향상되도록 유도한다.
  • 자기 경쟁 기반 기준을 안정화하기 위해 YouTube UGC 데이터셋의 3062개 5초 클립에서 학습을 수행하였으며, 각 [영상, 목표 비트레이트] 쌍은 다수의 인코딩을 통해 반복 처리되었다.
  • 최종 정책는 libvpx의 SimpleEncode API를 통해 구현되어 기존 영상 스트리밍 파이프라인에 직접 통합 가능하다.

실험 결과

연구 질문

  • RQ1딥 강화학습 에이전트는 libvpx와 같은 블랙박스 영상 인코더 환경에서 비트레이트 제어 정책을 효과적으로 학습할 수 있는가?
  • RQ2비디오 간 제약 조건 준수 난이도가 다양할 경우, 자기 경쟁 기반 보상 메커니즘이 제약 조건이 있는 강화학습 성능을 향상시킬 수 있는가?
  • RQ3MuZero-RC 에이전트는 libvpx의 이중패스 VBR 비트레이트 제어보다 더 낮은 비트레이트로 더 높은 영상 품질을 달성할 수 있는가?
  • RQ4전체 인코딩 효율성을 향상시키면서도 비트레이트 제약 조건 준수를 더 탄탄하게 유지할 수 있는가?
  • RQ5이 방법은 다른 코덱, 품질 측정 지표 또는 최소 품질 목표와 같은 다른 제약 유형으로 일반화될 수 있는가?

주요 결과

  • MuZero-RC는 3062개 영상 클립 전반에서 libvpx의 이중패스 VBR 비트레이트 제어 대비 평균적으로 6.28%의 비트레이트 감소(PSNR BD-rate 기준)를 달성하였다.
  • 에이전트는 비트레이트 제약 조건 준수 능력이 크게 향상되었으며, 목표 비트레이트를 5% 초과하는 영상 비율이 2.04%에 불과했고, libvpx의 경우 64.00%에 달했다.
  • MuZero-RC는 목표 비트레이트의 5% 이내에 머무는 영상 비율이 84.14%였으며, libvpx의 71.34%에 비해 우수한 제약 준수 능력을 보였다.
  • 에이전트는 개선된 계획 수립 행동을 보였는데, 예를 들어 고운동 프레임이 후반에 올 경우 초기에 비트를 절약하여 품질을 유지하거나, 개별 프레임에서 극심한 PSNR 하락을 방지하는 방식이었다.
  • 특히 영상 끝부분 근처에서 장면 전환이 일어나는 경우, MuZero-RC는 향후 더 높은 품질이 필요할 것을 예측하여 비트를 사전에 할당하는 반면, libvpx는 종종 예산을 소진하는 경향이 있었다.
  • 자기 경쟁 메커니즘은 변수적이고 복잡한 비트레이트-왜곡 동역학을 가진 환경에서도 안정적인 학습과 효과적인 탐색을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.