Skip to main content
QUICK REVIEW

[논문 리뷰] Convex Hull Prediction for Adaptive Video Streaming by Recurrent Learning

Somdyuti Paul, Andrey Norkin|arXiv (Cornell University)|2022. 06. 10.
Image and Video Quality Assessment인용 수 4
한 줄 요약

이 논문은 적응형 비디오 스트리밍 비트레이트 계단을 위한 각 샷 별 볼록껍질을 예측하는 순환 합성곱 신경망(RCN) 모델인 RCN-Hull을 제안한다. 이는 사전 인코딩 시간을 크게 줄인다. 공간-시간 특징을 Conv-GRUs를 통해 활용하고, 이중 단계의 전이 학습 전략을 적용함으로써, 평균 58.0%의 시간 절감을 달성했으며, 지표값과의 평균 BD-비트레이트 오차는 0.08%이며, 평균 절대편차는 0.44%로, 프oxy 기반 및 특징 기반 방법들을 능가한다.

ABSTRACT

Adaptive video streaming relies on the construction of efficient bitrate ladders to deliver the best possible visual quality to viewers under bandwidth constraints. The traditional method of content dependent bitrate ladder selection requires a video shot to be pre-encoded with multiple encoding parameters to find the optimal operating points given by the convex hull of the resulting rate-quality curves. However, this pre-encoding step is equivalent to an exhaustive search process over the space of possible encoding parameters, which causes significant overhead in terms of both computation and time expenditure. To reduce this overhead, we propose a deep learning based method of content aware convex hull prediction. We employ a recurrent convolutional network (RCN) to implicitly analyze the spatiotemporal complexity of video shots in order to predict their convex hulls. A two-step transfer learning scheme is adopted to train our proposed RCN-Hull model, which ensures sufficient content diversity to analyze scene complexity, while also making it possible to capture the scene statistics of pristine source videos. Our experimental results reveal that our proposed model yields better approximations of the optimal convex hulls, and offers competitive time savings as compared to existing approaches. On average, the pre-encoding time was reduced by 53.8% by our method, while the average Bjontegaard delta bitrate (BD-rate) of the predicted convex hulls against ground truth was 0.26%, and the mean absolute deviation of the BD-rate distribution was 0.57%.

연구 동기 및 목표

  • 적응형 비디오 스트리밍에서 각 샷 별 볼록껍질 생성에 따른 높은 계산 및 시간 오버헤드를 줄이기 위해.
  • 전체 사전 인코딩 없이도 최적의 비트레이트-품질 포인트를 예측함으로써 콘텐츠 인식 기반 비트레이트 계단 최적화를 가능하게 하기 위해.
  • 비디오 샷 내의 장기적인 공간-시간 복잡성을 정확한 볼록껍질 추정을 위해 포괄하는 딥 러닝 모델을 개발하기 위해.
  • 기존 방법들과 비교해도 높은 정확도를 유지하면서도 상당한 시간 절감을 달성하기 위해.
  • 전이 학습 및 엔드 투 엔드 학습을 통해 다양한 비디오 콘텐츠와 샷 길이에 일반화할 수 있도록 하기 위해.

제안 방법

  • Conv-GRUs 기반의 순환 합성곱 신경망(RCN)을 사용하여 비디오 샷 프레임 간의 공간적 및 시간적 특징을 동시에 모델링한다.
  • 모델은 이중 단계의 전이 학습 전략을 통해 훈련된다: 먼저 다양한 비디오 샷 데이터셋에서 훈련하고, 이후 원본 소스 비디오에서 세부 장면 통계를 포착하기 위해 미세조정한다.
  • 각 샷의 300프레임 클립에서 공간-시간 특징을 추출하여 장면의 복잡성을 표현하고 볼록껍질 포인트를 예측한다.
  • RCN-Hull 모델은 비트레이트-품질 곡선 상의 파레토 최적 포인트를 예측하여, 전체 사전 인코딩 없이도 진짜 볼록껍질을 근사한다.
  • 모델 성능 평가에는 지표값 및 기준 방법과의 비교에서 BD-비트레이트, 평균 절대편차(MAD), 시간 절감률을 사용한다.
  • 모델은 여섯 개의 테스트 시퀀스와 짧은 2~3초 비디오 세그먼트에서 검증되었으며, 샷 길이에 걸쳐 뛰어난 강건성을 보였다.

실험 결과

연구 질문

  • RQ1전체 사전 인코딩 없이도 딥 러닝 모델이 비디오 샷의 볼록껍질을 정확하게 예측할 수 있는가?
  • RQ2RCN-Hull 모델은 프록시 기반 및 수작업 특징 기반 방법과 비교해 예측 정확도와 시간 효율성 측면에서 어떻게 다른가?
  • RQ3모델은 다양한 샷 길이와 비디오 콘텐츠 유형에 얼마나 잘 일반화되는가?
  • RQ4이중 단계 전이 학습 전략이 모델 성능과 학습 효율성에 어떤 영향을 미치는가?
  • RQ5모델은 지표값 볼록껍질과의 낮은 BD-비트레이트 편차를 유지하면서도 상당한 시간 절감을 달성할 수 있는가?

주요 결과

  • RCN-Hull 모델은 전체 사전 인코딩 대비 평균 58.0%의 시간 절감을 달성했으며, 보간 기반 및 프록시 기반 방법보다 뚜렷이 뛰어났다.
  • 예측된 볼록껍질의 평균 BD-비트레이트는 0.08%로, 지표값 비트레이트-품질 곡선에 근접한 최적의 근사치를 나타낸다.
  • BD-비트레이트 분포의 평균 절대편차(MAD)는 0.44%로, 예측의 분산이 낮고 신뢰성이 높음을 보여준다.
  • 짧은 비디오 샷(2~3초)에서도 뛰어난 성능 유지를 보였으며, 최대 70.1%의 시간 절감과 ±1% 이내의 BD-비트레이트를 기록했다.
  • 특히 더 긴 샷과 고해상도 시퀀스에서 RCN-Hull은 정확도(낮은 BD-비트레이트 및 MAD)와 속도 면에서 프록시 기반 및 특징 기반 모델을 모두 능가했다.
  • 다양한 비디오 콘텐츠에 걸쳐 일관된 성능을 보였으며, 'Wildlife'와 'Aspen' 시퀀스에서는 최소한의 편차를 보였고, 'Into Tree'에서는 소량의 오차만 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.