Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Wi-Fi AP-Assisted Content Prefetching for On-Demand TV Series: A Reinforcement Learning Approach

Wen Hu, Yichao Jin|arXiv (Cornell University)|2017. 03. 10.
Caching and Content Delivery참고 문헌 25인용 수 4
한 줄 요약

이 논문은 시작 지연과 버퍼링을 줄임으로써 온디맨드 TV 시리즈의 QoE를 향상시키기 위해 강화학습 기반의 콘텐츠 프리패칭 프레임워크를 제안한다. 저장소, 전송 및 지연 비용을 균형 잡는 MDP(마르코프 결정 과정)로 프리패칭 결정을 모델링함으로써, 제안된 방법은 무작위 기반 기준 대비 80%의 히트 비율과 70%의 비용 절감을 달성하였으며, 실제 사용자 트레이스를 기반으로 한 추적 기반 실험에서 히우리스틱 및 오프라인 기준 기반 기준보다 뛰어난 성능을 보였다.

ABSTRACT

The emergence of smart Wi-Fi APs (Access Point), which are equipped with huge storage space, opens a new research area on how to utilize these resources at the edge network to improve users' quality of experience (QoE) (e.g., a short startup delay and smooth playback). One important research interest in this area is content prefetching, which predicts and accurately fetches contents ahead of users' requests to shift the traffic away during peak periods. However, in practice, the different video watching patterns among users, and the varying network connection status lead to the time-varying server load, which eventually makes the content prefetching problem challenging. To understand this challenge, this paper first performs a large-scale measurement study on users' AP connection and TV series watching patterns using real-traces. Then, based on the obtained insights, we formulate the content prefetching problem as a Markov Decision Process (MDP). The objective is to strike a balance between the increased prefetching&storage cost incurred by incorrect prediction and the reduced content download delay because of successful prediction. A learning-based approach is proposed to solve this problem and another three algorithms are adopted as baselines. In particular, first, we investigate the performance lower bound by using a random algorithm, and the upper bound by using an ideal offline approach. Then, we present a heuristic algorithm as another baseline. Finally, we design a reinforcement learning algorithm that is more practical to work in the online manner. Through extensive trace-based experiments, we demonstrate the performance gain of our design. Remarkably, our learning-based algorithm achieves a better precision and hit ratio (e.g., 80%) with about 70% (resp. 50%) cost saving compared to the random (resp. heuristic) algorithm.

연구 동기 및 목표

  • AP 지원 콘텐츠 프리패칭 환경에서 동적인 서버 로드와 변동성이 큰 사용자 영상 시청 패턴에 대응하기 위해.
  • 프리패칭 비용(저장소, 대역폭, 지연)과 사용자 QoE 간의 트레이드오프를 균형 잡기 위해.
  • 스마트 AP의 저장소를 활용하고 사용자 행동 패턴에서 학습하는 온라인, 적응형 프리패칭 전략을 설계하기 위해.
  • 실제 세계 트레이스를 기반으로 제안된 방법의 성능을 랜덤, 히우리스틱, 오프라인 기준 기준과 비교하기 위해.

제안 방법

  • 사용자 AP 연결 및 시청 행동에 기반한 상태 전이를 모델링함으로써 콘텐츠 프리패칭 문제를 마르코프 결정 과정(MDP)으로 공식화한다.
  • QoE 향상(예: 시작 지연 감소, 높은 히트 비율)과 비용(예: 저장소, 전송, 자원 경쟁) 간의 균형을 고려한 보상 함수를 정의한다.
  • 이력 사용자 트레이스를 기반으로 온라인, 적응형 방식으로 최적의 프리패칭 정책을 학습하는 강화학습 에이전트를 구현한다.
  • 8.5천 개의 시리즈에 걸쳐 2.7억 건의 사용자-AP 연결 및 180만 건의 TV 시리즈 세션에서 수집한 실제 트레이스를 사용해 모델을 훈련하고 평가한다.
  • 성능 한계를 설정하기 위해 랜덤 고정, 히우리스틱, 이상적인 오프라인 알고리즘의 세 가지 기준 기준과 RL 에이전트를 비교한다.
  • 큰 상태 공간을 다루고 실시간 배포에서 수렴을 보장하기 위해 함수 근사 및 탐색 전략을 적용한다.

실험 결과

연구 질문

  • RQ1사용자 AP 연결 패턴과 TV 시리즈 시청 행동은 시간에 따라 어떻게 변화하며, 프리패칭에 어떤 통찰을 제공할 수 있는가?
  • RQ2변동성이 큰 서버 로드 환경에서 프리패칭 비용과 사용자 QoE 간의 최적 트레이드오프는 무엇인가?
  • RQ3실제 트레이스 환경에서 강화학습 기반 접근법이 정적 또는 히우리스틱 프리패칭 정책을 능가할 수 있는가?
  • RQ4제안된 방법은 비용을 최소화하면서 히트 비율을 최대화하는 동시에 변화하는 네트워크 조건과 사용자 행동에 어떻게 적응하는가?

주요 결과

  • 60% 이상의 사용자가 자신의 최상위 1개 AP에서 50% 이상의 AP 연결을 처리하며, 90% 이상은 최상위 5개 AP에서 연결을 확보함으로써 강한 AP 애자성과 안정적인 연결성을 보여준다.
  • 사용자는 시간적, 순차적 패턴을 명백히 보이며, 동일한 TV 시리즈의 연속 에피소드를 자주 시청함으로써 효과적인 예측이 가능하다.
  • 제안된 강화학습 알고리즘은 랜덤 기준 대비 70%의 비용 절감을 달성하였고, 히우리스틱 기준 대비 50%의 비용 절감을 기록하였다.
  • RL 기반 접근법은 80%의 히트 비율을 달성하여 랜덤 기준을 크게 능가하였으며, 동적인 서버 로드 환경에 대한 강력한 적응성을 보였다.
  • 오프라인 최적 알고리즘은 거의 완벽한 히트 비율을 기록하여, 학습 기반 접근법이 이 상한선에 매우 가까이 도달하고 있음을 검증하였다.
  • 시스템은 스마트 AP의 저장소와 학습 기반 프리패칭을 조합함으로써 피크 시간대의 네트워크 부하를 크게 줄이고 사용자 QoE를 향상시킬 수 있음을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.