Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Streaming Perception using Deep Reinforcement Learning.

Anurag Ghosh, Akshay Nambi|arXiv (Cornell University)|2021. 06. 10.
Advanced Bandit Algorithms Research참고 문헌 41인용 수 7
한 줄 요약

이 논문은 실시간으로 정확도와 지연 시간을 동시에 균형 잡는 데에 깊이 강화학습 기반 접근법을 제안한다. 이는 정확도와 지연 시간의 상호보완적 관계를 통합 보상 함수를 가진 연역적 밴드잇 문제로 공식화하여, 상태기반 정책을 학습시켜 공개 데이터셋에서 최신 기술보다 뛰어난 성능을 달성한다.

ABSTRACT

Executing computer vision models on streaming visual data, or streaming perception is an emerging problem, with applications in self-driving, embodied agents, and augmented/virtual reality. The development of such systems is largely governed by the accuracy and latency of the processing pipeline. While past work has proposed numerous approximate execution frameworks, their decision functions solely focus on optimizing latency, accuracy, or energy, etc. This results in sub-optimum decisions, affecting the overall system performance. We argue that the streaming perception systems should holistically maximize the overall system performance (i.e., considering both accuracy and latency simultaneously). To this end, we describe a new approach based on deep reinforcement learning to learn these tradeoffs at runtime for streaming perception. This tradeoff optimization is formulated as a novel deep contextual bandit problem and we design a new reward function that holistically integrates latency and accuracy into a single metric. We show that our agent can learn a competitive policy across multiple decision dimensions, which outperforms state-of-the-art policies on public datasets.

연구 동기 및 목표

  • 지연 시간이나 정확도와 같이 단일 지표에 집중하는 스트리밍 인식 시스템에서의 비최적의 의사결정 문제를 해결하기 위해.
  • 실시간으로 정확도를 극대화하고 지연 시간을 최소화함으로써 시스템 성능을 종합적으로 최적화하기 위해.
  • 스트리밍 인식에서의 동적 트레이드오프를 통합 보상 함수를 가진 연역적 밴드잇 문제로 모델링하기 위해.
  • 런타임 중 다양한 입력 데이터와 시스템 제약 조건에 적응할 수 있는 학습 가능한 정책을 개발하기 위해.
  • 공개 데이터셋에서 방법을 평가하고 최신 기술 대비 뛰어난 성능을 입증하기 위해.

제안 방법

  • 스트리밍 인식 의사결정 문제를 딥 컨텍스트 밴드잇으로 공식화하여, 행동은 처리 설정 선택을 포함한다.
  • 지연 시간과 정확도를 하나의 지표로 통합하는 새로운 보상 함수를 설계하여 통합 최적화를 가능하게 한다.
  • 실시간 컨텍스트를 바탕으로 누적 보상을 극대화하기 위해 행동(예: 모델 해상도, 프레임 레이트)을 선택하는 딥 Q네트워크(DQN) 에이전트를 학습시킨다.
  • 에이전트는 입력 프레임과 시스템 상태를 관찰한 후 성능과 효율성을 균형 잡는 처리 전략을 선택한다.
  • 정확도 및 지연 시간 결과에 대한 피드백을 지속적으로 학습함으로써 온라인 적응을 가능하게 한다.
  • 모델 선택, 해상도, 프레임 샘플링 레이트와 같은 다차원 결정을 지원한다.

실험 결과

연구 질문

  • RQ1강화학습 에이전트가 단일 목표 기반 접근법보다 스트리밍 인식에서 정확도와 지연 시간을 더 효과적으로 균형 잡을 수 있는가?
  • RQ2통합 보상 함수를 가진 제안된 연역적 밴드잇 공식화가 다양한 입력 데이터와 시스템 제약 조건에 대해 얼마나 잘 일반화되는가?
  • RQ3학습된 정책이 공개 벤치마크에서 기존 히우리스틱 또는 단일 최적화 전략보다 얼마나 뛰어난가?
  • RQ4입력 스트림 특성의 동적 변화 상황에서 에이전트의 의사결정은 얼마나 견고한가?
  • RQ5통합 보상 함수는 정책 수렴과 장기적인 시스템 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 방법은 정확도와 지연 시간을 동시에 최적화하여 공개 데이터셋에서 최신 기술 정책을 능가하는 뛰어난 시스템 성능을 달성한다.
  • 딥 강화학습 에이전트는 모델 선택, 프레임 레이트 등 여러 결정 차원에서 효과적으로 적응하는 경쟁력 있는 정책을 학습한다.
  • 통합 보상 함수는 경쟁 목표를 성공적으로 균형 잡아 종합적인 시스템 효율성을 향상시킨다.
  • 에이전트는 다양한 입력 스트림과 런타임 조건에 대해 뛰어난 일반화 능력과 적응성을 보여준다.
  • 이전 방법들처럼 단일 지표(예: 지연 시간 또는 정확도)만 최적화하는 것보다 더 우수한 트레이드오프를 달성한다.
  • 결과는 종합적인 최적화가 깊이 강화학습을 통해 종단 간 시스템 성능 향상에 측정 가능한 기여를 한다고 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.