Skip to main content
QUICK REVIEW

[논문 리뷰] AccMPEG: Optimizing Video Encoding for Video Analytics

Kuntai Du, Qizheng Zhang|arXiv (Cornell University)|2022. 04. 26.
Advanced Neural Network Applications인용 수 6
한 줄 요약

AccMPEG는 비디오 분석을 위한 압축을 최적화하기 위해 경량 모델을 사용해 매크로블록 수준의 정확도 기울기(gradient)를 학습하는 영상 인코딩 시스템이다. 이로 인해 카메라 측에서 낮은 계산 자원을 사용하면서도 근접 실시간, 고정확도의 DNN 추론을 가능하게 하며, 종래의 최상위 수준 기준 대비 종단 간 지연을 10–43% 감소시키고 정확도를 최대 3% 향상시킨다.

ABSTRACT

With more videos being recorded by edge sensors (cameras) and analyzed by computer-vision deep neural nets (DNNs), a new breed of video streaming systems has emerged, with the goal to compress and stream videos to remote servers in real time while preserving enough information to allow highly accurate inference by the server-side DNNs. An ideal design of the video streaming system should simultaneously meet three key requirements: (1) low latency of encoding and streaming, (2) high accuracy of server-side DNNs, and (3) low compute overheads on the camera. Unfortunately, despite many recent efforts, such video streaming system has hitherto been elusive, especially when serving advanced vision tasks such as object detection or semantic segmentation. This paper presents AccMPEG, a new video encoding and streaming system that meets all the three requirements. The key is to learn how much the encoding quality at each (16x16) macroblock can influence the server-side DNN accuracy, which we call accuracy gradient. Our insight is that these macroblock-level accuracy gradient can be inferred with sufficient precision by feeding the video frames through a cheap model. AccMPEG provides a suite of techniques that, given a new server-side DNN, can quickly create a cheap model to infer the accuracy gradient on any new frame in near realtime. Our extensive evaluation of AccMPEG on two types of edge devices (one Intel Xeon Silver 4100 CPU or NVIDIA Jetson Nano) and three vision tasks (six recent pre-trained DNNs) shows that AccMPEG (with the same camera-side compute resources) can reduce the end-to-end inference delay by 10-43% without hurting accuracy compared to the state-of-the-art baselines

연구 동기 및 목표

  • 엣지 비디오 분석에서 저지연 영상 인코딩, 고정확도 서버 측 DNN 추론, 낮은 카메라 측 계산 오버헤드를 동시에 만족시키는 데 도전하는 것.
  • 특히 객체 검출 및 의미 세분화와 같은 복잡한 작업에서 동시에 세 가지 요구사항을 충족하지 못하는 기존 영상 압축 시스템의 한계를 극복하는 것.
  • 특정 영상 영역(매크로블록)이 최종 DNN 정확도에 가장 큰 영향을 미치는 지 식별함으로써 효율적이고 실시간 영상 스트리밍을 가능하게 하는 것.
  • 모든 파이프라인 재학습 없이도 새로운 사전 학습된 DNN에 빠르게 맞춤화할 수 있는 시스템을 설계하는 것.

제안 방법

  • AccMPEG는 각 16×16 매크로블록의 인코딩 품질이 최종 DNN 추론 정확도에 미치는 영향을 예측하는 경량 정확도 기울기 모델(AccModel)을 도입한다.
  • AccModel은 DNN 출력이 매크로블록 수준의 품질 변화에 얼마나 민감한지 추정하기 위해 훈련된 작은, 빠른 신경망(예: MobileNet-SSD)이다.
  • 시스템은 H.264/265 코덱을 사용해 영역 중심 인코딩(Region-of-Interest, RoI)을 구현하며, 예측된 정확도 기울기에 기반해 매크로블록별로 다양한 품질 수준을 적용한다.
  • AccModel은 새로운 DNN이 도입될 때마다 한 번만 재학습하거나 미세조정(fine-tuned)되므로, 다양한 비전 모델에 대해 최소한의 오버헤드로 신속한 적응이 가능하다.
  • 시스템은 프레임을 배치 단위로 처리하며, 예를 들어 k=10일 경우 매 k 프레임마다 AccModel을 실행하고, 예측된 기울기를 기반으로 실시간 인코딩 결정을 유도한다.
  • 정확도 기울기 예측은 전체 의미 세분화를 수행하는 것보다 간단하므로, 효율적인 매크로블록 수준의 품질 제어가 가능하다는 통찰을 활용한다.

실험 결과

연구 질문

  • RQ1경량 모델이 영상 분석의 최종 DNN 추론 정확도에 미치는 매크로블록 수준의 인코딩 품질 영향을 정확하게 예측할 수 있는가?
  • RQ2매크로블록 수준에서 영상 인코딩을 최적화하면 DNN 정확도를 향상시키면서도 카메라 측 계산 비용을 최소화할 수 있는가?
  • RQ3종래의 최상위 수준 방법과 비교해도 종단 간 지연을 낮추면서 DNN 추론 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ4전체 파이프라인 재학습 없이도 새로운 DNN 아키텍처에 얼마나 효율적으로 적응할 수 있는가?

주요 결과

  • AccMPEG는 종래의 최상위 수준 기준 대비 종단 간 추론 지연을 10–43% 감소시키면서도 DNN 정확도를 유지하거나 향상시킨다.
  • 세 가지 비전 작업(객체 검출, 의미 세분화, 분류)을 대상으로 한 여섯 개의 사전 학습된 DNN을 사용한 평균적으로 DNN 추론 정확도를 최대 3% 향상시켰다.
  • 전통적인 코덱과 거의 동일한 카메라 측 계산 오버헤드를 유지함으로써 자원이 제한된 엣지 장치에서 실용적인 적용이 가능하다.
  • 정확도 기울기 모델(AccModel)은 낮은 지연으로도 효과적인 매크로블록 수준의 인코딩 결정을 유도할 수 있는 충분한 정밀도를 확보했다.
  • 더 거친 수준의 접근 방식(예: 객체 수준 또는 프레임 수준의 품질 제어)보다 더 세밀하고 맥락 인식형 품질 할당이 가능하므로 성능이 뛰어나다.
  • Intel Xeon 및 NVIDIA Jetson Nano 기기에서의 평가를 통해 다양한 엣지 하드웨어 플랫폼에서 시스템의 효율성과 적응 가능성 확인됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.