Skip to main content
QUICK REVIEW

[논문 리뷰] Video Coding for Machines: A Paradigm of Collaborative Compression and Intelligent Analytics

Ling‐Yu Duan, Jiaying Liu|arXiv (Cornell University)|2020. 01. 10.
Advanced Vision and Imaging참고 문헌 144인용 수 7
한 줄 요약

이 논문은 기계 시각과 인간 시각을 위한 영상 및 특징 스트림을 공동으로 최적화하는 협업 압축 패러다임인 영상용 기계 코딩(VCM)을 소개한다. 예측 및 생성형 딥러닝 모델을 통합함으로써 VCM는 HEVC보다 낮은 비트레이트에서 우수한 영상 복원 품질을 달성하여, 대용량 데이터 응용 분야에서 지능형 영상 분석의 효율성 향상이 뚜렷하게 나타난다.

ABSTRACT

Video coding, which targets to compress and reconstruct the whole frame, and feature compression, which only preserves and transmits the most critical information, stand at two ends of the scale. That is, one is with compactness and efficiency to serve for machine vision, and the other is with full fidelity, bowing to human perception. The recent endeavors in imminent trends of video compression, e.g. deep learning based coding tools and end-to-end image/video coding, and MPEG-7 compact feature descriptor standards, i.e. Compact Descriptors for Visual Search and Compact Descriptors for Video Analysis, promote the sustainable and fast development in their own directions, respectively. In this paper, thanks to booming AI technology, e.g. prediction and generation models, we carry out exploration in the new area, Video Coding for Machines (VCM), arising from the emerging MPEG standardization efforts1. Towards collaborative compression and intelligent analytics, VCM attempts to bridge the gap between feature coding for machine vision and video coding for human vision. Aligning with the rising Analyze then Compress instance Digital Retina, the definition, formulation, and paradigm of VCM are given first. Meanwhile, we systematically review state-of-the-art techniques in video compression and feature compression from the unique perspective of MPEG standardization, which provides the academic and industrial evidence to realize the collaborative compression of video and feature streams in a broad range of AI applications. Finally, we come up with potential VCM solutions, and the preliminary results have demonstrated the performance and efficiency gains. Further direction is discussed as well.

연구 동기 및 목표

  • 빅데이터 영상 분석에서 전통적인 압축 후 분석 파이프라인의 비효율성을 해결하기 위해 영상 및 특징 압축을 통합한다.
  • 인간 중심의 영상 코딩과 기계 중심의 특징 압축 간 격차를 협업 최적화를 통해 메우며.
  • AI 기반 영상 응용을 위한 새로운 패러다임인 영상용 기계 코딩(VCM)을 제안하며, 이는 신규로 진행 중인 MPEG 표준화 노력과 부합한다.
  • 딥러닝 기반 예측 및 생성 모델을 사용하여 영상 및 특징 스트림의 확장성 있고 종단 간 최적화를 실현한다.
  • VCM에서 다양한 시각 작업에 걸쳐 엔트로피 한계와 피드백 메커니즘의 이론적 및 실용적 기초를 제공한다.

제안 방법

  • 계층적 딥 뉴럴 네트워크를 사용하여 영상 프레임과 기계로 추출 가능한 특징을 함께 압축하는 통합 프레임워크로 VCM를 수립한다.
  • 예측 및 생성 모델을 활용하여 압축된 특징을 추출하면서도 인간 시각을 위한 복원 정밀도를 유지한다.
  • 인터옵레러빌리티를 가능하게 하기 위해 영상 코딩 파이프라인에 압축된 특징 서술자(예: CDVA, CDVS)를 통합한다.
  • 상수 비트레이트 요인을 사용한 비용-편미도 최적화를 통해 HEVC와의 성능 비교를 수행하며, SSIM 및 시각적 품질을 평가한다.
  • 기계 시각의 다양한 추상화 수준에서 다중 작업 최적화를 지원하기 위한 확장 가능한 피드백 메커니즘을 설계한다.
  • 종단 간 학습을 적용하여 영상 압축과 특징 추출을 함께 최적화함으로써 스트림 간 冗잔도를 최소화한다.

실험 결과

연구 질문

  • RQ1기계 시각 응용 분야에서 성능과 효율성을 향상시키기 위해 영상 및 특징 압축을 어떻게 협업 최적화할 수 있는가?
  • RQ2다중 작업 영상 분석에서 엔트로피 한계와 작업별 성능 간 이론적 관계는 무엇인가?
  • RQ3딥러닝 기반 예측 및 생성 모델은 다양한 영상 도메인에서 VCM의 도메인 이동 문제를 줄일 수 있는가?
  • RQ4VCM 프레임워크는 전통적인 HEVC에 비해 비트레이트-편미도 성능과 시각적 품질 측면에서 어떻게 비교되는가?
  • RQ5생체 모방 데이터 수집 메커니즘(예: 스파이크 카메라)은 실시간, 저지연 분석을 위한 VCM 발전에 어떤 역할을 하는가?

주요 결과

  • 제안된 VCM 방법은 HEVC보다 낮은 비트레이트에서 더 우수한 영상 복원 품질을 달성하며, SSIM 값이 뛰어난 성능을 나타낸다.
  • 주관적 평가 결과 VCM 결과는 HEVC 대비 눈에 띄게 감소된 압축 잡음으로 인해 더 시각적으로 매력적인 복원을 제공한다.
  • 비트레이트-편미도 곡선은 VCM이 모든 테스트 비트레이트에서 HEVC를 능가함을 보여주며, 낮은 비트레이트에서도 더 높은 품질을 유지한다.
  • 초기 결과는 영상 및 특징 스트림의 협업 압축이 AI 워크로드에서 효율적인 전송과 고정밀도 분석을 가능하게 한다는 것을 확인한다.
  • 코드 인코딩 파이프라인에 압축된 서술자(CDVA, CDVS)를 통합함으로써 대규모 영상 분석을 위한 상호운용성 있고 저대역폭 전송이 가능해졌다.
  • 이 프레임워크는 다중 시각 작업에서 확장성과 피드백 기반 최적화 잠재력을 보이며, 향후 이론적 및 실용적 발전을 위한 길을 열어 놓았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.