Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Deep Video Compression by Resolution-adaptive Flow Coding

Zhihao Hu, Zhenghao Chen|arXiv (Cornell University)|2020. 09. 13.
Advanced Vision and Imaging참고 문헌 32인용 수 5
한 줄 요약

이 논문은 깊이 학습 기반 영상 압축을 위한 새로운 프레임워크인 해상도 적응형 플로우 코딩(RaFC)을 제안한다. 이는 프레임 수준(RaFC-frame)과 블록 수준(RaFC-block)에서 운동 복잡도에 따라 최적의 해상도 표현을 비용-왜곡 최적화 기반으로 자동으로 선택함으로써, 운동 정보 압축을 향상시킨다. 동적으로 고해상도 또는 저해상도의 플로우 맵과 운동 특징을 선택함으로써 RaFC는 기존 DVC 기반 기준 대비 최대 70%까지 운동 코딩 비트를 감소시키면서도 높은 재구성 품질을 유지하며 최신 기술 수준의 성능을 달성한다.

ABSTRACT

In the learning based video compression approaches, it is an essential issue to compress pixel-level optical flow maps by developing new motion vector (MV) encoders. In this work, we propose a new framework called Resolution-adaptive Flow Coding (RaFC) to effectively compress the flow maps globally and locally, in which we use multi-resolution representations instead of single-resolution representations for both the input flow maps and the output motion features of the MV encoder. To handle complex or simple motion patterns globally, our frame-level scheme RaFC-frame automatically decides the optimal flow map resolution for each video frame. To cope different types of motion patterns locally, our block-level scheme called RaFC-block can also select the optimal resolution for each local block of motion features. In addition, the rate-distortion criterion is applied to both RaFC-frame and RaFC-block and select the optimal motion coding mode for effective flow coding. Comprehensive experiments on four benchmark datasets HEVC, VTL, UVG and MCL-JCV clearly demonstrate the effectiveness of our overall RaFC framework after combing RaFC-frame and RaFC-block for video compression.

연구 동기 및 목표

  • 깊이 학습 기반 영상 압축에서 단일 해상도 플로우 표현의 한계를 해결하기 위해, 다양한 프레임 간 운동 복잡도 변화에 적응하지 못하는 문제를 해결한다.
  • 전역(프레임 수준) 및 국소(블록 수준) 운동 특징에 대해 동적 해상도 선택을 가능하게 하여 운동 정보 압축을 향상시킨다.
  • 각 프레임 또는 블록에 대해 가장 효율적인 해상도를 자동으로 선택함으로써 운동 코딩에서 비용-왜곡 트레이드오프를 최적화한다.
  • 기존의 딥러닝 기반 방법들인 DVC, H.264, H.265와 비교해 뛰어난 영상 압축 성능을 달성한다.

제안 방법

  • 운동 복잡도와 비용-왜곡(RD) 기준을 바탕으로 전체 플로우 맵에 대한 최적의 해상도를 선택하는 프레임 수준 기반 기법인 RaFC-frame을 제안한다.
  • 각 국소 블록의 운동 특징에 대해 독립적으로 해상도를 선택함으로써 국소 운동 패턴에 맞는 블록 수준 기반 기법인 RaFC-block을 도입한다.
  • 해상도 적응을 가능하게 하기 위해 입력 운동 플로우 맵과 출력 운동 특징 모두에 다중 해상도 표현을 활용한다.
  • 비용-왜곡 최적화 프레임워크를 사용하여 프레임 수준과 블록 수준에서 가장 적절한 해상도 선택을 결정함으로써 비트 비용을 최소화하면서 품질을 유지한다.
  • RaFC-frame와 RaFC-block을 통합하여 전체 영상 시퀀스에 걸쳐 해상도 선택을 공동 최적화하는 유일한 RaFC 프레임워크를 구성한다.
  • 해상도 최적화된 선택을 운동 벡터 인코딩과 잔차 코딩에 모두 적용함으로써 전체 압축 효율성을 향상시킨다.

실험 결과

연구 질문

  • RQ1다중 해상도 플로우 표현은 깊이 학습 기반 영상 압축에서 운동 코딩 효율을 향상시킬 수 있는가?
  • RQ2전체 운동 복잡도를 기반으로 한 프레임 수준 해상도 적응은 더 나은 비용-왜곡 성능을 이끌 수 있는가?
  • RQ3국소 운동 패턴을 기반으로 한 블록 수준 해상도 선택은 압축 효율을 추가로 향상시킬 수 있는가?
  • RQ4프레임 수준과 블록 수준의 해상도 적응 조합은 단일 해상도 기반 기준 대비 어떤가?
  • RQ5해상도 적응은 시각적 품질을 훼손하지 않으면서 운동 코딩 비트 사용을 얼마나 줄일 수 있는가?

주요 결과

  • RaFC 프레임워크는 HEVC Class E, VTL, UVG, MCL-JCV 네 가지 벤치마크 데이터셋에서 H.264, H.265 및 기준 DVC 방법을 모두 초월하는 성능을 보였다.
  • 기준 DVC 방법과 동일한 PSNR 조건에서 RaFC는 운동 코딩 비트를 최대 70%까지 감소시켜 운동 압축 효율을 크게 향상시켰다.
  • 저비트 레이트(낮은 λ)에서는 저해상도 플로우 맵과 큰 블록을 선호하며, 기존 압축 전략의 비트 절감 방식과 일치한다.
  • 고비트 레이트(높은 λ)에서는 점점 고해상도 플로우 맵과 더 작은 블록을 선택함으로써 가용한 비트를 더 높은 세부 정보에 효율적으로 활용함을 보여준다.
  • 시각화 결과는 고운동 영역(예: 물체 경계)에서는 작은 블록이 선호되고, 부드러운 영역에서는 큰 블록이 사용됨을 확인하였으며, 이는 운동 복잡도와 일치한다.
  • RaFC에서는 DVC 대비 운동 코딩에 사용되는 비트 비율이 크게 감소하였다. 예를 들어 λ=256일 때 비트 비율은 61.11%에서 38.89%로 감소하였다. 이는 운동 비트 비용 감소를 명확히 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.