Skip to main content
QUICK REVIEW

[논문 리뷰] A New Image Codec Paradigm for Human and Machine Uses

Sien Chen, Jian Jin|arXiv (Cornell University)|2021. 12. 19.
Image Processing Techniques and Applications인용 수 5
한 줄 요약

이 논문은 인간 시각과 기계 시각을 동시에 고려하여 공동 최적화하는 새로운 이미지 코덱 파라다임을 제안한다. 16비트 회색조 인스턴스 세그멘테이션 맵과 저수준 신호 특징을 손실 없는 압축을 통해 인코딩하고, 일반 품질의 이미지를 복원하기 위한 학습된 이미지 예측기와 잔차 압축을 위한 손실성 코덱을 사용한다. 이 방법은 기존의 전통적 및 학습 기반 코덱에 비해 이미지 복원(PSNR 및 MS-SSIM)과 기계 시각 작업(mAP) 모두에서 뛰어난 성능을 달성한다.

ABSTRACT

With the AI of Things (AIoT) development, a huge amount of visual data, e.g., images and videos, are produced in our daily work and life. These visual data are not only used for human viewing or understanding but also for machine analysis or decision-making, e.g., intelligent surveillance, automated vehicles, and many other smart city applications. To this end, a new image codec paradigm for both human and machine uses is proposed in this work. Firstly, the high-level instance segmentation map and the low-level signal features are extracted with neural networks. Then, the instance segmentation map is further represented as a profile with the proposed 16-bit gray-scale representation. After that, both 16-bit gray-scale profile and signal features are encoded with a lossless codec. Meanwhile, an image predictor is designed and trained to achieve the general-quality image reconstruction with the 16-bit gray-scale profile and signal features. Finally, the residual map between the original image and the predicted one is compressed with a lossy codec, used for high-quality image reconstruction. With such designs, on the one hand, we can achieve scalable image compression to meet the requirements of different human consumption; on the other hand, we can directly achieve several machine vision tasks at the decoder side with the decoded 16-bit gray-scale profile, e.g., object classification, detection, and segmentation. Experimental results show that the proposed codec achieves comparable results as most learning-based codecs and outperforms the traditional codecs (e.g., BPG and JPEG2000) in terms of PSNR and MS-SSIM for image reconstruction. At the same time, it outperforms the existing codecs in terms of the mAP for object detection and segmentation.

연구 동기 및 목표

  • AIoT 및 스마트 시티 환경에서 인간의 시각 인지와 기계 시각 작업을 동시에 충족하는 이미지 코덱의 증가하는 수요를 해결한다.
  • 오직 인간 시각을 고려해 최적화된 전통적 코덱과 인간이 읽을 수 없는 기술 기반 특징 기반 코덱의 한계를 극복한다.
  • 부분적 비트스트림이 기계 작업을 지원하는 스케일러블 이미지 압축을 가능하게 하며, 전체 복원이 고품질 인간 시각을 지원하도록 한다.
  • 이미지 복원과 객체 탐지, 세그멘테이션과 같은 후속 기계 시각 작업의 압축 효율을 향상시킨다.
  • 인스턴스 세그멘테이션과 같은 고수준 의미 정보를 활용해 단일 프레임워크를 설계함으로써, 인지 품질이나 작업 정확도를 희생시키지 않고 이중 목적 사용을 가능하게 한다.

제안 방법

  • 딥 네트워크를 사용해 고수준 인스턴스 세그멘테이션 맵과 저수준 신호 특징을 추출한다.
  • 의미적 내용을 유지하면서 재현율을 줄이기 위해 인스턴스 세그멘테이션 맵을 압축된 16비트 회색조 프로파일로 표현한다.
  • 손실 없는 코덱(FLIF)을 사용해 16비트 프로파일과 신호 특징을 압축하여 강건한 전송과 복원을 보장한다.
  • 16비트 프로파일과 신호 특징을 사용해 딥 이미지 예측기를 훈련시켜 일반 품질의 이미지 복원을 생성한다.
  • 원본 이미지와 예측된 이미지 간 잔차를 손실성 코덱(VVC)을 사용해 압축하여 고정밀 복원을 달성한다.
  • 스케일러블 복원을 지원: 부분적 비트스트림은 기계 시각 작업을 지원하고, 전체 비트스트림은 고품질 인간 시각을 가능하게 한다.

실험 결과

연구 질문

  • RQ1통합된 이미지 코덱 프레임워크가 고품질 인간 이미지 복원과 고정밀 기계 시각 작업을 동시에 지원할 수 있는가?
  • RQ2원시 또는 압축된 특징 표현 방식에 비해, 인스턴스 세그멘테이션을 16비트 회색조 프로파일로 표현할 경우 압축 효율성과 작업 성능에 어떤 영향을 미치는가?
  • RQ316비트 프로파일을 통한 고수준 의미 정보의 포함이 이미지 복원과 후속 기계 시각 정확도를 어느 정도 향상시키는가?
  • RQ4제안된 예측 코딩 프레임워크는 PSNR, MS-SSIM, mAP 측면에서 기존의 전통적 코덱(BPG, JPEG2000)과 학습 기반 코덱에 비해 어떻게 비교되는가?
  • RQ5압축 효율성을 향상시키는 데 있어 채널 정규화, 배치 정규화, 인스턴스 정규화 중 어느 것이 이미지 예측기 및 복원 파이프라인에서 가장 우수한 성능을 내는가?

주요 결과

  • 제안된 코덱은 최신 학습 기반 코덱 수준의 PSNR 및 MS-SSIM 성능를 달성하며, BPG 및 JPEG2000와 같은 기존 전통적 코덱보다 이미지 복원 품질에서 뛰어난 성능을 보인다.
  • 기존 코덱에 비해 객체 탐지 및 인스턴스 세그멘테이션의 mAP가 크게 향상되어 기계 시각 작업에서 뛰어난 성능을 입증한다.
  • 학습된 인코더 및 이미지 예측기 모듈에서 채널 정규화가 PSNR 및 MS-SSIM 측면에서 배치 및 인스턴스 정규화를 능가하는 최고의 압축 효율성을 제공한다.
  • 제거 분석 결과, 16비트 인스턴스 세그멘테이션 프로파일이 이미지 복원 품질(PSNR 및 MS-SSIM)과 기계 시각 정확도(mAP)를 모두 향상시킨다는 것이 확인되었다.
  • 비트스트림 구조는 스케일러블 복원을 가능하게 하며, 부분 비트스트림(stream1 및 stream2)은 기계 시각 작업을 지원하고, 전체 비트스트림(stream3)은 고정밀 인간 시각 복원을 가능하게 한다.
  • 다양한 QP 값에서 VVC를 통한 잔차 압축 결과, 더 낮은 QP 값일수록 더 높은 품질의 복원이 이루어지는 것으로 나타나, 잔차 기반 정밀화의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.