Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Coding for Human and Machine Vision: A Scalable Image Coding Approach

Yueyu Hu, Shuai Yang|arXiv (Cornell University)|2020. 01. 09.
Advanced Image and Video Retrieval Techniques참고 문헌 19인용 수 5
한 줄 요약

이 논문은 압축 특징 추출(경계 맵)과 희소 기준 픽셀을 이용한 재구성용 딥 생성 모델을 조합하여 인간 시각 품질과 기계 시각 성능을 동시에 최적화하는 확장 가능한 이미지 인코딩 프레임워크를 제안한다. 유사 비트레이트에서 JPEG 대비 인간 시각 선호도 90%를 달성하고 얼굴 랜드마크 검출에서 44.75%의 오차 감소를 이룩한다.

ABSTRACT

The past decades have witnessed the rapid development of image and video coding techniques in the era of big data. However, the signal fidelity-driven coding pipeline design limits the capability of the existing image/video coding frameworks to fulfill the needs of both machine and human vision. In this paper, we come up with a novel image coding framework by leveraging both the compressive and the generative models, to support machine vision and human perception tasks jointly. Given an input image, the feature analysis is first applied, and then the generative model is employed to perform image reconstruction with features and additional reference pixels, in which compact edge maps are extracted in this work to connect both kinds of vision in a scalable way. The compact edge map serves as the basic layer for machine vision tasks, and the reference pixels act as a sort of enhanced layer to guarantee signal fidelity for human vision. By introducing advanced generative models, we train a flexible network to reconstruct images from compact feature representations and the reference pixels. Experimental results demonstrate the superiority of our framework in both human visual quality and facial landmark detection, which provide useful evidence on the emerging standardization efforts on MPEG VCM (Video Coding for Machine).

연구 동기 및 목표

  • 빅데이터 시대에 인간 인식과 기계 시각 작업을 동시에 지원하는 이미지 인코딩의 증가하는 수요를 해결하기 위해.
  • 신호 품질 중심 압축과 기능 기반 압축 간 격차를 메우기 위해.
  • 인간을 위한 고품질 재구성과 기계 시각 성능을 동시에 유지하는 확장 가능한 인코딩 프레임워크를 개발하기 위해.
  • 하이브리드 구조-색상 표현을 통해 인간 시각 품질과 기계 시각 정확도를 공동 최적화할 수 있도록 하기 위해.

제안 방법

  • 프레임워크는 먼저 기계 시각 작업을 위한 기초 레이어로 압축된 경계 맵을 추출하기 위해 기능 분석을 수행한다.
  • 경계 위치를 바탕으로 희소 기준 픽셀을 샘플링하여 인간 시각을 위한 재구성 정밀도를 향상시킨다.
  • 경계 맵과 기준 픽셀의 조합으로부터 고품질 이미지를 재구성하기 위해 딥 생성 모델을 훈련시킨다.
  • 이미지 품질 향상을 위해 인지적, 적대적, 재구성 손실을 포함한 다중 손실 훈련 목표를 사용한다.
  • 경계 맵을 구조적 정보를 유지하면서 비트레이트를 최소화하기 위해 압축된 벡터로 파arameter화한다.
  • 확장 가능한 디코딩을 지원: 기초 레이어(경계)는 기계 작업을 가능하게 하고, 향상된 레이어(기준 픽셀)는 시각 품질을 향상시킨다.

실험 결과

연구 질문

  • RQ1단일 이미지 인코딩 프레임워크가 동시에 인간 시각 품질과 기계 시각 성능을 최적화할 수 있는가?
  • RQ2얼굴 랜드마크 검출과 같은 기계 시각 작업을 위한 기초 레이어로 압축된 경계 맵이 얼마나 효과적인가?
  • RQ3생성 모델이 최소한의 구조적 표현으로부터 고해상도 이미지를 얼마나 잘 재구성할 수 있는가?
  • RQ4인간과 기계 시각 영역 모두에서 비트레이트 효율성과 성능 간의 상호 상충 관계는 어느 정도인가?

주요 결과

  • 제안된 방법은 유사 비트레이트에서 인간 시각 품질 선호도 비율 90%와 미적 감상도 73%를 달성하여 JPEG보다 뚜렷이 뛰어나다.
  • qp=4에서 JPEG 대비 얼굴 랜드마크 검출의 정규화 평균 오차(NME)를 44.75% 감소시켰다.
  • 색상과 구조 정보를 함께 사용했을 때, NME는 3.33%에 그쳤으며, 이는 qp=8에서 JPEG의 4.48% NME를 뛰어넘는 성능이다.
  • 제안된 방법으로 재구성된 이미지 중 90% 이상에서 얼굴 랜드마크 검출 오차가 5% 이하였으며, 이는 높은 강건성을 시사한다.
  • 사용자 연구 결과, 제안된 방법은 품질과 미적 감상도 모두에서 선호되었으며, 각각 90%와 73%의 선호도 비율을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.