Skip to main content
QUICK REVIEW

[논문 리뷰] Raw Bayer Pattern Image Synthesis for Computer Vision-oriented Image Signal Processing Pipeline Design

Wei Zhou, Xiangyu Zhang|arXiv (Cornell University)|2021. 10. 25.
Generative Adversarial Networks and Image Synthesis인용 수 6
한 줄 요약

이 논문은 역행성 변환, 특히 디모사이싱을 활용하여 색상 이미지에서 고품질의 임의 크기의 RAW 베이어 패턴 이미지를 합성하는 GAN 기반 방법을 제안한다. 이는 훈련 안정성과 생성 성능을 향상시킨다. 이 방법은 RAW 이미지를 사용하는 엔드 투 엔드 컴퓨터 비전 파이프라인을 가능하게 하여 실제 RAW 데이터로 훈련된 모델과 거의 동일한 검출 정확도를 달성하며, ISP 공동 설계 및 센서 내 계산을 가능하게 한다.

ABSTRACT

In this paper, we propose a method to add constraints that are un-formulatable in generative adversarial networks (GAN)-based arbitrary size RAW Bayer image generation. It is shown theoretically that by using the transformed data in GAN training, it is able to improve the learning of the original data distribution, owing to the invariant of Jensen-Shannon (JS) divergence between two distributions under invertible and differentiable transformation. Benefiting from the proposed method, RAW Bayer pattern images can be generated by configuring the transformation as demosaicing. It is shown that by adding another transformation, the proposed method is able to synthesize high-quality RAW Bayer images with arbitrary size. Experimental results show that images generated by the proposed method outperform the existing methods in the Fréchet inception distance (FID) score, peak signal to noise ratio (PSNR), and mean structural similarity (MSSIM), and the training process is more stable. To the best knowledge of the authors, there is no open-source, large-scale image dataset in the RAW Bayer domain, which is crucial for research works aiming to explore the image signal processing (ISP) pipeline design for computer vision tasks. Converting the existing commonly used color image datasets to their corresponding RAW Bayer versions, the proposed method can be a promising solution to the RAW image dataset problem. We also show in the experiments that, by training object detection frameworks using the synthesized RAW Bayer images, they can be used in an end-to-end manner (from RAW images to vision tasks) with negligible performance degradation.

연구 동기 및 목표

  • 컴퓨터 비전 및 ISP 파이프라인 연구에 필수적인 대규모, 오픈소스 RAW 베이어 이미지 데이터셋의 부족을 해결하기 위해.
  • 표준 ISP 파이프라인을 우회하여 RAW 베이어 이미지에서 직접 뷰어 모델을 엔드 투 엔드로 훈련할 수 있도록 하기 위해.
  • 실제 RAW 이미지의 통계적 및 구조적 특성을 유지하는 안정적이고 고정밀도의 이미지 합성 방법을 개발하기 위해.
  • 특정 뷰어 작업에 최적화된 ISP 파이프라인을 최적화하기 위해 합성된 RAW 이미지를 사용할 수 있는지 탐색하기 위해.
  • 컴퓨터 비전 알고리즘에서 직접 RAW 센서 데이터를 사용할 수 있도록 하여 계산 오버헤드를 줄이고, 센서 내 계산을 지원하기 위해.

제안 방법

  • 이 방법은 GAN 훈련이 더 안정적이고 효과적으로 이루어질 수 있도록 하는 변환 공간으로 RAW 베이어 이미지를 매핑하기 위해, 특히 디모사이싱을 포함한 역행성 및 미분 가능한 변환을 사용한다.
  • 역행성 변환에 의한 젠슨-셜라드(JS) 발산의 불변성을 활용하여 생성기의 원래 데이터 분포 학습을 향상시킨다.
  • 생성기는 변환된 데이터(디모사이스드 이미지)에서 훈련되며, 원상복귀 변환을 적용하여 고품질의 RAW 베이어 이미지를 재구성한다.
  • 이 아키텍처는 베이어 패턴의 공간적 및 색상 구조를 유지하기 위해 특별히 설계된 모듈을 포함하여 이미지의 정밀도를 향상시킨다.
  • 적절하게 변환 파이프라인을 구성함으로써 임의의 이미지 크기의 합성을 지원한다.
  • 이 방법은 가역적 데이터 생성을 가능하게 하여 기존의 색상 이미지 데이터셋을 해당하는 RAW 베이어 버전으로 변환할 수 있다.

실험 결과

연구 질문

  • RQ1역행성 변환이 RAW 베이어 이미지 합성에서 GAN 훈련의 안정성과 성능을 향상시킬 수 있는가?
  • RQ2합성된 RAW 베이어 이미지가 후속 컴퓨터 비전 작업에서 실제 RAW 이미지와 유사한 성능을 달성할 수 있는가?
  • RQ3합성된 RAW 이미지는 얼마나 잘 ISP 처리 없이 엔드 투 엔드 뷰어 파이프라인을 지원할 수 있는가?
  • RQ4FID, PSNR 및 MSSIM 지표 측면에서 기존의 GAN 기반 접근법과 비교해 본다면, 제안된 방법은 어떻게 다른가?
  • RQ5기존의 표준 색상 이미지 데이터셋에서 임의의 크기의 고품질 RAW 베이어 이미지를 생성할 수 있는가?

주요 결과

  • 제안된 방법은 동일한 훈련 조건에서 기존 방법보다 뛰어난 FID, PSNR 및 MSSIM 점수를 달성한다.
  • 합성된 RAW 베이어 이미지에서 훈련된 객체 검출 모델은 동일한 데이터셋에서 Faster R-CNN 기준 AP 점수 69.19, SSD300 기준 63.33, Yolo-v3 기준 70.86을 기록하여 실제 RAW 데이터로 훈련된 모델과 거의 동일한 성능을 보였다.
  • 실제 RAW 베이어 이미지에서 평가했을 때, 합성 데이터로 훈련된 모델은 성능 저하가 거의 없었으며, Faster R-CNN 기준 AP 점수 68.81, SSD300 기준 63.21, Yolo-v3 기준 70.82를 기록했다.
  • 합성된 RAW 데이터를 사용할 경우, 작은 또는 어두운 물체의 누락 검출 비율이 크게 감소했으며, 색상 이미지로 훈련된 모델에 비해 검출 실패율이 낮아졌다.
  • 이 방법은 ISP 파이프라인에 의해 발생하는 성능 저하를 피할 수 있도록, RAW 베이어 이미지에서 직접 엔드 투 엔드 객체 검출을 가능하게 한다.
  • 기존 GAN과 비교해 안정적인 훈련 과정을 보였으며, 일관된 지표 향상과 감소한 훈련 발산을 통해 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.