[논문 리뷰] GANs-NQM: A Generative Adversarial Networks based No Reference Quality Assessment Metric for RGB-D Synthesized Views
이 논문은 RGB-D 합성 영상에 대한 참조 없는 품질 측도인 GANs-NQM을 제안한다. 이는 RGB-D 데이터가 아닌 대규모 2D 데이터셋으로 훈련된 생성적 적대적 네트워크(GAN)를 사용한다. 이 방법은 훈련된 판별기(discriminator)를 활용해 '왜곡 단어의 백업(Bag of Distortion Words)' 코드북을 학습하고 국소적 왜곡을 식별함으로써 정확한 인지적 품질 예측을 가능하게 하며, 최신 기술을 능가하는 성능을 보이며 동시에 높은 품질의 망막 보정(inpainter)을 부가적으로 생성한다.
In this paper, we proposed a no-reference (NR) quality metric for RGB plus image-depth (RGB-D) synthesis images based on Generative Adversarial Networks (GANs), namely GANs-NQM. Due to the failure of the inpainting on dis-occluded regions in RGB-D synthesis process, to capture the non-uniformly distributed local distortions and to learn their impact on perceptual quality are challenging tasks for objective quality metrics. In our study, based on the characteristics of GANs, we proposed i) a novel training strategy of GANs for RGB-D synthesis images using existing large-scale computer vision datasets rather than RGB-D dataset; ii) a referenceless quality metric based on the trained discriminator by learning a `Bag of Distortion Word' (BDW) codebook and a local distortion regions selector; iii) a hole filling inpainter, i.e., the generator of the trained GANs, for RGB-D dis-occluded regions as a side outcome. According to the experimental results on IRCCyN/IVC DIBR database, the proposed model outperforms the state-of-the-art quality metrics, in addition, is more applicable in real scenarios. The corresponding context inpainter also shows appealing results over other inpainting algorithms.
연구 동기 및 목표
- 비균일한 망막 보정 왜곡이 발생하는 탈락 영역으로 인해 RGB-D 합성 영상의 인지적 품질 평가에 어려움이 존재하는 문제를 해결하기 위해.
- 기준 영상이 필요 없는 참조 없는 품질 측도를 개발하여 실시간 및 실용적인 구현을 가능하게 하기 위해.
- 작은 규모이자 노이즈가 많은 RGB-D 데이터셋의 한계를 극복하기 위해 대규모 2D 컴퓨터 비전 데이터셋으로 훈련하는 것.
- GAN 훈련 과정의 부가적인 결과로 고성능 망막 보정기를 동시에 생성하기 위해.
- 복잡한 무늬 영역과 물체 경계에서 발생하는 블러링, 겹침 현상 등 인지적으로 중요한 왜곡을 모델링하기 위해.
제안 방법
- RGB-D 데이터셋을 사용하지 않고 2D 이미지 데이터셋(예: ImageNet)만을 사용하는 새로운 GAN 훈련 전략을 제안하며, 합성된 깊이 맵과 마스킹을 통해 탈락 영역의 왜곡을 시뮬레이션한다.
- 판별기가 '왜곡 단어의 백업(Bag of Distortions Words, BDW)' 코드북을 학습하도록 미세조정하여 합성 영상의 국소적 왜곡 패턴을 인코딩한다.
- 판별기의 특징 맵에서 유도된 국소적 왜곡 영역 선택기(local distortion region selector)를 통해 비균일한 망막 보정 왜곡을 식별하고 국소화한다.
- BDW 코드북과 왜곡 영역 특징을 지지 벡터 회귀기(SVR)의 입력으로 사용하여 인지적 품질 점수를 예측한다.
- 훈련된 GAN의 생성기(generator)를 RGB-D 합성에서 탈락 영역을 위한 망막 보정기로 재사용하며, 동일한 훈련 데이터와 아키텍처를 활용한다.
- 구멍 메꾸기 과정에서 구조적 및 무늬적 정합성을 유지하기 위해 인지적 손실과 적대적 손실의 조합을 사용해 모델을 훈련시킨다.
실험 결과
연구 질문
- RQ1대규모 2D 이미지 데이터셋으로 훈련된 GAN이 기준 영상이나 RGB-D 데이터셋 없이도 RGB-D 합성 영상의 인지적 품질을 효과적으로 평가할 수 있는가?
- RQ2GAN의 판별기가 합성 영상의 탈락 영역에서 비균일한 망막 보정 왜곡을 탐지하고 정량화하는 데 어떻게 활용될 수 있는가?
- RQ3이러한 GAN의 생성기가 실제로 RGB-D 합성에 대해 고성능 망막 보정기로 효과적으로 재사용될 수 있는가?
- RQ4제안된 GANs-NQM 측도는 실제 RGB-D 합성 데이터에 대해 기존의 최신 기술 기반 전반적 기준(Full-Reference) 및 참조 없는(no-reference) 측도와 비교해 성능 면에서 어떻게 나타나는가?
- RQ5노이즈가 많은 깊이 데이터를 회피하는 본 논문의 훈련 전략이 실제 탈락 왜곡 패턴에 대해 얼마나 일반화되는가?
주요 결과
- GANs-NQM은 IRCCyN/IVC DIBR 데이터베이스에서 평가된 모든 측도 중에서 가장 높은 성능을 기록했으며, 전반적 기준 및 참조 없는 최신 기술을 모두 능가했다.
- 모델의 정규화된 실행 시간은 1.25로, 두 번째로 좋은 NR 측도인 APT와 가장 좋은 FR 측도인 ST-IQM보다도 뚜렷이 빠르며, 실시간 적용 가능성에서 뛰어난 성능을 보였다.
- 사전 훈련된 생성기(inpainter)는 특히 물체 경계나 균일한 무늬 영역에서 도전적인 탈락 영역에 대해 다른 망막 보정 알고리즘보다 뛰어난 결과를 내놓았다.
- 헤어 실이나 포스터 모서리와 같은 미세한 구조를 더 정확히 보존하여 겹침 현상과 이중 가장자리 왜곡을 줄였다.
- RGB-D 데이터셋 대신 2D 데이터셋을 사용함으로써, 단지 1만 장의 이미지로도 효과적인 훈련이 가능함을 보여주었으며, 제한된 데이터에도 불구하고 확장성과 강건성을 입증했다.
- BDW 코드북과 국소적 왜곡 선택기가 인지적으로 중요한 왜곡을 효과적으로 포착하여, 복잡하고 비균일한 왜곡 패턴에서도 정확한 품질 예측이 가능함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.