Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Implicit Neural Representations in Low-Level Vision

Wentian Xu, Jianbo Jiao|arXiv (Cornell University)|2023. 04. 20.
Image Processing Techniques and Applications인용 수 4
한 줄 요약

이 논문은 저수준 이미지 복원을 위한 새로운 접근법인 LINR를 제안한다. LINR는 오염된 입력에서의 픽셀 좌표를 기반으로 하여 청소된 이미지를 다층퍼셉트론(MLP)을 통해 매개변수화하는 암묵적 신경 표현(INR)을 사용한다. LINR는 노이즈 제거, 초해상도, 복원, 흐림 제거 등 다양한 과제에서 최신 기술 수준(SOTA)의 성능을 달성하며, 제한된 데이터 설정에서 이전 방법보다 2 dB 이상 PSNR 성능을 뛰어넘고, 여러 오염 유형을 동시에 학습했을 때 놀라운 성능 향상을 보였다.

ABSTRACT

Implicit Neural Representation (INR) has been emerging in computer vision in recent years. It has been shown to be effective in parameterising continuous signals such as dense 3D models from discrete image data, e.g. the neural radius field (NeRF). However, INR is under-explored in 2D image processing tasks. Considering the basic definition and the structure of INR, we are interested in its effectiveness in low-level vision problems such as image restoration. In this work, we revisit INR and investigate its application in low-level image restoration tasks including image denoising, super-resolution, inpainting, and deblurring. Extensive experimental evaluations suggest the superior performance of INR in several low-level vision tasks with limited resources, outperforming its counterparts by over 2dB. Code and models are available at https://github.com/WenTXuL/LINR

연구 동기 및 목표

  • 암묵적 신경 표현(INR)이 노이즈 제거, 초해상도, 복원, 흐림 제거와 같은 저수준 시각 과제에서 효과적으로 작동하는지 조사하는 것.
  • 특히 지도 학습 데이터가 없거나 단일 이미지 설정에서 참값 청소 이미지가 제공되지 않는 경우에 이미지 복원 문제를 해결하는 데 도전하는 것.
  • INR 기반 모델이 작업별 특화된 아키텍처 재설계 없이 다양한 저수준 시각 과제에 일반화될 수 있는지 탐색하는 것.
  • 다양한 오염 유형에 대한 동시 학습이 성능에 미치는 영향을 평가하여, 혼합 오염이 성능을 떨어뜨린다는 전제를 도전하는 것.

제안 방법

  • LINR는 다층퍼셉트론(MLP)을 사용하여 픽셀 좌표의 연속 함수로 잠재된 청소된 이미지를 암묵적으로 표현한다. 이는 (x, y) 좌표를 RGB 값으로 매핑한다.
  • 네트워크는 샘플링된 픽셀 위치에서 MLP 출력과 관측된 오염된 이미지 간의 재구성 손실을 최소화함으로써 엔드 투 엔드로 최적화된다.
  • 복잡한 이미지 신호를 효과적으로 매개변수화하기 위해 SIREN 활성화 함수를 사용하여 기존의 ReLU 기반 MLP의 한계를 극복한다.
  • 학습은 각 샘플당 하나의 오염된 이미지로 수행되며, 대규모 쌍화된 데이터셋이 필요로 하지 않으며, Deep Image Prior(DIP)와 유사하다.
  • 동시 학습을 위해, 동일한 원본 이미지의 여러 오염된 버전(예: 노이즈 및 흐림 등)이 함께 최적화된다.
  • 최적화 과정은 오염된 이미지에서 청소된 이미지로 직접 매핑을 학습하는 대신, MLP의 인덕티브 바이어스를 통해 고품질의 이미지 표현을 암묵적으로 학습한다.

실험 결과

연구 질문

  • RQ1단일 오염된 이미지만을 사용할 때, 암묵적 신경 표현(INR)이 노이즈 제거, 초해상도, 복원, 흐림 제거 등의 과제에서 저수준 이미지 세부 정보를 효과적으로 복원할 수 있는가?
  • RQ2제한된 데이터 및 자원 제약 조건 하에서, 기존의 단일 이미지 복원 방법(DIP 및 S2S 등)에 비해 INR 기반 접근법(LINR)이 성능 면에서 뛰어나게 되는가?
  • RQ3다양한 오염 유형(예: 노이즈 및 흐림)에 대해 동시 학습하는 것이 단일 오염 유형 학습 대비 INR 기반 이미지 복원 성능에 어떤 영향을 미치는가?
  • RQ4아키텍처 수정 없이 LINR가 네 가지의 다른 저수준 시각 과제에 효과적으로 일반화될 수 있는가? 이는 INR 표현의 내재적 강건성을 시사한다.

주요 결과

  • 초해상도 과제에서 Set5, ×4 조건에서 LINR는 PSNR 31.20을 기록했으며, DIP(26.40) 대비 4.6 dB 향상되어 모든 기준 모델을 앞서며 성능을 뛰어넘었다.
  • 10% 희박성 조건에서 복원 과제에서 LINR는 PSNR 26.85를 기록했으며, DIP(24.57)와 S2S(21.68)를 크게 앞서는 성능을 보였다.
  • 가우시안 블러(σ=1.6) 조건에서의 흐림 제거 과제에서 LINR는 평균 PSNR 31.20을 기록했으며, DIP(29.03)와 DeepRED(30.35)를 모두 앞서는 성능을 보였다.
  • 다양한 오염 유형에 대한 동시 학습은 PSNR 30.98을 기록했으며, 단일 오염 유형 학습(노이즈 제거: 27.63, 초해상도: 28.60)을 뛰어넘어 상호보완적 특징 학습이 이루어졌음을 시사한다.
  • 아키텍처 변경 없이 네 가지의 다른 저수준 시각 과제에 효과적으로 일반화되어, INR가 이미지 복원에 있어 유연성을 지닌다는 점을 입증했다.
  • 오염 다양성에 대한 강건성을 보였으며, 상반된 오염 유형이 존재함에도 불구하고 동시 최적화가 성능 향상을 이끌어내어, 오염 간 간섭이 성능을 떨어뜨린다는 기존의 가정을 도전했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.