Skip to main content
QUICK REVIEW

[논문 리뷰] Signal Processing for Implicit Neural Representations

Dejia Xu, Peihao Wang|arXiv (Cornell University)|2022. 10. 17.
Advanced Neural Network Applications인용 수 11
한 줄 요약

이 논문은 암시적 신경 표현(implicit neural representations, INRs)에 대한 직접적이고 미분 가능한 신호 처리를 위한 새로운 프레임워크인 INSP-Net을 소개한다. 명시적 복호화 없이도 작동하며, 닫힌 형태의 고차 미분 연산자와 학습 가능한 가중치를 활용하여 연속적인 컨볼루션 필터를 근사한다. 이를 통해 INR 기반 모델(예: INSP-ConvNet)의 엔드 투 엔드 학습이 가능해지며, 암시적 필드에서의 저수준 영상 처리 및 고수준 분류 작업에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Implicit Neural Representations (INRs) encoding continuous multi-media data via multi-layer perceptrons has shown undebatable promise in various computer vision tasks. Despite many successful applications, editing and processing an INR remains intractable as signals are represented by latent parameters of a neural network. Existing works manipulate such continuous representations via processing on their discretized instance, which breaks down the compactness and continuous nature of INR. In this work, we present a pilot study on the question: how to directly modify an INR without explicit decoding? We answer this question by proposing an implicit neural signal processing network, dubbed INSP-Net, via differential operators on INR. Our key insight is that spatial gradients of neural networks can be computed analytically and are invariant to translation, while mathematically we show that any continuous convolution filter can be uniformly approximated by a linear combination of high-order differential operators. With these two knobs, INSP-Net instantiates the signal processing operator as a weighted composition of computational graphs corresponding to the high-order derivatives of INRs, where the weighting parameters can be data-driven learned. Based on our proposed INSP-Net, we further build the first Convolutional Neural Network (CNN) that implicitly runs on INRs, named INSP-ConvNet. Our experiments validate the expressiveness of INSP-Net and INSP-ConvNet in fitting low-level image and geometry processing kernels (e.g. blurring, deblurring, denoising, inpainting, and smoothening) as well as for high-level tasks on implicit fields such as image classification.

연구 동기 및 목표

  • 암시적 신경 표현(INRs)을 명시적 복호화 없이도 편집하는 데 도전하는 것.
  • INRs의 압축성과 연속성 특성을 유지하는 연속적이고 미분 가능한 신호 처리 프레임워크를 개발하는 것.
  • 연속적인 컨볼루션 커널이 고차 미분 연산자의 선형 조합으로 균일하게 근사될 수 있음을 보여주는 것.
  • 암시적 필드에서 직접 작동하는 첫 번째 컨볼루션 신경망(INSP-ConvNet)을 구축하는 것.
  • 복호화 없이 다양한 작업(영상 처리, 오디오 노이즈 제거 등)에서 프레임워크의 성능을 검증하여 뛰어난 성능을 보여주는 것.

제안 방법

  • 분석적 고차 도함수를 사용하여 INRs에 직접 작용하는 미분 가능한 신호 처리 네트워크인 INSP-Net을 제안한다.
  • 고차 공간 도함수(예: 기울기, 라플라시안 등)의 계산 그래프를 기반 함수로 사용하여 신호 변환을 수행한다.
  • 학습 가능한 가중치 메커니즘(인셉션 스타일 융합)을 통해 도함수 브랜치를 융합하며, 융합 가중치는 엔드 투 엔드로 학습된다.
  • 모든 연속 컨볼루션 커널이 고차 미분 연산자의 선형 조합으로 균일하게 근사될 수 있음을 보여주는 이론적 증명을 기반으로 한다.
  • 각 층이 이전 층의 도함수를 학습 가능한 가중치와 함께 조합하여 컨볼루션 필터를 시뮬레이션하는 방식으로, INSP-Net 레이어를 연결하여 INSP-ConvNet을 구성한다.
  • 좌표 수준의 입력 변형을 통한 데이터 증강을 지원하며, 암시적 표현의 특성을 유지한다.

실험 결과

연구 질문

  • RQ1INRs에 대한 연속적 신호 처리 연산을 명시적 복호화나 표현의 이산화 없이 수행할 수 있는가?
  • RQ2고차 도함수 연산자가 연속 도메인에서 임의의 연속 컨볼루션 필터를 분석적으로 근사할 수 있는가?
  • RQ3INR의 매개변수에 직접 작용하는 학습 가능한, 미분 가능한 신호 처리 연산자를 어떻게 구성할 수 있는가?
  • RQ4픽셀 수준의 액세스 없이도 암시적 신경 표현에서 직접 전체 컨volutional 신경망을 학습하고 실행할 수 있는가?
  • RQ5INSP-Net과 INSP-ConvNet은 암시적 필드에서 저수준 및 고수준 시각 작업 전반에 걸쳐 얼마나 잘 일반화되는가?

주요 결과

  • INSP-Net은 이미지 노이즈 제거에서 경쟁적인 성능을 달성하였으며, DIV-2k 테스트 세트에서 PSNR 23.86과 SSIM 0.65를 기록하여 평균 필터링 및 MPRNet, MAXIM과 비교해 핵심 지표에서 뛰어난 성능을 보였다.
  • 프레임워크는 INRs에 직접적으로 에지 검출, 블러링, 디블러링, 인painting, 기하학적 스무딩을 성공적으로 수행하였으며, 시각적 결과는 참값과 강한 유사성을 보였다.
  • 오디오 노이즈 제거 실험을 통해 INSP-Net이 SIREN 기반 INRs에 인코딩된 노이즈 있는 오디오 신호를 효과적으로 복원함을 입증하였으며, 입력에 비해 시각적·정량적 개선이 뚜렷했다.
  • INSP-ConvNet은 픽셀 복호화 없이 암시적 필드 표현만을 사용하여 이미지 분류 작업에서 뛰어난 성능을 달성하였으며, INRs에서 엔드 투 엔드 학습의 가능성을 입증하였다.
  • 이론적 분석을 통해 연속 컨볼루션 연산자가 고차 도함수 연산자의 선형 조합으로 균일하게 근사될 수 있음을 확인하였으며, 이는 프레임워크 설계의 타당성을 뒷받침한다.
  • 절단 실험 결과, INSP-Net의 학습 가능한 융합 메커니즘이 성능 향상에 필수적임을 입증하였으며, 수작업으로 설정한 가중치는 열등한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.