[논문 리뷰] WIRE: Wavelet Implicit Neural Representations
WIRE는 연속적인 복소수 가우시안 웨이블릿 활성화 함수를 사용하는 새로운 암묵적 신경 표현을 도입하며, 사인 함수의 주파수 집중성과 가우시안 비선형성의 공간 집중성을 결합한다. 이 설계는 이미지 복원, 초해상도, 신경 렌더링 장치(NeRF)와 같은 다양한 시각 작업에서 정확도, 학습 속도, 내성 강도 면에서 최고 성능을 달성한다. 특히 제한된 데이터나 노이즈가 있는 경우에도 유사한 성능을 유지한다.
Implicit neural representations (INRs) have recently advanced numerous vision-related areas. INR performance depends strongly on the choice of the nonlinear activation function employed in its multilayer perceptron (MLP) network. A wide range of nonlinearities have been explored, but, unfortunately, current INRs designed to have high accuracy also suffer from poor robustness (to signal noise, parameter variation, etc.). Inspired by harmonic analysis, we develop a new, highly accurate and robust INR that does not exhibit this tradeoff. Wavelet Implicit neural REpresentation (WIRE) uses a continuous complex Gabor wavelet activation function that is well-known to be optimally concentrated in space-frequency and to have excellent biases for representing images. A wide range of experiments (image denoising, image inpainting, super-resolution, computed tomography reconstruction, image overfitting, and novel view synthesis with neural radiance fields) demonstrate that WIRE defines the new state of the art in INR accuracy, training time, and robustness.
연구 동기 및 목표
- 기존 암묵적 신경 표현(INRs)에서 정확도와 내성 강도 사이의 상충 관계를 해결하기 위해.
- 이미지 노이즈 제거, 메쉬 복원, 초해상도, 컴퓨터 톰로그래피(CT) 복원과 같은 역문제에서 INR 성능을 향상시키기 위해.
- 특히 제한되거나 노이즈가 있는 데이터에서 더 빠르고 정확한 INR 학습을 가능하게 하기 위해.
- 고주파 및 에지가 많은 신호 특징에 강력한 인도크티브 편향을 가진 INR을 개발하기 위해.
- 더 적은 학습 시각으로도 높은 품질의 새로운 시각 합성 성능을 보여주기 위해 NeRF에서 뛰어난 성능을 달성하기 위해.
제안 방법
- INR의 MLP에서 연속적인 복소수 가우시안 웨이블릿을 활성화 함수로 제안하며, 공간-주파수 농도 최적화를 활용한다.
- 가우시안 웨이블릿의 시간 도메인과 주파수 도메인에서의 이중 국소화 특성을 활용해 이미지 및 신호의 표현을 향상시킨다.
- 위상과 진폭 정보를 모두 캡처할 수 있는 복소수 활성화 함수를 도입하여 모델링 능력을 강화한다.
- 복소수 가중치로 인한 파rameter 수의 두 배 증가를 고려해 은닉 유닛 수를 √2로 감소시켜(예: 182 → 128) 네트워크 너비를 조정한다.
- 위치 인코딩을 사용하지 않고 표준 최적화와 학습률 스케줄링을 사용해 비선형성의 영향을 분리한다.
- PSNR, SSIM 및 시각적 정밀도를 사용해 이미지 노이즈 제거, 초해상도, CT, NeRF, 과적합성 등 다양한 작업에서 성능을 평가한다.

실험 결과
연구 질문
- RQ1웨이블릿 기반 활성화 함수는 SIREN이나 ReLU와 같은 기존 비선형성보다 더 높은 정확도와 내성 강도를 달성할 수 있는가?
- RQ2가우시안 웨이블릿 활성화 함수는 투과 수가 적은 경우에도 CT 복원과 같은 불안정한 역문제에서 성능을 어떻게 향상시키는가?
- RQ3WIRE는 이미지 복원 작업에서 리버버브나 흐림 현상과 같은 잡음 요소를 어느 정도 줄일 수 있는가?
- RQ4기존 방법에 비해 더 적은 학습 이미지로도 WIRE는 NeRF에서 고해상도의 새로운 시각 합성 성능을 달성할 수 있는가?
- RQ5가우시안 기반 INR은 고주파 및 에지가 많은 콘텐츠를 포함한 다양한 신호 유형에 대해 더 잘 일반화되는가?
주요 결과
- WIRE는 CT 복원에서 가장 높은 PSNR를 기록했으며, 16개의 투과 수가 있을 때조차 모든 다른 비선형성보다 뛰어난 성능을 보였다.
- 다중 이미지 초해상도 작업에서 WIRE는 SIREN보다 1dB 이상 향상되었고, SSIM은 0.04 높아져 더 선명한 특징 복원을 보였다.
- 드럼스 데이터셋에서의 NeRF 작업에서, WIRE는 25, 50, 75장의 학습 이미지로 SIREN보다 0.1dB 높은 PSNR를 기록했으며, 100장일 경우 0.4dB 높았다.
- NeRF에서 25장의 학습 이미지로도 WIRE는 2500 에포크 내에 더 빠르게 수렴하고 더 높은 정확도에 도달했으며, ReLU+PE는 100장의 모든 이미지와 더 긴 학습 시간이 필요했다.
- 시각적 결과에서는 WIRE가 가장 정확하고 잡음 없는 복원 결과를 도출했으며, 특히 고주파 영역에서 SIREN의 리버버브 현상과 가우시안의 안개 효과를 효과적으로 방지했다.
- WIRE는 노이즈와 부족한 샘플링에 대해 뛰어난 내성 강도를 보이며, 제한되거나 열악한 데이터로 인해 발생하는 실제 역문제에 효과적으로 대응할 수 있다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.