Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Sparse Wavelet Representations

Daniel Recoskie, Richard Mann|arXiv (Cornell University)|2018. 02. 08.
Image and Signal Denoising Methods참고 문헌 9인용 수 6
한 줄 요약

이 논문은 수정된 컨volution 신경망(CNN) 아키텍처를 사용하여 원시 데이터에서 직접 희박한 웨이블릿 필터를 학습하는 가역적이고 엔드 투 엔드로 학습 가능한 오토인코더 프레임워크를 제안한다. 경사 하강법을 통해 훈련함으로써 모델은 합성 및 실제 음성 데이터로부터 전통적인 푸리에 기반 웨이블릿과 유사한 구조적 웨이블릿 함수를 학습하며, 사전에 웨이블릿을 설계할 필요 없이 효과적인 신호 복원 및 생성을 가능하게 한다.

ABSTRACT

In this work we propose a method for learning wavelet filters directly from data. We accomplish this by framing the discrete wavelet transform as a modified convolutional neural network. We introduce an autoencoder wavelet transform network that is trained using gradient descent. We show that the model is capable of learning structured wavelet filters from synthetic and real data. The learned wavelets are shown to be similar to traditional wavelets that are derived using Fourier methods. Our method is simple to implement and easily incorporated into neural network architectures. A major advantage to our model is that we can learn from raw audio data.

연구 동기 및 목표

  • 머신러닝 응용 분야에서 적절한 웨이블릿 함수를 선택하거나 설계하는 데 도전하는 문제를 해결하기 위해, 이는 종종 깊은 웨이블릿 이론 지식이 필요하기 때문이다.
  • 분석적 도구인 푸리에 방법을 거치지 않고도 원시 데이터에서 직접 웨이블릿 필터를 엔드 투 엔드로 학습할 수 있도록 하기 위해.
  • 웨이블릿 변환을 딥러닝 파ip라인에 통합하기 위해, 이를 가역적 신경망 레이어로 재구성하기 위해.
  • 학습된 웨이블릿이 데이터에 특화된 구조를 포착하고 효과적인 신호 복원 및 생성을 지원할 수 있음을 보여주기 위해.
  • 이 방법이 구현이 단순하고 텐서플로우와 같은 기존 딥러닝 프레임워크와 호환됨을 보여주기 위해.

제안 방법

  • 이산 웨이블릿 변환(DWT)은 스케일링 필터(h)와 웨이블릿 필터(g)를 갖는 두 개의 학습 가능한 필터를 사용하여 수정된 컨volution 신경망으로 재구성된다.
  • 모델은 두 단계의 오토인코더 아키텍처를 사용한다: 웨이블릿 변환 인코더와 웨이블릿 역변환 디코더로 구성된다.
  • 신호 복원 손실을 최소화하기 위해 확률적 경사 하강법과 Adam 옵timizer를 사용하여 네트워크를 훈련시킨다.
  • 완벽한 복원과 안정성을 보장하기 위해 필터 가중치는 캐스케이드 알고리즘을 사용해 초기화된다.
  • 학습된 필터를 전통적 웨이블릿 가족(예: 다우브체스, 코이플레트)과 비교하기 위해 원형으로 이동한余弦 유사도 기반의 거리 측정 기준을 사용한다.
  • 신호 생성은 학습된 필터의 희박한 웨이블릿 계수를 채우고 역변환을 적용하여 새로운 신호를 생성함으로써 평가된다.

실험 결과

연구 질문

  • RQ1기울기 기반 최적화를 사용해 원시 데이터에서 웨이블릿 필터를 효과적으로 학습할 수 있는가?
  • RQ2학습된 웨이블릿이 다우브체스나 코이플레트와 같은 확립된 웨이블릿 가족과 구조적 유사성을 보이는가?
  • RQ3학습된 웨이블릿이 훈련 데이터의 통계적 및 시간적 구조를 유지하는 방식으로 신호를 복원하고 생성할 수 있는가?
  • RQ4복원 정확도와 신호 품질 측면에서 학습된 웨이블릿의 성능이 고정된 분석적 도출 웨이블릿과 비교해 어떻게 되는가?
  • RQ5이 방법이 오디오 및 신호 처리 작업에 대한 기존 딥러닝 파이프라인에 얼마나 잘 통합될 수 있는가?

주요 결과

  • 모델은 합성 조화 신호와 MAPS 데이터셋의 실제 음성 데이터로부터 모두 구조적 웨이블릿 필터를 성공적으로 학습했다.
  • 학습된 웨이블릿은 전통적 웨이블릿과 강한 유사성을 보였으며, 다우브체스 및 코이플레트 가족과 비교할 때 유사도 거리 점수가 최소 0.05로 매우 낮았다.
  • 학습된 웨이블릿의 희박한 계수에서 생성된 신호는 시각적으로 훈련 신호와 유사했으며, 데이터의 구조를 효과적으로 포착하고 있음을 시사했다.
  • 이 방법은 푸리에 변환과 같은 수작업 기반 표현이 필요 없이 원시 음성에서 직접 학습이 가능함을 보여주었다.
  • 이 프레임워크는 텐서플로우와 같은 딥러닝 라이브러리와 호환되며 기존 신경망 아키텍처에 원활하게 통합될 수 있다.
  • 오토인코더 아키텍처는 높은 품질의 신호 복원을 달성하여 학습된 웨이블릿 기저의 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.