Skip to main content
QUICK REVIEW

[논문 리뷰] Listen to What You Want: Neural Network-based Universal Sound Selector

Tsubasa Ochiai, Marc Delcroix|arXiv (Cornell University)|2020. 06. 10.
Speech and Audio Processing참고 문헌 19인용 수 4
한 줄 요약

이 논문은 학습된 n-핫 클래스 표현을 사용하여 오디오 혼합물에서 직접 다수의 원하는 청각 이벤트(AE)를 추출하는 딥 네ural 네트워크인 Sound Selector를 제안한다. 이는 소스 분리나 분류의 필요성을 회피하며, 다양한 수의 소스와 대상 클래스에 대해 일관된 성능을 보이며 높은 품질의 사운드 선택을 달성한다. 이는 강력한 일반화 능력과 계산 효율성을 보여준다.

ABSTRACT

Being able to control the acoustic events (AEs) to which we want to listen would allow the development of more controllable hearable devices. This paper addresses the AE sound selection (or removal) problems, that we define as the extraction (or suppression) of all the sounds that belong to one or multiple desired AE classes. Although this problem could be addressed with a combination of source separation followed by AE classification, this is a sub-optimal way of solving the problem. Moreover, source separation usually requires knowing the maximum number of sources, which may not be practical when dealing with AEs. In this paper, we propose instead a universal sound selection neural network that enables to directly select AE sounds from a mixture given user-specified target AE classes. The proposed framework can be explicitly optimized to simultaneously select sounds from multiple desired AE classes, independently of the number of sources in the mixture. We experimentally show that the proposed method achieves promising AE sound selection performance and could be generalized to mixtures with a number of sources that are unseen during training.

연구 동기 및 목표

  • 복잡한 오디오 혼합물에서 원하는 청각 이벤트(AE)를 선택하기 위해 계층적 소스 분리 및 분류의 한계를 해결하기 위해.
  • 혼합물 내 소스 수에 대한 사전 지식이 필요 없이 직접 목표 AE를 추출하는 통합 프레임워크를 개발하기 위해.
  • 단일 순방향 전파를 통해 다중 AE 클래스를 동시에 선택하여 반복적 방법에 비해 계산 비용을 감소시키기 위해.
  • 훈련 중에 관찰하지 못한 조건, 예를 들어 더 많은 AE 클래스 수나 더 많은 목표 클래스 수를 포함한 혼합물에 대한 일반화 능력을 향상시키기 위해.
  • 실시간 听용 기기용으로 적합한 계산 효율성이 뛰어난 엔드 투 엔드 솔루션을 제공하기 위해.

제안 방법

  • Sound Selector는 원시 시간 도메인 오디오 혼합물과 목표 AE 클래스를 나타내는 one-hot 또는 n-hot 벡터를 입력으로 사용하는 딥 네ural 네트워크(DNN)를 사용한다.
  • 소리 선택 성능을 최적화하기 위한 미분 가능 손실 함수를 사용하여, 네트워크는 직접적으로 선택된 AE 사운드의 시간 도메인 웨이브폼을 추정한다.
  • 다중 클래스 선택을 위해 네트워크는 공유 아키텍처를 사용하며 공동 최적화를 통해 단일 순방향 전파에서 동시에 다수의 AE 클래스를 추출하도록 훈련된다.
  • 이 방법은 소스 분리에 기반한 순열 불변 훈련(PIT)에서 기인하는 순열 모호성과 고정 소스 제한을 피하기 위해 직접적인 선택 모델링을 통해 분리가 아닌 선택을 직접 다룬다.
  • 프레임워크는 다양한 AE 클래스 수와 목표 조합을 가진 합성 혼합물 데이터셋을 기반으로 엔드 투 엔드로 훈련된다.
  • 모델은 재훈련 없이도 훈련 중에 볼 수 없었던 7개의 AE 클래스나 4개의 동시 선택 클래스를 포함한 혼합물에 일반화된다.

실험 결과

연구 질문

  • RQ1딥 네럴 네트워크는 소스 분리 과정 없이도 클래스 레이블만을 지침으로 사용하여 혼합물에서 다수의 원하는 청각 이벤트를 직접 추출할 수 있는가?
  • RQ2직접적인 사운드 선택 성능는 소스 분리와 분류를 조합한 계층적 접근 방식과 비교해 어떻게 되는가?
  • RQ3제안된 방법은 훈련 중에 관찰하지 못한 더 많은 AE 클래스를 포함한 혼합물에 일반화 가능한가?
  • RQ4동시 다중 클래스 선택은 품질과 효율성 측면에서 반복적 단일 클래스 추출보다 뛰어나지 않는가?
  • RQ5실제와 유사한 오디오 환경에서 미관측된 소스 수와 목표 클래스 수에 대해 모델의 일반화 능력은 어떠한가?

주요 결과

  • 제안된 Sound Selector는 3~5개의 AE 클래스를 포함한 혼합물에서 이중 클래스 선택에 대해 평균 SDR 향상 6.9 dB를 달성하며, 일부 경우에서 반복적 방법을 능가한다.
  • 4개의 클래스를 동시에 선택할 경우, 훈련 데이터에 포함되지 않은 7개의 클래스 혼합물에서 평균 SDR 향상 5.3 dB를 기록하여 더 높은 복잡성에 대한 강력한 일반화 능력을 입증한다.
  • 동시 추출 방식은 반복적 추출 대비 유사하거나 더 높은 성능를 달성하면서도 훨씬 낮은 계산 비용을 기록한다.
  • 세 개의 목표 클래스가 포함된 고복잡도 설정에서도 모델은 16.9 dB의 높은 절대 SDR를 유지하여 신호 왜곡이 최소화됨을 시사한다.
  • 훈련 데이터에 포함되지 않은 7개의 AE 클래스 혼합물과 4개의 목표 클래스에 대해 모델은 효과적으로 일반화되며, 이는 새로운 조건에 대한 강건성을 확인한다.
  • 사운드 제거 실험 결과, 약 6 dB의 일관된 SDR 향상이 관찰되어, 선택 및 억제 작업 모두에 대한 방법의 효과성을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.