Skip to main content
QUICK REVIEW

[논문 리뷰] SSLIDE: Sound Source Localization for Indoors based on Deep Learning

Yifan Wu, Roshan Ayyalasomayajula|arXiv (Cornell University)|2020. 10. 27.
Speech and Audio Processing참고 문헌 28인용 수 5
한 줄 요약

SSLIDE는 반향이 강한 실내 환경에서 다중경로 간섭을 보완하면서 소리 원천 위치를 동시에 추정하는 인코더-디코더 아키텍처를 갖춘 딥러닝 기반 소리 원천 정위치화 방법을 제안한다. 두 개의 병렬 디코더를 사용하여, 시뮬레이션 및 실제 데이터에서 최신 기술을 초월하는 성능을 달성하며, 평균 절대 오차가 낮고 반향, 마이크 간격, 예측되지 않은 음성 신호에 대해 뛰어난 일반화 능력을 보인다.

ABSTRACT

This paper presents SSLIDE, Sound Source Localization for Indoors using DEep learning, which applies deep neural networks (DNNs) with encoder-decoder structure to localize sound sources with random positions in a continuous space. The spatial features of sound signals received by each microphone are extracted and represented as likelihood surfaces for the sound source locations in each point. Our DNN consists of an encoder network followed by two decoders. The encoder obtains a compressed representation of the input likelihoods. One decoder resolves the multipath caused by reverberation, and the other decoder estimates the source location. Experiments based on both the simulated and experimental data show that our method can not only outperform multiple signal classification (MUSIC), steered response power with phase transform (SRP-PHAT), sparse Bayesian learning (SBL), and a competing convolutional neural network (CNN) approach in the reverberant environment but also achieve a good generalization performance.

연구 동기 및 목표

  • 다중경로 효과로 인해 전통적 방법이 실패하는 반향이 강한 실내 환경에서 강건한 소리 원천 정위치화(SSL) 방법을 개발하는 것.
  • 사전 정의된 후보 DOA 격자에 의존하지 않고 연속 공간에서의 정위치화를 가능하게 하여 실세계 적용성을 높이는 것.
  • 다양한 반향 시간, 마이크 구성, 예측되지 않은 음성 신호에 대한 일반화 능력을 향상시키는 것.
  • 단일 딥 네트워크에 두 개의 병렬 디코더를 사용하여 소리 원천 위치 추정과 다중경로 간섭 억제를 동시에 수행하는 것.

제안 방법

  • 시간-주파수 도메인에서의 빔포밍을 통해 유도된 입력 가능성 표면을 압축하는 인코더를 갖춘 딥 네트워크를 사용한다.
  • 두 개의 병렬 디코더를 활용: 하나는 소리 원천 위치를 추정하고, 다른 하나는 실내 반향으로 인한 다중경로 간섭을 억제하는 데 전용이다.
  • 입력 특징은 시간-주파수 도메인에서의 STFT와 각도 $ \theta $ 및 거리 $ d $에 대한 스텐딩 백터 투영을 통해 계산된 가능성 표면 $ P_{ns}(\theta,d) $ 로 구성된다.
  • 가능성 표면은 각도와 거리에 대해 $ U \times V $ 개의 점으로 이루어진 2차원 격자로 표현되며, 딥 네트워크의 텐서 입력이 된다.
  • 지식 기반의 소리 원천 위치와 다중경로 인식 타겟을 사용하여 지도 학습 방식으로 엔드 투 엔드로 네트워크를 훈련시킨다.
  • 다중경로 완화 디코더는 가능성 표현에서 반향으로 인한 왜곡을 억제하도록 특별히 설계되었다.
Fig. 1 : Likelihood surfaces (a) before and (b) after range compensation, and (c) after range compensation and coordinate transformation, (d) Output likelihood surface from localization decoder. The correct source position (+), and maximum value (for (a) - (c)) / predicted location (for (d)) ( $\cir
Fig. 1 : Likelihood surfaces (a) before and (b) after range compensation, and (c) after range compensation and coordinate transformation, (d) Output likelihood surface from localization decoder. The correct source position (+), and maximum value (for (a) - (c)) / predicted location (for (d)) ( $\cir

실험 결과

연구 질문

  • RQ1이중 디코더 아키텍처를 갖춘 딥러닝 모델이 다중경로 효과가 뚜렷한 반향이 강한 실내 환경에서 MUSIC 및 SRP-PHAT와 같은 전통적 SSL 방법을 뛰어넘을 수 있는가?
  • RQ2제안된 방법은 다양한 반향 시간, 마이크 간격, 예측되지 않은 음성 신호에 대해 잘 일반화되는가?
  • RQ3다중경로 완화 디코더는 성능 향상에 필수적인가? 그 제거가 정위치화 정확도를 떨어뜨리는가?
  • RQ4대부분의 기준 방법과 달리 사전 정의된 후보 DOA 방향에 대한 지식 없이도 정확한 정위치화를 달성할 수 있는가?

주요 결과

  • 0.6초 반향 시간을 가진 시뮬레이션 데이터에서 SSLIDE는 평균 절대 오차(MAE) 6.7미터를 달성하여 SRP-PHAT(25m), MUSIC(27m), SBL(17m), CNN(16m)을 모두 뛰어넘었다.
  • MIRD 데이터셋에서 SSLIDE는 DOA 추정에 대해 MAE 8.1°를 기록했으며, SRP-PHAT(19°), MUSIC(18°), SBL(18°), CNN(9.8°)보다 유의미하게 낮았다.
  • 절단 실험 결과, 다중경로 완화 디코더를 제거하면 시뮬레이션 데이터에서 MAE가 0.2–0.3미터 증가하고, MIRD 데이터에서 0.06–0.12° 증가하여 그 핵심적 역할을 확인했다.
  • 편미네이션 테스트에서 0.7초 RT60(훈련 시 0.6초) 조건에서도 MAE는 0.77m에서 0.93m로 뿐만 아니라 CNN(1.1m에서 1.7m)보다 뛰어난 성능를 유지했다.
  • 3개의 새로운 예측되지 않은 음성 녹음 데이터에서 SSLIDE는 MAE 0.45m를 유지했고, CNN의 12.0m와 비교해 음성 변동에 대한 뛰어난 강건성을 입증했다.
  • SRP-PHAT, MUSIC, SBL, CNN와 달리 사전 정의된 DOA 후보 격자가 필요 없이도 높은 정확도를 달성하여, 이는 기존 방법과의 핵심적 차이점이다.
Fig. 2 : SSLIDE architecture. $C$ , $N$ , $X$ and $Y$ are followed by the definitions in Sec 2.1–2.4. s and p stand for stride and padding, respectively
Fig. 2 : SSLIDE architecture. $C$ , $N$ , $X$ and $Y$ are followed by the definitions in Sec 2.1–2.4. s and p stand for stride and padding, respectively

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.