[논문 리뷰] Deep Residual Network for Sound Source Localization in the Time Domain
이 논문은 3cm 간격을 가진 8채널 선형 마이크로폰 어레이를 사용하여 시간 도메인에서 음원 위치 추정(SSL)을 위한 딥 리뷰즈 네트워크를 제안한다. 30ms 음성 프레임으로서의 SSL을 분류 문제로 재정의함으로써, 모델은 99.2%의 분류 정확도와 4°의 표준편차를 기록하며, 음성 인식 파ip라인에 통합되었을 때 GCC-PHAT보다 단어 오류율(WER)이 1.14% 감소함으로써 기존 방법을 초월한다.
This study presents a system for sound source localization in time domain using a deep residual neural network. Data from the linear 8 channel microphone array with 3 cm spacing is used by the network for direction estimation. We propose to use the deep residual network for sound source localization considering the localization task as a classification task. This study describes the gathered dataset and developed architecture of the neural network. We will show the training process and its result in this study. The developed system was tested on validation part of the dataset and on new data capture in real time. The accuracy classification of 30 m sec sound frames is 99.2%. The standard deviation of sound source localization is 4°. The proposed method of sound source localization was tested inside of speech recognition pipeline. Its usage decreased word error rate by 1.14% in comparison with similar speech recognition pipeline using GCC-PHAT sound source localization.
연구 동기 및 목표
- 원시 음성 프레임을 사용하여 시간 도메인에서 음원 위치 추정을 위한 딥 러닝 기반 접근법을 개발하는 것.
- 실시간 음성 처리에서 정확하고 견고한 도래 방향 추정 문제를 해결하는 것.
- 고정확도의 SSL 시스템을 통합하여 음성 인식 성능을 향상시키는 것.
- 리뷰즈 네트워크가 시간 도메인 신호로부터 음원 방향을 분류하는 데 효과적인지 입증하는 것.
제안 방법
- 8채널 선형 마이크로폰 어레이로 캡처한 30ms 시간 도메인 음성 프레임에서 음원 방향을 분류하기 위해 딥 리뷰즈 신경망을 학습한다.
- 딥 네트워크의 안정적 학습을 위해 잔차 블록을 활용한 특수 설계된 네트워크 아키텍처를 사용한다.
- 스펙트럼 변환 없이 원시 시간 도메인 신호에서 직접 입력 특징을 추출하여 시간 해상도를 유지한다.
- 통제된 음원을 가진 실제 음향 환경에서 수집한 고유 데이터셋을 사용하여 시스템을 학습한다.
- 이산 방향 박스 간의 다중 클래스 분류를 위해 소프트맥스 교차 엔트로피 손실을 사용한다.
- 학습된 모델을 음성 인식 파이프라인에 통합하여 후행 성능 향상을 평가한다.
실험 결과
연구 질문
- RQ1딥 리뷰즈 네트워크는 시간 도메인 음성 프레임에서 직접 음원 위치를 학습하는 데 효과적인가?
- RQ2제안된 시간 도메인 리뷰즈 네트워크의 성능은 GCC-PHAT와 같은 전통적 방법에 비해 방향 추정 정확도에서 어떻게 비교되는가?
- RQ3제안된 SSL 시스템을 음성 인식 파이프라인에 통합했을 때 단어 오류율(WER)은 어느 정도 향상되는가?
- RQ4모델은 실시간으로 발생하는 미리 보지 않은 음성 데이터에 대해 얼마나 잘 일반화되는가?
주요 결과
- 제안된 딥 리뷰즈 네트워크는 음원 위치 추정을 위한 30ms 음성 프레임에서 99.2%의 분류 정확도를 달성했다.
- 위치 추정 오차의 표준편차는 4°로 측정되어 방향 추정의 높은 정밀도를 나타낸다.
- 음성 인식 파이프라인에 통합되었을 때, GCC-PHAT를 사용한 유사한 파이프라인 대비 단어 오류율(WER)이 1.14% 감소했다.
- 모델은 검증 데이터와 실시간 캡처된 테스트 데이터 모두에서 높은 성능을 유지하며 강력한 일반화 능력을 보였다.
- 스펙트럼 변환 없이 원시 시간 도메인 입력을 사용한 것이 방향 분류에 효과적이고 효율적이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.