Skip to main content
QUICK REVIEW

[논문 리뷰] Convolutional Gated Recurrent Neural Network Incorporating Spatial Features for Audio Tagging

Yong Xu, Qiuqiang Kong|arXiv (Cornell University)|2017. 02. 24.
Music and Audio Processing참고 문헌 20인용 수 10
한 줄 요약

이 논문은 스테레오 오디오에서 공간적 특징을 통합하여 오디오 태깅 성능을 햖थ하는 컨volutional 게이트드 리커런트 신경망(CGRNN)을 제안한다. MFBs 또는 스펙트로그램과 이어간 크기 차이(IMD) 특징을 결합하고 CNN-GRU 아키텍처를 사용함으로써, DCASE 2016 평가 세트에서 최신 기술 수준의 등오류률(EER) 0.123을 달성하여 이전 시스템을 능가하며, 환경 음향 인식에서 공간적 단서의 효과성을 입증한다.

ABSTRACT

Environmental audio tagging is a newly proposed task to predict the presence or absence of a specific audio event in a chunk. Deep neural network (DNN) based methods have been successfully adopted for predicting the audio tags in the domestic audio scene. In this paper, we propose to use a convolutional neural network (CNN) to extract robust features from mel-filter banks (MFBs), spectrograms or even raw waveforms for audio tagging. Gated recurrent unit (GRU) based recurrent neural networks (RNNs) are then cascaded to model the long-term temporal structure of the audio signal. To complement the input information, an auxiliary CNN is designed to learn on the spatial features of stereo recordings. We evaluate our proposed methods on Task 4 (audio tagging) of the Detection and Classification of Acoustic Scenes and Events 2016 (DCASE 2016) challenge. Compared with our recent DNN-based method, the proposed structure can reduce the equal error rate (EER) from 0.13 to 0.11 on the development set. The spatial features can further reduce the EER to 0.10. The performance of the end-to-end learning on raw waveforms is also comparable. Finally, on the evaluation set, we get the state-of-the-art performance with 0.12 EER while the performance of the best existing system is 0.15 EER.

연구 동기 및 목표

  • 스테레오 오디오에서의 공간 정보를 활용하여 오디오 태깅 성능을 향상시키기 위해.
  • 딥 러닝 프레임워크 내에서 메르 필터 밴드(MFBs), 스펙트로그램, 원시 웨이브포워밍 등의 다양한 오디오 표현 방식의 효과를 평가하기 위해.
  • 수작업 특징을 사용하는 것과 비교해도 엔드 투 엔드 학습을 통한 원시 웨이브포워밍 학습이 성능을 동일하거나 초월할 수 있는지 조사하기 위해.
  • 이어간 크기 차이(IMD) 특징을 순환 신경망에 통합하여 시간적 및 공간적 모델링을 향상시키기 위해.

제안 방법

  • 1차원 컨volution 신경망(1D-CNN)을 사용하여 MFBs, 스펙트로그램 또는 원시 웨이브포워밍으로부터 계층적 특징을 추출한다.
  • CNN 이후에 게이트드 리커런트 유닛(GRUs)을 스택하여 오디오 신호의 장기적 시간적 의존성을 모델링한다.
  • 보조적인 CNN이 좌우 채널 신호를 처리하여 이어간 크기 차이(IMD) 특징을 공간적 단서로 추출한다.
  • IMD 특징을 GRU의 은닉 상태와 결합하여 공간 정보를 더 풍부하게 표현한다.
  • 다중 레이블 오디오 태깅을 위해 교차 엔트로피 손실을 사용하여 전체 CGRNN 모델을 엔드 투 엔드로 학습시킨다.
  • 프레임워크는 원시 웨이브포워밍, 스펙트로그램, MFBs 등 다양한 입력 모odal을 지원하며, 공간적 특징은 일관되게 적용된다.

실험 결과

연구 질문

  • RQ1CNN-GRU 아키텍처는 오디오 태깅 작업을 위한 환경 음향의 시간 패턴을 효과적으로 모델링할 수 있는가?
  • RQ2스테레오 녹음에서의 공간적 특징을 통합하면 단일 또는 평균화된 입력에 비해 오디오 태깅 정확도가 향상되는가?
  • RQ3엔드 투 엔드 딥 러닝을 사용할 때 원시 웨이브포워밍은 스펙트로그램 및 MFBs에 비해 성능에서 어떻게 비교되는가?
  • RQ4이어간 크기 차이(IMD)는 오디오 태깅에서 소리의 원천을 구분하는 데 유용한 공간적 특징인가?
  • RQ5MFBs와 IMD 특징의 조합이 DCASE 2016 오디오 태깅 벤치마크에서 최신 기술 수준의 성능을 달성할 수 있는가?

주요 결과

  • 제안된 MFBs와 IMD 특징을 갖춘 CGRNN는 개발 세트에서 가장 낮은 등오류률(EER) 0.102를 기록하여 이전 DNN 방법의 0.13에서 0.10으로 EER을 감소시켰다.
  • 공식 DCASE 2016 평가 세트에서 MFB-IMD 조합은 최신 기술 수준의 EER 0.123을 달성하여 기존 최고 성능 시스템(0.15 EER)을 능가했다.
  • 스펙트로그램만 사용할 경우 MFBs만 사용하는 것보다 성능이 뛰어나지만, MFBs에 IMD 특징을 결합한 경우 스펙트로그램에 IMD를 결합한 것보다 성능이 뛰어나 (EER 0.102 vs. 0.104), MFB-IMD 조합이 더 유리하다.
  • 개발 세트에서 원시 웨이브포워밍에 IMD 특징을 적용한 경우 EER가 0.106을 기록하여 MFBs 및 스펙트로그램과 유사한 성능을 보였으며, 엔드 투 엔드 학습의 잠재력을 시사했다.
  • 모든 입력 유형(MFBs, 스펙트로그램, 원시 웨이브포워밍)에 대해 IMD 특징 통합이 일관되게 성능 향상을 이끌어내어, 그 보완적 가치를 입증했다.
  • 원시 웨이브포워밍을 사용할 때조차도 최신 기술 수준의 성능을 달성하여, 원시 데이터에서 학습된 필터가 환경 음향 태깅에 효과적일 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.