Skip to main content
QUICK REVIEW

[논문 리뷰] Sound event detection via dilated convolutional recurrent neural networks

Yanxiong Li, Mingle Liu|arXiv (Cornell University)|2019. 11. 25.
Music and Audio Processing참고 문헌 21인용 수 5
한 줄 요약

이 논문은 수신장과 장기적 시간적 의존성을 늘리되 모델 파rameter 수를 늘리지 않는 다이레이티드 컨볼루션을 활용하여 수신장과 장기적 시간적 의존성을 늘리는 확장된 컨볼루션 순환 신경망(dilated CRNN)을 제안한다. 표준 CRNN에 비해 TUT-SED 2016에서 최대 6.3% 높은 F1 스코어와 최대 4.1% 낮은 오류율을 기록하여 효율적인 맥락 모델링을 통한 SED 성능 향상을 입증한다.

ABSTRACT

Convolutional recurrent neural networks (CRNNs) have achieved state-of-the-art performance for sound event detection (SED). In this paper, we propose to use a dilated CRNN, namely a CRNN with a dilated convolutional kernel, as the classifier for the task of SED. We investigate the effectiveness of dilation operations which provide a CRNN with expanded receptive fields to capture long temporal context without increasing the amount of CRNN's parameters. Compared to the classifier of the baseline CRNN, the classifier of the dilated CRNN obtains a maximum increase of 1.9%, 6.3% and 2.5% at F1 score and a maximum decrease of 1.7%, 4.1% and 3.9% at error rate (ER), on the publicly available audio corpora of the TUT-SED Synthetic 2016, the TUT Sound Event 2016 and the TUT Sound Event 2017, respectively.

연구 동기 및 목표

  • 깊은 신경망에서 시간적 맥락 모델링을 향상시켜 음향 이벤트 검출(SED) 성능을 향상시키는 것.
  • 표준 CRNN가 제한된 수신장으로 인해 장기적 의존성을 포착하지 못하는 한계를 해결하는 것.
  • 다이레이티드 컨볼루션의 효과를 검토하여 모델 파rameter 수를 늘리지 않고 맥락을 연장하는 데 기여하는지 탐색하는 것.
  • TUT-SED 2016, 2017 및 Synthetic 2016와 같은 표준 SED 벤치마크에서 제안된 다이레이티드 CRNN의 성능을 평가하는 것.
  • F1 스코어와 오류율 측면에서 다이레이티드 CRNN와 기준 CRNN 간의 성능을 비교하는 것.

제안 방법

  • 제안된 모델은 순환층 이전에 다이레이티드 컨볼루션 레이어를 사용하여 네트워크의 수신장을 확장한다.
  • 컨볼루션 레이어에 다이레이션 비율을 적용하여 파rameter 수를 늘리지 않고도 효과적인 시야를 확장한다.
  • 지역적 특징 추출을 위한 컨볼루션 레이어와 시퀀스 모델링을 위한 양방향 장기 단기 기억망(BLSTM) 레이어를 결합한 아키텍처를 구현한다.
  • 다이레이티드 컨볼루션은 정확한 음향 이벤트 위치 추정에 필수적인 장기적 시간적 의존성을 포착할 수 있도록 한다.
  • 이벤트 경계가 약간 표시된 오디오 데이터를 사용하여 교차 엔트로피 손실을 기반으로 엔드 투 엔드로 모델을 훈련시킨다.
  • 최종 예측 헤드는 각 음향 이벤트 클래스에 대해 프레임 단위의 확률을 출력한다.

실험 결과

연구 질문

  • RQ1다이레이티드 컨볼루션을 통해 CRNN의 수신장을 확장함으로써 음향 이벤트 검출 성능 향상이 가능한가?
  • RQ2다이레이티드 컨볼루션의 사용이 오디오 시퀀스에서 장기적 시간적 의존성을 더 잘 모델링하는 데 기여하는가?
  • RQ3공개 SED 데이터셋인 TUT-SED 2016, 2017, Synthetic 2016에서 다이레이티드 CRNN와 표준 CRNN 간의 F1 스코어와 오류율 측면에서 성능가 비교 가능한가?
  • RQ4모델 파rameter 수를 늘리지 않고도 다이레이티드 CRNN가 성능을 유지하거나 향상시킬 수 있는가?
  • RQ5다이레이션 비율이 다양한 음향 이벤트의 탐지 정확도에 미치는 영향은 무엇인가?

주요 결과

  • 다이레이티드 CRNN는 기준 CRNN에 비해 TUT Sound Event 2016 데이터셋에서 최대 6.3% 높은 F1 스코어를 기록했다.
  • TUT-SED Synthetic 2016 데이터셋에서는 F1 스코어가 1.9% 향상되고 오류율이 1.7% 감소했다.
  • TUT Sound Event 2017 데이터셋에서는 F1 스코어가 2.5% 향상되고 오류율이 3.9% 감소했다.
  • 성능 향상은 세 가지 벤치마크 데이터셋 전반에서 일관되게 관찰되어 이 접근법의 일반화 능력을 입증한다.
  • 다이레이티드 CRNN는 모델 파arameter 수를 늘리지 않고도 이러한 향상을 달성하여 파arameter 효율성을 입증한다.
  • 결과는 다이레이티드 컨볼루션이 SED 작업에서 시간적 모델링을 효과적으로 향상시킨다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.