[논문 리뷰] Forward-Backward Convolutional Recurrent Neural Networks and Tag-Conditioned Convolutional Neural Networks for Weakly Labeled Semi-supervised Sound Event Detection
이 논문은 약한 레이블이 붙은 반감성 학습을 위한 전방-후방 컨volutional 순환 신경망(FBCRNN)과 태그 조건부 CNN을 제안한다. FBCRNN는 전체 입력 시퀀스의 맥락을 활용해 각 시점에서 음성 태그를 예측하도록 전방 및 후방 RNN을 동시에 학습함으로써, 짧은 세그먼트에서도 SED를 수행할 수 있도록 조기 태깅을 가능하게 한다. 태그 조건부 CNN은 FBCRNN의 예측 태그를 입력으로 받아 강한 레이블 예측을 정밀화한다. 시스템은 검증 세트에서 52.8%의 매크로 F1을 기록하여 챌린지 베이스라인 대비 18.0% 향상되고, 우승 시스템 대비 2.2% 높은 성능을 보였다.
In this paper we present our system for the detection and classification of acoustic scenes and events (DCASE) 2020 Challenge Task 4: Sound event detection and separation in domestic environments. We introduce two new models: the forward-backward convolutional recurrent neural network (FBCRNN) and the tag-conditioned convolutional neural network (CNN). The FBCRNN employs two recurrent neural network (RNN) classifiers sharing the same CNN for preprocessing. With one RNN processing a recording in forward direction and the other in backward direction, the two networks are trained to jointly predict audio tags, i.e., weak labels, at each time step within a recording, given that at each time step they have jointly processed the whole recording. The proposed training encourages the classifiers to tag events as soon as possible. Therefore, after training, the networks can be applied to shorter audio segments of, e.g., 200 ms, allowing sound event detection (SED). Further, we propose a tag-conditioned CNN to complement SED. It is trained to predict strong labels while using (predicted) tags, i.e., weak labels, as additional input. For training pseudo strong labels from a FBCRNN ensemble are used. The presented system scored the fourth and third place in the systems and teams rankings, respectively. Subsequent improvements allow our system to even outperform the challenge baseline and winner systems in average by, respectively, 18.0% and 2.2% event-based F1-score on the validation set. Source code is publicly available at https://github.com/fgnt/pb_sed.
연구 동기 및 목표
- 약한 레이블(이벤트 존재/부재)만 제공되는 도메인 환경에서의 사운드 이벤트 검출(Sed) 문제를 해결하기 위해.
- 전체 녹음 파일에 약한 레이블로 훈련된 모델이 짧은 오디오 세그먼트(예: 200ms)에서도 SED 추론이 가능하도록 하는 방법을 개발하기 위해.
- FBCRNN 예측에서 유도된 가짜 강한 레이블을 활용해 반감성 학습 성능을 향상시키기 위해.
- 약한 레이블을 보조 입력으로 사용해 태그 조건부 기반의 정확도 향상 효과를 탐색하기 위해.
제안 방법
- FBCRNN는 공유 CNN을 통해 특징 추출을 수행한 후, 입력을 전방으로 처리하는 RNN과 후방으로 처리하는 RNN을 동시에 사용하며, 전체 녹음 시퀀스의 맥락을 바탕으로 각 시점에서 음성 태그를 예측하도록 공동으로 학습한다.
- 공동 학습은 양방향 RNN이 전체 시퀀스를 기반으로 태그를 예측하도록 유도함으로써 조기 태깅을 촉진하고, 훈련 후 짧은 세그먼트에 대한 추론을 가능하게 한다.
- 태그 조건부 CNN은 FBCRNN의 예측 태그를 추가 입력 특징으로 사용하여 강한 이벤트 발생 및 종료 시점 예측을 수행한다.
- 가짜 강한 레이블은 FBCRNN 앙상블의 출력에서 생성되며, 이는 태그 조건부 CNN의 훈련을 보조한다.
- 훈련 중에 mixup, 시간/주파수 마스킹, 무작위 스케일링 등의 데이터 증강 기법을 적용하여 모델의 강건성을 향상시킨다.
- 여러 개의 FBCRNN 및 CNN 모델 앙상블은 일반화 능력 향상과 더 높은 탐지 성능을 달성하는 데 기여한다.
실험 결과
연구 질문
- RQ1약한 레이블로 훈련된 전방-후방 RNN 아키텍처가 강한 감독 없이도 짧은 오디오 세그먼트에서 효과적인 사운드 이벤트 검출을 가능하게 하는가?
- RQ2FBCRNN 예측 태그를 CNN의 조건부 입력으로 사용할 경우, 반감성 SED에서 강한 레이블 예측을 정밀화하는 데 얼마나 효과적인가?
- RQ3FBCRNN 출력을 기반으로 한 가짜 레이블링이 태그 조건부 CNN의 성능 향상에 뚜렷한 기여를 하는가?
- RQ4FBCRNN와 태그 조건부 CNN 모델을 앙상블할 경우 개별 모델 대비 전체 SED 성능 향상 정도는 어느 정도인가?
- RQ5효과적인 모델 설계와 결합된 간단한 가짜 레이블링 전략이, 더 복잡한 반감성 학습 방법(예: mean-teacher)을 능가할 수 있는가?
주요 결과
- FBCRNN 앙상블은 검증 세트에서 매크로 F1 점수 48.3%를 기록하여 조기 태깅과 짧은 세그먼트 추론의 효과를 입증하였다.
- 태그 조건부 CNN 앙상블은 검증 세트에서 매크로 F1 점수 52.1%를 기록하여 FBCRNN를 초월하며 태그 조건부 기반의 성능 향상 효과를 보였다.
- FBCRNN와 CNN 모델을 조합한 하이브리드 앙상블은 검증 세트에서 매크로 F1 52.8%를 기록하여 챌린지 베이스라인 대비 18.0% 향상되었다.
- 시스템은 검증 세트에서 2020년 챌린지 우승 시스템 대비 매크로 F1 2.2% 높은 성능을 기록하여 뛰어난 일반화 능력을 보였다.
- yt-eval-2019 세트에서 단일 FBCRNN 모델 대비 앙상블은 2.4% 향상되었고, 단일 CNN 모델 대비 0.7% 향상되었다.
- 보다 광범위한 초모수 튜닝은 성능 향상에 미미한 영향을 미쳤으며, 성능 향상의 주요 원인은 개선된 가짜 레이블링 전략임을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.