[논문 리뷰] Weakly supervised CRNN system for sound event detection with large-scale unlabeled in-domain data
이 논문은 대규모 비라벨된 도메인 내 오디오 데이터를 활용하여 음향 이벤트 검출(Sound Event Detection, SED) 성능을 향상시키는 약한 감독 기반 CRNN 시스템을 제안한다. 사전 훈련된 오디오 태깅 모델을 사용해 비라벨 데이터에 대해 의사 레이블을 생성하고, 노이즈가 있는 레이블의 영향을 줄이기 위해 앙상블 전략을 적용함으로써, DCASE 2018 SED 챌린지에서 기준 모델 대비 10% 향상된 21.0%의 F1 스코어를 달성한다.
Sound event detection (SED) is typically posed as a supervised learning problem requiring training data with strong temporal labels of sound events. However, the production of datasets with strong labels normally requires unaffordable labor cost. It limits the practical application of supervised SED methods. The recent advances in SED approaches focuses on detecting sound events by taking advantages of weakly labeled or unlabeled training data. In this paper, we propose a joint framework to solve the SED task using large-scale unlabeled in-domain data. In particular, a state-of-the-art general audio tagging model is first employed to predict weak labels for unlabeled data. On the other hand, a weakly supervised architecture based on the convolutional recurrent neural network (CRNN) is developed to solve the strong annotations of sound events with the aid of the unlabeled data with predicted labels. It is found that the SED performance generally increases as more unlabeled data is added into the training. To address the noisy label problem of unlabeled data, an ensemble strategy is applied to increase the system robustness. The proposed system is evaluated on the SED dataset of DCASE 2018 challenge. It reaches a F1-score of 21.0%, resulting in an improvement of 10% over the baseline system.
연구 동기 및 목표
- 음향 이벤트 검출(Sound Event Detection, SED)에서 강한 시간 레이블의 높은 레이블링 비용 문제를 대규모 비라벨 도메인 내 오디오 데이터를 활용하여 해결하고자 한다.
- 약한 감독 기반 CRNN와 의사라벨이 부여된 비라벨 데이터를 융합한 공동 학습 프레임워크를 개발하여 SED 성능을 향상시키고자 한다.
- 약한 레이블 데이터에서 유도된 노이즈가 있는 의사 레이블의 영향을 줄이기 위해 앙상블 전략을 통해 강건성을 향상시키고자 한다.
- 실세계 SED 벤치마크에서 비지도 사전 훈련과 도메인 내 데이터 기반 자기 훈련의 효과를 입증하고자 한다.
제안 방법
- 최신 기술의 오디오 태깅 모델을 사용해 대규모 비라벨 도메인 내 오디오 데이터에 대해 약한 레이블을 예측한다.
- 예측된 의사 레이블을 사용해 약한 감독 기반의 CRNN 아키텍처를 훈련시켜 강한 시간 레이블이 부여된 음향 이벤트를 국소화한다.
- 여러 모델 간 앙상블 전략을 적용하여 노이즈가 있는 의사 레이블의 영향을 줄이고 일반화 성능을 향상시킨다.
- 약한 레이블이 부여된 데이터와 원본 라벨이 부여된 훈련 세트를 함께 사용해 CRNN의 SED 최적화를 공동으로 수행한다.
- CRNN 출력과 의사 레이블 신뢰도를 조합한 공동 손실을 사용해 프레임워크를 엔드 투 엔드로 훈련시킨다.
실험 결과
연구 질문
- RQ1약한 감독과 함께 대규모 비라벨 도메인 내 오디오 데이터를 활용할 경우, SED 성능 향상에 상당한 기여를 할 수 있는가?
- RQ2사전 훈련된 오디오 태깅 모델에서 유도된 의사 레이블은 비용이 많이 드는 강한 레이블링의 필요성을 얼마나 줄일 수 있는가?
- RQ3약한 감독 기반 SED에서 의사 레이블이 유도하는 노이즈를 앙상블 전략이 어느 정도 완화할 수 있는가?
- RQ4라벨이 부여된 데이터와 의사라벨이 부여된 데이터를 함께 훈련시키는 것이 단순히 감독 훈련보다 더 나은 일반화 성능을 이끌어낼 수 있는가?
주요 결과
- 제안된 시스템은 DCASE 2018 음향 이벤트 검출 평가 세트에서 F1 스코어 21.0%를 달성한다.
- 기준 모델 대비 성능 향상이 10个百分点(백분율 포인트)로 나타나, 제안된 방법의 효과성을 입증한다.
- 훈련 과정에 더 많은 비라벨 데이터를 통합할수록 시스템 성능이 일관되게 향상된다.
- 앙상블 전략은 특히 오디오 태깅 모델에서 유도된 노이즈가 있는 의사 레이블을 다룰 때 강건성을 크게 향상시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.