[논문 리뷰] Multi-Channel Target Speaker Extraction with Refinement: The WavLab Submission to the Second Clarity Enhancement Challenge
이 논문은 소음이 많고 반향이 있는 환경에서 보청기용으로 사용하기 위한 새로운 다중 채널 대상 발화자 추출 시스템인 iNeuBe-X를 제안한다. 기존 iNeuBe 프레임워크를 확장하여 인과적이고 발화자 조건화된 MISO-TF-GridNet 및 听력 청력도 기반 정밀 조정 단계를 도입하였다. 이 시스템은 CEC2 개발 세트에서 HASPI 점수 0.942를 기록하여 엄격한 5 ms 지연 제약 조건 하에서도 최신 기술 수준의 성능을 입증하였다.
This paper describes our submission to the Second Clarity Enhancement Challenge (CEC2), which consists of target speech enhancement for hearing-aid (HA) devices in noisy-reverberant environments with multiple interferers such as music and competing speakers. Our approach builds upon the powerful iterative neural/beamforming enhancement (iNeuBe) framework introduced in our recent work, and this paper extends it for target speaker extraction. We therefore name the proposed approach as iNeuBe-X, where the X stands for extraction. To address the challenges encountered in the CEC2 setting, we introduce four major novelties: (1) we extend the state-of-the-art TF-GridNet model, originally designed for monaural speaker separation, for multi-channel, causal speech enhancement, and large improvements are observed by replacing the TCNDenseNet used in iNeuBe with this new architecture; (2) we leverage a recent dual window size approach with future-frame prediction to ensure that iNueBe-X satisfies the 5 ms constraint on algorithmic latency required by CEC2; (3) we introduce a novel speaker-conditioning branch for TF-GridNet to achieve target speaker extraction; (4) we propose a fine-tuning step, where we compute an additional loss with respect to the target speaker signal compensated with the listener audiogram. Without using external data, on the official development set our best model reaches a hearing-aid speech perception index (HASPI) score of 0.942 and a scale-invariant signal-to-distortion ratio improvement (SI-SDRi) of 18.8 dB. These results are promising given the fact that the CEC2 data is extremely challenging (e.g., on the development set the mixture SI-SDR is -12.3 dB). A demo of our submitted system is available at WAVLab CEC2 demo.
연구 동기 및 목표
- 보청기 응용에서 흔히 발생하는 다중 소스, 소음이 많고 반향이 있는 환경에서의 대상 발화자 추출 문제를 해결한다.
- 실시간 보청기 구현에 적합한 저지연(≤5 ms) 시스템을 개발한다.
- 청력 장애를 가진 청취자에게 맞춤형 청력도를 모델 훈련에 통합하여 언어 이해도를 향상시킨다.
- iNeuBe 프레임워크를 확장하여 발화자 조건화 딥 러닝을 통한 발화자 추출을 지원한다.
- 외부 데이터 없이 CEC2 챌린지에서 높은 성능를 달성하며, 내구성과 실시간 구현 가능성에 중점을 둔다.
제안 방법
- 대상 발화자 추출을 위한 발화자 등록 임bedding 조건화를 적용한 이중 단계 DNN 기반 시스템인 iNeuBe-X를 제안한다.
- 비인과적 TF-GridNet을 인과적 자기주의, 단방향 LSTMs 및 레이어 정규화로 수정하여 인과적 프레임 온라인 MISO-TF-GridNet을 구현한다.
- 알고리즘 지연을 낮추기 위해 DNN 단계 사이에 인과적 다중 채널 위너 필터(MCWF)를 통합한다.
- FiLM 모듈을 통해 발화자 임베딩을 MISO-TF-GridNet에 조건화하여 대상 발화자에 특화된 향상 기능을 구현한다.
- 이중 단계 훈련 전략을 적용: 먼저 발화자 임베딩을 포함한 DNN 1을 훈련하고, 이후 다중 해상도 STFT 진폭 손실을 사용하여 DNN 2를 정밀 조정한다.
- 청취자 적응형 정밀 조정 단계를 도입하여 NAL-R 피팅 및 다이내믹 레인지 압축을 적용하여 HASPI를 향상시킨다.
실험 결과
연구 질문
- RQ1인과적, 저지연 다중 채널 음성 향상 시스템은 복잡한 소음 환경에서 높은 품질의 대상 발화자 추출을 달성할 수 있는가?
- RQ2임베딩 기반의 발화자 조건화 학습은 다중 대화자, 반향 환경에서 대상 음성 추출에 어떻게 기여하는가?
- RQ3훈련 단계에서 청취자 고유의 청력도를 통합할 경우, HASPI로 측정된 청취자 인지적 음성 품질은 어느 정도 향상되는가?
- RQ4반복적 비트포밍과 후처리 필터링의 조합은 단일 단계 향상 기술을 초월해 성능을 향상시키는가?
- RQ5비인과적 최신 기술 수준의 분리 모델(TF-GridNet)이 실시간 인과적 다중 채널 처리에 효과적으로 적응될 수 있는가?
주요 결과
- 제안된 iNeuBe-X 시스템은 CEC2 개발 세트에서 HASPI 점수 0.942를 기록하여 챌린지 기준점(0.245)과 오라클 혼합 결과(0.998)를 크게 앞서며 뛰어난 성능을 입증하였다.
- 청취자 청력도 기반 정밀 조정을 추가함으로써 SI-SDRi가 18.082 dB에서 19.082 dB로 향상되어 개인 맞춤 보정의 효과를 입증하였다.
- 단방향 LSTMs와 마스크된 자기주의를 갖춘 인과적 MISO-TF-GridNet을 사용함으로써 4 ms의 알고리즘 지연으로 프레임 온라인 처리가 가능하였다.
- 시스템은 5 ms 지연 제약 조건을 충족하였으며, 공개된 지연 검증 코드를 통해 확인되었으며, 실시간 보청기 구현에 적합하다.
- NAL-R 피팅을 통한 정밀 조정으로 HASPI가 0.015 증가하여 청취자 맞춤형 적응이 청취자 인지적 품질 향상에 크게 기여함을 보였다.
- DNN 2 및 NAL-R 정밀 조정 이후 STOI는 0.947, PESQ는 2.269를 기록하여 높은 음성 품질과 이해도를 확보하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.