Skip to main content
QUICK REVIEW

[논문 리뷰] Multitask-Based Joint Learning Approach To Robust ASR For Radio Communication Speech

Duo Ma, Nana Hou|arXiv (Cornell University)|2021. 07. 22.
Speech and Audio Processing참고 문헌 30인용 수 11
한 줄 요약

이 논문은 별도의 사전 훈련 없이 스피치 인식(ASR) 백엔드와 스피치 향상(SE) 프론트엔드를 함께 처음부터 동시에 훈련하는 다중 작업 기반 공동 학습 프레임워크를 제안한다. 복합 손실을 통해 말의 명료성과 ASR 성능을 동시에 최적화하고, 위상 정보를 유지함으로써 이중 채널 데이터 증강을 사용한 RATS 영어 데이터셋에서 상대적 WER 감소율 11.2%를 달성한다.

ABSTRACT

To realize robust end-to-end Automatic Speech Recognition(E2E ASR) under radio communication condition, we propose a multitask-based method to joint train a Speech Enhancement (SE) module as the front-end and an E2E ASR model as the back-end in this paper. One of the advantage of the proposed method is that the entire system can be trained from scratch. Different from prior works, either component here doesn't need to perform pre-training and fine-tuning processes separately. Through analysis, we found that the success of the proposed method lies in the following aspects. Firstly, multitask learning is essential, that is the SE network is not only learning to produce more Intelligent speech, it is also aimed to generate speech that is beneficial to recognition. Secondly, we also found speech phase preserved from noisy speech is critical for improving ASR performance. Thirdly, we propose a dual channel data augmentation training method to obtain further improvement.Specifically, we combine the clean and enhanced speech to train the whole system. We evaluate the proposed method on the RATS English data set, achieving a relative WER reduction of 4.6% with the joint training method, and up to a relative WER reduction of 11.2% with the proposed data augmentation method.

연구 동기 및 목표

  • 저 SNR와 대역폭 제한으로 심하게 열악한 조건에 놓인 초고주파(UHF) 무선 통신 음성에 대해 강인한 엔드 투 엔드 ASR 시스템을 개발하는 것.
  • SE와 ASR 간의 불일치 문제를 해결하기 위해 두 모듈을 별도의 사전 훈련 없이 공동으로 훈련하는 것.
  • 극도로 노이즈가 많은 무선 통신 환경에서 위상 유지와 데이터 증강이 ASR 성능에 미치는 영향을 조사하는 것.
  • SE 및 ASR 모듈의 별도 사전 훈련 또는 최적화 없이 처음부터 엔드 투 엔드 공동 훈련을 가능하게 하여 필요성을 제거하는 것.

제안 방법

  • ASR 성능과 스피치 향상 품질을 균형 있게 유지하기 위해 (1−β)ℒASR + βℒSE의 복합 손실을 사용하는 다중 작업 기반 공동 학습 방법을 적용한다.
  • SE에 시간-주파수 스펙트럼 마스킹 방법을 사용하며, STFT 크기를 입력으로 사용하고 위상 정보를 유지하여 인식 성능을 향상시킨다.
  • 청결한 음성과 향상된 음성을 함께 사용하는 이중 채널 데이터 증강 전략을 도입하여 ASR 훈련의 강인성을 향상시킨다.
  • 엔드 투 엔드 ASR 백엔드에 Conformer 아키텍처를 사용하며, 80차원의 로그-멜 특징과 바이트-페어 인코딩(BPE) 토크나이제이션을 적용한다.
  • 훈련 중 청정 음성과 향상된 음성의 기여도를 균형 맞추기 위해 손실 함수에 청정 데이터 가중치 요소 γ를 적용한다.
  • SE 모듈의 마스크 추정에 다양한 활성화 함수(ReLU, Mish, meta-ACON)를 평가하여, ReLU가 가장 우수한 성능을 보임을 발견한다.

실험 결과

연구 질문

  • RQ1극도로 노이즈가 많은 무선 통신 음성에서, 처음부터 SE와 ASR을 공동으로 훈련하는 것이 별도의 훈련이나 사전 훈련보다 우수한가?
  • RQ2향상된 음성에서 위상 정보 유지가 후속 ASR 성능 향상에 얼마나 중요한가?
  • RQ3청정 음성과 향상된 음성을 모두 사용하는 이중 채널 데이터 증강 전략이 저SNR 조건에서 ASR 강인성에 얼마나 기여하는가?
  • RQ4다중 작업 손실 함수에서 ASR와 SE 목표 간 최적의 균형은 무엇이며, 스케일링 인자 β는 성능에 어떤 영향을 미치는가?
  • RQ5공동 학습 환경에서 SE 마스크 추정 네트워크의 활성화 함수 중 어느 것이 ASR 성능을 가장 잘 향상시키는가?

주요 결과

  • 제안된 다중 작업 기반 공동 학습 방법은 데이터 증강 없이 기준 시스템 대비 상대적 WER 감소율 4.6%를 달성했다.
  • 이중 채널 데이터 증강을 적용한 결과, 기준 시스템 대비 상대적 WER 감소율 11.2%를 기록하여 극도로 노이즈가 많은 조건에서 뚜렷한 성능 향상을 입증했다.
  • 향상된 음성에서 위상 정보 유지가 핵심적이었으며, 위상 정보를 생략한 경우 WER가 68.6%로 상당한 성능 저하가 발생했다(S5 시스템).
  • SE 모듈의 마스크 추정에 ReLU를 사용할 경우 ASR 성능이 가장 우수했으며(WER 51.8%), Mish(53.3%) 및 meta-ACON(52.9%)보다 뛰어났다.
  • 이중 채널 다중 작업 공동 학습 환경에서 최적의 청정 데이터 가중치 요소 γ는 0.7이었으며, 이로 인해 가장 낮은 WER(48.2%)를 기록했다.
  • 데이터 증강 없이도 다중 작업 학습과 위상 정보 유지가 공동 훈련을 통해 성능을 크게 향상시켰으며, WER를 54.3%에서 51.8%로 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.