[논문 리뷰] Improving Code-Switching and Named Entity Recognition in ASR with Speech Editing based Data Augmentation
이 논문은 엔드 투 엔드 음성 인식(ASR)에서 코드 스위칭 및 명명된 실체 인식(NER) 성능을 향상시키기 위해 음성 편집 기반 데이터 증강 방법을 제안한다. 텍스트 기반 음성 편집 모델을 사용해 실제 음성을 편집함으로써, 전통적인 오디오 스플리싱 또는 신경 TTS 방법보다 더 일관되고 다양한, 현실적인 증강 오디오를 생성한다. 이는 도메인 내 및 도메인 외 테스트 세트에서 WER와 명명된 실체 재현율/정밀도에 있어 뚜렷한 향상을 이끌어낸다.
Recently, end-to-end (E2E) automatic speech recognition (ASR) models have made great strides and exhibit excellent performance in general speech recognition. However, there remain several challenging scenarios that E2E models are not competent in, such as code-switching and named entity recognition (NER). Data augmentation is a common and effective practice for these two scenarios. However, the current data augmentation methods mainly rely on audio splicing and text-to-speech (TTS) models, which might result in discontinuous, unrealistic, and less diversified speech. To mitigate these potential issues, we propose a novel data augmentation method by applying the text-based speech editing model. The augmented speech from speech editing systems is more coherent and diversified, also more akin to real speech. The experimental results on code-switching and NER tasks show that our proposed method can significantly outperform the audio splicing and neural TTS based data augmentation systems.
연구 동기 및 목표
- 희귀어의 데이터 부족 및 긴 꼬리 분포로 인해 엔드 투 엔드 ASR 모델에서 코드 스위칭 및 명명된 실체 인식 성능이 떨어지는 문제를 해결하기 위해.
- 기존 데이터 증강 기법인 오디오 스플리싱 및 신경 TTS의 한계를 극복하기 위해, 음성의 음향 불연속성, 잡음, 합성 음성의 다양성 부족을 줄이기 위해.
- 더 현실적이고 일관된 증강 훈련 데이터를 생성함으로써, 미리 보지 못한 코드 스위칭 및 명명된 실체 문장에 대한 모델 일반화 능력과 강건성을 향상시키기 위해.
- 실세계 ASR 환경에서 코드 스위칭 및 NER 작업에 대한 음성 편집 기반 데이터 증강의 효과를 평가하기 위해.
제안 방법
- 이 방법은 실제 음성 오디오에 목표 단어(예: 명명된 실체 또는 코드 스위칭 세그먼트)를 삽입하거나 대체함으로써, 원래의 화자 음성과 음향 특성을 유지하면서 텍스트 기반 음성 편집 모델을 적용한다.
- 기존의 실제 오디오 샘플을 편집하여 증강된 음성을 생성함으로써, 서로 다른 세그먼트를 연결하는 오디오 스플리싱과는 달리 연속성과 자연스러움을 확보한다.
- 이 방법은 두 가지 변형을 생성한다: 전체 오디오 편집(Aug_edit)과 음향 특성만 편집하는 변형(Aug_edit-feats)으로, 현실성과 훈련 효율성 사이의 트레이드오프를 가능하게 한다.
- 하이브리드 데이터 증강 전략은 편집된 음성과 신경 TTS로 생성된 음성을 조합함으로써 더 높은 다양성과 일반화 능력을 향상시킨다(Aug_edit-feats+tts).
- 증강된 데이터는 사전에 훈련된 ASR 모델을 미세조정하는 데 사용되며, 인코더의 하위 11개 레이어는 일반 음성 인식 능력을 유지하기 위해 고정된다.
- 훈련 데이터는 실제 비대상 음성과 혼합되어 도메인 이동을 균형 잡고, 합성 데이터에 대한 과적합을 방지한다.
실험 결과
연구 질문
- RQ1음성 편집 기반 데이터 증강은 엔드 투 엔드 ASR에서 코드 스위칭 인식 성능 향상에 있어 오디오 스플리싱 및 신경 TTS보다 뛰어나다고 할 수 있는가?
- RQ2음성 편집 기반 데이터 증강은 도메인 내 및 도메인 외 설정 모두에서 명명된 실체 인식 성능 향상에 기여하는가?
- RQ3실세계 ASR 응용에서, 편집된 음성의 일관성과 음향 현실성은 오디오 스플리싱 또는 TTS로 생성된 음성과 비교해 어떻게 다른가?
- RQ4편집된 음성과 신경 TTS로 생성된 음성을 조합함으로써 모델의 일반화 능력과 강건성에 어떤 영향을 미치는가?
주요 결과
- 제안된 음성 편집 기반 데이터 증강(Aug_edit)은 오디오 스플리싱 및 신경 TTS 기반 베이스라인 대비 도메인 내 및 도메인 외 테스트 세트에서 가장 낮은 단어 오류률(WER)과 가장 높은 명명된 실체 재현율 및 정밀도를 달성했다.
- 하이브리드 접근 방식(Aug_edit-feats+tts)은 모든 메트릭에서 최고의 전반적 성능을 기록했으며, WER 및 명명된 실체 인식 점수 모두에서 모든 다른 방법을 앞섰다.
- 실제 데이터와 증강 데이터를 혼합하여 미세조정함으로써 모델의 일반화 능력이 뚜렷이 향상되었으며, 합성 데이터만을 사용한 경우에 비해 과적합이 감소했다.
- Aug_edit-feats 변형은 Aug_edit, Aug_splice, Aug_tts와 비교해 WER와 명명된 실체 인식 성능 사이의 균형을 더 잘 유지했으며, 수정되지 않은 영역의 음향 일관성이 유지되었기 때문이다.
- 결과는 음성 편집이 오디오 스플리싱 또는 신경 TTS보다 더 현실적이고 일관된 증강 음성을 생성하며, 희귀어 및 OOV(Out-of-Vocabulary) 단어에 대한 ASR 강건성 향상에 측정 가능한 기여를 한다는 것을 보여준다.
- 성능 향상은 코드 스위칭 및 명명된 실체 인식 작업 모두에서 일관되게 나타났으며, 이는 본 방법이 데이터 부족 상황에서의 ASR 시나리오에 널리 적용 가능하다는 것을 검증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.