[논문 리뷰] Decoupling Pronunciation and Language for End-to-end Code-switching Automatic Speech Recognition
이 논문은 종단 간 코드 스위칭 음성 인식(ASR)을 두 단계로 분리하는 분리형 트랜스포머 모델을 제안한다: 음성에서 음소로(음성-음소, A2P)와 음소에서 텍스트로(음소-텍스트, P2T)의 네트워크이다. A2P 네트워크는 단일 언어 쌍화된 데이터로 사전 훈련하고, P2T 네트워크는 쌍화되지 않은 텍스트 데이터로 사전 훈련하며, 주의 집합을 통한 공동 최적화를 통해 중국어-영어 코드 스위칭 데이터에서 상대 오류율을 18.14% 감소시켰다. 이는 희소한 코드 스위칭 음성-텍스트 쌍화 데이터에 대한 의존도를 크게 줄였다.
Despite the recent significant advances witnessed in end-to-end (E2E) ASR system for code-switching, hunger for audio-text paired data limits the further improvement of the models' performance. In this paper, we propose a decoupled transformer model to use monolingual paired data and unpaired text data to alleviate the problem of code-switching data shortage. The model is decoupled into two parts: audio-to-phoneme (A2P) network and phoneme-to-text (P2T) network. The A2P network can learn acoustic pattern scenarios using large-scale monolingual paired data. Meanwhile, it generates multiple phoneme sequence candidates for single audio data in real-time during the training process. Then the generated phoneme-text paired data is used to train the P2T network. This network can be pre-trained with large amounts of external unpaired text data. By using monolingual data and unpaired text data, the decoupled transformer model reduces the high dependency on code-switching paired training data of E2E model to a certain extent. Finally, the two networks are optimized jointly through attention fusion. We evaluate the proposed method on the public Mandarin-English code-switching dataset. Compared with our transformer baseline, the proposed method achieves 18.14% relative mix error rate reduction.
연구 동기 및 목표
- 종단 간 ASR에서 코드 스위칭 음성-텍스트 쌍화 데이터의 부족 문제를 해결하기 위해.
- 비용이 많이 들고 제한된 코드 스위칭 훈련 데이터에 대한 종단 간 모델의 의존도를 줄이기 위해.
- 코드 스위칭 ASR에서 단일 언어 쌍화된 데이터와 쌍화되지 않은 텍스트 데이터를 효과적으로 활용하기 위해.
- 성능 향상과 함께 훈련 및 추론의 단순성을 유지하기 위해.
제안 방법
- 모델은 음성-음소(A2P) 네트워크와 음소-텍스트(P2T) 네트워크로 분리된다.
- A2P 네트워크는 단일 언어 쌍화된 데이터를 사용하여 연결주의 시간 분류(CTC) 기준으로 사전 훈련되며, 언어적 맥락과 무관하게 음향 패턴을 학습할 수 있도록 한다.
- 훈련 중 A2P 네트워크는 음성 입력당 실시간으로 여러 개의 음소 시퀀스 후보를 생성한다.
- 생성된 음소-텍스트 쌍은 P2T 네트워크를 훈련하는 데 사용되며, 이 네트워크는 대규모 쌍화되지 않은 텍스트 데이터로 사전 훈련된다.
- 공동 최적화 중 계산 비용을 줄이기 위해 다중 수준 주의 메커니즘을 사용한다.
- 두 네트워크는 주의 집합을 통해 공동 최적화되어 정렬과 성능을 향상시킨다.

실험 결과
연구 질문
- RQ1쌍화된 코드 스위칭 데이터가 필요 없이도 단일 언어 쌍화된 데이터를 효과적으로 활용하여 코드 스위칭 ASR를 향상시킬 수 있는가?
- RQ2쌍화되지 않은 텍스트 데이터를 사용하여 코드 스위칭 ASR 시스템의 언어 모델링 구성 요소를 사전 훈련할 수 있는가?
- RQ3음성 모델링과 언어 모델링 구성 요소를 분리함으로써 희소한 코드 스위칭 훈련 데이터에 대한 의존도를 줄일 수 있는가?
- RQ4주의 집합을 통한 A2P와 P2T 네트워크의 공동 최적화가 종단 간 훈련 및 추론의 단순성을 유지할 수 있는가?
주요 결과
- 제안된 모델은 중국어-영어 코드 스위칭 데이터셋에서 트랜스포머 기준 모델 대비 18.14% 상대 오류율 감소를 달성했다.
- 외부 데이터를 사용할 경우 영어의 상대 단어 오류율(WER)은 9.39% 감소하고, 중국어의 문자 오류율(CER)은 9.78% 감소했다.
- 중국어 단일 언어 데이터 500시간과 영어 단일 언어 데이터 460시간으로 A2P 네트워크를 사전 훈련하면, 오직 코드 스위칭 데이터만으로 훈련한 경우 대비 9.42% 상대 MER 감소를 기록했다.
- 제거 분석 결과, 음성 정보와 음소 정보를 모두 사용할 경우 음소 수준의 모델링만 사용하는 것보다 더 뛰어난 성능을 보였으며, 이는 다중 모odal 정보 융합의 이점이 확인됨을 시사한다.
- 분리된 아키텍처임에도 불구하고 표준 종단 간 모델과 유사하게 훈련 및 디코딩의 단순성을 유지했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.