[논문 리뷰] Transformer-based Models of Text Normalization for Speech Applications
이 논문은 음성 응용 분야에서 텍스트 정규화를 위한 Transformer 기반 모델을 평가하며, 특히 텍스트 음성 합성(TTS)에서 seq2seq 및 이중 단계 아키텍처의 변종을 비교한다. 주요 발견은 이중 단계 모델 내에서 BERT 인코더를 미세조정하는 것이 가장 뛰어난 성능을 보이며, 표준 데이터셋에서 문장 오류율(SER)을 1.42%로 낮추고 수동 데이터셋에서는 5.59%로 낮춘다는 것이다. 이는 RNN 기반 기준 모델과 일반적인 Transformer보다 뛰어난 성능을 보였다.
Text normalization, or the process of transforming text into a consistent, canonical form, is crucial for speech applications such as text-to-speech synthesis (TTS). In TTS, the system must decide whether to verbalize "1995" as "nineteen ninety five" in "born in 1995" or as "one thousand nine hundred ninety five" in "page 1995". We present an experimental comparison of various Transformer-based sequence-to-sequence (seq2seq) models of text normalization for speech and evaluate them on a variety of datasets of written text aligned to its normalized spoken form. These models include variants of the 2-stage RNN-based tagging/seq2seq architecture introduced by Zhang et al. (2019), where we replace the RNN with a Transformer in one or more stages, as well as vanilla Transformers that output string representations of edit sequences. Of our approaches, using Transformers for sentence context encoding within the 2-stage model proved most effective, with the fine-tuned BERT encoder yielding the best performance.
연구 동기 및 목표
- 음성 응용 분야, 특히 텍스트 음성 합성(TTS)에서의 텍스트 정규화에 대해 Transformer 기반 아키텍처의 효과성을 평가하는 것.
- 사전 훈련된 모델(예: BERT)이 초기 훈련 또는 표준 Transformer를 사용할 때보다 성능을 향상시키는지 조사하는 것.
- 실세계 텍스트 정규화 데이터셋에서 단일 단계 seq2seq, 편집 기반 표현 방식, 이중 단계 모델 등의 다양한 아키텍처 설계를 비교하는 것.
- 의미론적 클래스 토큰화 오류가 전체 시스템 성능에 미치는 영향을 분석하고 이를 완화할 수 있는 방법을 탐색하는 것.
- 훈련 데이터가 제한적이거나 기준 오류를 포함하고 있을 경우 신경망 모델이 복구 불가능한 오류를 다루는 데에 한계를 보이는지 평가하는 것.
제안 방법
- 첫 번째 단계에서 의미론적 클래스(예: 숫자, 날짜 등)를 분류하고 두 번째 단계에서 Transformer 기반 seq2seq 모델을 사용해 정규화를 수행하는 이중 단계 아키텍처를 채택한다.
- 원래의 이중 단계 모델에서 RNN을 제거하고 문장의 문맥을 인코딩하는 데 Transformer 인코더를 사용하며, 미세조정된 BERT 및 동결된 BERT 버전을 평가한다.
- 전체 문자열 출력과 편집 기반 표현 방식을 모두 실험하며, pos* 토큰을 사용해 소스 범위의 대체를 나타내어 그대로 복사할 필요를 줄인다.
- 표준 교차 엔트로피 손실과 베이즈 서치 추론을 사용해 모델을 훈련하며, 자동 생성된(표준) 및 수동으로 주석 처리된(수동) 두 데이터셋의 데이터를 사용한다.
- 정확한 토큰화(수동으로 확인된 의미론적 클래스 경계)를 사용해 분류 오류의 영향을 고립하고 측정한다.
- 문장 오류율(SER)을 주요 평가 지표로 사용해 다양한 모델 간 성능을 비교하며, BERT의 미세조정 대비 동결 및 입력 표현 방식 유형에 대한 분석 실험을 수행한다.
실험 결과
연구 질문
- RQ1TTS 응용 분야에서 Transformer 기반 seq2seq 모델은 RNN 기반 모델보다 어떻게 다른가?
- RQ2이중 단계 정규화 파이프라인에 사전 훈련된 BERT 인코더를 통합하면, 초기 훈련 또는 일반적인 Transformer를 사용할 때보다 성능이 향상되는가?
- RQ3편집 기반 표현 방식과 전체 문자열 출력 표현 방식의 영향은 모델의 강건성과 오류율에 어떤 영향을 미치는가?
- RQ4의미론적 클래스 토큰화 오류가 전체 시스템 오류에 얼마나 기여하는가? 그리고 정확한 토큰화가 이러한 오류를 크게 줄일 수 있는가?
- RQ5미세조정된 BERT와 같은 고급 모델을 사용하더라도, '7/8 인치'를 '다섯 여덟 분의 일'로 잘못 분류하는 것처럼 복구 불가능한 오류가 여전히 흔한가?
주요 결과
- 이중 단계 모델 내에서 BERT 인코더를 미세조정한 결과, 표준 데이터셋에서 문장 오류율(SER)이 1.42%로 가장 낮아졌고, 수동 데이터셋에서는 5.59%를 기록하여 테스트된 모든 다른 모델보다 뛰어난 성능을 보였다.
- 정확한 의미론적 클래스 토큰화를 사용할 경우, BERT 인코더를 포함한 이중 단계 모델은 오류율을 61% 감소시켰으며, 이는 분류 오류가 실패의 주요 원인임을 시사한다.
- 일반적인 단일 단계 Transformer 모델은 훈련 데이터가 제한적일 경우 희귀 위치 토큰(pos*)에 노출되지 않아 성능이 열악했다.
- 토큰화된 입력과 편집 기반 표현 방식을 사용한 모델은 표준 데이터셋에서 SER가 2.04%로, 수동 데이터셋에서는 5.65%로 나타나 중간 수준의 성능를 보였지만, 이중 단계 BERT 접근 방식에 비해 강건성이 떨어졌다.
- 최고의 모델을 사용하더라도 복구 불가능한 오류가 여전히 존재했으며, 예를 들어 '7/8 인치'를 '다섯 여덟 분의 일'로 잘못 분류하는 등의 사례는 정규화의 지속적인 과제임을 보여주었다.
- 연구는 자동 생성된 데이터셋에서의 기준 오류(예: 'TIME' → 't i m e')와 수동 주석에서의 평가자 일관성 부족이 신뢰할 수 있는 평가 및 모델 향상에 있어 여전히 중요한 장벽임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.