Skip to main content
QUICK REVIEW

[논문 리뷰] A Unified Transformer-based Framework for Duplex Text Normalization

Tuan Lai, Yang Zhang|arXiv (Cornell University)|2021. 08. 23.
Speech Recognition and Synthesis참고 문헌 24인용 수 7
한 줄 요약

이 논문은 작업 전용 접두사가 포함된 단일 듀얼모델을 사용하여 텍스트 정규화(TN)와 역정규화(ITN)를 동시에 수행하는 통합된 트랜스포머 기반 프레임워크를 제안한다. 시퀀스 태깅 헤드와 시퀀스-투-시퀀스 정규화기와 데이터 증강을 조합함으로써, 영어 및 러시아어 공개 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성하고, 피니팅 없이도 내부 영어 대화 데이터셋에서 문장 수준 정확도가 95% 이상을 기록한다.

ABSTRACT

Text normalization (TN) and inverse text normalization (ITN) are essential preprocessing and postprocessing steps for text-to-speech synthesis and automatic speech recognition, respectively. Many methods have been proposed for either TN or ITN, ranging from weighted finite-state transducers to neural networks. Despite their impressive performance, these methods aim to tackle only one of the two tasks but not both. As a result, in a complete spoken dialog system, two separate models for TN and ITN need to be built. This heterogeneity increases the technical complexity of the system, which in turn increases the cost of maintenance in a production setting. Motivated by this observation, we propose a unified framework for building a single neural duplex system that can simultaneously handle TN and ITN. Combined with a simple but effective data augmentation method, our systems achieve state-of-the-art results on the Google TN dataset for English and Russian. They can also reach over 95% sentence-level accuracy on an internal English TN dataset without any additional fine-tuning. In addition, we also create a cleaned dataset from the Spoken Wikipedia Corpora for German and report the performance of our systems on the dataset. Overall, experimental results demonstrate the proposed duplex text normalization framework is highly effective and applicable to a range of domains and languages

연구 동기 및 목표

  • 생산 환경에서 텍스트 정규화(TN)와 역정규화(ITN)를 위한 별도의 모델을 구동하는 데 발생하는 기술적 및 유지보수 부담을 해결하기 위해.
  • TN과 ITN을 하나의 신경망 프레임워크로 통합하여 시스템의 이질성과 복잡성을 줄이기 위해.
  • 데이터 증강과 공유 표현 학습을 통해 다양한 도메인과 언어 간 일반화 능력과 성능을 향상시키기 위해.
  • Spoken Wikipedia에서 새로 제작한 독일어 데이터셋을 포함해 공개 데이터셋(영어, 러시아어)과 내부 대화 데이터셋에서 프레임워크의 효과성을 입증하기 위해.
  • 더 넓은 보급을 위해 NeMo, NVIDIA의 오픈소스 대화형 AI 툴킷에 프레임워크를 통합하기 위해.

제안 방법

  • 트랜스포머 기반 태거가 BIO 스타일 레이블링과 작업 지시자와 함께 입력 텍스트에서 의미적 스펙트럼(예: 숫자, 날짜, URL)을 식별하는 이중 인코더 아키텍처.
  • 입력 시퀀스에 작업 지시자('TN' 또는 'ITN')를 접두사로 추가하여 동일한 모델이 TN과 ITN를 모두 수행할 수 있도록 한다.
  • T5 또는 mT5 기반의 시퀀스-투-시퀀스 정규화기가 식별된 스펙트럼만 처리하여 정규화된 형태로 변환한다(예: '72' → 'seventy two').
  • 희귀 또는 도메인 외 예시에 대해 강건성과 일반화 능력을 향상시키기 위해 단순하지만 효과적인 데이터 증강 전략을 적용한다.
  • 다양한 언어에서 효율성과 확장성을 확보하기 위해 사전 학습된 모델의 정제된(디스틸리드) 버전(예: 디스틸리드 RoBERTa, mT5)을 사용한다.
  • TN과 ITN 인스턴스를 동시에 엔드 투 엔드로 훈련하여 공동 최적화와 공유 표현 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1단일 신경망 모델이 텍스트 정규화와 역정규화 작업을 효과적으로 동시에 수행할 수 있는가?
  • RQ2작업 전용 접두사의 사용이 다양한 언어 간 모델 성능과 일반화 능력에 어떤 영향을 미치는가?
  • RQ3데이터 증강이 새로운 도메인에서의 제로샷 또는 피처샷 성능 향상에 어느 정도 기여하는가?
  • RQ4통합 프레임워크가 정규화 전용 모델(TN-만)이나 역정규화 전용 모델(ITN-만)보다 정확도와 유지보수성 측면에서 뛰어나게 성능을 낼 수 있는가?
  • RQ5대화형 문장과 같은 저자원 또는 도메인 이동 데이터에 대해 프레임워크의 일반화 능력은 어느 정도인가?

주요 결과

  • 통합 듀얼모델은 구글 TN 데이터셋에서 최신 기술 수준 성능을 달성했으며, 영어의 문장 수준 정확도는 98.25%, 러시아어는 93.02%를 기록했다.
  • 내부 영어 대화 데이터셋(NLU 어시스턴트)에서 피니팅 없이도 문장 수준 정확도가 95% 이상을 달성하여 강력한 제로샷 일반화 능력을 입증했다.
  • 데이터 증강의 포함은 모든 언어에서 성능 향상을 일관되게 유도했으며, 영어 단일 모델(TN-만)에서는 성능이 약간 감소했다.
  • TN에서 7,551개의 테스트 인스턴스 중 오직 11개의 복구 불가능한 오류(0.146%)만 발생했으며, 대부분의 오류(7/11)는 URL과 숫자와 관련이 있었다.
  • 프레임워크는 NVIDIA의 오픈소스 대화형 AI 툴킷인 NeMo에 성공적으로 통합되어 실용적 구현 가능성과 검증을 통과했다.
  • 제안된 프레임워크는 정규화 전용 모델(TN-만)과 역정규화 전용 모델(ITN-만)을 능가하거나 동등하게 성능을 낼 뿐 아니라, 시스템 복잡성과 유지보수 비용을 줄였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.