Skip to main content
QUICK REVIEW

[논문 리뷰] SPGISpeech: 5,000 hours of transcribed financial audio for fully formatted end-to-end speech recognition

Patrick O’Neill, Vitaly Lavrukhin|arXiv (Cornell University)|2021. 04. 05.
Speech Recognition and Synthesis참고 문헌 29인용 수 9
한 줄 요약

이 논문은 5,000시간 분량의 영어 음성-텍스트 코퍼스인 SPGISpeech를 소개한다. 이 코퍼스는 완전히 형식화되고 전문적으로 번역된 수익 보고 회의 음성 자료로 구성되어 있으며, 자동으로 대문자,标 punctuations, 및 적절한 문장 구조를 포함한 전체 철자 체계를 예측하는 엔드 투 엔드 신경망 음성 인식을 가능하게 한다. 이 코퍼스를 기반으로 훈련된 Conformer 기반 모델은 문자 오류율(CER)이 1.7로 나타나, 엔드 투 엔드 철자 기반 음성 인식이 실현 가능하고 효과적임을 입증한다.

ABSTRACT

In the English speech-to-text (STT) machine learning task, acoustic models are conventionally trained on uncased Latin characters, and any necessary orthography (such as capitalization, punctuation, and denormalization of non-standard words) is imputed by separate post-processing models. This adds complexity and limits performance, as many formatting tasks benefit from semantic information present in the acoustic signal but absent in transcription. Here we propose a new STT task: end-to-end neural transcription with fully formatted text for target labels. We present baseline Conformer-based models trained on a corpus of 5,000 hours of professionally transcribed earnings calls, achieving a CER of 1.7. As a contribution to the STT research community, we release the corpus free for non-commercial use at https://datasets.kensho.com/datasets/scribe.

연구 동기 및 목표

  • 완전히 형식화된 철자 텍스트(구두점, 대문자, 적절한 문장 구조 포함)를 포함한 공개된 음성 인식 데이터셋의 부족을 보완하기 위해.
  • 엔드 투 엔드 음성-텍스트 모델이 원시 음성에서 직접 완전한 영어 철자 체계를 예측할 수 있음을 입증하여 정확도를 향상시키고 파ip라인을 단순화하기 위해.
  • 연구 공동체를 위해 실생활 재무 수익 보고 회의 자료를 대상으로 한 대규모 고품질 코퍼스를 공개하기 위해.
  • 음성 내의 청각적 신호가 구두점 및 대문자와 같은 형식적 특징을 정확하게 예측하는 데 기여할 수 있음을 보여주며, 이는 일반적인 STT 파이프라인에서 종종 손실되는 요소임.
  • 목표 출력이 단순히 정규화된 번역이 아니라 완전히 형식화된 텍스트인 코퍼스를 기반으로 훈련된 모델을 통해 엔드 투 엔드 음성 인식의 새로운 벤치마크를 설정하기 위해.

제안 방법

  • SPGISpeech 코퍼스는 실제 기업 수익 보고 회의의 전화 회의 녹음 자료 5,000시간 분량으로 구성되며, 완전한 철자 형식으로 수작업으로 변환됨.
  • 다양한 어원(50,000명)과 다양한 L1 및 L2 발음 스타일을 포함하며, 비즈니스 및 금융 분야의 즉흥적이고 서술적인 언어 사용을 다룸.
  • 기준 모델은 ESPnet 및 NeMo 프레임워크를 사용하여 훈련되며, 12개의 인코더 블록과 6개의 디코더 블록을 가진 Conformer 아키텍처를 사용함. 각 블록은 8개의 어텐션 헤드와 2,048개의 피드포워드 유닛을 가짐.
  • 모델은 CTC 및 교차 엔트로피 손실을 사용하여 훈련되며, 데이터 증강을 위해 SpecAugment를 사용하여 2개의 주파수 마스크와 5개의 시간 마스크를 적용함.
  • ~5,000개의 토큰 어휘를 사용하며, 이는 코퍼스 내 모든 문자, 숫자, 구두점, 특수 기호를 포함함.
  • 모델 추론은 급격한 디코딩을 사용하며, 최종 모델은 10개의 최상의 체크포인트를 앙상블하여 강건성을 향상시킴.
Figure 1: Distribution of Speakers by Global Region. Speaker distribution is estimated in a random sample according to reported region of corporate domicile.
Figure 1: Distribution of Speakers by Global Region. Speaker distribution is estimated in a random sample according to reported region of corporate domicile.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 음성 인식 모델이 원시 음성에서 직접 구두점, 대문자, 적절한 문장 구조를 포함한 완전한 영어 철자 체계를 예측할 수 있는가?
  • RQ2음성 내의 청각적 신호가 일반적인 STT 파이프라인에서 후처리로 추론되는 형식적 특징을 얼마나 정확하게 예측할 수 있는가?
  • RQ3형식화된 철자 기반 STT 성능은 일반적인 정규화된 번역 작업과 비교해 문자 오류율 및 단어 오류율 측면에서 어떻게 다를까?
  • RQ4오류의 형식 관련 요소가 총 오류에 얼마나 기여하는가? 이 중 불가피한 레이블 모호성으로 인한 비율은 어느 정도인가?
  • RQ5실생활 재무 음성 자료를 대상으로 한 대규모 전문 번역 코퍼스가 고정밀도 완전 형식화 엔드 투 엔드 STT 시스템 훈련에 적합한가?

주요 결과

  • SPGISpeech를 기반으로 훈련된 Conformer 모델은 완전히 형식화된 철자 텍스트를 예측할 때 테스트 세트에서 문자 오류율(CER)이 1.7%를 기록함.
  • 동일한 모델의 단어 오류율(WER)은 5.7%로 나타나, 형식 예측의 복잡성에도 불구하고 뛰어난 성능을 보임.
  • 소문자로 정규화하고 기본 문자로만 줄였을 때 CER는 1.0%로 감소함으로써, 오류의 절반 이상이 형식 문제로 인한 것임을 시사함.
  • Conformer-CTC 변형 모델은 철자 작업에서 CER 1.8%를 기록하여, 비자기적 모델도 엔드 투 엔드 형식 예측에서 높은 정확도를 달성할 수 있음을 확인함.
  • 이 연구는 음성 모델이 프로소디적 신호를 활용해 구두점 및 대문자와 같은 철자적 특징을 예측할 수 있음을 입증하며, 후처리 파이프라인 의존도를 감소시킴.
  • SPGISpeech의 공개는 완전히 형식화된 번역이 포함된 가장 큰 알려진 공개 코퍼스를 제공하며, 향후 엔드 투 엔드 철자 기반 STT 연구를 가능하게 함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.