[논문 리뷰] SPGISpeech: 5,000 hours of transcribed financial audio for fully formatted end-to-end speech recognition
이 논문은 5,000시간 분량의 영어 음성-텍스트 코퍼스인 SPGISpeech를 소개한다. 이 코퍼스는 완전히 형식화되고 전문적으로 번역된 수익 보고 회의 음성 자료로 구성되어 있으며, 자동으로 대문자,标 punctuations, 및 적절한 문장 구조를 포함한 전체 철자 체계를 예측하는 엔드 투 엔드 신경망 음성 인식을 가능하게 한다. 이 코퍼스를 기반으로 훈련된 Conformer 기반 모델은 문자 오류율(CER)이 1.7로 나타나, 엔드 투 엔드 철자 기반 음성 인식이 실현 가능하고 효과적임을 입증한다.
In the English speech-to-text (STT) machine learning task, acoustic models are conventionally trained on uncased Latin characters, and any necessary orthography (such as capitalization, punctuation, and denormalization of non-standard words) is imputed by separate post-processing models. This adds complexity and limits performance, as many formatting tasks benefit from semantic information present in the acoustic signal but absent in transcription. Here we propose a new STT task: end-to-end neural transcription with fully formatted text for target labels. We present baseline Conformer-based models trained on a corpus of 5,000 hours of professionally transcribed earnings calls, achieving a CER of 1.7. As a contribution to the STT research community, we release the corpus free for non-commercial use at https://datasets.kensho.com/datasets/scribe.
연구 동기 및 목표
- 완전히 형식화된 철자 텍스트(구두점, 대문자, 적절한 문장 구조 포함)를 포함한 공개된 음성 인식 데이터셋의 부족을 보완하기 위해.
- 엔드 투 엔드 음성-텍스트 모델이 원시 음성에서 직접 완전한 영어 철자 체계를 예측할 수 있음을 입증하여 정확도를 향상시키고 파ip라인을 단순화하기 위해.
- 연구 공동체를 위해 실생활 재무 수익 보고 회의 자료를 대상으로 한 대규모 고품질 코퍼스를 공개하기 위해.
- 음성 내의 청각적 신호가 구두점 및 대문자와 같은 형식적 특징을 정확하게 예측하는 데 기여할 수 있음을 보여주며, 이는 일반적인 STT 파이프라인에서 종종 손실되는 요소임.
- 목표 출력이 단순히 정규화된 번역이 아니라 완전히 형식화된 텍스트인 코퍼스를 기반으로 훈련된 모델을 통해 엔드 투 엔드 음성 인식의 새로운 벤치마크를 설정하기 위해.
제안 방법
- SPGISpeech 코퍼스는 실제 기업 수익 보고 회의의 전화 회의 녹음 자료 5,000시간 분량으로 구성되며, 완전한 철자 형식으로 수작업으로 변환됨.
- 다양한 어원(50,000명)과 다양한 L1 및 L2 발음 스타일을 포함하며, 비즈니스 및 금융 분야의 즉흥적이고 서술적인 언어 사용을 다룸.
- 기준 모델은 ESPnet 및 NeMo 프레임워크를 사용하여 훈련되며, 12개의 인코더 블록과 6개의 디코더 블록을 가진 Conformer 아키텍처를 사용함. 각 블록은 8개의 어텐션 헤드와 2,048개의 피드포워드 유닛을 가짐.
- 모델은 CTC 및 교차 엔트로피 손실을 사용하여 훈련되며, 데이터 증강을 위해 SpecAugment를 사용하여 2개의 주파수 마스크와 5개의 시간 마스크를 적용함.
- ~5,000개의 토큰 어휘를 사용하며, 이는 코퍼스 내 모든 문자, 숫자, 구두점, 특수 기호를 포함함.
- 모델 추론은 급격한 디코딩을 사용하며, 최종 모델은 10개의 최상의 체크포인트를 앙상블하여 강건성을 향상시킴.

실험 결과
연구 질문
- RQ1엔드 투 엔드 음성 인식 모델이 원시 음성에서 직접 구두점, 대문자, 적절한 문장 구조를 포함한 완전한 영어 철자 체계를 예측할 수 있는가?
- RQ2음성 내의 청각적 신호가 일반적인 STT 파이프라인에서 후처리로 추론되는 형식적 특징을 얼마나 정확하게 예측할 수 있는가?
- RQ3형식화된 철자 기반 STT 성능은 일반적인 정규화된 번역 작업과 비교해 문자 오류율 및 단어 오류율 측면에서 어떻게 다를까?
- RQ4오류의 형식 관련 요소가 총 오류에 얼마나 기여하는가? 이 중 불가피한 레이블 모호성으로 인한 비율은 어느 정도인가?
- RQ5실생활 재무 음성 자료를 대상으로 한 대규모 전문 번역 코퍼스가 고정밀도 완전 형식화 엔드 투 엔드 STT 시스템 훈련에 적합한가?
주요 결과
- SPGISpeech를 기반으로 훈련된 Conformer 모델은 완전히 형식화된 철자 텍스트를 예측할 때 테스트 세트에서 문자 오류율(CER)이 1.7%를 기록함.
- 동일한 모델의 단어 오류율(WER)은 5.7%로 나타나, 형식 예측의 복잡성에도 불구하고 뛰어난 성능을 보임.
- 소문자로 정규화하고 기본 문자로만 줄였을 때 CER는 1.0%로 감소함으로써, 오류의 절반 이상이 형식 문제로 인한 것임을 시사함.
- Conformer-CTC 변형 모델은 철자 작업에서 CER 1.8%를 기록하여, 비자기적 모델도 엔드 투 엔드 형식 예측에서 높은 정확도를 달성할 수 있음을 확인함.
- 이 연구는 음성 모델이 프로소디적 신호를 활용해 구두점 및 대문자와 같은 철자적 특징을 예측할 수 있음을 입증하며, 후처리 파이프라인 의존도를 감소시킴.
- SPGISpeech의 공개는 완전히 형식화된 번역이 포함된 가장 큰 알려진 공개 코퍼스를 제공하며, 향후 엔드 투 엔드 철자 기반 STT 연구를 가능하게 함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.