[논문 리뷰] DiDiSpeech: A Large Scale Mandarin Speech Corpus
DiDiSpeech는 약 800시간의 고품질 48kHz 오디오를 포함한 대규모 공개 중국어 음성 코퍼스로, 6,000명의 모국어 사용자로부터 수집되었으며 다양한 음성 처리 작업을 위한 것으로 설계되었습니다. 이는 자동 음성 인식(정확도: CER 2.50%), 음성 변환, 다중화자 텍스트-음성 합성, 그리고 화자 분류(정확도 98.20%) 및 연령 추정(MAE: 3.76)과 같은 부언적 정보 처리 작업에서 최고 수준의 성능을 달성하여 연구 및 산업 응용 분야에서의 유용성을 입증합니다.
This paper introduces a new open-sourced Mandarin speech corpus, called DiDiSpeech. It consists of about 800 hours of speech data at 48kHz sampling rate from 6000 speakers and the corresponding texts. All speech data in the corpus is recorded in quiet environment and is suitable for various speech processing tasks, such as voice conversion, multi-speaker text-to-speech and automatic speech recognition. We conduct experiments with multiple speech tasks and evaluate the performance, showing that it is promising to use the corpus for both academic research and practical application. The corpus is available at https://outreach.didichuxing.com/research/opendata/.
연구 동기 및 목표
- 다양한 음성 처리 작업에 적합한 대규모, 고품질, 다목적 중국어 음성 코퍼스의 부족을 해결하기 위해.
- 스케일링 가능한 오픈 액세스 데이터셋을 제공함으로써 학계 연구와 산업 응용 간 격차를 해소하기 위해.
- 음성 변환, 다중화자 텍스트-음성 합성, 자동 음성 인식, 부언적 정보 추출(예: 화자, 성별, 연령 분류)과 같은 고급 연구를 지원하기 위해.
- 조용한 환경에서의 통제된 기록 조건과 연령, 성별, 지역적 배경이 균형 잡힌 인구 통계적 분포를 통해 데이터 품질을 확보하기 위해.
- 모델 훈련 및 평가에 대한 유연성을 제공하기 위해 평행 및 비평행 음성 발화를 모두 포함한 코퍼스를 제공하기 위해.
제안 방법
- 코퍼스는 두 개의 하위집합으로 나뉘어지며, DiDiSpeech-1(572시간, 4,500명의 화자)은 음성 변환 및 다중화자 TTS를 위한 것이고, DiDiSpeech-2(227시간, 1,500명의 화자)는 ASR 및 부언적 정보 처리 작업을 위한 것입니다.
- 모든 오디오가 조용한 환경에서 48kHz 샘플링 속도로 기록되었으며, 모든 발화에 대해 해당 전사본이 제공되었습니다.
- ASR 작업에서는 Transformer-ASR 모델을 사용하고, 빔 서치, 언어 모델링, CTC-결합 디코딩을 적용하여 DiDiSpeech-2에서 CER 2.50%의 성능을 달성했습니다.
- 화자 및 성별 분류 작업에서는 40 또는 80차원 필터뱅크 특징을 사용하는 얇은 ResNet-34 아키텍처를 사용하였고, 평균 풀링과 소프트맥스 레이어를 통해 6,000개 클래스의 분류를 수행했습니다.
- 연령 추정 작업에서는 동일한 모델 아키텍처를 사용하였으며, 평가 지표로 평균 절대 오차(MAE)와 피어슨 상관계수를 사용하였고, 수렴을 보장하기 위해 초기 학습률을 낮게 설정하여 훈련을 수행했습니다.
- 데이터는 각 화자당 네 개의 발화를 무작위로 선택하여 훈련, 개발, 테스트 세트로 분할하였으며, 데이터 증강 또는 음성 활성도 탐지 기법을 적용하지 않았습니다.

실험 결과
연구 질문
- RQ1DiDiSpeech는 중국어 자동 음성 인식에서 높은 성능을 달성할 수 있으며, 기존 벤치마크와 비교해 어떤가요?
- RQ2DiDiSpeech는 자원이 제한된 환경에서 효과적인 음성 변환 및 다중화자 텍스트-음성 합성 생성에 얼마나 기여할 수 있나요?
- RQ3DiDiSpeech는 화자 식별, 성별 분류, 연령 추정과 같은 부언적 정보 처리 작업에서 얼마나 잘 작동합니까?
- RQ4DiDiSpeech의 인구 통계적 다양성과 높은 데이터 품질이 연령, 성별, 지역 방언에 걸쳐 모델 일반화 능력을 향상시키나요?
- RQ5DiDiSpeech는 중국어 음성 기술 발전을 위해 기업 전용 데이터셋의 실질적인 대안이 될 수 있나요?
주요 결과
- DiDiSpeech-2 하위집합은 CTC-결합 디코딩을 사용한 Transformer-ASR 모델을 통해 테스트 세트에서 단어 수준 CER 2.50%를 달성하여 뛰어난 ASR 성능을 입증했습니다.
- DiDiSpeech에서의 화자 분류는 테스트 세트에서 상위 1위 정확도 98.20%와 상위 5위 정확도 99.76%를 기록하여 높은 모델 신뢰도를 보였습니다.
- 성별 분류는 개발 및 테스트 세트에서 모두 97.39%의 정확도를 기록하여 성인 남성, 성인 여성, 어린이 모두에서 뛰어난 성능을 보였습니다.
- 연령 추정 작업에서는 테스트 세트에서 MAE 3.76와 피어슨 상관계수 0.79를 기록하여 화자의 연령을 합리적으로 예측할 수 있음을 시사했습니다.
- 이 코퍼스는 음성 변환, 다중화자 TTS, 화자 다이아라이제이션 등 다양한 음성 처리 작업을 지원하며, 평가된 모든 작업에서 일관된 성능을 보였습니다.
- DiDiSpeech-1에 포함된 평행 및 비평행 발화를 통해 음성 변환 및 제로샷 전이 학습 시나리오에 대한 모델 훈련에 매우 민첩하게 대응할 수 있습니다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.