Skip to main content
QUICK REVIEW

[논문 리뷰] ASCEND: A Spontaneous Chinese-English Dataset for Code-switching in Multi-turn Conversation

Holy Lovenia, Samuel Cahyawijaya|arXiv (Cornell University)|2021. 12. 12.
Speech and dialogue systems인용 수 12
한 줄 요약

이 논문은 홍콩에서의 다중 전환 대화에서 수집한 10.62시간 분량의 자연스러운 중국어-영어 혼용 음성 코퍼스인 ASCEND를 소개한다. 이 코퍼스는 다양한 방언과 능력 수준을 가진 23명의 双어화자 포함되어 있으며, 사전 학습된 wav2vec 2.0 모델을 ASCEND에 맞추어 미세조정한 결과, 최고 성능으로 22.69%의 문자 오류율과 27.05%의 혼합 오류율을 기록하였다. 중국어 사전 학습 모델이 영어 및 다국어 모델보다 뛰어난 성능을 보인 이유는 더 나은 어휘 일치와 언어 분포 매칭 덕분이었다.

ABSTRACT

Code-switching is a speech phenomenon occurring when a speaker switches language during a conversation. Despite the spontaneous nature of code-switching in conversational spoken language, most existing works collect code-switching data from read speech instead of spontaneous speech. ASCEND (A Spontaneous Chinese-English Dataset) is a high-quality Mandarin Chinese-English code-switching corpus built on spontaneous multi-turn conversational dialogue sources collected in Hong Kong. We report ASCEND's design and procedure for collecting the speech data, including annotations. ASCEND consists of 10.62 hours of clean speech, collected from 23 bilingual speakers of Chinese and English. Furthermore, we conduct baseline experiments using pre-trained wav2vec 2.0 models, achieving a best performance of 22.69\% character error rate and 27.05% mixed error rate.

연구 동기 및 목표

  • 저자원 환경에서의 고품질 자연스러운 혼용 음성 데이터 부족 문제를 해결하기 위해, 특히 중국어-영어 이중어화자 음성에 초점을 맞춘다.
  • 홍콩에서의 실제 혼용 패턴을 반영하는 자연스러운 다중 전환 대화의 다양하고 균형 잡히며 대표적인 코퍼스를 구축한다.
  • 사전 학습된 모델을 사용하여 혼용 음성에 대한 자동 음성 인식(ASR)의 강력한 기준 성능을 수립한다.
  • 사전 학습 언어 선택(중국어, 영어, 다국어)이 혼용 음성 ASR 성능에 미치는 영향을 평가한다.

제안 방법

  • 데이터 수집은 홍콩, 대만, 중국 본토 출신의 23명의 이중어화자와 함께 26회의 자연스러운 대화 세션을 진행하여 이루어졌으며, 다양한 주제와 능력 수준을 포함하였다.
  • 코퍼스는 8:1:1의 훈련, 검증, 테스트 세트로 나누어졌으며, 성별 분포가 균형을 이루었고, 문장 간 및 문장 내 혼용 패턴이 주석 처리되었다.
  • 사전 학습된 wav2vec 2.0 모델(중국어, 영어, 다국어)은 단일 GPU에서 CTC 손실을 사용하여 Adam 최적화 기법으로 미세조정되었다.
  • 훈련 중 음성 데이터는 시간 및 주파수 마스킹 처리되었으며, 시간 왜곡은 적용되지 않았다.
  • 모델 평가에는 문자 오류율(CER)과 혼합 오류율(MER)을 사용하였으며, MER는 중국어 성분에 대해 CER, 영어 성분에 대해 WER로 계산되었다.

실험 결과

연구 질문

  • RQ1사전 학습된 wav2vec 2.0 모델이 자연스러운 중국어-영어 혼용 음성 코퍼스에 대해 미세조정되었을 때 성능는 어떻게 변하는가?
  • RQ2사전 학습 언어(중국어 대비 영어 대비 다국어)가 혼용 음성 ASR 성능에 어떤 영향을 미치는가?
  • RQ3사전 학습 모델과 코퍼스 간의 언어 분포 및 어휘 겹침은 ASR 정확도에 어떤 영향을 미치는가?
  • RQ4자연스러운 음성 데이터를 사용할 경우, 독서 기반 기준 대비 혼용 음성 ASR 성능 향상은 어느 정도 이루어지는가?

주요 결과

  • 중국어 사전 학습 모델이 테스트 세트에서 가장 뛰어난 성능을 보였으며, CER 22.69%, MER 27.05%를 기록하였다. 영어 및 다국어 모델보다 뛰어난 성능을 보였다.
  • 중국어 사전 학습 모델은 영어 모델보다 빠르게 수렴했으며, 다국어 모델보다 초기 수렴 속도는 느렸지만 최종 성능은 더 뛰어났다.
  • 다국어 사전 학습 모델은 더 일찍 성능 정점에 도달했고, 중국어 사전 학습 모델보다 열 劣한 결과를 보였다( MER 29.35%, CER 24.31%).
  • 중국어 사전 학습 모델의 뛰어난 성능은 ASCEND와의 높은 어휘 겹침과 약 50%의 코퍼스가 중국어로 구성되어 있어 사전 학습 분포와 더 잘 일치하기 때문이라고 분석된다.
  • ASCEND는 기존의 중국어-영어 혼용 데이터셋인 CECOS 및 SEAME와 유사한 크기와 언어 다양성을 보이며, 저자원 ASR 연구에 유용함을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.