[논문 리뷰] Prabhupadavani: A Code-mixed Speech Translation Data for 25 Languages
Prabhupadavani는 25개 언어에서 94시간의 오디오를 포함한 다국어, 코드 혼합 음성 번역 데이터셋으로, 수동으로 정렬되고 번역되었으며, 주로 영어, 베냐르, 상스키트어와의 코드 스위칭을 포함한다. 이는 대규모, 다분야, 다국어 코드 혼합 ST 데이터셋으로서, 강건한 ST 시스템, 다국어 훈련, 다양한 언어 유형에 걸친 엔드 투 엔드 모델 일반화 연구를 가능하게 한다.
Nowadays, the interest in code-mixing has become ubiquitous in Natural Language Processing (NLP); however, not much attention has been given to address this phenomenon for Speech Translation (ST) task. This can be solely attributed to the lack of code-mixed ST task labelled data. Thus, we introduce Prabhupadavani, which is a multilingual code-mixed ST dataset for 25 languages. It is multi-domain, covers ten language families, containing 94 hours of speech by 130+ speakers, manually aligned with corresponding text in the target language. The Prabhupadavani is about Vedic culture and heritage from Indic literature, where code-switching in the case of quotation from literature is important in the context of humanities teaching. To the best of our knowledge, Prabhupadvani is the first multi-lingual code-mixed ST dataset available in the ST literature. This data also can be used for a code-mixed machine translation task. All the dataset can be accessed at https://github.com/frozentoad9/CMST.
연구 동기 및 목표
- NLP 및 ST 연구 분야에서 대규모, 다국어, 코드 혼합 음성 번역 데이터셋의 부족을 보완하기 위해.
- 특히 다국어 및 다분야 환경에서 코드 혼합 현상에 대한 강건한 모델링을 가능하게 하기 위해.
- 다양한 어족과 언어적 구조를 포함한 다양한 언어 가족 간에 일반화되는 엔드 투 엔드 및 캐스케이드 ST 시스템 개발을 지원하기 위해.
- 코드 혼합 음성 번역 및 코드 혼합 기계 번역 작업을 위한 고품질 수동 정렬 데이터셋을 제공하기 위해.
- 25개의 언어형태학적으로 다양하게 구성된 언어들을 대상으로 한 다국어 전이 학습 및 통합 모델링 연구를 촉진하기 위해.
제안 방법
- 데이터셋은 비크티브 문화 및 인도 문학에 관한 강의, 토론, 인터뷰, 대화의 오디오 녹음본에서 수집되었으며, Bhaktivedanta Book Trust와 Vanipedia에서 자료를 확보하였다.
- 오디오는 수동으로 타이핑되어 25개의 목표 언어로 번역되었으며, 음성과 텍스트 간의 정밀한 정렬을 통해 고품질의 병렬 데이터를 확보하였다.
- 코드 혼합는 자연스럽게 통합되었으며, 주로 상스키트어 문헌의 인용문과 힌두어 또는 베냐르어로 된 설명을 통해 이루어져, 인문학 교육 분야에서의 실제 언어 사용 행동을 반영한다.
- 데이터셋은 인도-유럽어족, 우랄리안어족, 아스트로네시안어족, 드라비아티아어족 등 10개의 어족을 포함하며, SVO, SOV, 유연한 어순 등 다양한 문법적 및 형태적 특징을 지닌다.
- 모든 25개 언어에서 표준화된 훈련, 검증, 테스트를 지원하기 위해 계층적 데이터 분할을 구축하여 데이터 泄露를 최소화하고 재현 가능성을 향상시켰다.
- 데이터셋은 GitHub에 공개되어 오디오, 텍스트, 번역 전부에 접근 가능하며, ST 및 NLP 연구 분야에서 널리 활용할 수 있도록 하였다.
실험 결과
연구 질문
- RQ1다양한 어족에 걸쳐 코드 혼합 음성 번역에서 다국어 훈련이 성능 향상에 기여할 수 있는가?
- RQ2기존의 엔드 투 엔드 및 캐스케이드 ST 시스템은 코드 혼합 음성에서 어떻게 작동하는가? 이 데이터셋을 통해 성능 격차를 줄일 수 있는가?
- RQ3이 데이터셋의 병렬 구조를 활용해 25개 언어 모두를 위한 단일 통합 모델을 훈련시킬 수 있는가?
- RQ4어순, 성 표시, 형태적 복잡성 등의 언어적 변형이 코드 혼합 ST에서 모델의 일반화에 어떤 영향을 미치는가?
- RQ5이 데이터셋은 코드 스위칭을 어순적으로 통합된 현상으로 간주할 수 있는 강건한 시스템 개발을 지원할 수 있는가?
주요 결과
- Prabhupadavani는 문헌상으로는 처음으로 25개 언어와 94시간의 수동 정렬된 오디오를 포함한 다국어, 코드 혼합 음성 번역 데이터셋이다.
- 이 데이터셋은 10개의 어족을 포함하며, 융합어, 축합어, 고립어를 포함하여 코드 혼합 영향의 언어 간 분석이 가능하다.
- 총 2,400시간의 음성 데이터를 포함하고 있으며, 현재 공개된 데이터셋은 고품질의 병렬 코드 혼합 ST 데이터 94시간을 제공한다.
- 주로 문학적 인용문과 설명을 통해 코드 스위칭를 통합함으로써 교육 및 문화적 맥락에서의 진정성 있는 언어 사용 행동을 반영한다.
- 이 데이터셋은 음성 번역과 코드 혼합 기계 번역 작업 모두를 지원하며, 25개 언어 전부에 대해 병렬 번역이 제공된다.
- 저자들은 데이터셋을 108개 이상의 언어로 확장할 계획을 세우고 있어, 이 데이터셋의 확장성과 장기적인 연구적 유용성을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.