[논문 리뷰] LibriVoxDeEn - A Corpus for German-to-English Speech Translation and Speech Recognition
LibriVoxDeEn은 100시간 이상의 오디오, 독일어 텍스트 및 독일어 청취자료에서 유래한 영어 번역을 포함하는 대규모 고품질 독일어-영어 음성 번역 코퍼스입니다. 이는 종단 간 음성 번역 및 인식을 가능하게 하며, 매우 정확한 문장 수준의 정렬과 낮은 불순물 수준을 제공하여 지금까지 가장 큰 독일어-영어 작업을 위한 자원입니다.
This dataset is a corpus of sentence-aligned triples of German audio, German text, and English translation, based on German audio books. The corpus consists of over 100 hours of audio material and over 50k parallel sentences. The speech data are low in disfluencies because of the audio book setup. The quality of audio and sentence alignments has been checked by a manual evaluation, showing that that speech alignment is in general very high. The sentence alignment quality is comparable to well-used parallel translation data and can be adjusted by cutoffs on the automatic alignment score. To our knowledge, this corpus is to date the largest resource for end-to-end speech translation for German.
연구 동기 및 목표
- 독일어-영어 음성 번역 및 인식을 위한 대규모 고품질 병렬 코퍼스를 구축하기 위해.
- 특히 종단 간 학습 프레임워크에서 사용 가능한 대규모이자 낮은 불순물 수준의 음성 번역 데이터셋 부족 문제를 해결하기 위해.
- 수동 평가 및 자동 점수 기준을 통해 높은 문장 정렬 정확도를 확보하기 위해.
- 종단 간 음성 번역 모델의 훈련 및 평가에 적합한 자원을 제공하기 위해.
- 청취자료에서 유래한 깔끔하고 정렬된 데이터셋을 제공함으로써 多국어 음성 처리 연구를 지원하기 위해.
제안 방법
- 코퍼스는 LibriVox에서 확보한 공공 영역의 독일어 청취자료에서 구성됩니다.
- 오디오, 독일어 텍스트 및 영어 번역이 자동 정렬 도구를 사용해 문장 수준에서 정렬된 후 수동 검증을 거칩니다.
- 고품질 오디오 및 정렬을 갖춘 50,000개 이상의 병렬 문장 트리플이 포함되어 있습니다.
- 청취자료 녹음의 공식적인 독서 스타일로 인해 불순물 수준이 낮아 훈련 가능성을 높입니다.
- 정렬 품질은 수동 평가를 통해 평가되었으며, 기존의 잘 알려진 병렬 텍스트 데이터셋과 유사한 높은 정확도를 확인했습니다.
- 저품질 정렬을 걸러내기 위해 자동 정렬 점수에 대한 컷오프 기준을 적용하여 전체 신뢰도를 향상시켰습니다.
실험 결과
연구 질문
- RQ1어떻게 청취자료에서 대규모 고품질 독일어-영어 음성 번역 코퍼스를 구축할 수 있을까요?
- RQ2청취자료의 높은 음질과 낮은 불순물 수준이 정렬 정확도 및 모델 성능에 어느 정도 기여할까요?
- RQ3이 코퍼스의 문장 정렬 품질은 기존의 잘 알려진 병렬 텍스트 데이터셋과 비교해 어떻게 될까요?
- RQ4이 코퍼스는 종단 간 음성 번역 및 인식 모델의 실질적인 기준점으로 활용될 수 있을까요?
- RQ5자동 정렬 점수 컷오프 기준이 최종 데이터셋의 신뢰성에 어떤 영향을 미칠까요?
주요 결과
- 코퍼스는 100시간 이상의 독일어 오디오, 독일어 텍스트 및 영어 번역을 포함하며, 50,000개 이상의 문장 정렬 트리플을 형성합니다.
- 수동 평가를 통해 문장 정렬 품질이 매우 높으며, 잘 알려진 병렬 텍스트 데이터셋과 유사한 수준임을 확인했습니다.
- 청취자료의 공식적인 독서 스타일로 인해 오디오 데이터의 불순물 수준이 낮아 모델 훈련 잠재력이 향상됩니다.
- 이 데이터셋은 지금까지 알려진 바 있는 종단 간 독일어-영어 음성 번역을 위한 가장 큰 자원입니다.
- 자동 정렬 점수는 컷오프 기준을 적용함으로써 효과적으로 활용되어 데이터셋의 신뢰성과 일관성을 향상시킬 수 있습니다.
- 이 코퍼스는 종단 간 음성 번역 및 인식 시스템의 훈련 및 평가에 적합합니다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.