[논문 리뷰] ON-TRAC Consortium End-to-End Speech Translation Systems for the IWSLT 2019 Shared Task
이 논문은 IWSLT 2019 공동 과제를 위해 ON-TRAC 컨sortium에서 개발한 엔드 투 엔드 음성 번역 시스템을 제시한다. 영어에서 포르투갈어 번역을 위해 단일 신경 인코더-디코더 아키텍처와 어텐션 메커니즘을 사용하였다. 최고의 모델은 MuST-C에서 BLEU 점수 26.91점, How2에서 43.82점의 성능을 기록하여, 파ipel라인 ASR+MT 기준선보다 각각 4.77점과 9.59점 높은 성능을 보였으며, 통합된 훈련 데이터와 문자 수준의 토크나이제이션으로 최적의 결과를 얻었다.
This paper describes the ON-TRAC Consortium translation systems developed for the end-to-end model task of IWSLT Evaluation 2019 for the English-to-Portuguese language pair. ON-TRAC Consortium is composed of researchers from three French academic laboratories: LIA (Avignon Universit\\'e), LIG (Universit\\'e Grenoble Alpes), and LIUM (Le Mans Universit\\'e). A single end-to-end model built as a neural encoder-decoder architecture with attention mechanism was used for two primary submissions corresponding to the two EN-PT evaluations sets: (1) TED (MuST-C) and (2) How2. In this paper, we notably investigate impact of pooling heterogeneous corpora for training, impact of target tokenization (characters or BPEs), impact of speech input segmentation and we also compare our best end-to-end model (BLEU of 26.91 on MuST-C and 43.82 on How2 validation sets) to a pipeline (ASR+MT) approach.
연구 동기 및 목표
- IWSLT 2019 공동 과제에서 영어-포르투갈어 번역을 위한 엔드 투 엔드 음성 번역 시스템을 개발하고 평가하는 것.
- 이질적인 음성 번역 코퍼스(MuST-C 및 How2)를 결합할 경우 모델 성능에 어떤 영향을 미치는지 조사하는 것.
- 번역 품질을 고려할 때, 타겟 측 토크나이제이션 전략(문자 vs. BPE) 중 어느 것이 더 우수한지 비교하는 것.
- ASR 기반과 발화자 다이아라이제이션 기반의 음성 입력 분할 방법 중 어느 것이 더 효과적인지 평가하는 것.
- 피넷튜닝 및 엔드 투 엔드 훈련이 표준 파이프라인 ASR+MT 접근 방식보다 우수한지 평가하는 것.
제안 방법
- 모든 제출물에 대해 단일 엔드 투 엔드 신경 인코더-디코더 모델과 어텐션 메커니즘을 사용하였다.
- MuST-C와 How2에서의 훈련 데이터를 통합하여 총 674.4시간의 음성 데이터를 포함하는 통합 코퍼스를 구축하였다.
- 음성 입력은 침묵 기반 분할(0.65초 임계값, 장시간 세그먼트의 경우 0.15초로 감소)을 적용한 ASR 시스템을 통해 분할되었다.
- 타겟 측 토크나이제이션은 다양한 어휘 크기(400~8000)를 가진 문자 수준과 BPE 기반 단위를 사용하여 평가되었다.
- 가장 성능이 뛰어난 모델에 대해 How2 데이터셋에서 피넷튜닝을 적용하였으며, 전체 및 디코더 전용 피넷튜닝 전략을 모두 사용하였다.
- BPE-30k 토크나이제이션을 사용한 별도의 ASR 및 NMT 시스템을 기반으로 한 파이프라인 기준선을 구축하였다.
실험 결과
연구 질문
- RQ1How2와 MuST-C를 포함한 이질적인 코퍼스를 통합하면 엔드 투 엔드 음성 번역 성능이 향상되는가?
- RQ2문자 단위와 서브워드 단위(BPE) 중 어느 타겟 측 토크나이제이션 단위가 더 우수한 성능을 보이는가?
- RQ3음성 입력 분할의 최적 방법은 무엇인가: ASR 기반인가, 발화자 다이아라이제이션 기반인가?
- RQ4피넷튜닝은 엔드 투 엔드 모델의 성능을 향상시키는가?
- RQ5엔드 투 엔드 모델은 표준 ASR+MT 파이프라인 접근 방식보다 우수한가?
주요 결과
- MuST-C와 How2 코퍼스를 통합함으로써 성능 향상이 뚜렷하게 관찰되었으며, MuST-C tst-COMMON에서 BLEU 점수 26.91점, How2 검증 세트에서 42.97점의 성능을 기록하였다.
- 문자 수준의 토크나이제이션은 MuST-C에서 최고의 성능을 기록하여 BLEU 점수 26.91점을 달성하였고, BPE-400은 How2에서 가장 높은 점수(43.82점)를 기록하였다.
- ASR 기반 음성 분할이 발화자 다이아라이제이션 기반 분할보다 우수했으며, 훈련 데이터와 유사한 세그먼트 길이 분포를 보였고, 더 높은 BLEU 점수를 기록하였다.
- How2 데이터셋에서 모델에 대한 피넷튜닝은 약간의 향상만을 가져왔으며, 통계적으로 유의미하지 않았다. How2 검증 세트에서 각각 43.02점(전체 미동결)과 43.04점(디코더만 동결)의 점수를 기록하였다.
- 엔드 투 엔드 모델은 ASR 및 MT 컴포넌트를 공동 최적화하지 않은 상태에서도 MuST-C에서 파이프라인 ASR+MT 기준선보다 BLEU 점수 4.77점 높았고, How2에서는 9.59점 높은 성능을 기록하였다.
- 최고 성능을 기록한 엔드 투 엔드 모델은 MuST-C에서 케이스 센시티브 BLEU 점수 26.91점, How2에서 43.82점의 성능을 기록하였으며, 후자의 결과는 평가 마감일 이후에 BPE-400를 사용하여 도출되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.