[논문 리뷰] The HW-TSC's Offline Speech Translation Systems for IWSLT 2021 Evaluation
이 논문은 IWSLT 2021 평가를 위한 캐스케이드 기반 오프라인 음성 번역 시스템을 제시하며, 발화자 다이어라이제이션, 다중 소스 훈련된 Transformer ASR 모델(소스별 태그 [LS], [MC], [CV] 포함), 그리고 WMT에서 사전 훈련하고 TED에서 미세조정한 NMT 모델을 결합한다. 이 시스템은 IWSLT 2021 테스트 세트에서 24.6 BLEU 점수를 기록하여 다중 소스 훈련과 도메인 특화 미세조정의 효과를 입증한다.
This paper describes our work in participation of the IWSLT-2021 offline speech translation task. Our system was built in a cascade form, including a speaker diarization module, an Automatic Speech Recognition (ASR) module and a Machine Translation (MT) module. We directly use the LIUM SpkDiarization tool as the diarization module. The ASR module is trained with three ASR datasets from different sources, by multi-source training, using a modified Transformer encoder. The MT module is pretrained on the large-scale WMT news translation dataset and fine-tuned on the TED corpus. Our method achieves 24.6 BLEU score on the 2021 test set.
연구 동기 및 목표
- IWSLT 2021 평가를 위한 캐스케이드 아키텍처를 사용한 강력한 오프라인 음성 번역 시스템을 개발하기 위해.
- 명시적인 데이터 소스 태그를 사용한 다중 소스 훈련을 통해 다양한 음성 도메인 간의 ASR 일반화를 향상시키기 위해.
- 대규모 WMT 뉴스 데이터에서의 사전 훈련과 도메인 내 TED 코퍼스에서의 미세조정을 통해 번역 품질을 향상시키기 위해.
- 다중 소스 훈련과 도메인 특화 미세조정이 ASR 및 MT 성능에 미치는 영향을 평가하기 위해.
- 제약 조건이 있는 및 없는 자원을 사용하여 IWSLT 2021 테스트 세트에서 최신 기술 성능을 달성하기 위해.
제안 방법
- 시스템은 발화자 분할을 위해 LIUM SpkDiarization를 사용한 후, 1D 컨볼루션 레이어를 단어 임베딩의 대체로 사용하여 음성 특징을 더 잘 모델링하는 Transformer 기반 ASR 모델을 적용한다.
- 다중 소스 훈련은 ASR 훈련 중 첫 번째 토큰으로 소스별 태그([LS], [MC], [CV])를 삽입하여 모델이 데이터 분포와 스타일에 조건화되도록 한다.
- 추론 과정에서는 IWSLT 테스트 세트의 TED 강연 스타일에 맞추기 위해 모델이 반드시 [MC] 태그를 사용하여 디코딩하도록 유도한다.
- MT 모델은 WMT 뉴스 병렬 데이터와 백트랜슬레이션된 단일 언어 데이터에서 사전 훈련한 후, 도메인 적응을 위해 TED 코퍼스에서 미세조정한다.
- 최종 시스템은 모델 앙상블을 사용하며, BLEU, TER, BEER, CharacTER를 포함한 메트릭스를 통해 SLT.KIT 툴킷을 이용해 평가한다.
- 모든 모델는 Adam 옵timizer, 학습률 스케줄링, CMVN 정규화를 사용하며, ASR는 스펙트럼 증강과 4개의 V100 GPU를 사용해 50 에포크 동안 훈련한다.
실험 결과
연구 질문
- RQ1명시적인 소스 태깅을 사용한 다중 소스 훈련이 다양한 음성 도메인 간의 ASR 성능을 어떻게 향상시키는가?
- RQ2대규모 WMT 데이터에서의 사전 훈련과 TED 코퍼스에서의 미세조정이 음성 번역에 어떤 영향을 미치는가?
- RQ3IWSLT 2021 테스트 세트에서 BLEU 점수 측면에서 캐스케이드 시스템은 엔드 투 엔드 모델보다 어떻게 비교되는가?
- RQ4왜 다중 소스 훈련은 MuST-C와 CoVoST에서는 성능을 향상시키지만 LibriSpeech에서는 성능을 떨어뜨리는가?
- RQ5도메인 특화 미세조정이 도메인 내 테스트 세트에서 번역 품질을 얼마나 향상시키는가?
주요 결과
- 시스템은 IWSLT 2021 테스트 세트에서 24.6 BLEU 점수를 기록하여 오프라인 음성 번역 분야에서 뛰어난 성능을 입증했다.
- 하이브리드 훈련을 사용할 경우, 다중 소스 훈련은 MuST-C(15.64 vs. 17.23)와 CoVoST(29.25 vs. 31.08)에서 ASR WER를 크게 향상시켰지만, LibriSpeech에서는 성능 저하(3.57 vs. 3.32)를 초래했다.
- TED 코퍼스에서 NMT 모델을 미세조정함으로써 dev2010 세트에서 BLEU 점수가 31.0에서 33.1로 상당히 향상되어 도메인 적응의 가치를 확인했다.
- 다중 소스 태깅을 사용해 훈련한 모델은 스타일 일반화에 더 우수했으며, 특히 MuST-C와 CoVoST 간의 구어체 스타일과 문장 부호 처리의 유사성 덕분이었다.
- tst2018에서의 성능 저하(29.9 BLEU)는 강의에서 TED 강연으로의 도메인 이동 때문으로 기인되었으며, 이는 외부 도메인 데이터의 과제를 강조한다.
- 두 개의 미세조정된 NMT 모델을 앙상블함으로써 번역 품질이 향상되었으며, 이는 순서 생성 작업에서 모델 평균화의 이점을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.