[논문 리뷰] Lite Training Strategies for Portuguese-English and English-Portuguese Translation
이 논문은 단일 8GB 게이밍 GPU를 사용하여 포르투갈어-영어 및 영어-포르투갈어 신경 기계 번역을 위한 경량 훈련 전략을 제안한다. 영어 또는 포르투갈어 코퍼스에서 미세 조정된 T5 모델을 활용하며, 포르투갈어 음절 표기(예: ã, ç, á)를 처리하기 위해 토크나이저를 적응시켰다. 최소한의 하드웨어와 오픈소스 모델 및 데이터를 사용하여 경쟁적인 성능을 달성했으며, en-pt 번역에서는 Google 번역과 유사하고, WMT19 생물의학 과제에서는 최신 기술 수준을 초월한다.
Despite the widespread adoption of deep learning for machine translation, it is still expensive to develop high-quality translation models. In this work, we investigate the use of pre-trained models, such as T5 for Portuguese-English and English-Portuguese translation tasks using low-cost hardware. We explore the use of Portuguese and English pre-trained language models and propose an adaptation of the English tokenizer to represent Portuguese characters, such as diaeresis, acute and grave accents. We compare our models to the Google Translate API and MarianMT on a subset of the ParaCrawl dataset, as well as to the winning submission to the WMT19 Biomedical Translation Shared Task. We also describe our submission to the WMT20 Biomedical Translation Shared Task. Our results show that our models have a competitive performance to state-of-the-art models while being trained on modest hardware (a single 8GB gaming GPU for nine days). Our data, models and code are available at https://github.com/unicamp-dl/Lite-T5-Translation.
연구 동기 및 목표
- 저비용 소비자용 하드웨어를 사용하여 포르투갈어-영어 및 영어-포르투갈어를 위한 고품질 신경 기계 번역 시스템을 개발한다.
- 영어 전용 코퍼스에서 사전 훈련된 모델이 포르투갈어 고유의 문자(예: 음절, ~ 기호)를 처리하는 데 도전하는 문제를 해결한다.
- 병렬 코퍼스에 대해 미세 조정된 T5 기반 모델의 성능을 평가하고, 영어 사전 훈련과 포르투갈어 사전 훈련 간의 비교를 수행한다.
- 연구자 및 소규모 연구소에서 사용할 수 있고, 효율적이며 재현 가능한 번역 시스템을 공개한다.
- 표준 데이터셋에서 Google 번역과 같은 상용 시스템 및 최신 기술 수준의 모델과의 성능을 비교 평가한다.
제안 방법
- 영어 또는 포르투갈어 단어 코퍼스에서 사전 훈련된 T5-base 모델을 사용하여 번역을 위한 순서-시퀀스 훈련을 수행한다.
- 원본 영어 토크나이저를 포르투갈어 고유 문자(예: ã, ç, á)를 처리할 수 있도록 사전 및 사후 처리 전략을 통해 적응시킨다.
- T5의 텍스트-투-텍스트 프레임워크를 활용하여 번역 과제를 텍스트 생성 문제로 재구성한다.
- ParaCrawl 및 WMT 데이터셋을 사용하여 9일간 단일 NVIDIA RTX 2070 GPU(8GB)와 32GB RAM에서 훈련한다.
- 장문 번역 과제에서의 성능 향상을 위해 시퀀스 길이 조정(TSL 및 SSL)을 적용한다.
- SacreBLEU를 사용하여 ParaCrawl 99k 테스트 세트와 공식 WMT 테스트 세트에서 모델을 평가한다.
실험 결과
연구 질문
- RQ1포르투갈어에서 사전 훈련된 T5 모델이 포르투갈어-영어 및 영어-포르투갈어 번역에서 영어에서 사전 훈련된 모델보다 더 높은 번역 품질을 달성할 수 있는가?
- RQ2재훈련 없이도 영어 토크나이저를 포르투갈어 음절 표기를 처리하도록 적응시키는 것이 번역 성능에 뚜렷한 향상을 가져오는가?
- RQ38GB 소비자용 GPU 하나로도 다수의 고성능 GPU에서 훈련된 시스템과 경쟁 가능한 번역 모델을 생성할 수 있는가?
- RQ4표준 벤치마크 데이터셋에서 우리의 시스템은 Google 번역 및 기타 최신 기술 수준의 모델과 비교해 어떻게 성능을 내는가?
- RQ5원천 및 대상 시퀀스 길이를 늘리는 것이 장문의 생물의학적 텍스트에서 번역 품질에 얼마나 기여하는가?
주요 결과
- 포르투갈어에서 사전 훈련된 T5 모델은 WMT19 생물의학 pt-en 과제에서 46.51 BLEU를 기록했으며, 영어에서 사전 훈련된 모델(45.89)을 뛰어나고, en-pt 과제에서 우승 제출물(45.62 대비 48.18)과 유사한 성능을 보였다.
- ParaCrawl 99k 테스트 세트에서 포르투갈어에서 사전 훈련된 모델은 pt-en에서 46.35 BLEU, en-pt에서 45.44 BLEU를 기록했으며, en-pt에서 Google 번역(51.20 및 45.17)과 유사했고, pt-en에서는 이를 뛰어넘었다.
- 목표 및 원천 시퀀스 길이를 늘린 결과(TSL=256, SSL=256), en-pt BLEU 점수가 49.06으로 기존 모델 대비 +9.75 향상되었다.
- 토크나이저 적응이 재훈련 없이도 번역 품질을 크게 향상시켜 영어 사전 훈련된 모델을 포르투갈어 텍스트에 효과적으로 활용할 수 있도록 했다.
- 단일 8GB GPU만을 사용하여 WMT19에서 최신 기술 수준의 성능을 달성했으며, 우승한 WMT19 시스템은 네 대의 V100을 사용했다.
- WMT20에서 모델은 포르투갈어-영어 과제에서 우승 팀보다 2.17 BLEU 포인트 낮았지만, 베이스라인 대비 4.48 포인트 높아, 포르투갈어 사전 훈련의 잠재력이 높음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.