[논문 리뷰] Lingua Custodia's participation at the WMT 2021 Machine Translation using Terminologies shared task
이 논문은 WMT 2021 공동 과제에서 Lingua Custodia가 제안한 제약 조건이 있는 신경 기계 번역(NMT) 접근 방식을 제시한다. 학습 시 데이터 증강과 제약 토큰 마스킹을 통해 전문 분야(예: 생물의학 및 공중보건)에서 용어 준수를 향상시킨다. 이 방법은 영어-프랑스어 번역에서 정확한 일치 정확도를 91.9%로 크게 향상시키며, 높은 BLEU(44.90) 및 COMET(0.681) 점수를 유지하면서 표준 Transformer와 추론 시 제약 조건이 있는 디코딩 기법을 모두 능가한다.
This paper describes Lingua Custodia's submission to the WMT21 shared task on machine translation using terminologies. We consider three directions, namely English to French, Russian, and Chinese. We rely on a Transformer-based architecture as a building block, and we explore a method which introduces two main changes to the standard procedure to handle terminologies. The first one consists in augmenting the training data in such a way as to encourage the model to learn a copy behavior when it encounters terminology constraint terms. The second change is constraint token masking, whose purpose is to ease copy behavior learning and to improve model generalization. Empirical results show that our method satisfies most terminology constraints while maintaining high translation quality.
연구 동기 및 목표
- 생물의학 및 공중보건과 같은 전문 분야에서 신경 기계 번역 모델의 용어 제약 준수 능력을 향상시키기 위해.
- 병렬 학습 데이터의 낮은 용어 커버리지 문제를 해결하기 위해 단일 언어 데이터를 활용해 데이터 증강을 수행하기 위해.
- 새로운 마스킹 전략을 통해 모순되는 용어 제약을 다룰 때 모델의 일반화 능력과 강건성을 향상시키기 위해.
- 추론 시 계산 오버헤드 없이도 стрict한 용어 준수를 보장하는 학습 시점 접근 방식을 개발하기 위해.
제안 방법
- 모델이 복사 동작을 유도하도록 소스 측 용어를 <S> 및 </S> 태그로 표시하여 학습 데이터를 증강하는 것.
- <S> 태그 이후 소스 용어를 마스킹 토큰으로 대체하여 모델이 타겟 용어를 복사하도록 가르치는 마스킹 토큰 전략 도입.
- 결합된 임베딩과 8개의 어텐션 헤드를 사용한 Transformer 기반 아키텍처를 사용하며, BPE 또는 SentencePiece 토크나이저를 활용해 다국어 데이터로 학습.
- 영어-프랑스어 및 영어-러시아어에 대해 40,000개의 병합을 사용한 BPE 서어분할을 적용하고, 영어-중국어에는 SentencePiece를 사용하여 어휘 크기를 39,996에서 52,172 사이로 조정.
- 검증 손실 기반 조기 정지 기법을 사용해 최대 100 에포크 동안 학습하며, 추론 시에는 빔 크기를 5로 설정.
- 표준 기계 번역 평가 지표(BLEU, COMET)와 용어 전용 지표(정확한 일치 정확도, 윈도우 오버랩, 1-TERm)를 사용해 시스템 평가.
실험 결과
연구 질문
- RQ1용어 태깅을 통한 학습 시점 데이터 증강이 신경 기계 번역에서 어휘 제약 준수에 기여하는가?
- RQ2제약 조건 토큰 마스킹 전략이 모순되는 용어 매핑을 다룰 때 모델의 일반화 능력과 강건성을 향상시키는가?
- RQ3추론 시 제약 조건이 있는 디코딩과 비교해 제안된 방법은 용어 정확도와 번역 품질 측면에서 어떻게 성능을 내는가?
- RQ4단일 언어 데이터를 얼마나 효과적으로 활용해 용어 어휘를 포함한 학습 예제 수를 늘릴 수 있는가?
- RQ5근명한 용어 준수를 달성하면서도 높은 번역 품질(BLEU, COMET)을 유지할 수 있는가?
주요 결과
- TAG+MASK 모델은 영어-프랑스어 테스트 세트에서 91.9%의 정확한 일치 정확도를 기록하여 표준 Transformer(32.5%)와 제약 조건이 있는 디코더(85.6%) 기준선을 크게 뛰어넘었다.
- 영어-프랑스어 세트에서 BLEU 점수는 44.90, COMET 점수는 0.681을 기록하여 높은 번역 품질과 강력한 용어 준수 능력을 동시에 입증했다.
- 영어-러시아어에서는 정확한 일치 정확도 84.9%와 BLEU 점수 29.13을 기록하여 형태학적으로 복잡한 언어에서도 뛰어난 성능을 보였다.
- 영어-중국어에서는 정확한 일치 정확도 82.9%와 BLEU 점수 29.16을 기록하여 자원이 적고 비라틴 문자 기반 번역에 효과적으로 적응함을 보였다.
- 윈도우 오버랩(2) 및 (3) 지표는 모든 언어 쌍에서 일관된 향상을 보였으며, 영어-프랑스어에서는 각각 34.4%와 33.5%의 오버랩을 기록하여 용어 어휘의 문맥적 배치가 향상됨을 시사했다.
- 영어-프랑스어에서 1-TERm 점수 0.598은 기준선 대비 용어 관련 편집 오류가 상당히 감소했음을 나타냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.