Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning for Many-to-many Multilingual Neural Machine Translation

Xiao Pan, Mingxuan Wang|arXiv (Cornell University)|2021. 05. 20.
Natural Language Processing Techniques참고 문헌 36인용 수 5
한 줄 요약

이 논문은 병렬 및 단일 언어 데이터에서 대비 손실과 데이터 증강을 사용하여 다국어 간 표현 정렬을 향상시키는 대비 학습 프레임워크인 mRASP2를 제안한다. 이는 영어 중심 및 비영어 번역 방향에서 모두 최신 기술 수준의 성능을 달성하며, 기준 모델 대비 제로샷 및 비지도 설정에서 평균 10 BLEU 이상의 향상을 기록한다.

ABSTRACT

Existing multilingual machine translation approaches mainly focus on English-centric directions, while the non-English directions still lag behind. In this work, we aim to build a many-to-many translation system with an emphasis on the quality of non-English language directions. Our intuition is based on the hypothesis that a universal cross-language representation leads to better multilingual translation performance. To this end, we propose mRASP2, a training method to obtain a single unified multilingual translation model. mRASP2 is empowered by two techniques: a) a contrastive learning scheme to close the gap among representations of different languages, and b) data augmentation on both multiple parallel and monolingual data to further align token representations. For English-centric directions, mRASP2 outperforms existing best unified model and achieves competitive or even better performance than the pre-trained and fine-tuned model mBART on tens of WMT's translation directions. For non-English directions, mRASP2 achieves an improvement of average 10+ BLEU compared with the multilingual Transformer baseline. Code, data and trained models are available at https://github.com/PANXiao1994/mRASP2.

연구 동기 및 목표

  • 다국어 NMT에서 다양한 언어 간 표현 간 격차를 줄여 모든 언어 쌍 간 지식 전이를 향상시키기 위해.
  • 기존 다국어 시스템에서 성능이 떨어지는 비영어 번역 방향의 번역 품질을 향상시키기 위해.
  • 영어 중심이 아닌 모든 언어 쌍에서 잘 작동하는 통합적인 다대다 다국어 모델을 개발하기 위해.
  • 정렬된 데이터 증강을 통해 병렬 및 단일 언어 데이터를 효과적으로 활용하여 표현 학습을 향상시키기 위해.
  • 특히 제로샷 및 비지도 번역에서 mBART와 같은 강력한 双어 모델에 비해 경쟁적 또는 우수한 성능을 달성하기 위해.

제안 방법

  • mRASP2는 병렬 문장 쌍(양성 쌍)의 표현 간 거리를 최소화하고, 비병렬 쌍(음성 쌍)의 표현 간 거리를 최대화하는 대비 학습 기반 기법을 사용한다.
  • 12층 인코더와 디코더를 갖춘 다국어 트랜스포머를 사용하며, 훈련 안정성을 향상시키기 위해 레이어 정규화와 프리-노멀라이제이션 잔여 연결을 적용한다.
  • 다양한 언어의 입력과 출력을 가능하게 하기 위해 각 문장 앞에 언어 식별 토큰을 삽입한다.
  • 동의어 사전을 사용하여 단어를 동의어로 교체함으로써 병렬 및 단일 언어 코퍼스에 대해 정렬된 데이터 증강을 적용하여 가짜 병렬 또는 가짜 자기 병렬 예제를 생성한다.
  • 실제 병렬 데이터와 증강된 가짜 쌍을 통합하여 훈련하는 프레임워크를 구현하며, 표준 교차 엔트로피 손실과 대비 손실을 병합한 손실 함수를 사용한다.
  • 정렬된 및 비정렬된 문장 쌍의 인코더 표현에 대해 대비 학습을 적용하여 언어 간 의미 일관성을 유도한다.

실험 결과

연구 질문

  • RQ1대비 학습이 다국어 NMT 모델에서 다양한 언어 간 표현 간 격차를 효과적으로 줄일 수 있는가?
  • RQ2병렬 및 단일 언어 코퍼스에 대한 데이터 증강이 특히 자원이 적거나 비영어 방향에서의 다국어 번역 성능 향상에 기여하는가?
  • RQ3단일 통합 모델이 피봇 기반 방법에 의존하지 않고도 영어 중심 및 비영어 번역 방향에서 모두 경쟁 가능한 성능을 달성할 수 있는가?
  • RQ4다대다 다국어 환경에서 대비 학습이 제로샷 및 비지도 번역 성능 향상에 어느 정도 기여하는가?
  • RQ5mRASP2는 다양한 WMT 번역 벤치마크에서 mBART와 같은 강력한 双어 모델과 비교해 어떻게 성능을 내는가?

주요 결과

  • 영어 중심 방향에서 mRASP2는 20개의 WMT 번역 방향에서 다국어 트랜스포머 기준 모델을 능가하며, 10개의 WMT 벤치마크에서 mBART와 경쟁적 또는 더 우수한 성능을 기록한다.
  • 비영어 방향에서 mRASP2는 다국어 트랜스포머 기준 모델 대비 평균 10 BLEU 이상의 향상을 달성한다.
  • 제로샷 및 비지도 번역에서 mRASP2는 36개 번역 방향에서 강력한 성능을 기록하며, 기준 모델 대비 평균 10점 이상의 BLEU 향상을 기록한다.
  • 모든 언어 쌍에서 일관된 성능 향상을 보이며, 효과적인 다국어 간 지식 전이를 나타낸다.
  • 시각화 결과에 따르면, 대비 학습이 공유 임베딩 공간에서 다양한 언어 간 표현 간 격차를 성공적으로 줄였다.
  • 대비 학습과 정렬된 데이터 증강의 조합은 더 견고하고 일반화 능력이 뛰어난 다국어 표현을 생성한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.