Skip to main content
QUICK REVIEW

[논문 리뷰] Self-supervised and Supervised Joint Training for Resource-rich Machine Translation

Yong Cheng, Wei Wang.|arXiv (Cornell University)|2021. 06. 08.
Natural Language Processing Techniques인용 수 8
한 줄 요약

이 논문은 자원이 풍부한 신경 기계 번역을 향상시키기 위해 단일 언어(자기 지율) 및 병렬(감독) 문장을 크로스오버 인코더-디코더 메커니즘을 통해 융합하는 새로운 통합 학습 프레임워크인 $F_{2}$-XEnDec를 제안한다. 혼합 입력에서 $F_2$-세대 후손을 생성함으로써, 이 방법은 WMT’14 영어-프랑스 번역에서 46.19 BLEU를 달성하는 최고 성능을 기록하면서도 코드 스위칭과 같은 입력 교란에 대한 강건성까지 향상시킨다.

ABSTRACT

Self-supervised pre-training of text representations has been successfully applied to low-resource Neural Machine Translation (NMT). However, it usually fails to achieve notable gains on resource-rich NMT. In this paper, we propose a joint training approach, $F_2$-XEnDec, to combine self-supervised and supervised learning to optimize NMT models. To exploit complementary self-supervised signals for supervised learning, NMT models are trained on examples that are interbred from monolingual and parallel sentences through a new process called crossover encoder-decoder. Experiments on two resource-rich translation benchmarks, WMT'14 English-German and WMT'14 English-French, demonstrate that our approach achieves substantial improvements over several strong baseline methods and obtains a new state of the art of 46.19 BLEU on English-French when incorporating back translation. Results also show that our approach is capable of improving model robustness to input perturbations such as code-switching noise which frequently appears on social media.

연구 동기 및 목표

  • 자원이 풍부한 기계 번역 환경에서 레이블이 부여된 데이터가 풍부한 상황에서도 자기 지율 사전 학습의 효과가 제한적인 문제를 해결하기 위해.
  • 일반적으로 더 강한 자기 지율 신호를 압도하는 감독 신호의 지배를 극복하기 위해.
  • 비라벨링 단일 언어 문장과 레이블이 부여된 병렬 문장으로부터 유용한 신호를 보완적으로 활용할 수 있는 통합된 단일 단계 학습 프레임워크를 개발하기 위해.
  • 소셜 미디어와 유사한 환경에서 흔한 코드 스위칭 노이즈와 같은 입력 교란에 대한 모델의 강건성을 향상시키기 위해.

제안 방법

  • 두 입력 예제인 단일 언어 문장과 병렬 문장을 취하고, 원본 문장의 재배열과 조건부 디코딩을 통해 혼합된 하이브리드 문장 쌍을 생성하는 크로스오버 인코더-디코더(XEnDec) 메커니즘을 제안한다.
  • XEnDec를 활용해 $F_1$ 및 $F_2$ 세대를 생성한다: $F_1$-XEnDec는 노이즈가 첨가된 단일 언어 문장을 사용해 자기 지율 학습을 수행하고, $F_2$-XEnDec는 단일 언어 및 병렬 입력을 융합해 통합 학습을 수행한다.
  • 소스 공간에서 비선형 혼합 전략을 적용하고, 부분적으로 혼합된 소스 표현에서 전체 타겟 시퀀스를 재구성하도록 모델을 강제함으로써, 분리 및 일반화를 촉진한다.
  • 감독 번역 손실과 $F_1$ 및 $F_2$ 세대에 대한 자기 지율 재구성 손실을 결합한 다중 작업 목적 함수를 사용한다.
  • 단일 언어 문장을 $F_1$-XEnDec를 위해 손상시키는 데 사용되는 노이즈 함수 $n(\mathbf{y}^u)$를 도입하여, 통합 프레임워크 내에서 자기 지율 사전 학습을 가능하게 한다.
  • 단일 단계 학습 루프를 사용하여, 사전 학습된 구성 요소를 동 冻결하지 않고, WMT’14 영어-독일어 및 영어-프랑스 벤치마크에서 검증을 수행하며, 백트랜슬레이션 데이터도 포함한다.

실험 결과

연구 질문

  • RQ1자기 지율 학습 신호가 감독 목표와 함께 통합 학습될 경우, 자원이 풍부한 기계 번역에서 성능 향상에 기여할 수 있는가?
  • RQ2자기 지율 및 감독 신호를 단일 학습 단계에서 효과적으로 융합할 수 있는 방법은 무엇인가? 이는 신호 지배 및 치명적인 기억 상실을 방지하기 위함이다.
  • RQ3제안된 $F_2$-XEnDec 프레임워크는 자원이 적거나 소셜 미디어 유사 환경에서의 코드 스위칭 노이즈와 같은 입력 교란에 대해 모델의 강건성을 향상시키는가?
  • RQ4XEnDec 메커니즘은 통제된 데이터 혼합을 통해 기존의 자기 지율 및 감독 학습 목표를 복구하거나 초월할 수 있는가?
  • RQ5단일 단계 학습 프레임워크인 $F_2$-XEnDec를 사용한 통합 학습은 기존의 두 단계 미세조정 방법에 비해 성능 및 일반화 능력 측면에서 어떻게 비교되는가?

주요 결과

  • 백트랜슬레이션과 함께 사용할 경우, $F_2$-XEnDec 방법은 WMT’14 영어-프랑스 번역 벤치마크에서 새로운 최고 성능인 46.19 BLEU 점수를 기록한다.
  • 영어-독일어 번역에서는 기존의 트랜스포머보다 2.13 BLEU 포인트 향상되었고, 영어-프랑스 번역에서는 1.78 BLEU 포인트 향상되었다.
  • 코드 스위칭 노이즈와 같은 입력 교란에 대해 이전의 두 단계 미세조정 방법에서 관찰되지 않았던 우수한 강건성을 보였다.
  • 제거 실험 결과, $F_2$-세대 및 노이즈 함수 $n(\mathbf{y}^u)$가 성능 향상에 필수적임을 확인했으며, 이들을 제거하면 성능이 저하됨을 입증했다.
  • 믹스업 기반 데이터 혼합은 XEnDec보다 성능이 열 劣하다는 점에서, 이 맥락에서 비선형 혼합과 구조적 분리가 선형 보간보다 더 효과적임을 시사한다.
  • 단일 단계 통합 학습 프레임워크는 사전 학습된 표현을 동 冻결하거나 약간 조정하는 두 단계 방법보다 우수한 성능을 보였으며, 자기 지율 신호의 잠재력을 더 효과적으로 해방시킬 수 있음을 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.