Skip to main content
QUICK REVIEW

[논문 리뷰] Code-Switching for Enhancing NMT with Pre-Specified Translation

Kai Song, Yue Zhang|arXiv (Cornell University)|2019. 04. 19.
Natural Language Processing Techniques참고 문헌 29인용 수 43
한 줄 요약

이 논문은 소스 구를 미리 지정된 번역으로 대체하여 코드-스위칭 학습 데이터를 생성하는 데이터 증강 방법을 제안합니다. 이를 통해 NMT 모델이 대상어 구문을 직접 복사하도록 하고, 제한된 번역을 손상시키지 않으면서 무제한 단어의 번역도 개선합니다. 여러 도메인에서 En-Ru 및 Ch-En 상에서 대체 문장과 어휘 제한 방법보다 일관된 BLEU 이득을 보이고, 비제한 문장에 대한 성능도 보존합니다.

ABSTRACT

Leveraging user-provided translation to constrain NMT has practical significance. Existing methods can be classified into two main categories, namely the use of placeholder tags for lexicon words and the use of hard constraints during decoding. Both methods can hurt translation fidelity for various reasons. We investigate a data augmentation method, making code-switched training data by replacing source phrases with their target translations. Our method does not change the MNT model or decoding algorithm, allowing the model to learn lexicon translations by copying source-side target words. Extensive experiments show that our method achieves consistent improvements over existing approaches, improving translation of constrained words without hurting unconstrained words.

연구 동기 및 목표

  • 도메인 특화 NMT에서의 제약의 필요성과 자리표시(placeholder) 및 어휘 제약 방식의 한계를 동기화합니다.
  • NMT가 미리 지정된 번역을 복사하도록 가르치기 위한 코드-스위칭 데이터 증강 접근법을 도입합니다.
  • 복사를 강화하기 위해 공유 임베딩과 디코더에 통합된 포인터 네트워크를 도입합니다.
  • En-Ru 및 Ch-En에서 다수의 도메인에 걸쳐 베이스라인 대비 개선을 입증합니다.

제안 방법

  • SMT 구문표를 사용하여 소스 구를 대상 번역으로 대체하는 데이터 증강 병렬 데이터 구성.
  • 디코딩을 전처리하되 디코더를 수정하지 않고 소스 구를 사전에 지정된 번역으로 대체합니다.
  • 복사를 위해 대상 임베딩을 소스 측 대상 단어와 공유합니다.
  • 디코더에 포인터 네트워크를 통합하여 소스 측 대상 단어를 복사합니다.
  • 증강 데이터를 원본 데이터와 혼합하여 디코딩 알고리즘을 변경하지 않고 표준 Transformer를 학습합니다.
  • En-Ru 및 Ch-En에서 BLEU로 평가하며, 자리표시 및 어휘 제약 기반 비교대상과 비교합니다.

실험 결과

연구 질문

  • RQ1코드-스위치 학습 데이터가 디코딩 중에 미리 지정된 번역을 효과적으로 복사하도록 NMT를 가능하게 할 수 있는가?
  • RQ2공유 임베딩 및 포인터 네트워크가 복사와 전반적인 번역 품질을 향상시키는가?
  • RQ3이 방법이 도메인 간에 자리표시 및 어휘 제약 디코딩과 어떻게 비교되는가?
  • RQ4비-code-switch 입력에서도 번역 품질이 보존되는가?

주요 결과

  • 이 방법은 여러 테스트 세트와 도메인에서 En-Ru 및 Ch-En에 대해 자리표시 및 어휘 제약 기준선보다 일관된 향상을 보인다.
  • 영-러시아어 뉴스 도메인에서 평균 BLEU 이득은 자리표시 대비 3.48, 어휘 제약 대비 2.94이다.
  • 영-러시아어 이커머스 도메인에서 평균 BLEU 이득은 자리표시 대비 1.34, 어휘 제약 대비 2.63이다.
  • 중국어-영어 구어체 도메인 세트에서 평균 BLEU 이득은 자리표시 대비 1.35, 어휘 제약 대비 0.42이다.
  • 공유 임베딩과 포인터 네트워크가 복사 성공과 번역 품질을 향상시킨다.
  • 일부 비-code-switched 입력에서 BLEU가 비슷하거나 약간 개선되어 경쟁력을 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.