Skip to main content
QUICK REVIEW

[논문 리뷰] Word-based Domain Adaptation for Neural Machine Translation

Yan Shen, Leonard Dahlmann|arXiv (Cornell University)|2019. 06. 07.
Natural Language Processing Techniques참고 문헌 22인용 수 4
한 줄 요약

이 논문은 전자상거래 환경에서 신경 기계 번역(NMT)을 위한 단어 수준 도메인 적응 방법을 제안한다. 도메인 특화 언어 모델과 일반 언어 모델 간의 로그 확률 차이를 사용해 단어 가중치를 할당하며, 이를 평활화 및 이진 양자화한 후, 도메인 외 데이터에서 도메인 유사 단어를 강조함으로써 학습을 향상시킨다. 이로 인해 기준 방법 대비 최대 2.11 BLEU 및 1.59 TER 향상이 이루어지며, 미세조정과 조합할 경우 추가적인 성능 향상이 가능하다.

ABSTRACT

In this paper, we empirically investigate applying word-level weights to adapt neural machine translation to e-commerce domains, where small e-commerce datasets and large out-of-domain datasets are available. In order to mine in-domain like words in the out-of-domain datasets, we compute word weights by using a domain-specific and a non-domain-specific language model followed by smoothing and binary quantization. The baseline model is trained on mixed in-domain and out-of-domain datasets. Experimental results on English to Chinese e-commerce domain translation show that compared to continuing training without word weights, it improves MT quality by up to 2.11% BLEU absolute and 1.59% TER. We have also trained models using fine-tuning on the in-domain data. Pre-training a model with word weights improves fine-tuning up to 1.24% BLEU absolute and 1.64% TER, respectively.

연구 동기 및 목표

  • 작은 도메인 내 데이터와 큰 도메인 외 데이터 세트를 활용하여 자원이 제한된 전자상거래 도메인 번역 문제를 해결하기 위해.
  • 문장 또는 청크 수준의 가중치 할당이 아닌 단어 수준의 가중치 할당을 통해 NMT 성능을 향상시키기 위해.
  • 임계값 설정 이전에 노이즈를 줄이기 위해 평활화 기법을 사용하여 단어 점수 할당의 정밀도를 높이기 위해.
  • 단어 가중치를 사용한 사전 학습이 도메인 내 데이터에서의 후속 미세조정 성능을 향상시키는지 확인하기 위해.

제안 방법

  • 도메인 특화 언어 모델(LM)과 비도메인 특화 언어 모델의 확률 간 로그 차이를 사용해 단어 점수를 계산한다.
  • 이웃 단어를 고려한 가중 이동 평균 필터를 적용하여 단어 점수의 노이즈를 줄인다.
  • 평활화된 점수를 이진 양자화하여 0 또는 1인 단어 가중치를 생성하고, 도메인 유사 단어를 선별한다.
  • 단어 가중치로 교차 엔트로피 손실를 스케일링하는 수정된 목표 함수를 사용해 NMT 모델을 학습시킨다.
  • 도메인 내 데이터에서의 미세조정 이전에 단어 가중치 기반 모델을 사전 학습 기반으로 사용한다.
  • 영어-중국어 전자상거래 번역 벤치마크에서 BLEU와 TER를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1언어 모델 확률 차이를 기반으로 한 단어 수준의 가중치 할당이 자원이 제한된 전자상거래 도메인의 NMT 성능 향상에 기여하는가?
  • RQ2임계값 설정 이전에 단어 점수를 평활화하면 도메인 외 데이터에서 선별된 도메인 유사 단어의 품질에 어떤 영향을 미치는가?
  • RQ3단어 가중치를 사용한 사전 학습이 도메인 내 데이터에서 직접 미세조정하는 것보다 더 나은 성능을 내는가?
  • RQ4단어 수준의 가중치 할당은 문장 수준 또는 청크 수준의 가중치 할당보다 도메인 적응에서 어떻게 비교되는가?

주요 결과

  • 임계값 설정 이전에 단어 점수를 평활화하면 번역 품질이 크게 향상되며, BLEU는 21.38%에서 26.14%로 상승하고 TER는 66.25%에서 60.34%로 감소한다.
  • 단어 가중치를 사용해 계속 학습하면 단어 가중치 없이 학습한 경우 대비 BLEU가 2.11 점수 상승하고 TER는 1.59 점수 상승한다.
  • 단어 가중치 기반 사전 학습 후에 미세조정을 수행하면 직접 미세조정한 경우 대비 BLEU는 1.24 점수 상승하고 TER는 1.64 점수 상승한다.
  • 가장 긴 연속 단어(LCW) 방법은 "방/이월/분사/내"와 같은 의미 있는 도메인 세그먼트를 효과적으로 유지하면서도 "공기"와 같은 단독으로 나타나는 노이즈 단어를 걸러내는 데 성공한다.
  • 무작위 단어 마스킹 및 노이즈가 제거되지 않은 단어 가중치 할당보다 성능이 뛰어나며, 단어 점수 할당에서 노이즈 감소의 필요성을 확인한다.
  • 이 방법은 개별 단어의 선택을 도메인 유사도 기반으로 가능하게 하여 인스턴스 가중치 할당을 일반화함으로써 자원이 제한된 환경에서 데이터 효율성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.