Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Domain Adaptation Translation with Domain Invariant and Specific Information

Shuhao Gu, Yang Feng|arXiv (Cornell University)|2019. 04. 08.
Natural Language Processing Techniques참고 문헌 30인용 수 8
한 줄 요약

이 논문은 도메인 불변 및 도메인 특화 특징을 공유(공통) 및 비공유(개별) 인코더/디코더를 사용하여 명시적으로 분리하는 새로운 신경 기계 번역 프레임워크를 제안한다. 각 도메인에 대해 공유 및 비공유 인코더/디코더를 사용하고, 도메인 구분자에 의한 적대적 훈련을 통해 성능을 향상시킨다. 이 방법은 여러 데이터셋과 모델에서 도메인 내 번역 성능을 크게 향상시키며, 미세조정 및 샘플링 기반 접근법과 같은 강력한 베이스라인을 능가한다. 또한 도메인 외 번역 성능을 유지하거나 약간 향상시킨다.

ABSTRACT

In domain adaptation for neural machine translation, translation performance can benefit from separating features into domain-specific features and common features. In this paper, we propose a method to explicitly model the two kinds of information in the encoder-decoder framework so as to exploit out-of-domain data in in-domain training. In our method, we maintain a private encoder and a private decoder for each domain which are used to model domain-specific information. In the meantime, we introduce a common encoder and a common decoder shared by all the domains which can only have domain-independent information flow through. Besides, we add a discriminator to the shared encoder and employ adversarial training for the whole model to reinforce the performance of information separation and machine translation simultaneously. Experiment results show that our method can outperform competitive baselines greatly on multiple data sets.

연구 동기 및 목표

  • 풍부한 도메인 외 병렬 데이터를 활용하여 자원이 적은 도메인 내 신경 기계 번역 성능을 향상시키기 위해.
  • 도메인 외 데이터를 도메인 내 데이터와 직접 결합할 경우 과적합의 위험을 해결하기 위해.
  • 번역 프레임워크 내에서 도메인 간 공통 지식(공유됨)과 도메인 고유 지식(각 도메인에 고유함)을 명시적으로 모델링하기 위해.
  • 적대적 훈련을 통해 도메인 불변 및 도메인 특화 표현 간의 특징 분리(디센트레임트)를 향상시키기 위해.
  • 개선된 도메인 내 번역 성능를 위해 비공유 디코더의 추가 기여를 입증하기 위해.

제안 방법

  • 모델은 모든 도메인 간 도메인 불변 특징을 추출하기 위해 공유 인코더와 디코더를 사용하고, 각 도메인은 고유의 비공유 인코더와 디코더를 통해 도메인 특화 특징을 모델링한다.
  • 공유 인코더는 도메인 구분자와 함께 적대적 학습을 통해 도메인 불변 정보만을 추출하도록 훈련된다.
  • 각 도메인의 최종 번역 출력은 해당 도메인의 공유 디코더 출력과 비공유 디코더 출력을 조합하여 생성된다.
  • 공유 인코더와 구분자 간의 적대적 훈련을 통해 도메인 불변 표현 학습을 강제한다.
  • 모델은 RNN 기반(RNNSearch) 및 트랜스포머 기반 모델 모두에서 평가되어 다양한 NMT 아키텍처에 대한 일반화 능력을 입증한다.
  • t-SNE 시각화와 은닉 상태 좌표 분석을 통해 도메인 불변 및 도메인 특화 특징의 분리가 실험적으로 검증된다.

실험 결과

연구 질문

  • RQ1도메인 불변 및 도메인 특화 특징을 명시적으로 분리하면 도메인 내 신경 기계 번역 성능 향상에 기여하는가?
  • RQ2비공유 인코더 외에 비공유 디코더를 도입하면 비공유 인코더만을 갖는 모델보다 성능이 향상되는가?
  • RQ3공유 인코더에 대해 적용된 적대적 훈련이 도메인 불변 표현 학습을 효과적으로 강제하는가?
  • RQ4도메인 내 및 도메인 외 번역 성능 측면에서 이전의 미세조정 및 데이터 샘플링 기반 베이스라인과 비교해 볼 때, 제안된 방법은 어떤가?
  • RQ5모델의 특징 공간 분리 정도가 번역 품질 향상과 어느 정도 상관이 있는가?

주요 결과

  • 제안된 방법은 도메인 내 번역 성능에서 뚜렷한 향상을 이룩하였으며, 영어-중국어 및 영어-독일어 번역 작업 모두에서 미세조정 및 샘플링 기반 방법과 같은 강력한 베이스라인을 능가한다.
  • 트랜스포머 모델을 사용한 영어-중국어 번역 작업에서, 이 방법은 테스트 세트에서 BLEU 점수 37.26을 기록하여, 미세조정 기반 베이스라인(34.03)과 샘플링 방법(33.68)을 모두 초월한다.
  • 도메인 구분자가 없는 모델(’-DCN’)은 특징 분리를 잘 하지 못하여, t-SNE 시각화에서 서로 다른 도메인의 은닉 상태가 뚜렷이 겹쳐져 혼합된 도메인 정보가 포함되어 있음을 보여준다.
  • 완전한 모델을 사용할 경우, 도메인 내 및 도메인 외 은닉 상태 좌표 간 평균 거리는 21.3으로 감소하여 더 나은 도메인 분리와 효과적인 도메인 불변 표현 학습이 이루어졌음을 시사한다.
  • 이 방법은 도메인 외 번역 성능을 유지하거나 약간 향상시키며, 미세조정에서 관찰되는 치명적인 기억 상실 현상을 피한다. NIST 테스트 세트에서 BLEU 점수는 22.61로, 미세조정의 13.18보다 높다.
  • 제거 실험(ablation studies)는 비공유 디코더와 도메인 구분자가 성능 향상에 기여하는 데 중요한 역할을 함을 확인하여 설계 선택의 타당성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.