Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Learning for Context-aware Neural Machine TranslationUsing Coreference Information

Yongkeun Hwang, Hyungu Yun|arXiv (Cornell University)|2021. 09. 13.
Natural Language Processing Techniques참고 문헌 28인용 수 7
한 줄 요약

이 논문은 핵심 참조 정보를 활용하여 문맥에 민감한 신경 기계 번역 모델의 성능을 향상시키기 위한 대비 학습 프레임워크인 CorefCL을 제안한다. 문맥 문장 내 핵심 참조 표현을 단어 생략 및 교체를 통해 손상시켜 대비 예제를 생성함으로써, 다양한 문서 수준 번역 작업에서 번역 품질(BLEU)과 핵심 참조 해석 정확도를 향상시킨다.

ABSTRACT

Context-aware neural machine translation (NMT) incorporates contextual information of surrounding texts, that can improve the translation quality of document-level machine translation. Many existing works on context-aware NMT have focused on developing new model architectures for incorporating additional contexts and have shown some promising results. However, most existing works rely on cross-entropy loss, resulting in limited use of contextual information. In this paper, we propose CorefCL, a novel data augmentation and contrastive learning scheme based on coreference between the source and contextual sentences. By corrupting automatically detected coreference mentions in the contextual sentence, CorefCL can train the model to be sensitive to coreference inconsistency. We experimented with our method on common context-aware NMT models and two document-level translation tasks. In the experiments, our method consistently improved BLEU of compared models on English-German and English-Korean tasks. We also show that our method significantly improves coreference resolution in the English-German contrastive test suite.

연구 동기 및 목표

  • 기존의 문맥 인식 NMT 모델이 주로 교차 엔트로피 손실에 의존하여 문맥 정보를 제한적으로 활용하는 문제를 해결한다.
  • 데이터 증강 및 대비 학습 기반의 방법을 도입하여 문장 간 핵심 참조 일관성 문제에 대한 모델의 강건성을 향상시킨다.
  • 학습 데이터에 오라클 핵심 참조 애너테이션을 필요로 하지 않고도 번역 품질과 핵심 참조 해석 성능을 동시에 향상시킨다.
  • 다양한 아키텍처와 데이터셋(저자원 및 고자원 설정 포함)에서 모델에 종속되지 않는 성능 향상을 입증한다.
  • 핵심 참조 손상 전략(단어 생략 및 교체)이 핵심 참조 민감도 작업에서의 모델 일반화 능력을 향상시키는 데 얼마나 효과적인지 조사한다.

제안 방법

  • 사전 학습된 핵심 참조 해석 시스템을 사용하여 원본 문장과 문맥 문장 간 핵심 참조 표현을 자동으로 탐지한다.
  • 단어 생략 및 단어 교체 전략을 통해 문맥 문장 내 핵심 참조 표현을 손상시켜 대비 예제를 생성한다.
  • 원본 및 손상된 예제를 구분하도록 유도하는 최대 마진 대비 손실을 적용하여 문맥 일관성 문제에 대한 민감도를 향상시킨다.
  • 아키텍처 변경 없이 표준 문맥 인식 NMT 모델(예: 다중 인코더, 히에라르키컬 모델)에 대비 학습 목표를 통합한다.
  • 표준 교차 엔트로피 손실과 제안된 대비 손실을 조합하여 엔드 투 엔드로 모델을 훈련시켜 번역 및 핵심 참조 일관성 최적화를 동시에 달성한다.
  • WMT, IWSLT, OpenSubtitles, 그리고 웹 크롤링을 통해 확보한 영한 데이터셋을 포함한 다수의 문서 수준 번역 벤치마크에서 방법을 평가한다.

실험 결과

연구 질문

  • RQ1핵심 참조 기반 데이터 증강과 대비 학습이 표준 교차 엔트로피 훈련을 초월하여 문맥 인식 NMT 성능을 향상시킬 수 있는가?
  • RQ2제안된 CorefCL 방법은 ContraPro와 같은 전용 대비 벤치마크에서 핵심 참조 해석 성능에 어떻게 영향을 미치는가?
  • RQ3CorefCL의 성능 향상 정도가 손상 전략의 선택(단어 생략 대비 교체)에 얼마나 의존하는가?
  • RQ4CorefCL은 WMT와 OpenSubtitles 간 도메인 이탈이 발생하는 상황에서도 다양한 모델 아키텍처와 도메인 전환에 대해 일반화되는가?
  • RQ5CorefCL은 영한 자막과 같은 저자원 번역 작업에서 성능 향상에 기여하는가?

주요 결과

  • 모든 평가 작업에서 CorefCL은 BLEU 점수를 일관되게 향상시키며, WMT에서는 최대 1.5 BLEU 포인트, OpenSubtitles에서는 최대 2.1 BLEU 포인트 향상되었다.
  • ContraPro 영독어 대비 핵심 참조 벤치마크에서 CorefCL은 기준 모델 대비 대명사 해석 정확도를 최대 5.5%p 향상시켰다.
  • 제거 실험 결과, 단어 생략과 교체 전략을 모두 사용할 경우 성능이 가장 우수했으며, 특히 단어 교체 전략이 정확도 향상에 더 크게 기여했다.
  • IWSLT 및 영한 작업에서의 뚜렷한 성능 향상은 CorefCL이 저자원 환경에서 강력한 정규화 기법으로 작용함을 시사한다.
  • WMT 데이터셋(OpenSubtitles와의 도메인 이탈이 예상됨)에서도 CorefCL은 ContraPro 정확도를 3.1%p 향상시켜 분포 이질성에 대한 강건성을 입증했다.
  • 정성적 예시를 통해 CorefCL은 핵심 참조 일관성이 중요한 경우 성별을 고려한 대명사 번역(예: 'It'을 여성성 대명사 'Sie'가 아닌 남성성 대명사 'Er'로 번역)을 정확히 수행하도록 모델을 유도함을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.