Skip to main content
QUICK REVIEW

[논문 리뷰] Better Datastore, Better Translation: Generating Datastores from Pre-Trained Models for Nearest Neural Machine Translation

Jiahuan Li, Shanbo Cheng|arXiv (Cornell University)|2022. 12. 17.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 k-NN 신경망 번역(k-NNMT)을 위한 보다 고급 품질의 데이터스토어를 생성하기 위해 사전 훈련된 모델(PTMs)을 활용하는 PRED라는 프레임워크를 제안한다. 이는 검색 정확도와 번역 성능을 향상시키며, NMT 모델 크기를 증가시키지 않으면서도 이중어 및 다중어 번역 벤치마크에서 기존 방법들을 능가한다.

ABSTRACT

Nearest Neighbor Machine Translation (kNNMT) is a simple and effective method of augmenting neural machine translation (NMT) with a token-level nearest neighbor retrieval mechanism. The effectiveness of kNNMT directly depends on the quality of retrieved neighbors. However, original kNNMT builds datastores based on representations from NMT models, which would result in poor retrieval accuracy when NMT models are not good enough, leading to sub-optimal translation performance. In this paper, we propose PRED, a framework that leverages Pre-trained models for Datastores in kNN-MT. Better representations from pre-trained models allow us to build datastores of better quality. We also design a novel contrastive alignment objective to mitigate the representation gap between the NMT model and pre-trained models, enabling the NMT model to retrieve from better datastores. We conduct extensive experiments on both bilingual and multilingual translation benchmarks, including WMT17 English $\leftrightarrow$ Chinese, WMT14 English $\leftrightarrow$ German, IWSLT14 German $\leftrightarrow$ English, and IWSLT14 multilingual datasets. Empirical results demonstrate the effectiveness of PRED.

연구 동기 및 목표

  • 낮은 품질의 데이터스토어가 초래하는 k-NNMT의 번역 성능 저하 문제를 해결하기 위해.
  • 사전 훈련된 모델(PTMs)의 뛰어난 표현을 활용하여 데이터스토어의 키-밸류(K-V) 일관성을 향상시키기 위해.
  • NMT 모델과 PTM가 생성한 데이터스토어 간의 표현 불일치를 새로운 대비 정렬 목적함수로 완화하기 위해.
  • NMT 모델 크기를 늘리지 않으면서도 검색 및 번역 품질 향상에 기여하면서 추론 효율성을 유지하기 위해.
  • 다양한 双어 및 다국어 번역 벤치마크에서 PTM 기반 데이터스토어 생성의 유효성을 입증하기 위해.

제안 방법

  • 강력한 사전 훈련된 모델(PTMs)의 표현을 사용하여 NMT 모델의 표현이 아닌 데이터스토어를 구성함으로써 더 높은 K-V 일관성을 달성하기 위해.
  • 추론 중에는 NMT 모델의 디코딩 상태를 쿼리로 사용하고, PTM 표현으로 구성된 데이터스토어에서 검색을 수행함.
  • NMT 모델의 쿼리 표현을 PTM가 생성한 데이터스토어의 해당 키들과 정렬하는 데 목적이 있는 대비 정렬 목적함수를 설계함.
  • 표현 분포의 이질성에도 불구하고 검색 관련성을 향상시키기 위해, 대비 목적함수를 포함한 엔드 투 엔드로 NMT 모델을 훈련함.
  • 추론 시 NMT와 k-NN 확률을 온도 조정된 가중 평균 융합을 통해 통합하며, PTM 기반 데이터스토어에서 검색된 값을 활용함.
  • 기존 NMT 아키텍처를 유지하고 데이터스토어 및 검색 프로세스만 수정함으로써 NMT 모델 크기의 증가를 방지함.

실험 결과

연구 질문

  • RQ1사전 훈련된 모델을 활용하여 데이터스토어 생성을 통해 k-NNMT에서 검색 정확도와 번역 품질을 크게 향상시킬 수 있는가?
  • RQ2NMT 모델과 사전 훈련된 모델 간의 표현 격차가 검색 성능에 미치는 영향은 무엇이며, 이를 효과적으로 완화할 수 있는가?
  • RQ3PTM가 생성한 데이터스토어가 NMT가 생성한 데이터스토어보다 더 높은 K-V 일관성을 보일 수 있는가?
  • RQ4쿼리와 키 표현이 서로 다른 모델에서 유래할 경우, 대비 정렬 목적함수가 검색 성능 향상에 기여하는가?
  • RQ5PRED는 다국어 및 双어 벤치마크에서 기존 k-NNMT 방법들을 능가하면서도 계산 효율성을 유지하는가?

주요 결과

  • PRED는 WMT17 영어↔중국어, WMT14 영어↔독어, IWSLT14 독어↔영어, 그리고 IWSLT14 다국어 번역 벤치마크에서 k-NNMT 및 기타 기준 방법들에 비해 일관된 성능 향상을 보였다.
  • WMT17 중국어↔영어 벤치마크에서 PRED는 BLEU 점수 32.1을 기록하여 가장 강력한 기준 방법보다 1.2 BLEU 포인트 높게 기록했다.
  • WMT14 영어↔독어 벤치마크에서 PRED는 k-NNMT보다 BLEU 점수를 1.0 향상시켜 자원이 적고 복잡한 번역 환경에서 뚜렷한 성과를 보였다.
  • 대비 정렬 목적함수는 특히 개인 대명사나 연결 동사처럼 유사하지만 상호 교환 불가능한 단어들에 대해 검색 정확도를 크게 향상시켰으며, 정성적 분석과 그림 6을 통해 이를 입증했다.
  • PRED는 k-NNMT와 동일한 NMT 모델 크기를 유지하여 추론 비용 증가 없이도 더 높은 번역 품질을 달성했다.
  • 제거 실험 결과, PTM 기반 데이터스토어 생성과 대비 목적함수 모두 성능 향상에 필수적이며, 둘 중 하나를 제거할 경우 BLEU 점수에 심각한 하락이 발생함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.