Skip to main content
QUICK REVIEW

[논문 리뷰] Lattice-Based Transformer Encoder for Neural Machine Translation

Fengshun Xiao, Jiangtong Li|arXiv (Cornell University)|2019. 06. 04.
Natural Language Processing Techniques참고 문헌 49인용 수 9
한 줄 요약

이 논문은 신경 기계 번역(NMT)에서 트랜스포머 모델의 레이티스 기반 인코더를 제안하며, 여러 단어 또는 서브워드 분할을 통합하기 위해 레이티스 위치 인코딩(LPE)과 레이티스 인식 자기주의(모델링)(LSA)을 도입한다. 이 방법들은 조합 시 번역 성능을 0.91 BLEU 포인트 향상시키며, 파rameter 수 증가가 최소이고 훈련 효율성 손실가 중간 수준이어서, 단어 수준 및 서브워드 수준 표현 모두에서 효과적임을 입증한다.

ABSTRACT

Neural machine translation (NMT) takes deterministic sequences for source representations. However, either word-level or subword-level segmentations have multiple choices to split a source sequence with different word segmentors or different subword vocabulary sizes. We hypothesize that the diversity in segmentations may affect the NMT performance. To integrate different segmentations with the state-of-the-art NMT model, Transformer, we propose lattice-based encoders to explore effective word or subword representation in an automatic way during training. We propose two methods: 1) lattice positional encoding and 2) lattice-aware self-attention. These two methods can be used together and show complementary to each other to further improve translation performance. Experiment results show superiorities of lattice-based encoders in word-level and subword-level representations over conventional Transformer encoder.

연구 동기 및 목표

  • NMT에서 결정론적 분할의 한계로 인해 발생하는 소스 표현 다양성 제한 문제를 해결하기 위해.
  • 병렬 계산을 희생시키지 않고 트랜스포머 인코더에 여러 단어 또는 서브워드 분할을 통합하기 위해.
  • 트랜스포머의 자기주의 및 위치 인코딩과 호환되는 레이티스 인식 메커니즘을 개발하기 위해.
  • 레이티스 기반 방법의 효과성을 단어 수준 및 서브워드 수준 표현 모두에서 평가하기 위해.
  • 레이티스 통합을 통해 번역 품질을 향상시키면서도 훈련 효율성을 유지하기 위해.

제안 방법

  • 입력 시퀀스 내 상대적 순서에 따라 레이티스 간선에 위치 인코딩을 할당하기 위해 레이티스 위치 인코딩(LPE)을 제안한다.
  • 레이티스 간선 간의 구조적 관계를 고려하여 주의 분석 계산을 수정하는 레이티스 인식 자기주의(모델링)(LSA)를 도입한다.
  • 다양한 분할 가설을 방향성 간선으로 나타내는 레이티스 그래프 구조를 사용하여 분할 다양성을 유지한다.
  • 수정된 트랜스포머 아키텍처에서 훈련 안정성을 유지하기 위해 잔차 연결과 레이어 정규화를 적용한다.
  • 레이티스 내 장거리 위치 순서와 국소적 인접 정보를 모두 활용하기 위해 LPE와 LSA를 조합한다.
  • 레이티스 간선 간의 관계와 위치를 고려하여 수정된 주의 점수를 사용하는 표준 다중헤드 자기주의를 적용한다.

실험 결과

연구 질문

  • RQ1레이티스 기반 표현은 다양한 분할 선택을 포착함으로써 트랜스포머 기반 NMT를 향상시킬 수 있는가?
  • RQ2레이티스 구조는 트랜스포머의 자기주의 메커니즘에 효과적으로 통합될 수 있는가?
  • RQ3레이티스 위치 인코딩은 비선형 레이티스 구조에서 시퀀스 순서 모델링을 향상시키는가?
  • RQ4LPE와 LSA는 번역 성능 향상에 얼마나 잘 상호보완적인가?
  • RQ5레이티스 기반 방법은 번역 품질 향상과 함께 훈련 효율성을 유지할 수 있는가?

주요 결과

  • LPE와 LSA의 조합은 IWSLT2016 En-De 데이터셋에서 기준 트랜스포머를 초월하여 번역 성능을 0.91 BLEU 포인트 향상시켰다.
  • NIST Zh-En 데이터셋에서는 LPE만으로도 표준 위치 인코딩 대비 0.39 포인트 향상되었고, LSA는 0.23 포인트 향상되었다.
  • LPE+LSA 모델은 tst2014에서 BLEU 점수 30.28을 기록하였으며, 최고의 베이스라인 대비 통계적으로 유의미한 향상(p < 0.01)을 보였다.
  • 레이티스 기반 모델은 기준 트랜스포머 대비 뿐만 아니라 추가 파arameter 수가 6k에 불과하여 최소한의 파arameter 오버헤드를 보였다.
  • 훈련 속도는 0.714에서 0.328 스텝/초로 감소하여, 레이티스 복잡성에도 불구하고 중간 정도의 효율성 손실이 있었다.
  • 이 방법은 단어 수준 및 서브워드 수준 분할 모두에서 효과적이며, 광범위한 적용 가능성을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.