Skip to main content
QUICK REVIEW

[논문 리뷰] Enriching Non-Autoregressive Transformer with Syntactic and SemanticStructures for Neural Machine Translation

Ye Liu, Yao Wan|arXiv (Cornell University)|2021. 01. 22.
Natural Language Processing Techniques참고 문헌 28인용 수 4
한 줄 요약

이 논문은 신경 기계 번역을 위한 비자기적 Transformer인 SNAT를 제안한다. 이 모델은 번역 품질과 효율성을 향상시키기 위해 문법적(POS) 및 의미적(NER) 구조 레이블을 통합한다. 구조적 지침과 중간 잠재 대응을 통합함으로써, 자기적 Transformer보다 9.3배 빠른 디코딩을 달성하면서 WMT14 En-De 및 WMT16 En-Ro에서 최신 비자기적 모델과 동등하거나 이를 초월하는 BLEU 점수를 기록한다.

ABSTRACT

The non-autoregressive models have boosted the efficiency of neural machine translation through parallelized decoding at the cost of effectiveness when comparing with the autoregressive counterparts. In this paper, we claim that the syntactic and semantic structures among natural language are critical for non-autoregressive machine translation and can further improve the performance. However, these structures are rarely considered in the existing non-autoregressive models. Inspired by this intuition, we propose to incorporate the explicit syntactic and semantic structures of languages into a non-autoregressive Transformer, for the task of neural machine translation. Moreover, we also consider the intermediate latent alignment within target sentences to better learn the long-term token dependencies. Experimental results on two real-world datasets (i.e., WMT14 En-De and WMT16 En-Ro) show that our model achieves a significantly faster speed, as well as keeps the translation quality when compared with several state-of-the-art non-autoregressive models.

연구 동기 및 목표

  • 비자기적 및 자기적 NMT 모델 간의 성능 격차를 극복하기 위해 문법적 및 의미적 구조를 통합한다.
  • 명시적인 구조적 지도를 통해 비자기적 디코딩의 다모드 문제를 완화한다.
  • 디코더 레이어에서의 중간 잠재 대응을 통해 장거리 의존성 모델링을 향상시킨다.
  • 번역 품질을 희생시키지 않고 고속 추론을 달성한다.

제안 방법

  • 모델은 입력 토큰과 함께 POS/NER 태그를 입력으로 받아 인코더가 문법적 및 의미적 구조에 주의를 기울일 수 있도록 한다.
  • 문법적 및 의미적 구조 레이블은 임bedding 처리되어 단어 임베딩에 연결되어 디코더를 안내한다.
  • 디코더 레이어 간의 어텐션 맵과 타겟 토큰 간의 정규화를 통해 중간 잠재 대응을 도입하여 장기 의존성을 모델링한다.
  • 표준 크로스 엔트로피 손실과 대응 정규화를 조합한 다중 작업 학습 목표를 사용한다.
  • 표준 Transformer 구성 요소(다중 헤드 어텐션, 피드포워드 네트워크 등)를 사용하여 엔드 투 엔드로 훈련 가능한 아키텍처를 구현한다.
  • WMT14 En-De 및 WMT16 En-Ro에서 평가되며, 구조 사용 및 대응 레이어에 대한 추론 분석도 실시된다.

실험 결과

연구 질문

  • RQ1비자기적 Transformer에 POS 및 NER 태그를 통합하면 번역 품질이 향상되는가?
  • RQ2디코더 레이어 간의 중간 잠재 대응은 장거리 의존성 모델링에 어떤 영향을 미치는가?
  • RQ3제안된 모델은 최신 비자기적 모델과 비교해 성능을 향상시키면서도 고속을 유지하는가?
  • RQ4특히 긴 문장에서 모델의 성능은 어떻게 되는가?

주요 결과

  • SNAT는 배치 크기가 1인 WMT14 En-De에서 자기적 Transformer보다 9.3배 빠른 속도를 기록하면서도 경쟁력 있는 BLEU 점수를 유지한다.
  • POS 태그 통합은 WMT14 En-De에서 BLEU 점수를 1.37포인트 향상시키며, NER 태그 통합은 1.25포인트 향상시키며, 문법적 및 의미적 지도의 가치를 입증한다.
  • 중간 대응을 위해 세 번째 레이어 표현(Z³)을 사용할 경우 기준 모델 대비 최고의 향상(+1.46 BLEU)을 기록한다.
  • SNAT는 문장 길이에 관계없이 안정적인 성능을 유지하며, 길이 ≤10일 땐 BLEU 28.67에서 길이 >100일 땐 17.69로 약간 감소할 뿐이며, 일반적인 NAT는 급격히 성능이 떨어지는 것과 대비된다.
  • WMT14 En-De에서 SNAT는 Z³ 및 POS/NER 태그를 모두 사용해 BLEU 24.57을 기록하며, 속도와 정확도 면에서 여러 최신 비자기적 NAT 모델을 능가한다.
  • SNAT는 DCRF-NAT보다 빠르면서도 더 높은 번역 품질을 달성하여 효율성과 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.