Skip to main content
QUICK REVIEW

[논문 리뷰] Parallel Machine Translation with Disentangled Context Transformer

Jungo Kasai, James Cross|arXiv (Cornell University)|2020. 01. 15.
Natural Language Processing Techniques인용 수 23
한 줄 요약

이 논문은 주어진 참조 토큰의 임의의 부분집합에 조건을 두어 각 출력 토큰을 동시에 생성하는 비자기적 신경 기계 번역 모델인 분리된 컨텍스트(DisCo) 트랜스포머를 제안한다. 이는 어텐션 마스킹을 통해 컨텍스트의 분리된 표현을 가능하게 하며, 7개 번역 방향에서 번역 품질을 최고 수준으로 유지하면서도 디코딩 시간을 크게 단축시킨다.

ABSTRACT

State-of-the-art neural machine translation models generate a translation from left to right and every step is conditioned on the previously generated tokens. The sequential nature of this generation process causes fundamental latency in inference since we cannot generate multiple tokens in each sentence in parallel. We propose an attention-masking based model, called Disentangled Context (DisCo) transformer, that simultaneously generates all tokens given different contexts. The DisCo transformer is trained to predict every output token given an arbitrary subset of the other reference tokens. We also develop the parallel easy-first inference algorithm, which iteratively refines every token in parallel and reduces the number of required iterations. Our extensive experiments on 7 translation directions with varying data sizes demonstrate that our model achieves competitive, if not better, performance compared to the state of the art in non-autoregressive machine translation while significantly reducing decoding time on average. Our code is available at this https URL.

연구 동기 및 목표

  • 좌측에서 우측으로 토큰을 생성하는 방식으로 인해 발생하는 자율적 번역 모델의 지연 문제를 해결하기 위해.
  • 번역 품질을 희생시키지 않고 모든 출력 토큰을 동시에 생성할 수 있도록 하기 위해.
  • 각 출력 토큰이 참조 시퀀스의 다양한 부분집합에 조건을 두어 모델의 강건성과 일반화 능력을 향상시키기 위한 훈련 철학을 개발하기 위해.
  • 모든 토큰을 동시에 반복적으로 개선함으로써 수렴 속도를 가속화하는 효율적인 추론 알고리즘을 설계하기 위해.
  • 다양한 번역 방향과 데이터 크기에서 뛰어난 성능을 보이며, 정확성과 속도 면에서 기존 최고 수준의 비자기적 모델을 초월하거나 대체할 수 있음을 입증하기 위해.

제안 방법

  • 각 출력 토큰이 다른 참조 토큰의 임의의 부분집합에만 어텐션을 가질 수 있도록 하는 어텐션 마스킹 메커니즘을 제안하여, 분리된 컨텍스트 모델링을 가능하게 한다.
  • 모델을 훈련시켜 참조 시퀀스의 임의의 부분집합을 기반으로 각 출력 토큰을 예측하도록 함으로써, 부분적 컨텍스트에 대한 강건성을 향상시킨다.
  • 모든 토큰을 동시에 반복적으로 개선하는 병렬 쉬운 우선 추론 알고리즘을 설계하여, 필요한 디코딩 반복 수를 줄인다.
  • 분리된 컨텍스트 설정을 지원하기 위해 수정된 크로스 어텐션 메커니즘을 사용한 표준 트랜스포머 아키텍처를 사용한다.
  • 훈련 중에 컨텍스트 부분집합의 복잡도를 점진적으로 증가시키는 커리큘럼 학습 전략을 적용한다.
  • 표준 시퀀스-투-시퀀스 훈련 목표와 표준 토크나이제이션 및 정규화 방법을 사용하지만, 어텐션 마스킹 및 훈련 목표 설계에 집중한다.

실험 결과

연구 질문

  • RQ1비자기적 트랜스포머 모델이 모든 출력 토큰을 동시에 생성하면서도 경쟁 가능한 번역 품질을 달성할 수 있는가?
  • RQ2출력 토큰을 참조 토큰의 임의의 부분집합에 조건을 두는 방식이 모델의 강건성과 성능 향상에 어떤 영향을 미치는가?
  • RQ3제안된 병렬 쉬운 우선 추론 알고리즘이 기존 비자기적 또는 자율적 방법에 비해 디코딩 시간을 얼마나 줄이는가?
  • RQ4기존 비자기적 기준 모델과 비교해 복잡한 언어 쌍과 다양한 데이터 크기에서 모델의 성능은 어떠한가?
  • RQ5분리된 컨텍스트 메커니즘이 추론 중 일반화 능력 향상과 수렴 속도 향상에 기여하는가?

주요 결과

  • DisCo 트랜스포머는 7개 번역 방향에서 최고 수준의 비자기적 모델과 비교해 경쟁력 있거나 더 뛰어난 번역 성능을 달성한다.
  • 모델은 평균적으로 디코딩 시간을 크게 단축시켜 병렬 쉬운 우선 추론 전략의 효과를 입증한다.
  • 어텐션 마스킹 기반의 훈련 방식은 다양한 컨텍스트 부분집합을 사용해 각 출력 토큰을 강건하게 예측할 수 있도록 하여 일반화 능력을 향상시킨다.
  • 제한된 훈련 데이터 조건에서도 강력한 성능 유지를 보이며, 분리된 컨텍스트 설계에서 유도된 강력한 인덕티브 바이어스의 영향을 보여준다.
  • 병렬 추론 알고리즘은 모든 토큰을 동시에 효율적으로 개선함으로써 필요한 반복 수를 줄인다.
  • 다양한 언어 쌍에 걸쳐 잘 일반화되며, 주요 성능 저하 없이 추론 속도 향상이 일관되게 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.