Skip to main content
QUICK REVIEW

[논문 리뷰] Positional Encoding to Control Output Sequence Length

Sho Takase, Naoaki Okazaki|arXiv (Cornell University)|2019. 04. 16.
Topic Modeling참고 문헌 17인용 수 9
한 줄 요약

이 논문은 Transformer의 사인파 위치 인코딩을 확장하여 목표 길이까지의 거리를 인코딩함으로써 출력 시퀀스 길이를 제어하는 길이에 의존하는 위치 인코딩(LDPE 및 LRPE)을 제안한다. 이 방법은 정밀한 길이 제어를 가능하게 하며, 훈련 중에 볼 수 없었던 길이에 대해서도 ROUGE 점수를 향상시킨다. 헤드라인 생성 작업에서 이전 방법들을 능가한다.

ABSTRACT

Neural encoder-decoder models have been successful in natural language generation tasks. However, real applications of abstractive summarization must consider additional constraint that a generated summary should not exceed a desired length. In this paper, we propose a simple but effective extension of a sinusoidal positional encoding (Vaswani et al., 2017) to enable neural encoder-decoder model to preserves the length constraint. Unlike in previous studies where that learn embeddings representing each length, the proposed method can generate a text of any length even if the target length is not present in training data. The experimental results show that the proposed method can not only control the generation length but also improve the ROUGE scores.

연구 동기 및 목표

  • 개념 요약을 위한 신경망 인코더-디코더 모델에서 길이 제어의 부재를 해결하기 위해.
  • 훈련 데이터에 존재하지 않는 길이를 포함하여 임의의 목표 길이를 가진 요약어를 생성할 수 있도록 하기 위해.
  • 헤드라인 생성에서 길이 정밀도와 요약 품질(ROUGE 점수)을 동시에 향상시키기 위해.
  • 목표 길이까지의 잔여 길이 또는 길이 비율을 연속적이고 미분 가능한 방식으로 인코딩하는 방식으로 사인파 위치 인코딩을 확장하기 위해.

제안 방법

  • Transformer의 사인파 위치 인코딩을 목표 길이를 학습 가능한 입력으로 포함시켜 길이 차이(LDPE) 및 길이 비율(LRPE) 인코딩을 생성한다.
  • LDPE는 현재 위치와 목표 길이의 차이를 인코딩하여, 같은 잔여 길이를 가진 경우 동일한 값을 보장한다.
  • LRPE는 현재 위치와 목표 길이의 비율을 인코딩하여, 유사한 상대적 진행도를 가진 다양한 길이에 대해 일반화할 수 있다.
  • 수정된 위치 인코딩은 디코더 입력 레이어의 토큰 임베딩에 더해지며, 추론 중 표준 위치 인코딩을 대체한다.
  • 훈련 중에는 참조 요약어의 진짜 길이가 목표 길이로 사용되며, 추론 중에는 원하는 길이가 지정된다.
  • 이 방법은 연속적인 길이 표현을 사용하여 재훈련 없이도 새로운 길이에 일반화할 수 있다.

실험 결과

연구 질문

  • RQ1길이 전용 임베딩이 필요하지 않은 채로, 위치 인코딩을 확장하여 Transformer의 출력 시퀀스 길이를 제어할 수 있는가?
  • RQ2훈련 데이터에 드물게 또는 전혀 존재하지 않는 길이를 가진 요약어도 고급 품질로 생성할 수 있는가?
  • RQ3종료 위치까지의 거리를 고려한 방법이 기준 방법에 비해 길이 정밀도와 ROUGE 점수를 향상시키는가?
  • RQ4LenEmb, LenInit, LC와 같은 이전 방법들과 비교해 볼 때, 제안된 방법은 길이 제어 및 생성 품질 측면에서 어떻게 성능을 냈는가?

주요 결과

  • LDPE는 일본어 테스트 세트에서 목표 길이 30과 50일 때 길이 제어가 가장 정밀했으며, 분산이 0.00이었다.
  • 제안된 방법은 목표 길이가 훈련 데이터에서 제외된 경우에도 높은 ROUGE 점수를 유지하여, 새로운 길이에 대한 일반화 능력을 보였다.
  • DUC-2004 영문 테스트 세트에서 LDPE 및 LRPE는 순수한 Transformer와 이전 기준 방법들을 크게 능가하는 ROUGE 점수를 기록했으며, LRPE+PE+재정렬 기반 방법은 최신 기술 수준을 초월했다.
  • 매우 짧은 헤드라인(len=30)의 경우, 제안된 방법은 ROUGE-2 점수를 약간 낮추었지만, 이는 기준 모델의 본래 짧은 요약어 생성 능력 때문이지 방법 자체의 실패가 아니었다.
  • 일본어에서 len=10일 때 생성된 길이와 목표 길이 간 평균 절대 차이가 오직 0.1에 불과하여 높은 정밀도를 보였다.
  • 소스 단어 겹침 기반 재정렬이 요약어 품질을 향상시켰으며, Transformer+LRPE+PE+재정렬 방법이 DUC-2004에서 가장 높은 ROUGE 점수를 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.