Skip to main content
QUICK REVIEW

[논문 리뷰] Accessing Higher-level Representations in Sequential Transformers with Feedback Memory.

Angela Fan, Thibaut Lavril|arXiv (Cornell University)|2020. 02. 21.
Topic Modeling참고 문헌 13인용 수 7
한 줄 요약

피드백 트랜스포머는 각 레이어가 이전 타임스텝의 고수준 표현에 액세스할 수 있도록 하는 피드백 메모리 메커니즘을 도입하여, 표준 트랜스포머를 초월하는 순차적 모델링을 가능하게 한다. 이 아키텍처는 더 풍부한 문맥 표현을 활용함으로써 언어 모델링, 기계 번역, 요약, 강화 학습 벤치마크 전반에서 성능을 향상시킨다.

ABSTRACT

Transformers are feedforward networks that can process input tokens in parallel. While this parallelization makes them computationally efficient, it restricts the model from fully exploiting the sequential nature of the input - the representation at a given layer can only access representations from lower layers, rather than the higher level representations already built in previous time steps. In this work, we propose the Feedback Transformer architecture that exposes all previous representations to all future representations, meaning the lowest representation of the current timestep is formed from the highest-level abstract representation of the past. We demonstrate on a variety of benchmarks in language modeling, neural machine translation, summarization, and reinforcement learning that the increased representation capacity can improve over Transformer baselines.

연구 동기 및 목표

  • 표준 트랜스포머가 하위 레이어 표현에 단방향으로 액세스하기 때문에 순차적 종속성을 완전히 활용하지 못하는 한계를 해결하기 위해.
  • 미래 토큰이 과거 토큰들로부터 추상적이고 고수준의 표현에 액세스할 수 있도록 하여 표현 능력을 향상시키기 위해.
  • 언어 모델링, 기계 번역, 요약, 강화 학습과 같은 순차적 작업에서의 성능 향상을 위해.
  • 고수준 표현에서 온 피드백이 자동회귀 모델에서 더 효과적인 문맥 표현을 이끌 수 있는지 탐색하기 위해.

제안 방법

  • 피드백 트랜스포머는 이전 타임스텝의 고수준 표현을 저장하고 검색하는 피드백 메모리 메커니즘을 도입한다.
  • 각 타임스텝에서 모델은 현재 토큰의 표현과 과거 타임스텝들 중 최고 수준의 표현을 학습 가능한 피드백 게이트를 통해 결합한다.
  • 피드백 메커니즘은 최하위 레이어가 이전 입력들로부터 추상적이고 문맥적으로 풍부한 표현에 액세스할 수 있도록 하여 문맥 이해를 향상시킨다.
  • 표준 트랜스포머의 병렬 계산 이점을 유지하면서도, 메모리 보강형 어텐션 메커니즘을 통해 순차적 피드백을 추가한다.
  • 피드백 게이트는 미분 가능하며 종단 간 훈련이 가능하여 모델이 언제이고 어떻게 과거 고수준 표현에 주목할지를 학습할 수 있다.

실험 결과

연구 질문

  • RQ1고수준 표현에서 온 피드백이 자동회귀 모델의 순차적 작업에서 성능을 향상시킬 수 있는가?
  • RQ2과거 타임스텝들로부터의 고수준 표현 노출이 표현 품질과 모델 일반화에 어떤 영향을 미치는가?
  • RQ3피드백 트랜스포머가 다양한 NLP 및 강화 학습 벤치마크에서 표준 트랜스포머를 능가하는가?
  • RQ4피드백이 모델이 장거리 의존성을 파악하는 데 미치는 영향은 무엇인가?

주요 결과

  • 피드백 트랜스포머는 여러 언어 모델링 벤치마크에서 최고 성능을 기록하여 더 나은 생성 품질과 낮은 퍼플렉서티를 입증했다.
  • 신경 기계 번역에서, 모델은 WMT와 IWSLT 벤치마크 모두에서 표준 트랜스포머를 능가했으며, 더 강한 일반화 능력을 보였다.
  • 개괄적 요약 작업에서는 피드백 트랜스포머가 더 높은 ROUGE 점수를 기록하여 요약문의 사실적 일관성과 구조적 일관성이 향상되었음을 시사했다.
  • 강화 학습 작업에서는 피드백에서 유도된 향상된 상태 표현 덕분에 모델이 더 효율적인 정책을 학습했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.