[논문 리뷰] Addressing Some Limitations of Transformers with Feedback Memory
논문은 Feedback Transformer를 소개한다. 이 모델은 공유 피드백 메모리를 통해 모든 과거 표현을 미래의 계산에 접근 가능하게 만들어 얕은 모델이 언어 모델링, 번역, 강화 학습에서 Transformer와 대등하거나 이를 능가하도록 하며, 더 빠른 디코딩과 더 작은 메모리 사용량을 제공한다.
Transformers have been successfully applied to sequential, auto-regressive tasks despite being feedforward networks. Unlike recurrent neural networks, Transformers use attention to capture temporal relations while processing input tokens in parallel. While this parallelization makes them computationally efficient, it restricts the model from fully exploiting the sequential nature of the input. The representation at a given layer can only access representations from lower layers, rather than the higher level representations already available. In this work, we propose the Feedback Transformer architecture that exposes all previous representations to all future representations, meaning the lowest representation of the current timestep is formed from the highest-level abstract representation of the past. We demonstrate on a variety of benchmarks in language modeling, machine translation, and reinforcement learning that the increased representation capacity can create small, shallow models with much stronger performance than comparable Transformers.
연구 동기 및 목표
- 표준 Transformer가 자기회귀 시퀀스 모델링에서 가지는 한계를 동기화하고 해결한다.
- 과거의 높은 수준 표현을 재사용하여 현재 스텝을 계산하는 메모리 기반 Feedback Transformer를 도입한다.
- 얕은 Feedback Transformer가 더 빠른 디코딩과 감소된 메모리 사용으로 강력한 성능을 달성함을 증명한다.
- 언어 모델링, 기계 번역, 강화 학습 벤치마크에서 평가한다.
- 피드백 메모리의 이점을 확립하기 위해 순환 구조 및 다른 Transformer 변형과 비교한다.
제안 방법
- 시간 t에서 모든 레이어의 표현을 모아 학습 가능한 가중치 w^l와 소프트맥스 정규화를 사용해 메모리 벡터 m_t를 생성한다: m_t = sum_l Softmax(w^l) x_t^l.
- 메모리 m_t를 대상으로 어텐트를 수행하도록 자기-어텐션 입력을 하위 레이어 출력뿐만 아니라 메모리 m_t에 의존하도록 바꾼다: z_t^l = Attn(x_t^l, {m_{t-τ}, ..., m_{t-1}}).
- 모든 레이어에서의 키와 밸류 프로젝션을 공유하여 k_t^l = k_t = W_k m_t 이고 v_t^l = v_t = W_v m_t가 되게 하여 메모리와 계산을 줄인다.
- 모든 레이어의 과거 표현을 매 시점 하나의 피드백 메모리로 합쳐 매개변수 수를 w^l 외에는 늘리지 않고 재귀적 계산을 가능하게 한다.
- 생성 시점에는 순차적 계산을 유지하되 학습 중에는 메모리 공유를 통한 하드웨어 친화적 병렬성의 이점을 얻는다.
- 더 작은 Feedback Transformer가 얕은 디코더와 큰 인코더를 가진 번역에서 강력한 결과를 달성하고, 메모리 및 속도 특성이 개선됨을 보여준다.
실험 결과
연구 질문
- RQ1피드백 메모리를 통해 과거의 모든 표현을 미래의 계산에 노출하는 것이 표준 Transformer에 비해 자기회귀 모델링을 개선할 수 있는가?
- RQ2피드백 Transformer가 더 작고 얕은 네트워크로 효과적인 재귀 계산 및 장기 상태 추적을 가능하게 하는가?
- RQ3피드백 Transformer가 언어 모델링, 번역, 강화 학습 과제에서 순환 모델 및 다른 Transformer 변형과 비교하여 어떤 차이를 보이는가?
- RQ4피드백 Transformer에서 공유 키-값 프로젝션을 적용할 때의 메모리 및 속도 트레이드는 무엇인가?
- RQ5피드백 메커니즘이 실제 설정에서 디코딩 속도와 학습 효율에 어떤 영향을 미치는가?
주요 결과
- 피드백 Transformer는 표준 Transformer에 비해 얕은 아키텍처로도 번역 및 언어 과제에서 성능을 유지하거나 향상시킨다.
- 키/밸류 프로젝션의 공유는 메모리 사용량을 줄이고 학습 및 추론 속도를 높이며 특히 얕은 디코더에서 더 빠른 디코딩을 가능하게 한다.
- 긴 맥락 과제와 RL에서 피드백 모델은 한정된 메모리로도 성능을 유지하고 표준 Transformer보다 상태 추적이 더 우수한 것으로 나타난다.
- 이 아키텍처는 WMT En-De, WikiText-103과 같은 표준 벤치마크에서 더 작은 파라미터 수로 순환 모델과 특정 Transformer 혼합 모델을 능가할 수 있다.
- 피드백 메모리는 재귀적 계산을 가능하게 하여 시점마다 표현을 반복적으로 다듬을 수 있게 하지만 모델 깊이는 증가시키지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.