Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space

Mor Geva, Avi Caciularu|arXiv (Cornell University)|2022. 03. 28.
Topic Modeling인용 수 11
한 줄 요약

이 논문은 트랜스포머 언어 모델의 피드포워드 네트워크(FFN) 레이어가 어휘 공간 내에서 토큰 표현에 덧셈 업데이트를 적용함으로써 예측을 구성함을 밝혀냈습니다. 여기서 각 업데이트는 '대명사' 또는 '아침 식사'와 같은 인간이 이해할 수 있는 개념에 해당합니다. 저자들은 FFN 출력을 개별 파라미터 벡터에 의해 유도되는 부분 업데이트로 분해함으로써 해석 가능성을 확보하였으며, 이는 GPT-2의 독성 수준을 거의 50% 감소시키고, 초기 종료 규칙을 통해 20%의 계산량 절감을 달성합니다.

ABSTRACT

Transformer-based language models (LMs) are at the core of modern NLP, but their internal prediction construction process is opaque and largely not understood. In this work, we make a substantial step towards unveiling this underlying prediction process, by reverse-engineering the operation of the feed-forward network (FFN) layers, one of the building blocks of transformer models. We view the token representation as a changing distribution over the vocabulary, and the output from each FFN layer as an additive update to that distribution. Then, we analyze the FFN updates in the vocabulary space, showing that each update can be decomposed to sub-updates corresponding to single FFN parameter vectors, each promoting concepts that are often human-interpretable. We then leverage these findings for controlling LM predictions, where we reduce the toxicity of GPT2 by almost 50%, and for improving computation efficiency with a simple early exit rule, saving 20% of computation on average.

연구 동기 및 목표

  • 트랜스포머 기반 언어 모델의 피드포워드 네트워크(FFN) 레이어가 예측 구성에 어떻게 기여하는지 이해한다.
  • 현대 NLP 모델에서 핵심이지만 다소 간과된 FFN 연산의 투명성 문제를 해결한다.
  • FFN 업데이트를 출력 어휘 공간 내의 특정 개념 촉진 메커니즘으로 간주할 수 있는 방법을 개발한다.
  • 부분 업데이트 조작을 통해 독성 완화 및 계산 효율성 향상과 같은 실용적 응용을 가능하게 한다.
  • 개별 FFN 파라미터 벡터 수준에서 트랜스포머 내부의 세밀한 제어 및 해석 가능성을 제공하는 프레임워크를 마련한다.

제안 방법

  • FFN 출력을 어휘 공간 상의 표현에 대한 덧셈 업데이트로 재구성하며, 표현을 어휘에 대한 분포로 간주한다.
  • 각 FFN 업데이트를 두 번째 FFN 행렬의 개별 열(벡터)에 해당하는 부분 업데이트로 분해한다. 이를 '값 벡터(valued vectors)'라 칭한다.
  • 각 값 벡터를 어휘 공간 내 특정 인간이 이해할 수 있는 개념을 촉진하는 것으로 해석하며, 수동 애너테이션을 통해 검증한다.
  • 예측 과정을 개념 촉진 업데이트의 순차적 조합으로 모델링하며, 최종 출력 분포가 누적된 부분 업데이트 효과에서 유도됨을 설명한다.
  • 주도적인 부분 업데이트를 초기 종료 신호로 사용하여 충분한 신뢰도에 도달했을 때 예측을 조기에 종료함으로써 계산량을 절감한다.
  • 특정 값 벡터의 가중치를 수정하여 간섭을 가함으로써 모델 생성을 원하는 행동(예: 독성 감소)으로 유도한다.

실험 결과

연구 질문

  • RQ1트랜스포머 모델의 FFN 레이어는 출력 어휘 공간에서 최종 예측을 어떻게 구성하는가?
  • RQ2개별 FFN 파라미터 벡터(값 벡터)가 특정 인간이 이해할 수 있는 개념을 촉진하는 것으로 간주될 수 있는가?
  • RQ3FFN 업데이트가 낮은 확률의 토큰을 억제하는 것보다 높은 확률의 토큰을 촉진하는 데 얼마나 의존하는가?
  • RQ4FFN 레이어의 부분 업데이트를 활용하여 모델 행동을 제어할 수 있는가(예: 생성 텍스트의 독성 감소)?
  • RQ5주도적인 부분 업데이트가 초기 종료에 신뢰할 수 있는 신호로 기능할 수 있는가? 이는 계산 효율성을 향상시키는 데 기여하는가?

주요 결과

  • FFN 레이어는 토큰 표현에 덧셈 업데이트를 적용하며, 이는 출력 어휘에 대한 확률 분포의 이동으로 해석할 수 있다.
  • 각 FFN 업데이트는 개별 값 벡터에 의해 유도되는 부분 업데이트로 분해되며, 각각은 '대명사' 또는 '아침 식사'와 같이 명확한 인간 해석 가능한 개념을 촉진한다.
  • 예측 과정은 토큰 촉진에 의해 지배된다: 출력에서 높은 확률을 가지는 토큰들은 다수의 부분 업데이트에 의해 강하게 영향을 받는다.
  • GPT-2에서 단지 10개의 부분 업데이트에 대한 가중치를 증가시킴으로써 생성 텍스트의 독성을 거의 50% 감소시킬 수 있었다.
  • 주도적인 부분 업데이트는 초기 종료에 강력한 신호를 제공하며, 정확도 손실이 크지 않은 조건에서 평균 20%의 계산량 절감을 가능하게 한다.
  • 값 벡터의 개별 해석 가능성은 그 조합보다 높으며, 이는 개별 값 벡터를 고립적으로 분석하는 것이 모델의 해석 가능성에 있어 유망한 첫 단계임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.