[논문 리뷰] Analyzing Feed-Forward Blocks in Transformers through the Lens of Attention Maps
이 논문은 트랜스포머의 피드포워드(FF) 블록의 입력 컨텍스트화 효과를 시각화하고 분석하기 위해 주목적 맵 기반의 새로운 방법을 제안한다. 이는 서브워드-단어 및 다중어절 표현과 같은 특정 언어적 구성 요소를 증폭시킨다는 것을 드러낸다. 주요 발견은 FF 블록이 주목적 패턴을 크게 재구성하는 반면, 잔차 연결 및 정규화 레이어는 이러한 영향을 억제함으로써 트랜스포머의 내부 처리에서 부여가 존재할 수 있음을 시사한다.
Transformers are ubiquitous in wide tasks. Interpreting their internals is a pivotal goal. Nevertheless, their particular components, feed-forward (FF) blocks, have typically been less analyzed despite their substantial parameter amounts. We analyze the input contextualization effects of FF blocks by rendering them in the attention maps as a human-friendly visualization scheme. Our experiments with both masked- and causal-language models reveal that FF networks modify the input contextualization to emphasize specific types of linguistic compositions. In addition, FF and its surrounding components tend to cancel out each other's effects, suggesting potential redundancy in the processing of the Transformer layer.
연구 동기 및 목표
- 피드포워드(FF) 블록의 해석 가능성 부족 문제를 다루며, 이는 그들의 큰 파rameter 수와 모델 성능에서의 핵심적인 역할에도 불구하고 그렇다.
- FF 블록이 입력 컨텍스트화에 미치는 영향, 특히 언어적 구성과 토큰 간 관계와의 관련성에서 영향을 조사한다.
- 표준 주목적 메커니즘을 넘어서 FF 블록의 주목적 맵에 대한 영향을 캡처하는 시각화 방법을 개발한다.
- FF 블록과 주변 구성 요소(잔차 연결 및 정규화 레이어) 간의 상호작용이 중간 표현을 어떻게 형성하는지 조사한다.
- FF 블록의 영향을 분석함으로써 아키텍처의 부여와 잠재적인 모델 정리 기회에 대한 통찰을 제공한다.
제안 방법
- Kobayashi 등(2021)의 벡터 노름 기반의 기여도 방법을 확장하여, 입력 크기를 벡터 노름을 통해 FF 블록의 입력 컨텍스트화 효과를 캡처한다.
- 비선형성을 다루기 위해 통합 기울기 기법을 부분적으로 적용함으로써, 역전파 없이 기울기 유사 기여도를 가능하게 한다.
- 잔차 연결 및 정규화 레이어의 동역학과 함께 FF 블록의 출력 노름을 조합하여, FF 블록의 영향을 반영하는 주목적 맵를 계산한다.
- 역전파를 피하면서도 해석 가능성과 계산 효율성을 유지하기 위해 단순히 순방향 전파만을 사용한다.
- 특정 토큰 간 주목적 패턴에 대한 FF 블록의 영향을 시각화하며, 레이어 간 컨텍스트화 변화에 집중한다.
- 마스크된(BERT 등) 및 인과적(GPT-2 등) 언어 모델에 대해 계층별 분석을 수행하여 아키텍처 간 효과를 비교한다.
실험 결과
연구 질문
- RQ1피드포워드 블록은 주목적 맵에 반영된 바와 같이 트랜스포머에서 입력 컨텍스트화를 어떻게 수정하는가?
- RQ2다양한 모델 아키텍처에서 FF 블록은 어떤 유형의 언어적 구성 요소를 증폭하거나 억제하는가?
- RQ3잔차 연결 및 정규화 레이어는 동일 레이어 내에서 FF 블록의 영향을 어느 정도 억제하는가?
- RQ4다양한 모델 크기와 학습 시드에서 FF 블록의 행동에 일관된 패턴이 존재하는가?
- RQ5노름 기반 및 통합 기울기 기법을 사용하여 주목적 맵에 대한 FF 블록의 영향을 신뢰성 있게 시각화하고 기여도를 부여할 수 있는가?
주요 결과
- FF 블록은 FF 출력을 수정하거나 마스킹했을 때 주목적 맵 패턴에 뚜렷한 변화가 나타나는 것으로 나타나, 입력 컨텍스트화에 상당한 영향을 미친다.
- 특정 언어적 구성 요소—특히 서브워드-단어 및 다중어절 표현 구성—은 BERT와 GPT-2 모델 양쪽 모두에서 일관되게 FF 블록에 의해 증폭된다.
- 잔차 연결 및 정규화 레이어는 FF 블록의 영향을 억제하는 경향이 있어, 트랜스포머 레이어의 처리 과정에서 내재된 부여 형태가 존재할 수 있음을 시사한다.
- FF 출력 벡터의 크기와 주목적 맵의 변화 사이에 강한 상관관계가 있으며, 특히 깊은 레이어에서 그러한 경향이 두드러져, FF 출력 노름이 컨텍스트화 이동의 핵심 추진력임을 시사한다.
- 층별 정규화(LN) 가중치는 FF 블록의 입력/출력 벡터 노름과 강한 상관관계를 보이며, LN이 FF 영향을 조절하는 데 중심적인 역할을 한다는 것을 시사한다.
- 다양한 모델 변형(BERT-base, 다양한 시드 및 크기)에 대한 실험을 통해 일관된 FF 효과를 확인하였으며, 관측된 패턴이 아키텍처 및 학습 변형에 걸쳐 강인함을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.