Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Over-smoothing in BERT from the Perspective of Graph

Han Shi, Jiahui Gao|arXiv (Cornell University)|2022. 02. 17.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 레이어 정규화가 표준편차가 클 경우 표현을 낮은 질량의 부분공간으로 이끌어 과도하게 부드러워지는 현상(over-smoothing)을 유도함을 밝혀내며, 이 문제를 완화하기 위해 다양한 레이어의 특징을 적응적으로 융합하는 계층적 융합 전략을 제안한다. 이 전략은 GLUE, SWAG, SQuAD 벤치마크에서 일관된 성능 향상을 이룬다.

ABSTRACT

Recently over-smoothing phenomenon of Transformer-based models is observed in both vision and language fields. However, no existing work has delved deeper to further investigate the main cause of this phenomenon. In this work, we make the attempt to analyze the over-smoothing problem from the perspective of graph, where such problem was first discovered and explored. Intuitively, the self-attention matrix can be seen as a normalized adjacent matrix of a corresponding graph. Based on the above connection, we provide some theoretical analysis and find that layer normalization plays a key role in the over-smoothing issue of Transformer-based models. Specifically, if the standard deviation of layer normalization is sufficiently large, the output of Transformer stacks will converge to a specific low-rank subspace and result in over-smoothing. To alleviate the over-smoothing problem, we consider hierarchical fusion strategies, which combine the representations from different layers adaptively to make the output more diverse. Extensive experiment results on various data sets illustrate the effect of our fusion method.

연구 동기 및 목표

  • BERT의 과도한 부드러움 현상이 그래프 신경망 관점에서 근본 원인을 탐구한다.
  • 레이어 정규화가 트랜스포머 기반 모델에서 과도한 부드러움을 유도하는 이론적 역할을 분석한다.
  • 다양한 레이어의 표현을 융합하여 토큰 유사도를 감소시키고 과도한 부드러움을 완화하는 계층적 융합 전략을 개발한다.
  • 이론적 발견을 실증적으로 검증하고 표준 NLP 벤치마크에서 향상된 성능을 입증한다.

제안 방법

  • 자기어텐션 행렬을 가중치가 부여된 그래프의 정규화된 인접 행렬로 모델링하여 BERT를 그래프 컬러리션 네트워크와 연결한다.
  • 이론적으로 표준편차가 충분히 클 경우 출력이 낮은 질량 부분공간으로 수렴하여 과도한 부드러움이 발생함을 증명한다.
  • 다양한 레이어의 표현을 적응적으로 융합하기 위해 세 가지 융합 전략—Concat Fusion, Max Fusion, Gate Fusion—을 제안한다.
  • 입력 토큰에 따라 각 레이어의 표현에 중요도 가중치를 동적으로 할당하는 학습 가능한 게이트 메커니즘을 사용한다.
  • 사전학습된 BERT 및 미세조정된 모델에서 이론적 조건을 코사인 유사도 및 성능 지표를 통해 실증적으로 검증한다.
  • 주의 히트맵과 토큰 유사도를 시각화하여 과도한 부드러움 감소와 표현 다양성 향상을 입증한다.

실험 결과

연구 질문

  • RQ1그래프 이론적 관점에서 BERT의 과도한 부드러움 현상의 근본 원인은 무엇인가?
  • RQ2레이어 정규화는 트랜스포머 모델에서 과도한 부드러움 현상에 어떻게 기여하는가?
  • RQ3다중 레이어 표현 융합 전략은 토큰 유사도를 효과적으로 감소시키고 성능을 향상시킬 수 있는가?
  • RQ4다양한 NLP 벤치마크에서 Concat, Max, Gate 등의 융합 전략이 일관되게 성능 향상을 이끌 수 있는가?
  • RQ5다양한 토큰에서 동적 융합 가중치는 어떻게 변화하며, 이는 의미적 중요도와 일치하는가?

주요 결과

  • 충분히 큰 표준편차를 가진 레이어 정규화는 BERT 출력이 낮은 질량 부분공간으로 수렴하게 하여 과도한 부드러움을 유도한다.
  • 실증 분석을 통해 과도한 부드러움의 이론적 조건이 실제 사전학습 및 미세조정된 BERT 모델에 그대로 적용됨을 확인하였다.
  • 제안된 게이트 융합 전략이 가장 뛰어난 성능을 보였으며, GLUE(예: SQuAD v1.1에서 +0.5 F1), SWAG(82.1% 정확도), SQuAD v2.0(77.3% F1)에서 BERT 기준선을 초월하였다.
  • 특히 STS-B에서 융합 전략을 사용할 경우 최종 레이어에서 토큰 간 코사인 유사도가 감소하여 과도한 부드러움 감소가 확인되었다.
  • 시각화 결과, 높은 의미적 가치를 지닌 토큰(예: 'women', 'fish')은 깊은 레이어 표현을 선호하는 반면, 일반 단어(예: 'is', 'a')는 浅층 레이어 표현을 선호하는 경향을 보였다.
  • 계층적 융합 전략은 텍스트 분류, 공상 추론, 질의 응답 등 다양한 NLP 작업에서 일관되게 성능 향상을 이룬다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.