Skip to main content
QUICK REVIEW

[論文レビュー] Revisiting Over-smoothing in BERT from the Perspective of Graph

Han Shi, Jiahui Gao|arXiv (Cornell University)|Feb 17, 2022
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

本稿では、BERTにおけるレイヤー正規化が標準偏差が大きい場合に表現を低ランク部分空間へと駆り込むことで過剰平滑化を引き起こすことを明らかにし、異なる層からの特徴を適応的に統合する階層的統合戦略を提案する。この戦略により、GLUE、SWAG、SQuADベンチマークで一貫した性能向上が達成された。

ABSTRACT

Recently over-smoothing phenomenon of Transformer-based models is observed in both vision and language fields. However, no existing work has delved deeper to further investigate the main cause of this phenomenon. In this work, we make the attempt to analyze the over-smoothing problem from the perspective of graph, where such problem was first discovered and explored. Intuitively, the self-attention matrix can be seen as a normalized adjacent matrix of a corresponding graph. Based on the above connection, we provide some theoretical analysis and find that layer normalization plays a key role in the over-smoothing issue of Transformer-based models. Specifically, if the standard deviation of layer normalization is sufficiently large, the output of Transformer stacks will converge to a specific low-rank subspace and result in over-smoothing. To alleviate the over-smoothing problem, we consider hierarchical fusion strategies, which combine the representations from different layers adaptively to make the output more diverse. Extensive experiment results on various data sets illustrate the effect of our fusion method.

研究の動機と目的

  • グラフニューラルネットワークの視点から、BERTにおける過剰平滑化の根本的要因を調査すること。
  • レイヤー正規化が変換ベースモデルにおける過剰平滑化を引き起こす理論的役割を分析すること。
  • 複数層の表現を統合することでトークン類似度を低減し、過剰平滑化を緩和する階層的統合戦略を開発すること。
  • 理論的発見を実証的に検証し、標準的なNLPベンチマークにおける性能向上を示すこと。

提案手法

  • 自己注意行列を重み付きグラフの正規化隣接行列としてモデル化し、BERTとグラフ畳み込みネットワークを結びつける。
  • 理論的に、レイヤー正規化の標準偏差が十分に大きい場合、出力が低ランク部分空間に収束し、過剰平滑化が生じることを証明する。
  • 異なる層からの表現を適応的に統合するための3つの統合戦略—連結統合、最大統合、ゲート統合—を提案する。
  • 入力トークンに応じて各層からの表現に重要度重みを動的に割り当てる学習可能なゲートメカニズムを用いる。
  • コサイン類似度と性能指標を用いて、事前学習済みBERTおよび微調整済みモデルにおける理論的条件を実証的に検証する。
  • 注意重みとトークン類似度の可視化により、過剰平滑化の低減と表現多様性の向上を示す。

実験結果

リサーチクエスチョン

  • RQ1グラフ理論的視点から、BERTにおける過剰平滑化の背後にある根本的要因は何か?
  • RQ2レイヤー正規化は、変換モデルにおける過剰平滑化現象にどのように寄与しているか?
  • RQ3多層表現統合は、トークン類似度を効果的に低減し、モデル性能を向上させることができるか?
  • RQ4連結、最大、ゲートといった異なる統合戦略は、多様なNLPベンチマークで一貫した改善をもたらすか?
  • RQ5動的統合重みはトークンごとにどのように変化し、意味的重要性と整合性を示すか?

主な発見

  • 十分に大きな標準偏差を持つレイヤー正規化は、BERTの出力が低ランク部分空間に収束させ、過剰平滑化を引き起こす。
  • 実証的分析により、実際の事前学習済みおよび微調整済みBERTモデルにおいて、過剰平滑化の理論的条件が成立していることが確認された。
  • 提案されたゲート統合戦略が最良の性能を示し、GLUE(例:SQuAD v1.1でF1 +0.5)、SWAG(82.1%の正確度)、SQuAD v2.0(F1 77.3%)において、BERTベースラインを上回った。
  • 特にSTS-Bにおいて、統合手法を用いることで最終層のトークンごとのコサイン類似度が低下し、過剰平滑化の低減が示された。
  • 可視化により、意味的価値の高いトークン(例:'women'、'fish')は深層の表現を好むのに対し、一般的な語(例:'is'、'a')は浅層の表現を好む傾向が明らかになった。
  • 階層的統合戦略は、テキスト分類、常識的推論、質問応答といった多様なNLPタスクで一貫した性能向上を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。