[論文レビュー] Don't Judge a Language Model by Its Last Layer: Contrastive Learning with Layer-Wise Attention Pooling
本稿では、固定されたプーリング(例:最終層)に依存するのではなく、すべての層にわたる特徴を適応的に重み付けすることで、事前学習言語モデル(PLM)における文表現学習を改善する階層別アテンションプーリングを提案する。このアテンション機構を用いた対照的学習により、文書類似度と意味的検索のタスクで最先端の性能を達成しており、推論時にアテンション層を削除しても固定プーリング戦略を上回っている。
Recent pre-trained language models (PLMs) achieved great success on many natural language processing tasks through learning linguistic features and contextualized sentence representation. Since attributes captured in stacked layers of PLMs are not clearly identified, straightforward approaches such as embedding the last layer are commonly preferred to derive sentence representations from PLMs. This paper introduces the attention-based pooling strategy, which enables the model to preserve layer-wise signals captured in each layer and learn digested linguistic features for downstream tasks. The contrastive learning objective can adapt the layer-wise attention pooling to both unsupervised and supervised manners. It results in regularizing the anisotropic space of pre-trained embeddings and being more uniform. We evaluate our model on standard semantic textual similarity (STS) and semantic search tasks. As a result, our method improved the performance of the base contrastive learned BERT_base and variants.
研究の動機と目的
- 事前学習言語モデルの各層にわたる多様な言語的特徴を捉えるために、固定プーリング戦略(例:最終層や平均プーリング)の限界を是正すること。
- 階層別アテンションプーリングが、PLMの複数の層からのタスク関連信号をよりよく保持・統合できるかを検討すること。
- 提案されたプーリング戦略が、教師ありおよび教師なしの対照的学習目的の両方で有効であるかを評価すること。
- 推論コストを増加させることなく、アテンション層を分離しても意味的検索性能が向上することを示すこと。
- 既存のInfoNCEベースの対照的学習手法を上回る、タスクに依存しない学習可能なプーリング機構を確立すること。
提案手法
- 各層の[CLS]トークン表現と平均トークン表現の整合性に基づいて、層の重要度スコアを計算する乗法的アテンション機構を提案する。
- 学習可能なクエリ、キー、バリューの投影を用いて、各層のアテンション重みαiを計算し、層固有の特徴を動的に重み付け可能にする。
- 重み付き表現を式(2)に従って層全体で重み付き和で集約し、その後式(3)に従って重み付き表現のグローバル平均を計算する。
- 最後の層の[CLS]表現と集約された階層別表現を連結し、最終的な文表現を生成するための学習可能なMLPを通過させる(式(4)~(5))。
- 基本的な教師あり対照的学習、自己教師あり対照的学習、ハイブリッド手法の3つの対照的学習スキームにこのプーリング戦略を適用する。
- 類似した文のペアを近づけ、類縁のないペアを遠ざけるためにInfoNCE損失を用いてモデルを訓練し、埋め込み空間がより一様で、非均質的にならないように正則化する。
実験結果
リサーチクエスチョン
- RQ1学習可能な階層別アテンションプーリング機構は、[CLS]や平均プーリングといった固定プーリング戦略を上回る性能を示せるか?
- RQ2階層別アテンションプーリングを用いた対照的学習は、標準的手法と比較して、より一様で非均質的でない文の埋め込みを生成するか?
- RQ3提案されたプーリング戦略は、文書類似度(STS)および意味的検索タスクの両方で、推論コストを増加させることなく性能を向上させられるか?
- RQ4推論時にアテンション機構を削除しても、階層別アテンションプーリングによる性能向上が維持されるか?
- RQ5提案手法は、既存の最先端の文の埋め込み用対照的学習モデルと比較して、どのように性能を発揮するか?
主な発見
- 対照的学習を組み合わせた提案された階層別アテンションプーリングは、STS-Bテストセットでスピアマンの順位相関係数86.76を達成し、[CLS] Last + AVG Last連結(85.11)を含むすべてのベースライン固定プーリング戦略を上回った。
- Quoraの重複質問データセットでは、RoBERTa largeを用いた場合、階層別アテンションプーリングで学習したモデルがMRR@10で66.32を達成したのに対し、ベースラインは65.85であり、メモリ使用量は同一で、リtrieval時間も短縮された。
- 推論時にアテンション層を削除しても、階層別アテンションプーリングで学習したモデルはベースラインを上回った。これは、学習済み表現の有効性を示している。
- アブレーションスタディの結果、すべての層の[CLS]と平均アテンションを組み合わせた(LayerAttPooler(CLS All + AVG All attention))戦略が最も高い性能(STS-Bで86.57)を示し、最後の層の[CLS]と連結することでさらに向上(86.76)した。
- この手法により、埋め込み空間の非均質性が低減され、一様性が向上した。これは対照的学習目的の観点から裏付けられ、一般化性能の向上に寄与した。
- 同じパラメータ数でより低い遅延を実現し、意味的検索性能が向上した。これは、本手法がより効率的かつ正確なリtrievalを可能にしていることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。