[論文レビュー] Finding Experts in Transformer Models
本稿では、1,641の概念から成るOneSecデータセットから得たものとして、事前学習されたTransformerモデル内の「エキスパートユニット」——特定の概念を高い平均適合度で分類するニューロン——を同定・活用する手法を紹介する。エキスパートユニットの質はモデルの一般化性能と強く相関しており(R² = 0.833)、微調整を伴わずに上位エキスパートのみを活性化することで、概念条件付きのテキスト生成が可能となり、また、概念の共学習分析によって説明可能性が向上する。
In this work we study the presence of expert units in pre-trained Transformer Models (TM), and how they impact a model's performance. We define expert units to be neurons that are able to classify a concept with a given average precision, where a concept is represented by a binary set of sentences containing the concept (or not). Leveraging the OneSec dataset (Scarlini et al., 2019), we compile a dataset of 1641 concepts that allows diverse expert units in TM to be discovered. We show that expert units are important in several ways: (1) The presence of expert units is correlated ($r^2=0.833$) with the generalization power of TM, which allows ranking TM without requiring fine-tuning on suites of downstream tasks. We further propose an empirical method to decide how accurate such experts should be to evaluate generalization. (2) The overlap of top experts between concepts provides a sensible way to quantify concept co-learning, which can be used for explainability of unknown concepts. (3) We show how to self-condition off-the-shelf pre-trained language models to generate text with a given concept by forcing the top experts to be active, without requiring re-training the model or using additional parameters.
研究の動機と目的
- 事前学習されたTransformerモデルに特化したニューロン(エキスパートユニット)が存在するか、およびそれがモデル性能とどのように関係するかを調査すること。
- 微調整や追加パラメータを用いずにエキスパートユニットを同定・ランク付けする手法を開発すること。
- エキスパートユニットを用いて特定の概念に条件づけたテキスト生成をどのように行えるかを検討すること。
- エキスパートの重複を用いて概念の共学習を定量化し、モデルの説明可能性を向上させること。
- 多様な下流タスクにおいて、エキスパートユニットの質とモデル一般化性能の相関関係を確立すること。
提案手法
- 1,641の概念をOneSecデータセットから抽出し、それぞれを正例/負例の文のペア(バイナリ)として定義する。
- Transformerモデル内の個々のニューロンを候補となるエキスパートユニットとみなし、概念分類のための平均適合度(AP)を計算する。
- 系列長に依存しないように、トークンレベルのニューロン活性度に対して最大プーリングを適用する。
- エキスパートユニットをAPスコア順にランク付けし、上位エキスパートのAPの平均値を「概念専門性」として定義する。
- エキスパートの積(product of experts)の定式化を用い、ターゲット概念の上位エキスパートユニットのみを活性化することで、事前学習済み言語モデルを自己条件づける。
- 一般化性能との相関を最大化する最適な専門性しきい値(AP > 0.985)を経験的に特定する手法を提案する。
実験結果
リサーチクエスチョン
- RQ1事前学習されたTransformerモデルにエキスパートユニットは存在するのか? また、それらはモデル一般化性能とどのように相関するか?
- RQ2微調整や追加パラメータを用いずに、エキスパートユニットを用いて特定の概念に条件づけたテキスト生成が可能か?
- RQ3異なる概念間のエキスパート重複をどのように用いて、共学習の度合いを定量化・説明できるか?
- RQ4一般化性能との相関を最大化するためのエキスパート品質(AP)の最適しきい値は何か?
- RQ5下流タスクでの微調整を要せず、エキスパートユニットを用いてモデルをランク付け・比較できるか?
主な発見
- エキスパートユニットの質はモデル一般化性能と強く相関しており、GLUEおよびSQuADタスクにおける平均性能との間にR² = 0.833の相関が確認された。
- 一般化性能との相関を最大化するための最適なエキスパート品質しきい値はAP > 0.985であり、極めて高い適合度を持つエキスパートが強力な一般化性能を実現するために不可欠であることが示された。
- GPT-2-Lの微調整なしに、特定の概念(例:'football%1:04:00')を豊富に含むテキストを生成するためには、全ニューロンのうちたった0.012%(414,720個中上位50個)のエキスパートユニットを活性化するだけで十分であった。
- エキスパート間の重複は、共学習の度合いを意味的に測る指標として有効であり、関連する概念がモデル内でどのように表現されているかを説明可能にする。
- 微調整を伴わずモデルの比較・ランク付けが可能となり、下流タスクのバイアスやハイパーパramータ探索の必要が軽減された。
- エキスパート活性化による自己条件づけは、図1に示すように文脈的に適切なテキストを効果的に生成した。具体的には、'TM'がスポーツ的文脈で解釈され、'coach'と'shooting'が顕著に強調されている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。