[論文レビュー] Perturbed Masking: Parameter-free Probing for Analyzing and Interpreting BERT
本稿では、マスクされたトークンの予測に対する語の摂動の影響を測定することによって、BERTの言語的表現を分析するパラメータフリーなプロービング手法「Perturbed Masking」を提案する。2段階のマスキングと距離指標を用いた相互影響の計算により、ベースラインを上回り、人間が設計したスキーマでさえも上回る構文的従属木を回復する。これは追加のパラメータを用いずに、BERTの内在的な構文的知識を露呈するものである。
By introducing a small set of additional parameters, a probe learns to solve specific linguistic tasks (e.g., dependency parsing) in a supervised manner using feature representations (e.g., contextualized embeddings). The effectiveness of such probing tasks is taken as evidence that the pre-trained model encodes linguistic knowledge. However, this approach of evaluating a language model is undermined by the uncertainty of the amount of knowledge that is learned by the probe itself. Complementary to those works, we propose a parameter-free probing technique for analyzing pre-trained language models (e.g., BERT). Our method does not require direct supervision from the probing tasks, nor do we introduce additional parameters to the probing process. Our experiments on BERT show that syntactic trees recovered from BERT using our method are significantly better than linguistically-uninformed baselines. We further feed the empirically induced dependency structures into a downstream sentiment classification task and find its improvement compatible with or even superior to a human-designed dependency schema.
研究の動機と目的
- 追加のモデルパラメータに依存するプロービング手法における曖昧さを解消すること。これは、タスク固有の知識を捉える可能性があるため、事前学習済みモデルの表現そのものとは異なる。
- 追加のパラメータや教師ありラベルを導入せずに、BERTの内部表現を直接プローブするパラメータフリーの手法を開発すること。
- マスク言語モデルの動作のみを用いて、特に従属木を含むグローバルな言語的構造を抽出すること。
- 誘導された構文的構造が下流NLPタスクの性能を向上させるかどうかを、ベースラインおよび人間が設計したスキーマと比較して評価すること。
- 従来のプロービング研究の補完的で、追加のパラメータを有する教師あり分類器に依存する、非教師ありの検証を提供すること。
提案手法
- 本手法は2段階のマスキングを実行する:まず、ターゲットトークン $x_i$ を [MASK] でマスクし、次に同じ文脈で文脈語 $x_j$ をマスクして、$x_i$ の表現の変化を観察する。
- $x_j$ が $x_i$ に与える影響は、距離関数 $f(x_i, x_j) = d(H_{\theta}(\mathbf{x}\setminus\{x_i\})_i, H_{\theta}(\mathbf{x}\setminus\{x_i,x_j\})_i)$ を用いて定量化される。ここで $d$ はユークリッド距離またはトークン予測確率の差異のいずれかである。
- 2つの距離指標を評価する:Dist(隠れ表現間のユークリッド距離)とProb($x_i$ の予測確率の差異)。
- 得られた影響行列を用いて、強い影響関係を段階的に選択する貪欲アルゴリズムにより従属木を推定する。
- 本手法は構文解析およびディコースト・従属解析に適用され、言語学的に無知なベースラインおよび人間が設計したスキーマと比較される。
- 誘導された従属構造は、下流のセンチメント分類タスクでさらに評価され、その実用的価値が検証される。
実験結果
リサーチクエスチョン
- RQ1パラメータフリーのプロービング手法は、追加のモデルパラメータや教師ありラベルを導入せずに、BERTから意味的な構文的構造を抽出できるか?
- RQ2Perturbed Maskingが誘導する従属木は、単純なベースラインと比較して、言語学者が定義した構文的構造とどの程度整合しているか?
- RQ3Perturbed Maskingによって学習された構文的構造は、人間が設計した従属スキーマと比較して、下流NLPタスクの性能を向上させるか?
- RQ4マスク言語モデルからの影響行列は、BERTに埋め込まれた真の構文的従属関係をどの程度反映しているか?
- RQ5本手法は、ディコースト構造のようなグローバルな言語的性質を露わにできるか。これはBERTが長距離シーケンスモデリングを可能としていることを示唆する。
主な発見
- Perturbed Maskingを用いて回復された構文木は、右枝付きや左枝付き構造といった言語学的に無知なベースラインを著しく上回る性能を示す。
- 誘導された従属構造は、下流のセンチメント分類タスクで人間が設計した従属スキーマと同等またはそれ以上の性能を達成する。
- 本手法は、BERTが非教師ありで、かつパラメータフリーな方法で豊富な構文的知識をエンコードしていることを示しており、その構文的能力の下限推定値を提供する。
- 2段階のマスキングから導出された影響行列は、中間表現ではなくモデル出力から生じるが、アテンション機構と類似した相互単語相関を効果的に捉えている。
- 本手法は、BERTの自己教師あり事前学習が、構文を明示的に学習させないままに、実用的に役立つ内在的な構文的構造を生成していることを示している。
- 本手法はディコーストレベルの従属解析にも成功し、BERTが文単位の構文を越えて長距離依存関係をモデル化できることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。