Skip to main content
QUICK REVIEW

[論文レビュー] Designing and Interpreting Probes with Control Tasks

John Hewitt, Percy Liang|arXiv (Cornell University)|Sep 8, 2019
Topic Modeling参考文献 32被引用数 12
ひとこと要約

本論文は、言語的構造の真正な表現かどうか、あるいはプローブの記憶化に起因するかを評価するための制御タスク——語の品詞タイプから出力へのランダムマッピング——を導入する。その結果、ELMoにおける一般的に使われるMLPプローブは選択性が低く、単純な線形プローブの方が高い選択性を示す。これは、表現の質だけでなく、プローブの複雑さがプロービング結果に影響を及ける可能性を示唆する。

ABSTRACT

Probes, supervised models trained to predict properties (like parts-of-speech) from representations (like ELMo), have achieved high accuracy on a range of linguistic tasks. But does this mean that the representations encode linguistic structure or just that the probe has learned the linguistic task? In this paper, we propose control tasks, which associate word types with random outputs, to complement linguistic tasks. By construction, these tasks can only be learned by the probe itself. So a good probe, (one that reflects the representation), should be selective, achieving high linguistic task accuracy and low control task accuracy. The selectivity of a probe puts linguistic task accuracy in context with the probe's capacity to memorize from word types. We construct control tasks for English part-of-speech tagging and dependency edge prediction, and show that popular probes on ELMo representations are not selective. We also find that dropout, commonly used to control probe complexity, is ineffective for improving selectivity of MLPs, but that other forms of regularization are effective. Finally, we find that while probes on the first layer of ELMo yield slightly better part-of-speech tagging accuracy than the second, probes on the second layer are substantially more selective, which raises the question of which layer better represents parts-of-speech.

研究の動機と目的

  • プロービング結果の曖昧さを解消する:高い精度が表現内の言語的構造を反映しているのか、それともプローブの記憶化に起因するのかを特定すること。
  • 文脈とは無関係に語の品詞タイプにランダムな出力ラベルを割り当てるなど、プローブの能力を分離する制御タスクを提案すること。
  • 言語的タスクの精度と制御タスクの精度を組み合わせた選択性という診断指標を導入すること。
  • プローブアーキテクチャ、ハイパーパrameter、正則化がプロービング結果の選択性と解釈可能性に与える影響を評価すること。
  • ランダムベースラインを超えた解釈の枠組みを提供し、表現分析における信頼性を高めること。

提案手法

  • 文脈とは無関係に、各語の品詞タイプをランダムな出力ラベルにマッピングする制御タスクを定義し、非言語的記憶化を模倣する。
  • 言語的タスク(例:品詞タグ付け)と、同じ入出力空間を持つ対応する制御タスクを用いて、ELMo表現上にプローブを学習する。
  • 選択性を、言語的タスクの精度と制御タスクの精度の差分として測定し、高い選択性は表現構造との整合性が高いことを示す。
  • 表現力と記憶能力の比較のため、線形、双線形、および多層パーセプトロン(MLP)プローブを、複数のハイパーパrameter設定で用いる。
  • ドロップアウト、重み減衰、および隠れ層次元の削減といった正則化技術を適用し、それらが選択性に与える影響を評価する。
  • ELMoの各層およびランダム表現ベースラインと比較することで、相対的な選択性と解釈可能性を評価する。

実験結果

リサーチクエスチョン

  • RQ1高いプロービング精度は、表現内の言語的構造をどれほど反映しているのか、それともプローブの記憶化能力に起因するのか?
  • RQ2プローブアーキテクチャ(例:線形プローブ対MLP)がプロービングタスクにおける選択性に与える影響は?
  • RQ3ドロップアウトはMLPプローブにおける記憶化を効果的に抑えるのか、それとも不十分なのか?
  • RQ4異なる正則化手法は、ELMo表現上のMLPプローブの選択性にどのように影響するか?
  • RQ5選択性は、ELMoのレイヤー1とレイヤー2の間で、言語的表現力の相対的差異について何を示唆するか?

主な発見

  • 品詞タグ付けタスクにおいて、ELMo上に学習されたMLPプローブは言語的精度97.3%を達成したが、制御タスク精度も92.8%に達し、選択性はわずか4.5にとどまり、強い記憶化能力が示された。
  • 線形プローブは言語的精度97.2%、制御タスク精度71.2%を記録し、選択性は26.0に達した。MLPのわずかな精度上昇は、言語的符号化の向上ではなく、表現力の向上に起因している可能性がある。
  • ドロップアウトはMLPプローブにおける選択性を一貫して向上させず、この文脈では記憶化の制御に効果的でないことが示された。
  • より小さな隠れ層次元(例:10ユニット)、少ない訓練データ、重み減衰は、MLPにおける選択性向上に効果的な正則化戦略である。
  • 言語的精度は類似していたが、ELMoのレイヤー2はレイヤー1よりも著しく高い選択性を示し、どちらのレイヤーが品詞情報をよりよく符号化しているかに疑問を呈する。
  • ELMo2はランダム表現ベースラインと同程度の品詞タグ付け精度を達成したが、はるかに高い選択性を示した。これは、ELMo2がベースラインよりもより多くの言語的構造を符号化している可能性を示唆する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。