[論文レビュー] Probing Neural Language Models for Human Tacit Assumptions
本稿では、人間が抽出した概念的性質に基づく埋め込み文の診断プロンプトを用いて、BERT や RoBERTa といった文脈依存型ニューラル言語モデルが、人間のステレオタイプ的暗黙的仮定(STAs)—概念に関する無言の共通認識—を、タスク固有の微調整なしに大規模なテキストコーパスの露出から学習しているかどうかを調査する。モデルは関連する性質から正しい概念を効果的に抽出することができ、STAs がタスク固有の微調整を経ずに大規模なテキスト露出から生じることを示している。
Humans carry stereotypic tacit assumptions (STAs) (Prince, 1978), or propositional beliefs about generic concepts. Such associations are crucial for understanding natural language. We construct a diagnostic set of word prediction prompts to evaluate whether recent neural contextualized language models trained on large text corpora capture STAs. Our prompts are based on human responses in a psychological study of conceptual associations. We find models to be profoundly effective at retrieving concepts given associated properties. Our results demonstrate empirical evidence that stereotypic conceptual representations are captured in neural models derived from semi-supervised linguistic exposure.
研究の動機と目的
- ニューラル言語モデルが、大規模なテキストコーパスから、ステレオタイプ的暗黙的仮定(STAs)—つまり、概念に関する共通認識—を学習しているかどうかを調査すること。
- 『クマには毛があり、つめがあり、捕食者である』といった STAs が、人間の心理的規範に基づく語彙予測プロンプトから抽出可能かどうかを評価すること。
- BERT と RoBERTa が、知覚的性質と非知覚的性質の両面で STAs をどの程度捉えられるかを比較すること。
- モデルの予測が心理的研究における人間の反応とどの程度一致するかを評価し、体系的な差異を同定すること。
提案手法
- 心理的研究における人間が抽出した性質に基づいて、診断用の埋め込み文のプロンプトを構築する。
- 事前学習済みの文脈依存型言語モデル(BERT と RoBERTa)を用い、これらのプロンプト内のマスクされたトークンの予測を生成する。
- 平均平均精度(mAP)を用いて、関係(例:'has'、'is'、'has a' など)複数にわたるモデルのパフォーマンスを評価し、概念の再現率と性質の関連性に関する指標を用いる。
- 『誰もが知っているように』というフレーズを除去することで、プロンプト構築のアブレーションを行い、その影響がモデルの安定性とパフォーマンスに与える影響を評価する。
- モデルの出力と人間の反応を定性的に比較し、推論における重複と特異性を同定する。
- RoBERTa-L を主なモデルとして用い、そのパフォーマンスがプリンス自身の STA 例(例:'person' や 'country' に関するもの)をどの程度正しく捉えられるかを分析する。
実験結果
リサーチクエスチョン
- RQ1BERT や RoBERTa といった文脈依存型言語モデルは、人間が心理的研究で行うのと同様に、関連する性質のセットから正しい概念を抽出できるか?
- RQ2BERT と RoBERTa は、知覚的性質と非知覚的性質の両面で STAs をどの程度捉えられるか。特に、知覚的性質と非知覚的性質におけるパフォーマンスの差は何か?
- RQ3モデルの予測は、人間が抽出した規範とどの程度一致するか。また、体系的な差異は存在するか?
- RQ4プロンプトの語彙的フレーミングがモデルのパフォーマンスに顕著な影響を与えるか。また、異なるプロンプト構造間で予測はどの程度安定しているか?
- RQ5トレーニングデータに明示的に含まれていない STAs もモデルが捉えられるか。例えば、人間の反応にリストされていない感覚的性質(例:聴覚的性質)は?
主な発見
- RoBERTa は、BERT よりも一貫して優れたパフォーマンスを示し、'has' 関係において最大 0.3 mAP の差を示している。
- モデルは知覚的性質(例:視覚的、触覚的)よりも、非知覚的性質(例:機能的、百科事典的)に対して顕著に高いパフォーマンスを示しており、感覚的関連性を捉える能力に制限があることが示唆されている。
- 微調整なしでも、モデルは概念的に整合性があり、文法的に正しい完成形を生成しており、多くの予測は人間によって検証可能である。
- モデルは特異なバイアスを示しており、文脈に関係なく頻繁に 'has legs' や 'is dangerous' を予測するなど、一般化しすぎていることが判明した。
- 人間とモデルの反応には顕著な重複があり、両方向で共通する:モデルは、プロンプトに明示的に記載されていなくても、概念と関連する性質の両方を正しく予測している。
- モデル RoBERTa-L は、プリンス自身の 'person' や 'country' に関する STAs を高信頼度で捉えており、彼女のコアな仮定と一致する予測を出力している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。