Skip to main content
QUICK REVIEW

[論文レビュー] Does BERT Solve Commonsense Task via Commonsense Knowledge

Leyang Cui, Sijie Cheng|arXiv (Cornell University)|Aug 10, 2020
Topic Modeling参考文献 30被引用数 19
ひとこと要約

この論文は、BERT が CommonSenseQA タスクを構造的共通知識によって解いているのか、浅い文法的パターンによって解いているのかを調査する。注目メカニズムを用いた分析により、BERT が ConceptNet からの構造的共通知識を捉え、微調整によって高層層でその知識の使用が強化されていることが示され、BERT における共通知識推論の深いつながりが裏付けられた。

ABSTRACT

The success of pre-trained contextualized language models such as BERT motivates a line of work that investigates linguistic knowledge inside such models in order to explain the huge improvement in downstream tasks. While previous work shows syntactic, semantic and word sense knowledge in BERT, little work has been done on investigating how BERT solves CommonsenseQA tasks. In particular, it is an interesting research question whether BERT relies on shallow syntactic patterns or deeper commonsense knowledge for disambiguation. We propose two attention-based methods to analyze commonsense knowledge inside BERT, and the contribution of such knowledge for the model prediction. We find that attention heads successfully capture the structured commonsense knowledge encoded in ConceptNet, which helps BERT solve commonsense tasks directly. Fine-tuning further makes BERT learn to use the commonsense knowledge on higher layers.

研究の動機と目的

  • BERT が CommonSenseQA タスクを、深いつながりのある共通知識によるものか、浅い文法的パターンによるものかを特定すること。
  • BERT の注目ヘッドが ConceptNet からの構造的共通知識をどのようにエンコード・利用しているかを分析すること。
  • 微調整が、ネットワークの高層層における BERT の共通知識の使用をどのように向上させるかを調査すること。
  • 共通知識が、共通知識タスクにおける BERT の予測性能にどの程度寄与しているかを定量化すること。

提案手法

  • BERT の注目ヘッド内に存在する共通知識の有無と寄与度を分析するための2つの注目ベースの手法を提案する。
  • CommonsenseQA タスクに関連する構造的共通知識を特定するために ConceptNet を活用する。
  • 注目活性化パターンを測定し、注目ヘッドが ConceptNet の関連する共通知識事実に注目しているかどうかを評価する。
  • 微調整前後での注目パターンを比較し、層ごとの知識利用の変化を評価する。
  • 注目ベースのプロービングを用いて、共通知識が予測意思決定に与える寄与度を隔離・定量化する。

実験結果

リサーチクエスチョン

  • RQ1推論中に、BERT の注目ヘッドは ConceptNet にエンコードされた構造的共通知識を捉え、活用しているか?
  • RQ2BERT の CommonSenseQA におけるパフォーマンスは、深いつながりのある共通知識によるものか、表面的な文法的パターンによるものか?
  • RQ3微調整は、ネットワークの異なる層における BERT の共通知識の使用にどのように影響するか?
  • RQ4共通知識は、BERT の予測の信頼性および正確性にどの程度寄与しているか?

主な発見

  • BERT の注目ヘッドは、ConceptNet にエンコードされた構造的共通知識を効果的に捉え、活用している。
  • モデルはこの知識を直接的に利用して共通知識推論タスクを解いているため、外部知識の深いつながりが示唆される。
  • 微調整により、特にネットワークの高層層で、共通知識の使用能力が向上している。
  • 注目パターンから、予測中に BERT が関連する共通知識事実を動的に注目していることが示され、知識に基づく推論が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。