[論文レビュー] Cracking the Contextual Commonsense Code: Understanding Commonsense Reasoning Aptitude of Deep Contextual Representations
本稿は、CSLB意味的規範データセットにおける属性分類を通じて、BERTの日常的知識の符号化能力を調査し、視覚的および知覚的属性における欠陥を明らかにした。視覚的および知覚的属性の欠陥を補うために、属性欠陥に基づくデータ選択による暗黙的ファインチューニングと、知識グラフ埋め込みの明示的統合の2つの手法を提案し、最小限のデータで2%の精度向上を達成。両手法を組み合わせることでMCScript 2.0で最大85.5%の精度を達成した。
Pretrained deep contextual representations have advanced the state-of-the-art on various commonsense NLP tasks, but we lack a concrete understanding of the capability of these models. Thus, we investigate and challenge several aspects of BERT's commonsense representation abilities. First, we probe BERT's ability to classify various object attributes, demonstrating that BERT shows a strong ability in encoding various commonsense features in its embedding space, but is still deficient in many areas. Next, we show that, by augmenting BERT's pretraining data with additional data related to the deficient attributes, we are able to improve performance on a downstream commonsense reasoning task while using a minimal amount of data. Finally, we develop a method of fine-tuning knowledge graphs embeddings alongside BERT and show the continued importance of explicit knowledge graphs.
研究の動機と目的
- BERTがGloVeのような非文脈的埋め込みと比較して、実態に基づく日常的知識属性をどの程度符号化しているかを評価すること。
- BERTの表現が依然として不足しているとされる特定の日常的知識属性タイプ、特に視覚的および知覚的特性を同定すること。
- データおよび知識拡張戦略を用いて、これらの不足を是正することで、BERTの下流タスクにおける日常的推論性能を向上させること。
- 暗黙的(データベース)および明示的(知識グラフ)な手法を組み合わせたアプローチが、文脈表現の向上にどの程度効果的であるかを評価すること。
提案手法
- CSLB意味的規範データセットのオブジェクト属性を予測するための論理回帰分類器を用いて、BERTの文脈的表現をプローブし、(オブジェクト, 属性)ペアを[CLS] c_prefix 名詞 c_affix 形容詞 c_postfix [SEP] の形式にフォーマットする。
- 特定の属性でBERTの性能が低かったことを理由に、RACEデータセットの例の最小サブセットを選択し、暗黙的ファインチューニングを実施することで、少ないデータで下流推論性能を向上させる。
- BERTのファインチューニング中に事前学習済みの知識グラフ埋め込み(ConceptNet, WebChild, ATOMIC)を統合し、欠落している日常的知識を明示的に注入する。
- 暗黙的RACEファインチューニングと明示的知識グラフ埋め込みの統合により、推論性能向上の補完的効果を活用する。
- 論理回帰分類器からの属性適合スコアを用いて、GloVeとBERTの両方が597の属性に対してどの程度特定の日常的特徴を符号化しているかを定量化する。
- MCScript 2.0の日常的推論ベンチマークで下流性能を評価し、属性プローブの結果と現実世界の推論向上を関連付ける。
実験結果
リサーチクエスチョン
- RQ1BERTの埋め込みは、視覚的、知覚的、機能的特性といった日常的知識属性をどの程度符号化しているか?
- RQ2BERTの文脈的表現において、どのタイプの日常的知識属性が不足しているか?
- RQ3RACEデータの最小サブセット(属性欠陥に基づく選択)でBERTをファインチューニングすることで、下流の日常的推論精度が向上するか?
- RQ4知識グラフ埋め込み(例:ConceptNet, ATOMIC)を統合することで、BERTの推論性能がさらに向上するか?
- RQ5暗黙的データベースファインチューニングと明示的知識グラフ統合を組み合わせることで、日常的推論に相乗効果が得られるか?
主な発見
- BERTはGloVeよりも顕著に優れた性能を示すが、視覚的および知覚的属性では依然として性能が低く、日常的知識符号化のギャップが継続していることが示された。
- 属性欠陥に基づいて選択されたRACEデータの最小サブセットでBERTをファインチューニングすることで、MCScript 2.0で2%の精度向上が達成され、全RACEデータセットを使用した場合と同等の性能を再現した。
- 知識グラフ埋め込みの統合により、下流精度が最大1.2ポイント向上し、特にConceptNetが最大の向上をもたらした(KBなし時82.1% vs. KBあり時83.3%)。
- RACEサブセットファインチューニングとすべての知識グラフ埋め込みを組み合わせることで、MCScript 2.0で最高の85.5%の精度を達成し、補完的向上効果が裏付けられた。
- 知識グラフ埋め込みによる向上は、データファインチューニングとは独立しており、両者を併用することで1%の絶対的向上が確認された。
- 意味的規範タスク(CSLB)は、不足している属性を特定するのに有効であり、この分析に基づくデータ選択により、最小限のデータで高い下流性能が達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。