[論文レビュー] Knowledge-Augmented Language Models for Cause-Effect Relation Classification
本稿では、ATOMIC²⁰およびGLUCOSEから自動的に抽出された日常的知識を用いて、BERTおよびRoBERTaを継続的微調整することで、因果関係分類の性能を向上させる知識拡張型事前学習フレームワークを提案する。モデル構造の変更や高品質な微調整データの強化なしに、COPA、BCOPA-CE、TCRベンチマークで顕著な性能向上を達成し、RoBERTa-LargeはCOPAテストで85.7%の正確度を達成した。
Previous studies have shown the efficacy of knowledge augmentation methods in pretrained language models. However, these methods behave differently across domains and downstream tasks. In this work, we investigate the augmentation of pretrained language models with commonsense knowledge in the cause-effect relation classification and commonsense causal reasoning tasks. After automatically verbalizing ATOMIC2020, a wide coverage commonsense reasoning knowledge graph, and GLUCOSE, a dataset of implicit commonsense causal knowledge, we continually pretrain BERT and RoBERTa with the verbalized data. Then we evaluate the resulting models on cause-effect pair classification and answering commonsense causal reasoning questions. Our results show that continually pretrained language models augmented with commonsense knowledge outperform our baselines on two commonsense causal reasoning benchmarks, COPA and BCOPA-CE, and the Temporal and Causal Reasoning (TCR) dataset, without additional improvement in model architecture or using quality-enhanced data for fine-tuning.
研究の動機と目的
- 事前学習言語モデルにおける日常的知識の統合が因果関係分類に与える影響を調査すること。
- 自動的に言語化された知識を用いた継続的微調整が、因果推論ベンチマークでの性能に与える影響を評価すること。
- アーキテクチャの変更や高品質な微調整データなしに、知識拡張が性能向上をもたらすことを実証すること。
- 再現可能性およびコミュニティ利用を目的として、コードとモデルを公開すること。
提案手法
- 人間が読みやすいテンプレートを用いて、ATOMIC²⁰の知識グラフに含まれる三項対を自然言語文に変換する。
- 変更を加えた因果接続語テンプレートを用いて、GLUCOSEの暗黙的因果知識を自然言語に変換する。
- マスク言語モデル学習を用いて、言語化された日常的知識上でBERTおよびRoBERTaを継続的微調整する。
- 得られたモデルを、因果関係ペアデータセットにおけるゼロショットまたはフェイントショット分類に適用する。
- 追加の微調整や損失関数の変更なしに、COPA、BCOPA-CE、TCRベンチマークで性能を評価する。
- ベースライン性能がランダムに近い場合に、プロンプト工学(例:「それは〜だからである」や「その結果、」など)を適用して性能を向上させる。
実験結果
リサーチクエスチョン
- RQ1自動的に言語化された日常的知識を用いた継続的微調整が、事前学習言語モデルにおける因果関係分類に効果をもたらすか?
- RQ2ATOMIC²⁰およびGLUCOSEからの知識拡張は、標準的な微調整と比較して因果推論ベンチマークでどのように性能を発揮するか?
- RQ3性能向上は、難易度の高い例や暗黙的因果関係を含むタスクにおいても持続的か?
- RQ4T5-11Bのような大規模モデルに比べ、BERT-Largeのような小規模モデルが知識拡張型事前学習により競争力のある結果を達成できるか?
- RQ5プロンプト工学は、曖昧なまたは暗黙的な因果関係推論タスクでさらに性能向上をもたらすか?
主な発見
- GLUCOSEの言語化データで微調整したRoBERTa-Largeは、COPAテストで85.7%の正確度を達成し、ベースラインのRoBERTa-Large(74.1%)を上回り、パrameter数が少ないにもかかわらずT5-11B(94.8%)を上回る正確度を記録した。
- GLUCOSEで拡張されたRoBERTa-Largeモデルは、COPAのハードスプリットで83.3%の正確度を達成し、ベースラインのRoBERTa-Large(70.2%)を顕著に上回り、困難な例に対しても頑健であることが示された。
- ATOMIC²⁰で拡張されたRoBERTa-Largeモデルは、イベント関連関係のみで微調整した場合でもCOPAで84.9%の正確度を達成し、日常的知識のサブセットでさえ性能向上をもたらすことを示した。
- BCOPA-CEでは、プロンプト工学を適用したGLUCOSEで拡張されたRoBERTa-Largeモデルが66.1%の正確度を達成し、HanとWang(2021)のb-l-augおよびb-l-regモデルを上回った。
- 知識拡張型モデルは、アーキテクチャの変更や追加の微調整データなしにTCRデータセットでベースラインを上回り、日常的知識を用いた継続的微調整の有効性を確認した。
- 研究者はコードとモデルを公開し、再現可能性および知識拡張型因果推論分野におけるさらなる研究を促進した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。