Skip to main content
QUICK REVIEW

[論文レビュー] Teaching Pre-Trained Models to Systematically Reason Over Implicit Knowledge.

Alon Talmor, Oyvind Tafjord|arXiv (Cornell University)|Jun 11, 2020
Topic Modeling参考文献 37被引用数 13
ひとこと要約

本論文では、事前学習された言語モデルが重みに埋め込まれた暗黙的知識と明示的な記号的事実の両方に対して体系的かつ体系的に推論できるように訓練する手法を提案する。主な貢献は、モデルが、チェーンニング、カウント、分類的推論などの複雑で構成的な推論を学習することを示したことである。これは、学習分布を超えて、1つの例で複数の推論スキルを組み合わせる一般化を達成している。

ABSTRACT

To what extent can a neural network systematically reason over symbolic facts? Evidence suggests that large pre-trained language models (LMs) acquire some reasoning capacity, but this ability is difficult to control. Recently, it has been shown that Transformer-based models succeed in consistent reasoning over explicit symbolic facts, under a closed-world assumption. However, in an open-domain setup, it is desirable to tap into the vast reservoir of implicit knowledge already encoded in the parameters of pre-trained LMs. In this work, we provide a first demonstration that LMs can be trained to reliably perform systematic reasoning combining both implicit, pre-trained knowledge and explicit natural language statements. To do this, we describe a procedure for automatically generating datasets that teach a model new reasoning skills, and demonstrate that models learn to effectively perform inference which involves implicit taxonomic and world knowledge, chaining and counting. Finally, we show that teaching models to reason generalizes beyond the training distribution: they successfully compose the usage of multiple reasoning skills in single examples. Our work paves a path towards open-domain systems that constantly improve by interacting with users who can instantly correct a model by adding simple natural language statements.

研究の動機と目的

  • 事前学習された言語モデルが、暗黙的知識と明示的な記号的事実の両方に対して体系的に推論できるかどうかを調査すること。
  • しばしば体系的一般化を欠く大規模言語モデルにおける推論の制御という課題に取り組むこと。
  • モデルに新しい推論スキルを学ばせるスケーラブルな訓練データ生成手法を開発すること。
  • モデルが学習分布を超えて一般化できるかどうか、特に構成的状況での推論スキルの一般化を評価すること。
  • ユーザーが自然言語による修正を提供することで、モデルの行動を改善できるオープンドメインシステムを実現すること。

提案手法

  • モデルが暗黙的知識と明示的な自然言語文の両方を組み合わせて推論できるようにする合成データセットを自動生成する。
  • チェーンニング、エンティティのカウント、分類階層の適用といった体系的推論を要する訓練例を設計する。
  • これらの合成データセット上で標準的な事前学習言語モデルを訓練し、構造的な推論パターンを学習させる。
  • 訓練中に閉世界仮説を採用して一貫性を確保するが、暗黙的知識を活用することでオープンドメイン推論を可能にする。
  • 段階的に推論の複雑さを高めるカリキュラムに似たデータ生成戦略を採用する。
  • 複数の推論スキルを一度に組み合わせた例を訓練中に見なかったものとしてテストすることで、一般化を検証する。

実験結果

リサーチクエスチョン

  • RQ1事前学習された言語モデルは、暗黙的知識と明示的な記号的事実の両方に対して体系的に推論できるか?
  • RQ2自動生成されたデータセットは、チェーンニング、カウント、分類的推論といった新しい推論スキルを効果的にモデルに教えることができるか?
  • RQ3訓練中に見なかった複数の推論スキルを組み合わせた構成的例に対しても、推論能力が一般化するか?
  • RQ4オープンドメイン設定において、暗黙的知識に基づいて推論する際、モデルの性能はどの程度か?
  • RQ5ユーザーが単純な自然言語の修正を提供することで、モデルの行動を改善でき、継続的学習が可能になるか?

主な発見

  • 合成データセットで微調整されたモデルは、分類的知識や世界知識といった暗黙的知識を含む体系的推論を効果的に実行できる。
  • モデルは構成的推論タスクに一般化し、1つの例で複数の推論スキル(例:チェーンニングとカウント)を正しく組み合わせている。
  • 本手法を用いたモデルは、訓練手順を経ないベースラインモデルと比較して、推論性能が著しく向上している。
  • 事前学習済みの知識を活用することで、明示的なリtrievalを必要とせず、オープンドメイン設定でも信頼性の高い推論が可能になる。
  • 本手法は継続的学習を支援でき、ユーザーが単純な自然言語文でモデルを修正できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。