Skip to main content
QUICK REVIEW

[論文レビュー] Critical Thinking for Language Models

Gregor Betz, Voigt, Christian|arXiv (Cornell University)|Sep 15, 2020
Topic Modeling参考文献 36被引用数 12
ひとこと要約

本論文では、言語モデルのための『論理的思考カリキュラム』を構築するために、演繹的に妥当な議論の合成コーパスを導入し、GPT-2をモード・ポネンスや対偶法といった基本的な論理的スキームで訓練した。モデルは強力な転移学習を示し、複雑な議論形式に一般化し、GLUEおよびSNLIベンチマークにおけるゼロショット性能を最大で15パーセンテージポイント向上させた。

ABSTRACT

This paper takes a first step towards a critical thinking curriculum for neural auto-regressive language models. We introduce a synthetic corpus of deductively valid arguments, and generate artificial argumentative texts to train and evaluate GPT-2. Significant transfer learning effects can be observed: Training a model on three simple core schemes allows it to accurately complete conclusions of different, and more complex types of arguments, too. The language models generalize the core argument schemes in a correct way. Moreover, we obtain consistent and promising results for NLU benchmarks. In particular, pre-training on the argument schemes raises zero-shot accuracy on the GLUE diagnostics by up to 15 percentage points. The findings suggest that intermediary pre-training on texts that exemplify basic reasoning abilities (such as typically covered in critical thinking textbooks) might help language models to acquire a broad range of reasoning skills. The synthetic argumentative texts presented in this paper are a promising starting point for building such a "critical thinking curriculum for language models."

研究の動機と目的

  • 言語モデルを高品質で合成された演繹的推論の例に訓練させることで、その一般化された推論能力が向上するかどうかを調査すること。
  • 論理的三段論法の有効な形式を基盤とする合成コーパスを構築し、言語モデルの論理的思考訓練のための基盤資産とする。
  • 中間段階の事前学習が、下流のNLUタスクにおける転移学習効果をもたらすかどうかを評価すること。
  • 言語モデルが訓練分布を超えて学習した論理的パターンを一般化できるかどうかを検討すること。
  • このようなカリキュラムが、GLUE、SNLI、LogiQAを含む多様な推論ベンチマークに与える影響を評価すること。

提案手法

  • 自然言語テンプレートを用いて、一般化モード・ポネンス、対偶法、鎖状法といった基本的な論理的スキームをカバーする、演繹的に妥当な議論の合成コーパスを構築する。
  • 8台のGPU、2エポック、バッチサイズ2に設定したハイパーパrameterを用いて、因果的言語モデル化の目的関数でGPT-2をこのコーパスで訓練する。
  • 訓練中に見られなかった議論形式、たとえばジレンマやド・モーガンの法則のような複雑な形式の結論補完能力をモデルが果たせるかを評価する。
  • 標準的なNLUベンチマーク、特にGLUEおよびSNLIにおけるゼロショット性能をテストし、転移学習効果を測定する。
  • 手動によるプロンプトと制御されたテンプレートを用いて、訓練ドメインを超えた一般化を評価し、一貫した入力フォーマットを保証する。
  • 構成可能なテンプレートインfraを介して、将来の拡張として命題推論スキーム、モーダル推論、誤謬検出などを含む、コーパスの補完を計画する。

実験結果

リサーチクエスチョン

  • RQ1洗練された合成コーパスを用いて演繹的妥当な議論に言語モデルを訓練させることで、多様な議論形式にわたる推論一般化能力が向上するか?
  • RQ2基本的な論理的スキームにおける中間段階の事前学習が、GLUEやSNLIのような標準的なNLUベンチマークにおけるゼロショット性能にどの程度転送効果をもたらすか?
  • RQ3モデルが学習した議論パターンの一般化能力が、言語モデルの能力そのものに依存するか?
  • RQ4なぜこの議論コーパスでの訓練は、より意味的に複雑なタスク(例:議論的推論理解、LogiQA)のパフォーマンス向上に失敗するのか?
  • RQ5ルールに基づいた合成的議論コーパスが、言語モデルのための包括的な『論理的思考カリキュラム』の基盤として実用的であるか?

主な発見

  • 合成された演繹的に妥当な議論のコーパスでGPT-2を訓練することで、訓練中に見なかった複雑な議論形式に対しても、結論の正確な補完が可能になるという強力な転移学習効果が得られた。
  • モデルは、モード・ポネンス、対偶法、鎖状法といった基本的な論理的スキームを、訓練済みの形式を超えてより複雑な新しい議論形式へと正しく一般化しており、内部に定着した推論パターンを示している。
  • 議論コーパスでの事前学習後、GLUEベンチマークにおけるゼロショット性能が最大で15パーセンテージポイント向上し、下流タスクにおける顕著な推論能力の向上が確認された。
  • SNLIベンチマークにおいても一貫した向上が観察され、自然言語帰納能力の向上が裏付けられた。
  • より意味的に要求の高い議論的推論理解およびLogiQAタスクではパフォーマンスに変化がなく、高レベルの実用的・文脈的推論を処理する能力に限界があることが示唆された。
  • これらの結果は、基本的な推論スキルの例示に基づく中間段階の事前学習が、幅広いタスクにおいてモデルの推論能力を顕著に向上させられることを支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。