Skip to main content
QUICK REVIEW

[論文レビュー] Contrastive Reinforcement Learning of Symbolic Reasoning Domains

Gabriel Poesia, WenXin Dong|arXiv (Cornell University)|Jun 16, 2021
Intelligent Tutoring Systems and Adaptive Learning参考文献 32被引用数 4
ひとこと要約

本論文は、成功した解法経路における現在状態と将来状態の間の相互情報量を最大化するために InfoNCE コンタスティブ損失を最適化することで、数学のような分野における記号的推論を向上させる、新しい強化学習アルゴリズムである対照的方策学習(ConPoLe)を紹介する。ConPoLe は、Common Core を模した4つの数学環境およびルービックキューブにおいて優れた性能を発揮し、カリキュラムのカテゴリを 90.5% の正確さで予測できる意味的意味のある問題表現を学習する。

ABSTRACT

Abstract symbolic reasoning, as required in domains such as mathematics and logic, is a key component of human intelligence. Solvers for these domains have important applications, especially to computer-assisted education. But learning to solve symbolic problems is challenging for machine learning algorithms. Existing models either learn from human solutions or use hand-engineered features, making them expensive to apply in new domains. In this paper, we instead consider symbolic domains as simple environments where states and actions are given as unstructured text, and binary rewards indicate whether a problem is solved. This flexible setup makes it easy to specify new domains, but search and planning become challenging. We introduce four environments inspired by the Mathematics Common Core Curriculum, and observe that existing Reinforcement Learning baselines perform poorly. We then present a novel learning algorithm, Contrastive Policy Learning (ConPoLe) that explicitly optimizes the InfoNCE loss, which lower bounds the mutual information between the current state and next states that continue on a path to the solution. ConPoLe successfully solves all four domains. Moreover, problem representations learned by ConPoLe enable accurate prediction of the categories of problems in a real mathematics curriculum. Our results suggest new directions for reinforcement learning in symbolic domains, as well as applications to mathematics education.

研究の動機と目的

  • スパースなバイナリ報酬と非構造的なテキスト状態により学習が困難な分野、例えば代数や論理における強化学習エージェントの訓練という課題に対処すること。
  • 未収束の軌道、構造的洞察の欠如、報酬のスパarsity により、従来の強化学習アルゴリズムが失敗する分野における制限を克服すること。
  • 手作業で特徴を設計したり人間の解法を必要としない、ドメインに依存しないテキストベースの強化学習フレームワークを構築することにより、記号的ドメイン間での一般化を可能にすること。
  • 教育的カリキュラム構造を反映する問題表現を学習し、数学問題の分類を正確に行えるようにすること。
  • 本手法の汎用性と有効性を、教育的数学問題およびルービックキューブのような複雑な探索問題の両方で示すこと。

提案手法

  • 状態と行動が非構造的な文字列であるが、解法成功を示す唯一のバイナリ報酬を有する決定的でテキストベースの強化学習環境として、記号的推論ドメインを定式化する。
  • 訓練中に反復的深さ優先探索とビームサーチを用いて、成功した(ポジティブ)および失敗した(ネガティブ)軌道を収集し、対照的学習に用いる。
  • 現在の状態とその成功した将来状態間の相互情報量を最大化するために InfoNCE 損失を最適化し、価値関数推定を一切行わずに、効果的に方策を学習する。
  • 対照的学習を活用して、問題解決経路における意味的構造を捉えた意味的状態表現を学習する。
  • 推論時に、予測された対数確率をノードの重みとして使用するバッチ重み付き A* 探索(BWAS)を用いて、訓練済み方策を適用する。
  • 数学方程式やルービックキューブを含む多様なドメインで、統一されたテキスト対テキストインターフェースを用いて、同じモデルアーキテクチャを訓練する。

実験結果

リサーチクエスチョン

  • RQ1スパースな報酬と非構造的なテキストのみを備えた記号的推論ドメインにおいて、対照的学習を方策学習に効果的に適用できるか?
  • RQ2価値推定が報酬のスパarsity や長い軌道のため失敗する記号的ドメインにおいて、対照的アプローチが標準的な強化学習ベースラインを上回れるか?
  • RQ3エージェントが学習した表現が、実際の教育プラットフォームにおける問題カテゴリのような意味的カリキュラム構造を反映しているか?
  • RQ4同じアルゴリズムが、数学方程式やルービックキューブを含む多様な記号的ドメインに、アーキテクチャや報酬関数の変更なしに一般化できるか?
  • RQ5人間の解法や手作業で設計された特徴にアクセスできない状況で、効果的なソルバーを学習することは可能か?

主な発見

  • ConPoLe は、標準的な強化学習ベースラインが失敗する4つのCommon Coreを模した記号的推論環境をすべて正しく解ける。
  • ConPoLe が学習した問題表現は、カーンアカデミーのカリキュラムにおける数学問題のカテゴリを 90.5% の正確さで予測でき、ベースライン手法を著しく上回り、文字列編集距離をも上回る。
  • ConPoLe が学習した表現は、明示的なカリキュラムの監視がなくとも、カーンアカデミーのカリキュラムのセクションに対応する高密度なクラスタを形成している。
  • ルービックキューブにおいて、ConPoLe は1000回のスキャンブルでシャッフルされた100のテストインスタンスをすべて解けるが、DeepCubeA と同等の成功率を達成する一方、平均で300万ノードを訪問する。これは DeepCubeA の830万ノードより36%少ない。
  • ConPoLe の解法は平均39.4手であり、DeepCubeA の21.6手よりも長いが、これは ConPoLe が DeepCubeA より100倍少ない環境ステップで訓練されたことを考慮すれば予想される差である。
  • ConPoLe の成功は、対照的学習が記号的計画において価値関数推定を効果的に置き換えられることを示しており、報酬がスパースで非構造的な環境においても、サンプル効率の良い方策学習を可能にすることを裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。