Skip to main content
QUICK REVIEW

[论文解读] Contrastive Reinforcement Learning of Symbolic Reasoning Domains

Gabriel Poesia, WenXin Dong|arXiv (Cornell University)|Jun 16, 2021
Intelligent Tutoring Systems and Adaptive Learning参考文献 32被引用 4
一句话总结

本文提出对比策略学习(ConPoLe),一种新型强化学习算法,通过优化InfoNCE对比损失以最大化成功解题路径上当前状态与未来状态之间的互信息,从而提升数学等符号推理领域中的推理能力。ConPoLe在四个受Common Core启发的数学环境及魔方问题中均表现出色,学习到语义上合理的任务表征,对课程类别的预测准确率达90.5%。

ABSTRACT

Abstract symbolic reasoning, as required in domains such as mathematics and logic, is a key component of human intelligence. Solvers for these domains have important applications, especially to computer-assisted education. But learning to solve symbolic problems is challenging for machine learning algorithms. Existing models either learn from human solutions or use hand-engineered features, making them expensive to apply in new domains. In this paper, we instead consider symbolic domains as simple environments where states and actions are given as unstructured text, and binary rewards indicate whether a problem is solved. This flexible setup makes it easy to specify new domains, but search and planning become challenging. We introduce four environments inspired by the Mathematics Common Core Curriculum, and observe that existing Reinforcement Learning baselines perform poorly. We then present a novel learning algorithm, Contrastive Policy Learning (ConPoLe) that explicitly optimizes the InfoNCE loss, which lower bounds the mutual information between the current state and next states that continue on a path to the solution. ConPoLe successfully solves all four domains. Moreover, problem representations learned by ConPoLe enable accurate prediction of the categories of problems in a real mathematics curriculum. Our results suggest new directions for reinforcement learning in symbolic domains, as well as applications to mathematics education.

研究动机与目标

  • 解决在符号推理领域(如代数与逻辑)中训练强化学习智能体的挑战,这些领域因稀疏的二元奖励和非结构化文本状态而难以学习。
  • 克服现有强化学习算法在这些领域中的局限性,其失败原因包括轨迹无界、缺乏结构洞察力以及奖励稀疏。
  • 开发一种与领域无关、基于文本的强化学习框架,实现在无手工特征或人类解法的情况下,跨符号领域的一般化能力。
  • 学习反映语义课程结构的问题表征,实现对数学问题的准确分类。
  • 在教育类数学问题和复杂搜索问题(如魔方)上,展示该方法的通用性与有效性。

提出的方法

  • 将符号推理领域建模为确定性、基于文本的强化学习环境,其中状态和动作为非结构化字符串,仅通过二元奖励指示解题成功。
  • 在训练过程中使用迭代加深和束搜索,收集正样本(成功)和负样本(失败)轨迹以进行对比学习。
  • 优化InfoNCE损失,以最大化当前状态与成功未来状态之间的互信息,从而在无需价值函数估计的情况下有效学习策略。
  • 利用对比学习学习有意义的状态表征,捕捉问题求解路径中的语义结构。
  • 在推理阶段应用训练好的策略,并结合批量加权A*搜索(BWAS),使用预测的对数概率作为搜索中节点的权重。
  • 使用统一的文本到文本接口,在包括数学方程和魔方在内的多种领域中训练单一模型架构。

实验结果

研究问题

  • RQ1在仅提供二元奖励和非结构化文本的符号推理领域中,对比学习能否有效应用于策略学习?
  • RQ2在因奖励稀疏和轨迹过长而导致价值估计失败的符号领域中,对比方法能否优于标准强化学习基线?
  • RQ3智能体学习到的表征是否反映了语义课程结构,例如真实教育平台中的问题类别?
  • RQ4该算法能否在无架构或奖励函数修改的前提下,泛化至包括数学方程和魔方在内的多样化符号领域?
  • RQ5是否可能在无须访问人类解法或手工设计特征的情况下,学习到有效的符号领域求解器?

主要发现

  • ConPoLe成功解决了所有四个受Common Core启发的符号推理环境,而标准强化学习基线方法则全部失败。
  • ConPoLe学习到的问题表征在预测Khan Academy课程中数学问题类别的任务上达到90.5%的准确率,显著优于基线方法,甚至超过字符串编辑距离方法。
  • 尽管未提供显式的课程监督,ConPoLe学习到的表征形成了高度结构化的聚类,对应Khan Academy课程的各个章节。
  • 在魔方任务中,ConPoLe成功解决全部100个经过1000步随机打乱的测试实例,成功率与DeepCubeA相当,但平均仅访问300万个节点,比DeepCubeA的830万个节点减少36%。
  • ConPoLe的解法平均长度为39.4步,长于DeepCubeA的21.6步,但考虑到ConPoLe的训练步数仅为DeepCubeA的1/100,这一差异在预期范围内。
  • ConPoLe的成功表明,对比学习可有效替代符号规划中的价值函数估计,实现在稀疏奖励、非结构化环境下的样本高效策略学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。