Skip to main content
QUICK REVIEW

[论文解读] The Efficiency of Human Cognition Reflects Planned Information Processing

Mark K. Ho, David Abel|arXiv (Cornell University)|Feb 13, 2020
AI-based Problem Solving and Planning参考文献 33被引用 13
一句话总结

本文提出人类认知反映了有计划的信息处理,个体战略性地分配认知资源,以规划不仅包括行动,还包括*何时*和*规划什么*——通过递归贝尔曼目标形式化为元推理问题,平衡任务奖励与信息论规划成本。实验表明,反应时间与该模型的预测一致,表明人们通过部分规划自适应地管理规划成本,支持人类决策中有限理性的规范性解释。

ABSTRACT

Planning is useful. It lets people take actions that have desirable long-term consequences. But, planning is hard. It requires thinking about consequences, which consumes limited computational and cognitive resources. Thus, people should plan their actions, but they should also be smart about how they deploy resources used for planning their actions. Put another way, people should also "plan their plans". Here, we formulate this aspect of planning as a meta-reasoning problem and formalize it in terms of a recursive Bellman objective that incorporates both task rewards and information-theoretic planning costs. Our account makes quantitative predictions about how people should plan and meta-plan as a function of the overall structure of a task, which we test in two experiments with human participants. We find that people's reaction times reflect a planned use of information processing, consistent with our account. This formulation of planning to plan provides new insight into the function of hierarchical planning, state abstraction, and cognitive control in both humans and machines.

研究动机与目标

  • 理解人类为何规划其计划而非仅规划其行动,认识到规划在时间和记忆上都是有成本的。
  • 将元规划形式化为一个递归决策问题,平衡任务奖励与规划成本。
  • 检验人类的反应时间是否反映出在问题解决过程中对信息处理的有计划、成本意识的使用。
  • 评估部分规划(以不同详细程度表示计划)是否比完整动作规划更能解释人类行为。
  • 探索层次规划与状态抽象如何从管理认知成本的需求中自然涌现。

提出的方法

  • 将元规划形式化为包含任务奖励与信息论规划成本的递归贝尔曼目标。
  • 使用Kullback-Leibler散度量化在部分计划之间转换的成本,代表更新计划的认知努力。
  • 通过部分计划中状态-动作分布的编码成本来建模规划成本,利用信息论量化计算努力。
  • 将该模型应用于二维迷宫导航任务,在不同任务结构下生成最优部分计划。
  • 使用混合效应线性模型检验部分计划差异是否能预测人类实验中的反应时间。
  • 基于部分计划相似性对状态表示进行层次聚类,以揭示涌现的类似选项的结构。

实验结果

研究问题

  • RQ1当人们在规划时如何自适应地分配认知资源,其选择何时和规划什么的因素是什么?
  • RQ2反应时间在多大程度上反映出有计划的信息处理,而非仅仅是行动规划?
  • RQ3基于信息论规划成本的正式模型是否能预测人类在动态规划任务中的行为?
  • RQ4部分计划(以不同详细程度表示的计划)如何从最小化规划成本的需求中自然涌现?
  • RQ5规划的哪些结构性特征(如层次、抽象)源于奖励与认知成本之间的权衡?

主要发现

  • 在实验1中,部分计划差异显著预测了迷宫导航中的反应时间,优于仅基于行动规划的模型。
  • 在实验2中,参与者在意外传送后反应时间的最佳解释是传送前后部分计划之间的差异,而非行动规划成本。
  • 部分计划差异度量(反映更新计划的认知成本)即使在控制传送距离后,仍是反应时间的显著预测因子。
  • 该模型的最优部分计划比其他规划度量(如路径长度或A*节点数)更能解释人类行为。
  • 基于部分计划相似性的状态层次聚类产生了类似于分层强化学习中选项的聚类,表明抽象结构自然涌现。
  • 将传送距离作为预测因子后,部分计划差异的显著性虽减弱但未消失,表明规划成本是独立且关键的影响因素。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。