Skip to main content
QUICK REVIEW

[论文解读] Computational evolution of decision-making strategies

Peter D. Kvam, Joseph Cesario|arXiv (Cornell University)|Sep 18, 2015
Evolutionary Game Theory and Cooperation参考文献 15被引用 11
一句话总结

本文提出了一种计算进化框架,模拟了在环境难度变化下,决策策略如何通过人工选择而涌现。结果表明,更复杂的环境倾向于促进更大的大脑和序列采样策略,而更简单的环境则推动进化出更小的大脑和类似启发式策略,即使没有明确的复杂性成本——这凸显了突变负荷是大脑尺寸的关键制约因素。

ABSTRACT

Most research on adaptive decision-making takes a strategy-first approach, proposing a method of solving a problem and then examining whether it can be implemented in the brain and in what environments it succeeds. We present a method for studying strategy development based on computational evolution that takes the opposite approach, allowing strategies to develop in response to the decision-making environment via Darwinian evolution. We apply this approach to a dynamic decision-making problem where artificial agents make decisions about the source of incoming information. In doing so, we show that the complexity of the brains and strategies of evolved agents are a function of the environment in which they develop. More difficult environments lead to larger brains and more information use, resulting in strategies resembling a sequential sampling approach. Less difficult environments drive evolution toward smaller brains and less information use, resulting in simpler heuristic-like strategies.

研究动机与目标

  • 研究决策策略如何响应环境约束而演化,而非预先假设策略的存在。
  • 检验大脑复杂性和信息使用是否通过演化过程受环境难度的影响。
  • 测试突变负荷是否在代谢成本较低时仍限制大脑大小的假设。
  • 比较在不同环境条件下,序列采样与启发式策略的演化出现。
  • 为理解动态决策中认知策略的演化提供一个生物上合理的框架。

提出的方法

  • 使用遗传算法演化具有马尔可夫大脑(16个节点的神经网络)的人工智能体,以解决一个动态二元决策任务。
  • 智能体接收随时间变化的输入,代表信号(S)或噪声(N),需基于累积证据判断来源。
  • 适应度由决策的准确性和速度决定,选择机制倾向于最大化长期奖励的智能体。
  • 在不同环境条件下运行演化,这些条件在信噪比和决策难度上有所变化。
  • 跨代追踪大脑大小和信息使用情况,以评估复杂性演化趋势。
  • 模型引入突变率和鲁棒性,以评估遗传负荷对大脑大小和策略演化的影响。

实验结果

研究问题

  • RQ1环境难度在多大程度上影响人工智能体大脑大小和信息处理复杂性的演化?
  • RQ2即使复杂策略可用且准确,更简单的环境是否仍偏好类似启发式的策略?
  • RQ3突变负荷是否足以单独限制大脑大小的演化,即使代谢成本很低?
  • RQ4所演化出的策略在多大程度上类似于序列采样或非补偿性启发式?
  • RQ5在高难度与低难度决策环境中,演化轨迹有何不同?

主要发现

  • 更困难的环境导致大脑更大、信息使用更多,产生类似序列采样、累积证据整合的策略。
  • 更简单的环境促使大脑更小、信息使用减少,偏好非补偿性、类似启发式的策略。
  • 即使没有明确的复杂性成本,突变负荷仍起到制约作用,限制了在简单环境中大脑大小的演化,因为更大的大脑在这些环境中并无适应性优势。
  • 在困难环境中,智能体即使拥有更长的处理链,仍保持高准确性和鲁棒性,表明其对信息干扰具有演化出的抗性。
  • 演化轨迹表明,只有当环境需求迫使时,复杂策略才会出现,支持策略使用依赖于环境的假设。
  • 结果表明,序列采样和快速而简单的启发式均可作为不同选择压力下演化的合理结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。