Skip to main content
QUICK REVIEW

[论文解读] Decision Theory with Resource-Bounded Agents

Joseph Y. Halpern, Rafael Pass|arXiv (Cornell University)|Aug 17, 2013
Game Theory and Applications参考文献 20被引用 4
一句话总结

本文提出了两种在决策理论中建模资源受限代理的框架:一种通过图灵机对计算复杂度收费,另一种将代理建模为具有有限状态的有限自动机。研究表明,这两种方法均可将诸如‘第一印象效应’和‘信念极化’等知名认知偏差解释为在资源约束下的最优行为,且随着状态数增加,基于自动机的策略可趋近最优性能。

ABSTRACT

There have been two major lines of research aimed at capturing resource-bounded players in game theory. The first, initiated by Rubinstein, charges an agent for doing costly computation; the second, initiated by Neyman, does not charge for computation, but limits the computation that agents can do, typically by modeling agents as finite automata. We review recent work on applying both approaches in the context of decision theory. For the first approach, we take the objects of choice in a decision problem to be Turing machines, and charge players for the ``complexity'' of the Turing machine chosen (e.g., its running time). This approach can be used to explain well-known phenomena like first-impression-matters biases (i.e., people tend to put more weight on evidence they hear early on) and belief polarization (two people with different prior beliefs, hearing the same evidence, can end up with diametrically opposed conclusions) as the outcomes of quite rational decisions. For the second approach, we model people as finite automata, and provide a simple algorithm that, on a problem that captures a number of settings of interest, provably performs optimally as the number of states in the automaton increases.

研究动机与目标

  • 对具有计算资源限制的决策代理进行建模,挑战经典决策理论中完美理性的假设。
  • 在计算资源约束下,解释系统性人类行为偏差(如第一印象效应和信念极化)为理性反应。
  • 为计算资源受限的代理开发简单且可实现的策略,使其在资源限制增加时趋近最优性能。
  • 比较两种不同方法:基于复杂度的成本模型(图灵机)与具有状态限制的有限自动机模型。
  • 为有限自动机策略在动态、不确定环境中的有效性提供理论与实验支持。

提出的方法

  • 将代理建模为选择图灵机,其效用取决于收益与计算复杂度(如运行时间、状态数)的综合。
  • 引入一种成本模型,对所选算法的复杂度进行收费,从而允许在收益与计算之间进行理性权衡。
  • 将代理建模为具有固定状态数的有限自动机,其状态转移取决于输入信号与内部状态。
  • 提出一族参数化自动机 A[N, p_exp, Pos, Neg, r_u, r_d],参数包括状态数 N、信号概率以及正/负信号的阈值。
  • 采用动态决策问题,其中自然状态随机变化,代理需基于随时间变化的噪声信号做出决策。
  • 证明当 N 增大时,该自动机族的期望收益趋近理论最优值,即使无预言机支持亦成立。

实验结果

研究问题

  • RQ1第一印象效应是否可被解释为在计算成本约束下的理性行为?
  • RQ2在具有不同先验信念但接收相同证据的代理中,信念极化是否可在资源约束下理性地出现?
  • RQ3具有 N 个状态的有限自动机在动态、不确定环境中能多好地近似最优决策?
  • RQ4在有限自动机策略中,哪些参数设置可在 N 增大时实现近似最优性能?
  • RQ5在计算资源有限的真实决策问题中,简单且低复杂度的策略是否能表现良好?

主要发现

  • 在 π 和 P_exp 满足弱条件时,自动机族 A[N, p_exp, Pos, Neg, r_u, r_d] 的期望收益可随 N 增大而任意接近理论最优值(x_G/2)。
  • 当 π = 0.001,x_G = 1,且有四个信号时,5 个状态的自动机可实现超过 0.4 的期望收益,显著优于随机或固定策略(后者收益为 0)。
  • 即使在 2 个状态的自动机下,相同条件下期望收益仍超过 0.15,表明其在极低资源下亦具强大性能。
  • 性能具有鲁棒性:为 N=5 选择最优 p_exp 后,对所有 N≥5 均可实现近似最优结果,从而减少对每个 N 单独优化的需求。
  • 理论结果表明,对于任意决策情境,均存在参数使得自动机的期望收益在 N→∞ 时收敛至最优值。
  • 复杂度收费与有限自动机两种模型均将常见认知偏差解释为计算约束下的最优反应,而非非理性行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。