[论文解读] The Quest for a Common Model of the Intelligent Decision Maker
本文提出了一种统一的、跨学科的智能决策者模型——以代理与世界通过动作、观测和奖励进行交互为核心,包含四个核心组件:感知、决策、内部评估(价值函数)和转移模型(世界模型)。其主要贡献在于构建了一个共享的概念框架,标准化了心理学、神经科学、人工智能、经济学和控制论中的术语与结构,从而促进更深层次的跨学科合作。
The premise of the Multi-disciplinary Conference on Reinforcement Learning and Decision Making is that multiple disciplines share an interest in goal-directed decision making over time. The idea of this paper is to sharpen and deepen this premise by proposing a perspective on the decision maker that is substantive and widely held across psychology, artificial intelligence, economics, control theory, and neuroscience, which I call the "common model of the intelligent agent". The common model does not include anything specific to any organism, world, or application domain. The common model does include aspects of the decision maker's interaction with its world (there must be input and output, and a goal) and internal components of the decision maker (for perception, decision-making, internal evaluation, and a world model). I identify these aspects and components, note that they are given different names in different disciplines but refer essentially to the same ideas, and discuss the challenges and benefits of devising a neutral terminology that can be used across disciplines. It is time to recognize and build on the convergence of multiple diverse disciplines on a substantive common model of the intelligent agent.
研究动机与目标
- 识别并形式化一个超越单一学科的智能决策的共享概念框架。
- 解决心理学、神经科学、人工智能、经济学和控制论中术语与概念化方式的碎片化问题。
- 建立一个中立、广泛适用的智能代理模型,突出其共有的结构与功能组件。
- 通过提供统一的术语和参考点,促进代理设计的跨学科研究。
- 通过识别一个支撑众多现有理论与系统的底层核心模型,推动不同领域洞察的深度融合。
提出的方法
- 提出一个通用的代理-世界交互框架,包含五个关键信号:动作、观测、奖励、状态和目标。
- 识别代理的四个内部组件:感知(将观测映射为内部状态)、决策(策略)、内部评估(价值函数)和转移建模(世界模型)。
- 主张这些组件虽在不同学科中独立发展,但功能上本质上等价。
- 引入中性术语——'代理'、'世界'、'动作'、'观测'、'奖励'——以避免学科偏见,促进跨学科思维。
- 使用心理学(托尔曼的认知地图)、神经科学(多巴胺作为奖励预测误差)、控制论和强化学习中的历史与当代实例,验证该模型的广泛适用性。
- 将该模型定位为新型代理设计的基础参考点,强调创新可被理解为对这一共同结构的扩展或修改。
实验结果
研究问题
- RQ1在研究智能决策的多样化学科中,哪些核心结构与功能组件是共通的?
- RQ2如何发展一种中立的、跨学科的术语体系,以统一决策科学中的概念框架?
- RQ3心理学、神经科学、人工智能和控制论中的现有理论在多大程度上汇聚于一个共同的智能代理模型?
- RQ4所提出的通用模型存在哪些局限性?为何应排除内在动机或辅助子任务等特征?
- RQ5该通用模型如何作为标准参考点,用于比较和扩展新型代理架构?
主要发现
- 尽管尚未正式承认或标准化,实践中已存在一个广泛共享的、跨学科的智能代理模型。
- 感知、策略、价值函数和转移模型这四个组件在心理学、神经科学、人工智能和控制论中独立发展并被使用,表明其深层一致性。
- 神经科学中的奖励预测误差信号(多巴胺)与强化学习中的价值函数误差直接对应,证明了跨学科的功能等价性。
- 转移模型(即‘世界模型’)在认知心理学(托尔曼的认知地图)、神经科学(海马体功能)和现代深度学习(本吉奥、勒昆、施密德胡伯)理论中均居核心地位。
- 该通用模型为比较代理设计提供了一个稳定且简洁的框架,具有加速跨学科进展的潜力。
- 尽管结构简单,该模型并非面面俱到;为保持普遍性并避免学科偏见,选择排除如内在动机或辅助子任务等特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。