[论文解读] Where do goals come from? A Generic Approach to Autonomous Goal-System Development
本文提出了潜在目标分析(LGA),一种计算框架,使智能体能够从内在奖励和动作结果的自我检测中自主学习目标作为高层次抽象。通过将目标视为解释奖励信号的隐变量,LGA 实现了强化学习中的降维,并从基于显著性的信息探索奖励中驱动了目标导向性抓取的出现,展示了无需外部监督的自监督目标系统发展。
Goals express agents' intentions and allow them to organize their behavior based on low-dimensional abstractions of high-dimensional world states. How can agents develop such goals autonomously? This paper proposes a detailed conceptual and computational account to this longstanding problem. We argue to consider goals as high-level abstractions of lower-level intention mechanisms such as rewards and values, and point out that goals need to be considered alongside with a detection of the own actions' effects. We propose Latent Goal Analysis as a computational learning formulation thereof, and show constructively that any reward or value function can by explained by goals and such self-detection as latent mechanisms. We first show that learned goals provide a highly effective dimensionality reduction in a practical reinforcement learning problem. Then, we investigate a developmental scenario in which entirely task-unspecific rewards induced by visual saliency lead to self and goal representations that constitute goal-directed reaching.
研究动机与目标
- 为长期存在的开放问题提供解决方案:即自主智能体如何在无外部监督或预设任务的情况下发展目标。
- 将目标概念化为低层次奖励与价值系统的高层抽象,其基础是动作结果的自我检测。
- 开发一种通用的计算框架,解释任何奖励函数如何通过潜在目标与自我检测机制来解释。
- 在强化学习中的降维和从任务无关奖励中启动目标导向行为方面,证明 LGA 的实际效用。
- 在机器人设置中研究目标表征与自我意识的发育性涌现,使用视觉显著性作为内在奖励。
提出的方法
- 提出一个概念性框架,其中目标是奖励系统的抽象,必须与动作结果的自我检测一同学习。
- 引入潜在目标分析(LGA)作为计算学习公式,从感官、动作和奖励数据中识别潜在目标与自我检测状态。
- 将学习问题形式化为概率推理任务,将目标与自我检测建模为解释观测奖励的隐变量。
- 采用变分推理方法近似潜在目标与自我检测的后验分布,实现可扩展的学习。
- 将 LGA 应用于推荐系统任务中作为降维技术,使用学习到的目标作为高维数据的紧凑表示。
- 在发展机器人学实验中实现视觉显著性作为任务无关奖励,表明 LGA 促进了目标导向性抓取与自我表征的出现。
实验结果
研究问题
- RQ1智能体如何在无外部监督或预设任务的情况下自主学习目标?
- RQ2目标、奖励与动作结果自我检测之间在概念上存在何种关系?
- RQ3任何奖励函数是否都能通过潜在目标与自我检测机制的组合来解释?
- RQ4LGA 是否可作为强化学习中有效的降维方法?
- RQ5如视觉显著性这类任务无关的内在奖励,能否导致目标导向行为与自我表征的涌现?
主要发现
- LGA 从奖励信号中成功提取了潜在目标,实现了在线新闻推荐强化学习任务中的有效降维。
- 在推荐系统实验中,通过 LGA 学习到的目标在预测性能上优于标准基线方法。
- 在发展实验中,基于显著性的信息探索奖励在短时间内使机器人手与目标物体的接触率达到 100%。
- 机器人根据距离差异,使用执行器的不同部位接触物体,表明其目标表征具有适应性且非任意性。
- 手-物体接触的自我检测自然地与目标表征一同出现,形成了自监督运动学习的闭环系统。
- LGA 与目标生成(goal babbling)的结合使机器人能够在无预编程目标或任务特定奖励的情况下生成目标导向性抓取动作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。