[论文解读] Active World Model Learning with Progress Curiosity
本文提出了一种新颖的基于好奇心的主动世界模型学习(AWML)框架,采用γ-Progress这一可扩展的学习进度型好奇心信号,使智能体能够高效探索三维虚拟环境中复杂且可学习的动力学。该方法克服了白噪声问题,在世界模型学习性能上优于最先进的探索策略(如RND和Model Disagreement)。
World models are self-supervised predictive models of how the world evolves. Humans learn world models by curiously exploring their environment, in the process acquiring compact abstractions of high bandwidth sensory inputs, the ability to plan across long temporal horizons, and an understanding of the behavioral patterns of other agents. In this work, we study how to design such a curiosity-driven Active World Model Learning (AWML) system. To do so, we construct a curious agent building world models while visually exploring a 3D physical environment rich with distillations of representative real-world agents. We propose an AWML system driven by $γ$-Progress: a scalable and effective learning progress-based curiosity signal. We show that $γ$-Progress naturally gives rise to an exploration policy that directs attention to complex but learnable dynamics in a balanced manner, thus overcoming the "white noise problem". As a result, our $γ$-Progress-driven controller achieves significantly higher AWML performance than baseline controllers equipped with state-of-the-art exploration strategies such as Random Network Distillation and Model Disagreement.
研究动机与目标
- 开发一种主动世界模型学习(AWML)系统,使智能体能够通过好奇心驱动的探索高效学习预测性世界模型。
- 解决探索中的白噪声问题,即智能体过度关注不可学习的噪声刺激,而非复杂但可学习的动力学。
- 在强化学习框架内形式化AWML,整合好奇心与主动学习。
- 设计一种可扩展且有效的新型好奇心信号——γ-Progress,以引导注意力聚焦于可学习且行为丰富的动力学,如社交互动。
- 在包含多种智能体行为(静态、周期性、噪声型及社交型如躲猫猫和模仿)的三维虚拟环境中评估该系统。
提出的方法
- 作者构建了一个三维虚拟环境,其中智能体展现出从静态到周期性、噪声型以及社交互动(如躲猫猫、追逐、模仿)的动力学谱系。
- 将AWML形式化为一个强化学习问题,其中智能体通过基于动作的未来状态预测来学习世界模型。
- 提出γ-Progress,一种基于世界模型学习进度速率的新奇度信号,计算方式为预测误差随时间的变化率。
- γ-Progress被设计为可扩展且高效,鼓励智能体探索复杂但可学习的动力学,从而避免不可学习的噪声。
- 使用γ-Progress作为内在奖励训练智能体的探索策略,使其在多样化刺激间保持平衡注意力,并优先关注信息丰富的互动。
- 通过世界模型预测精度(尤其针对外部智能体)以及注意力分配模式的分析来评估性能,以衡量学习效率。
实验结果
研究问题
- RQ1好奇心驱动的探索策略是否能在丰富且智能体密集的环境中,有效优先关注可学习的复杂动力学,而非不可学习的噪声?
- RQ2作为好奇心信号的γ-Progress是否在世界模型学习中优于现有的最先进探索策略(如RND和Model Disagreement)?
- RQ3γ-Progress在多大程度上帮助克服主动世界模型学习中的白噪声问题?
- RQ4早期注意力模式(如对生物体与非生物体的关注差异)是否能预测最终的世界模型性能?
- RQ5AWML框架能否作为人类早期发展中内在动机的计算模型,特别是在社交注意力与学习方面?
主要发现
- 基于γ-Progress的智能体在世界模型学习性能上显著优于使用RND和Model Disagreement的基线控制器。
- γ-Progress通过引导注意力聚焦于复杂且可学习的动力学(如社交互动),而非随机或周期性刺激,有效克服了白噪声问题。
- 智能体对生物体与非生物体的注意力差异与最终性能强相关,早期关注生物体是后期世界模型准确性的强有力预测指标。
- 基于γ-Progress的早期注意力差异指标在预测最终模型性能方面优于直接基于性能的预测器,表明注意力分配是学习效率的关键机制。
- 该模型的注意力模式与学习曲线与人类婴儿的发展时间进程相似,提示其在建模内在动机学习与发育变异性(包括自闭症谱系障碍等状况)方面具有潜力。
- 该框架表明,基于学习进度的好奇心信号可作为社交注意力发展的计算基础,对发育障碍的早期诊断工具具有启示意义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。