[论文解读] World Discovery Models
本文提出NDIGO,一种自监督强化学习智能体,通过优化微分信息增益,在部分可观察、随机性环境中自主发现其世界。通过衡量新观测如何提升未来预测准确性,NDIGO在学习准确世界表征方面优于最先进基线的 curiosity 方法,尤其在存在噪声时表现更优,并能成功发现隐藏物体,而不被随机模式误导。
As humans we are driven by a strong desire for seeking novelty in our world. Also upon observing a novel pattern we are capable of refining our understanding of the world based on the new information---humans can discover their world. The outstanding ability of the human mind for discovery has led to many breakthroughs in science, art and technology. Here we investigate the possibility of building an agent capable of discovering its world using the modern AI technology. In particular we introduce NDIGO, Neural Differential Information Gain Optimisation, a self-supervised discovery model that aims at seeking new information to construct a global view of its world from partial and noisy observations. Our experiments on some controlled 2-D navigation tasks show that NDIGO outperforms state-of-the-art information-seeking methods in terms of the quality of the learned representation. The improvement in performance is particularly significant in the presence of white or structured noise where other information-seeking methods follow the noise instead of discovering their world.
研究动机与目标
- 开发一种自监督智能体,能够在不依赖外在奖励的情况下,于部分可观察且具有随机性的环境中发现其世界。
- 解决现有基于好奇心的智能体常被噪声或随机模式吸引,而无法发现有意义世界结构的局限性。
- 不以任务解决成功率作为发现性能的评估标准,而是通过对象位置预测的透明箱评估方法,衡量内部世界表征的质量。
- 设计一种鲁棒的内在奖励机制,引导探索向未观测区域推进,并实现对已发现信息的长期记忆整合。
提出的方法
- NDIGO 将内在奖励计算为两个模型的预测损失差异:一个模型能看到当前观测,另一个则不能,以此衡量新信息对提升未来预测能力的贡献。
- 该方法使用神经网络基于过去观测序列预测未来观测,奖励定义为在包含最新观测后预测误差的降低量。
- 内在奖励用于通过最先进强化学习算法(如 IMPALA)训练策略,使智能体能够探索并发现新的世界结构。
- 该方法对噪声具有鲁棒性,因为预测损失的相减可抵消无法改善的误差,从而避免被随机或结构化噪声吸引。
- 世界表征通过透明箱方法进行评估,即衡量智能体从其内部状态预测固定与可移动物体位置的准确性。
实验结果
研究问题
- RQ1智能体是否能在无外在奖励的、部分可观察的二维环境中,学习发现隐藏物体?
- RQ2NDIGO 中提出的资讯增益机制是否在存在噪声或结构化环境时,优于现有基于好奇心的方法?
- RQ3智能体能否随时间维持并更新一个连贯的全局世界模型,整合新观测信息而不遗忘先前知识?
- RQ4基于差异预测损失的内在奖励是否能有效引导探索,使其聚焦于信息增益高的未观测区域?
主要发现
- 在存在白噪声或结构化噪声的环境中,NDIGO-4 成功忽略了干扰性的布朗运动,发现了固定物体,而 ICM 及其他 NDIGO 变体则被噪声吸引。
- 在一个无外在奖励的复杂迷宫中,NDIGO-1 和 NDIGO-2 探索了最多的房间并发现了最终的固定物体,而其他智能体则停留在噪声物体处无法前进。
- NDIGO-1 在所有房间中均实现了最低的发现损失,表明其世界表征质量更优,并且是唯一在探索迷宫后发现房间2中最后一个蓝色固定物体的智能体。
- 智能体的内部表征能准确预测物体位置,如俯视图快照和预测的世界视图所示,证实其构建了连贯的全局模型。
- 透明箱评估确认,NDIGO 的内部状态能够以高精度预测物体位置,证明其世界模型学习有效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。