[论文解读] Propagation Networks for Model-Based Control Under Partial Observation
本文提出传播网络(Propagation Networks, PropNet),一种可微、可学习的动力学模型,通过在场景图中跨多步交互路径传播信号,实现了在部分可观测环境中的基于模型的控制。与以往仅限于成对交互的方法不同,PropNet 能够建模长程、同步的多体动力学,在前向仿真和控制任务中表现出更优性能,具备更高的样本效率、准确性和对未见场景的泛化能力。
There has been an increasing interest in learning dynamics simulators for model-based control. Compared with off-the-shelf physics engines, a learnable simulator can quickly adapt to unseen objects, scenes, and tasks. However, existing models like interaction networks only work for fully observable systems; they also only consider pairwise interactions within a single time step, both restricting their use in practical systems. We introduce Propagation Networks (PropNet), a differentiable, learnable dynamics model that handles partially observable scenarios and enables instantaneous propagation of signals beyond pairwise interactions. Experiments show that our propagation networks not only outperform current learnable physics engines in forward simulation, but also achieve superior performance on various control tasks. Compared with existing model-free deep reinforcement learning algorithms, model-based control with propagation networks is more accurate, efficient, and generalizable to new, partially observable scenes and tasks.
研究动机与目标
- 解决现有可学习物理模拟器仅建模成对交互且需要完整状态可观测性的局限。
- 实现在仅部分物体可见的机器人环境中,实现准确的前向仿真与控制。
- 开发一种可微分动力学模型,支持在单步时间内对非直接对象对的物理效应进行即时、多步传播。
- 提升在复杂、接触丰富的任务中基于模型强化学习的样本效率、准确性和泛化能力。
- 通过在线自适应机制,展示对物理属性不确定性的鲁棒性,并实现对未见配置的泛化。
提出的方法
- 该方法将场景表示为有向图,其中物体为节点,交互为有向边,从而实现结构化的信号传播。
- 采用多步消息传递机制,在单个时间步内跨图传播物理效应(如力、速度),建模长程与同步交互。
- 模型基于潜在动力学表征运行,能够从部分观测中推断隐藏物体状态,适用于部分可观测设置。
- 采用残差连接与共享编码,提升训练稳定性与计算效率。
- 通过可微损失函数端到端训练动力学模型,最小化预测配置与控制任务中目标配置之间的差异。
- 将模型集成至模型预测控制(MPC)框架中,用于预测未来状态并指导动作选择。
实验结果
研究问题
- RQ1可学习物理引擎是否能在单个时间步内建模超越成对关系的长程、多体交互?
- RQ2当在有限观测下进行训练时,动力学模型在新部分可观测环境中的泛化能力如何?
- RQ3基于 PropNet 的模型预测控制是否在样本效率、准确性和泛化能力方面优于模型无关的深度强化学习?
- RQ4PropNet 是否能通过在线反馈与微调,适应物理属性估计的不确定性或错误?
- RQ5在部分可观测条件下,PropNet 在复杂、接触丰富的控制任务(如牛顿摆、绳索操作、推箱)中的表现如何?
主要发现
- 在牛顿摆任务中,PropNet 的均方误差(MSE)为 3.08(与真实初始角度相比),而交互网络(Interaction Networks)的 MSE 高达 296.66,显著提升了控制精度。
- 在绳索操作任务中,PropNet 的表现优于人工调校的 PD 控制器(MSE 2.50)与深度强化学习方法,实现了更低的配置匹配误差。
- 当物理属性以 15% 噪声进行猜测时,PropNet 的性能初期下降,但通过 20 步的 SGD 在线自适应后恢复,优于固定属性基线模型。
- 在部分可观测的推箱任务中,PropNet 的性能优于深度强化学习与交互网络,其 Chamfer 距离更优,归因于对隐藏动力学的显式建模。
- PropNet 在新绳索长度(10–20)上表现出良好泛化能力,尽管仅在长度 15 的数据上进行训练,仍保持强劲性能,表明其具备鲁棒泛化性。
- 在所有评估任务中,基于 PropNet 的模型预测控制在样本效率与准确性方面均优于最先进模型无关的深度强化学习算法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。