QUICK REVIEW
[论文解读] Stochastic Prediction of Multi-Agent Interactions from Partial Observations
Chen Sun, Per Karlsson|arXiv (Cornell University)|Feb 25, 2019
Human Pose and Action Recognition参考文献 49被引用 34
一句话总结
我们提出 Graph-VRNN,一种图结构变分递归神经网络,结合学习的动力学与部分视觉观测以推断多方互动代理的当前状态并预测未来状态。它在篮球和足球数据集上优于基线。
ABSTRACT
We present a method that learns to integrate temporal information, from a learned dynamics model, with ambiguous visual information, from a learned vision model, in the context of interacting agents. Our method is based on a graph-structured variational recurrent neural network (Graph-VRNN), which is trained end-to-end to infer the current state of the (partially observed) world, as well as to forecast future states. We show that our method outperforms various baselines on two sports datasets, one based on real basketball trajectories, and one generated by a soccer game engine.
研究动机与目标
- 在相互作用代理的部分可观测性下,推动鲁棒状态估计和未来预测。
- 开发一个统一的端到端判别模型,将动力学先验与视觉证据融合。
- 利用图结构的 VRNN 来捕捉代理之间的互动和数据关联。
- 在篮球和足球数据集上展示改进的状态估计和预测。
提出的方法
- 为每个代理使用一个带图交互网络的 VRNN 来建模代理之间的动力学。
- 通过注意力型解码器将输出条件化于视觉输入,将当前视觉信息和过去信念混合。
- 在代理特定标识符下共享骨干特征,以学习数据关联。
- 以变分目标函数(ELBO)为基础并结合预测扩展;应用 beta 加权和计划采样。
- 结合热力图和潜在充分统计量来捕捉不确定性并促进未来状态预测。
实验结果
研究问题
- RQ1一个图结构的 VRNN 能否从部分观测的视频帧中联合推断当前多代理状态并预测未来状态?
- RQ2引入随机潜在动力学和代理交互是否比非图或非随机基线在状态估计和预测上有改进?
- RQ3部分可观测性(遮挡)如何影响篮球和足球情景中的跟踪精度和预测性能?
- RQ4基于注意力的视觉证据与潜在动力学融合是否能有效‘看穿像素’?
主要发现
- Graph-VRNN 在对遮挡代理的状态估计方面优于基线,如仅视觉、RNN、VRNN、Indep-RNN、Social-RNN 和 Graph-RNN。
- 引入随机潜在动力学比纯确定模型表现更好;基于图的交互建模优于简单的聚合方法。
- 在篮球数据中,Graph-VRNN 对可见和隐藏代理均实现更低的归一化 L2 距离,且其预测损失随时间改进。
- 在足球数据中,来自随机 Graph-RNN 的预测增益较小,因为仿真器的可预测性导致数据集特征影响随机性的收益。
- 定性结果显示,当观察帧增多时信念状态变得更确定,且在未来不确定性下 Graph-VRNN 的采样呈现多样性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。