[论文解读] Potential Field: Interpretable and Unified Representation for Trajectory Prediction
该论文提出了一种新颖的轨迹预测框架,利用势场作为环境、惯性和社交刺激的可解释、统一表示。通过将力建模为可学习的、数据驱动的势场,并基于高斯分布的速度场预测未来运动,该方法在ETH、UCY和Stanford Drone数据集上实现了最先进性能,展示了改进的可解释性以及多源运动线索的融合。
Predicting an agent's future trajectory is a challenging task given the complicated stimuli (environmental/inertial/social) of motion. Prior works learn individual stimulus from different modules and fuse the representations in an end-to-end manner, which makes it hard to understand what are actually captured and how they are fused. In this work, we borrow the notion of potential field from physics as an interpretable and unified representation to model all stimuli. This allows us to not only supervise the intermediate learning process, but also have a coherent method to fuse the information of different sources. From the generated potential fields, we further estimate future motion direction and speed, which are modeled as Gaussian distributions to account for the multi-modal nature of the problem. The final prediction results are generated by recurrently moving past location based on the estimated motion direction and speed. We show state-of-the-art results on the ETH, UCY, and Stanford Drone datasets.
研究动机与目标
- 解决现有轨迹预测模型在处理环境、惯性和社交刺激时缺乏可解释性以及融合不一致的问题。
- 开发一种统一表示,以实现中间监督和多样化运动刺激的一致性整合。
- 通过将速度方向和大小预测为高斯分布,对人类运动的多模态特性进行建模。
- 利用神经网络将势场知识泛化至未见过的环境。
- 在保持可解释性的同时,实现在标准轨迹预测基准上的最先进性能。
提出的方法
- 使用逆向公式从观测轨迹估计势场值,作为训练的真值。
- 定义三种不同的势场:环境势场(可行走区域和障碍物)、惯性势场(由过去运动驱动的意图)和社会势场(邻近个体的交互作用)。
- 使用原始RGB图像和轨迹数据,训练神经网络以将环境和惯性势场泛化至未见过的场景。
- 采用逐像素相加的方式,将环境、惯性和社交势场融合为统一的运动场。
- 从组合势场中预测未来速度为方向和大小的高斯分布。
- 通过时间上递归积分预测的速度场生成最终轨迹。
实验结果
研究问题
- RQ1势场能否作为统一、可解释的表示,用于在轨迹预测中建模多样化的运动刺激(环境、惯性、社交)?
- RQ2使用可解释势场进行中间监督,是否能改善多源运动线索的学习与融合?
- RQ3神经网络能否在无需显式场景标注的情况下,将学习到的势场知识泛化至未见过的环境?
- RQ4在具有非结构化环境、复杂拓扑结构和社交互动的复杂真实场景中,该方法表现如何?
- RQ5引入多模态速度预测在多大程度上提升了轨迹预测的准确性?
主要发现
- 所提方法在ETH、UCY和Stanford Drone数据集上实现了最先进性能,在单模态和多模态预测设置下均优于S-LSTM、DESIRE、Gated-RN和CVAE。
- 消融实验表明,加入环境和社交势场可显著提升性能,优于仅使用惯性势场的模型。
- 模型在未见场景中泛化良好,体现在SDD数据集上采用4:1训练-测试划分时仍表现出色,覆盖多样化环境。
- 定性结果表明,势场能从数据中学习到复杂的道路结构(如环岛、十字路口)和人类行走习惯(如靠右行走)。
- 模型成功预测了多样化行为,如转向、停止以及社交场景中的互动行为(如相遇、跟随)。
- 采用高斯分布的速度预测能够捕捉人类运动的固有多模态特性,在1至4秒预测时域内,FDE和ADE指标均有提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。