[论文解读] StretchBEV: Stretching Future Instance Prediction Spatially and Temporally
StretchBEV 提出了一种随机时间模型,通过在潜在空间中学习时间相关的动态变化,利用随机残差更新,提升了鸟瞰图(BEV)中长时程、空间扩展的未来实例预测性能。通过在每个时间步从学习到的概率分布中采样,该方法在长时程和大范围空间区域内生成多样化且准确的预测,相较于 FIERY 等先前方法,在准确性和多样性方面均有提升,尤其在远区域和长期预测场景下表现更优。
In self-driving, predicting future in terms of location and motion of all the agents around the vehicle is a crucial requirement for planning. Recently, a new joint formulation of perception and prediction has emerged by fusing rich sensory information perceived from multiple cameras into a compact bird's-eye view representation to perform prediction. However, the quality of future predictions degrades over time while extending to longer time horizons due to multiple plausible predictions. In this work, we address this inherent uncertainty in future predictions with a stochastic temporal model. Our model learns temporal dynamics in a latent space through stochastic residual updates at each time step. By sampling from a learned distribution at each time step, we obtain more diverse future predictions that are also more accurate compared to previous work, especially stretching both spatially further regions in the scene and temporally over longer time horizons. Despite separate processing of each time step, our model is still efficient through decoupling of the learning of dynamics and the generation of future predictions.
研究动机与目标
- 为解决多智能体运动固有的不确定性导致的长期时间跨度下未来预测质量下降问题。
- 提升自动驾驶中鸟瞰图(BEV)表示下未来实例预测的多样性和准确性。
- 通过将动态学习与预测生成解耦,实现高效性,同时保持高性能。
- 通过监督潜在预测中运动和位置的解码过程,实现更可解释且空间扩展的预测。
- 探究在动态学习过程中对齐未来输出模态的影响,平衡性能与标签依赖性。
提出的方法
- 模型通过在低维潜在空间中使用状态空间模型,实现动态学习与预测生成的解耦,从而学习时间动态变化。
- 在每个时间步,模型从学习到的概率分布中采样,以传播不确定性,从而生成多样化的未来预测。
- 潜在空间通过与预训练 BEV 分割模型预测的未来帧 BEV 表示对齐进行训练,确保与真实场景几何结构一致。
- 采用监督解码器将潜在预测映射为可解释的未来模态,如智能体位置和运动向量。
- 提出两种变体:一种在后验中显式包含未来模态标签(StretchBEV-P),另一种则不包含(StretchBEV),以研究标签依赖性的影响。
- 模型采用类似神经 ODE 的残差更新机制,实现稳定且可扩展的长时程建模。
实验结果
研究问题
- RQ1在潜在空间中采用随机残差更新,是否能超越单分布建模,在长时程 BEV 未来实例预测中实现性能提升?
- RQ2在每个时间步从学习到的概率分布中采样,如何影响未来预测的多样性和准确性?
- RQ3在后验中引入未来模态标签的条件化,在多大程度上提升了预测质量?其在推理依赖性方面存在何种权衡?
- RQ4状态空间模型是否能高效学习复杂的时间动态,同时在长时程 BEV 预测中保持高准确性和多样性?
- RQ5与先前方法相比,该模型在预测空间远距离智能体未来状态方面表现如何?
主要发现
- StretchBEV-P 在近区域预测中达到 82.04 的广义能量距离(GED),在远区域预测中达到 109.12,显著优于 FIERY 的 127.18 和 152.38。
- StretchBEV-P 在 2 秒时间跨度内的语义分割预测中 IoU 达到 65.7,超过 FIERY 的 58.8 和先前方法的 44.3。
- 即使在长时程跨度下,模型仍能生成多样化预测,定性结果表明不同样本间表现出多样的转向行为和速度调整,而 FIERY 则收敛于均值预测。
- 通过在潜在空间中使用动态建模与随机采样,模型实现了无需自回归生成即可获得准确且多样化预测,同时保持高效性。
- 采用后验条件化(StretchBEV-P)的模型在所有指标上均表现更优,尽管其在推理阶段依赖于未来标签的可用性。
- 消融实验确认,后验条件化显著提升了性能,尤其在远区域和长时程设置下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。