[论文解读] Adaptive Graph Spatial-Temporal Transformer Network for Traffic Flow Forecasting
本文提出了一种自适应图时空变换器网络(ASTTN),通过在可学习的自适应图上使用局部多头自注意力机制,直接建模跨空间-时间相关性,在交通预测基准测试中实现了最先进性能,尤其在长期预测任务中表现突出。
Traffic flow forecasting on graphs has real-world applications in many fields, such as transportation system and computer networks. Traffic forecasting can be highly challenging due to complex spatial-temporal correlations and non-linear traffic patterns. Existing works mostly model such spatial-temporal dependencies by considering spatial correlations and temporal correlations separately and fail to model the direct spatial-temporal correlations. Inspired by the recent success of transformers in the graph domain, in this paper, we propose to directly model the cross-spatial-temporal correlations on the spatial-temporal graph using local multi-head self-attentions. To reduce the time complexity, we set the attention receptive field to the spatially neighboring nodes, and we also introduce an adaptive graph to capture the hidden spatial-temporal dependencies. Based on these attention mechanisms, we propose a novel Adaptive Graph Spatial-Temporal Transformer Network (ASTTN), which stacks multiple spatial-temporal attention layers to apply self-attention on the input graph, followed by linear layers for predictions. Experimental results on public traffic network datasets, METR-LA PEMS-BAY, PeMSD4, and PeMSD7, demonstrate the superior performance of our model.
研究动机与目标
- 解决现有模型将空间和时间依赖关系分别分解处理的局限性,避免遗漏直接的跨空间-时间相关性。
- 克服对静态地理邻接矩阵的依赖,后者可能无法反映真实的交通依赖关系。
- 建模随时间步动态变化的空间相关性,特别是在具有双向交通模式的高峰时段。
- 通过捕捉空间-时间图中节点之间复杂且时变的交互关系,提升长期交通预测性能。
- 设计一种可扩展的注意力机制,在降低计算复杂度的同时保持高性能。
提出的方法
- 提出一种新颖的空间-时间自注意力机制,利用局部多头自注意力(local MSA)高效建模跨空间-时间依赖关系。
- 引入一种自适应图学习模块,从数据中动态学习节点相关性,替代固定的地理邻接矩阵。
- 设计一种门控融合机制,在每个Transformer块内有效结合空间和时间注意力特征。
- 对自适应邻接矩阵应用基于掩码的稀疏化处理,聚焦于高相关性节点对,降低计算量。
- 通过堆叠多个空间-时间注意力层并引入残差连接,捕捉时间与空间维度上的层次化依赖关系。
- 使用编码空间和时间位置信息的节点嵌入,增强模型关注相关历史和空间上下文的能力。
实验结果
研究问题
- RQ1与分别建模空间和时间依赖关系相比,通过自注意力机制直接建模跨空间-时间相关性是否能提升交通预测的准确性?
- RQ2与固定的地理邻接矩阵相比,自适应图在捕捉真实、数据驱动的节点依赖关系方面效果如何?
- RQ3局部多头自注意力与自适应图学习的结合是否能带来更好的性能表现,尤其是在长期预测任务中?
- RQ4在准确性、训练稳定性和推理速度方面,不同注意力机制(全连接、分解式、局部、自适应)之间有何差异?
- RQ5模型性能在多大程度上依赖于自适应邻接矩阵揭示非地理但有意义的交通相关性的能力?
主要发现
- ASTTN在METR-LA、PEMS-BAY、PeMSD4和PeMSD7上均达到最先进性能,在PEMS-BAY上15分钟预测时序的MAE为1.32,120分钟预测时序的MAE为1.72。
- 该模型在长期预测任务中显著优于DCRNN、STGCN、Graph WaveNet和GMAN,尤其在120分钟预测时性能提升最为明显。
- 消融实验表明,若移除自适应局部MSA模块(ASTTN-NA),在PEMS-BAY上15分钟预测的MAE上升至1.45,证实其对性能的关键作用。
- 自适应邻接矩阵揭示了原始图中不存在的非地理相关性,例如长距离交通传播效应,验证了其捕捉真实依赖关系的能力。
- 分解式和全连接注意力机制因过拟合和高计算成本而表现欠佳,而自适应局部MSA在准确率与效率之间实现了最佳平衡。
- 模型性能对自适应图和门控融合组件最为敏感,ASTTN-NE(无嵌入)和ASTTN-NF(无融合)均表现出显著性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。