[论文解读] Motion Style Transfer: Modular Low-Rank Adaptation for Deep Motion Forecasting
本文提出MoSA(基于模块化低秩微调的运动风格迁移),一种参数高效的迁移学习方法,可在仅使用少量数据的情况下,将预训练的运动预测模型高效适配至新的代理类型或场景。通过在冻结的编码器层中插入低秩适配器,并采用模块化策略解耦场景特征与运动特征,MoSA在仅使用10–30个目标样本的情况下,将泛化误差降低高达25%,在Level 5数据集上相比标准微调方法性能提升20%。
Deep motion forecasting models have achieved great success when trained on a massive amount of data. Yet, they often perform poorly when training data is limited. To address this challenge, we propose a transfer learning approach for efficiently adapting pre-trained forecasting models to new domains, such as unseen agent types and scene contexts. Unlike the conventional fine-tuning approach that updates the whole encoder, our main idea is to reduce the amount of tunable parameters that can precisely account for the target domain-specific motion style. To this end, we introduce two components that exploit our prior knowledge of motion style shifts: (i) a low-rank motion style adapter that projects and adjusts the style features at a low-dimensional bottleneck; and (ii) a modular adapter strategy that disentangles the features of scene context and motion history to facilitate a fine-grained choice of adaptation layers. Through extensive experimentation, we show that our proposed adapter design, coined MoSA, outperforms prior methods on several forecasting benchmarks.
研究动机与目标
- 解决深度运动预测模型在低数据或分布外设置下的泛化性能差的问题。
- 在保持对未见代理类型和场景上下文性能的前提下,减少适配过程中的可训练参数数量。
- 将运动风格变化——即导航行为差异——与不变的运动动力学特征分开建模。
- 通过仅对特定风格特征进行适配而非对整个网络进行微调,实现高效的迁移学习。
- 通过模块化、解耦的场景上下文与运动历史特征适配,提升迁移学习的样本效率。
提出的方法
- 提出MoSA,一种低秩适配器模块,包含两个可训练矩阵(A和B),构成瓶颈结构,将特定风格的更新注入冻结的编码器层。
- 将MoSA作为并行模块应用于注意力机制,通过低秩更新查询和值矩阵,实现对自注意力层的风格调整。
- 采用模块化适配策略,解耦场景上下文编码器与运动历史编码器,实现仅对其中一条路径进行选择性适配。
- 采用参数初始化策略:矩阵A随机初始化,矩阵B零初始化,确保模型初始行为与原始模型保持一致。
- 在适配过程中应用早停法与一阶段学习率调度,以提升收敛性与泛化能力。
- 在代理迁移中使用低秩秩为3,在场景迁移中使用秩为8,学习率根据方法进行调优(例如,MoSA的学习率设为3e-3)。
实验结果
研究问题
- RQ1能否设计一种参数高效的适配器,实现在极小数据量下跨不同代理类型的运动预测模型迁移?
- RQ2在分布偏移条件下,低秩微调与完整微调相比,在性能与参数效率方面表现如何?
- RQ3解耦场景上下文与运动历史特征是否能提升运动预测中迁移学习的有效性?
- RQ4MoSA在多样化场景(如行人到自行车、场景到场景、城市区域间迁移)中是否具备泛化能力?
- RQ5适配器位置(如注意力层与前馈网络层)对适配性能有何影响?
主要发现
- MoSA将每层可训练参数数量减少至不足2%,同时在SDD和inD数据集上达到最先进性能。
- 在SDD和inD数据集上,使用仅10–30条目标轨迹进行适配时,MoSA将泛化误差降低25%。
- 在Level 5数据集上,MoSA即使仅对未见场景进行一次前向传播,性能仍优于标准微调方法20%。
- 将MoSA应用于注意力层(查询和值矩阵)的性能优于应用于前馈层。
- 模块化适配策略通过仅对运动历史编码器进行选择性适配,在代理类型迁移的低数据场景下实现了显著性能提升。
- 初始化方案(A随机,B零)确保MoSA在训练初期不会改变原始模型的行为,从而实现稳定的适配。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。