[论文解读] Learning Motion in Feature Space: Locally-Consistent Deformable Convolution Networks for Fine-Grained Action Detection
本文提出了一种新型单流网络——局部一致可变形卷积(LCDC),通过在特征空间中学习自适应感受野变化的时序动态,实现细粒度运动建模,并强制实施局部一致性。LCDC在50 Salads(F1: 80.22%)和GTEA(F1: 75.39%)数据集上达到最先进性能,参数量显著少于基于光流的基线模型,通过联合学习时空特征,无需依赖像素级运动估计,优于双流和标准可变形卷积方法。
Fine-grained action detection is an important task with numerous applications in robotics and human-computer interaction. Existing methods typically utilize a two-stage approach including extraction of local spatio-temporal features followed by temporal modeling to capture long-term dependencies. While most recent papers have focused on the latter (long-temporal modeling), here, we focus on producing features capable of modeling fine-grained motion more efficiently. We propose a novel locally-consistent deformable convolution, which utilizes the change in receptive fields and enforces a local coherency constraint to capture motion information effectively. Our model jointly learns spatio-temporal features (instead of using independent spatial and temporal streams). The temporal component is learned from the feature space instead of pixel space, e.g. optical flow. The produced features can be flexibly used in conjunction with other long-temporal modeling networks, e.g. ST-CNN, DilatedTCN, and ED-TCN. Overall, our proposed approach robustly outperforms the original long-temporal models on two fine-grained action datasets: 50 Salads and GTEA, achieving F1 scores of 80.22% and 75.39% respectively.
研究动机与目标
- 为解决细粒度动作检测的挑战,即细微运动差异使得动作即使对人类也难以区分。
- 通过直接在特征空间中建模运动,改进短期时空特征提取,避免依赖计算成本高且易受噪声影响的光流。
- 开发一种紧凑的单流主干网络,通过引入局部一致性约束的自适应感受野,联合学习空间与时间特征。
- 设计一种灵活的特征提取器,当与现有长时序建模网络(如ST-CNN、DilatedTCN和ED-TCN)结合时,可进一步提升性能。
提出的方法
- 提出局部一致可变形卷积(LCDC),作为标准可变形卷积的扩展,通过连续帧间自适应感受野的变化来建模运动。
- 引入局部一致性约束,以确保相邻空间位置的运动向量保持一致,减少冗余参数并提升鲁棒性。
- 采用特征空间中的运动表示,而非像素级光流,通过聚合所有可变形卷积层的运动向量来计算运动能量。
- 利用可变形卷积偏移量动态调整感受野,聚焦显著区域,相比固定卷积核更高效地捕捉运动模式。
- 设计单流网络,联合学习时空特征,避免分离空间与时间流,支持端到端训练。
- 采用参数高效的结构设计,由于一致性约束,变形参数数量相比标准可变形卷积减少了36倍。
实验结果
研究问题
- RQ1是否可以通过自适应感受野的变化在特征空间中有效建模运动,而非依赖光流或像素级运动估计?
- RQ2在可变形卷积偏移量中强制实施局部一致性是否能提升运动建模的鲁棒性并降低参数复杂度?
- RQ3与双流或两阶段方法相比,一种联合学习时空特征的单流端到端网络在细粒度动作检测中的表现如何?
- RQ4当LCDC特征与ST-CNN或TCN等现有长时序建模网络结合时,性能提升程度如何?
- RQ5局部一致性约束在低运动或高相似性动作场景下的模型效率与准确性方面有何影响?
主要发现
- 在50 Salads数据集上,LCDC取得80.22%的F1分数,优于原始ST-CNN基线和基于光流的双流模型。
- 在GTEA数据集上,LCDC取得75.39%的F1分数,表明其在多样化第一人称动作数据集上具有强大的泛化能力。
- 由于局部一致性约束,LCDC将可变形卷积的参数量减少了36倍。
- 该模型在准确率上优于双流基线(TwoStreamNet),同时参数量显著更少,证明了其高效性与有效性。
- 消融实验表明,局部一致性约束对性能至关重要,若移除该约束,准确率将从73.77%下降至72.25%。
- LCDC特征在无光流的情况下依然鲁棒且高效,在两个数据集上均优于仅基于外观的基线和基于光流的运动流模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。