[论文解读] EgoDistill: Egocentric Head Motion Distillation for Efficient Video Understanding
EgoDistill 提出了一种知识蒸馏框架,仅通过单帧 RGB 图像和轻量级 IMU 头部运动数据即可重建昂贵的自指视频片段特征,在 Ego4D 和 EPIC-Kitchens 数据集上实现的参数量仅为基线模型的 1/200,同时优于当前最先进的高效视频理解方法。
Recent advances in egocentric video understanding models are promising, but their heavy computational expense is a barrier for many real-world applications. To address this challenge, we propose EgoDistill, a distillation-based approach that learns to reconstruct heavy egocentric video clip features by combining the semantics from a sparse set of video frames with the head motion from lightweight IMU readings. We further devise a novel self-supervised training strategy for IMU feature learning. Our method leads to significant improvements in efficiency, requiring 200x fewer GFLOPs than equivalent video models. We demonstrate its effectiveness on the Ego4D and EPICKitchens datasets, where our method outperforms state-of-the-art efficient video understanding methods.
研究动机与目标
- 解决当前最先进的自指视频理解模型计算成本过高的问题,该问题限制了其在资源受限的 AR/VR 设备上的部署。
- 探究 IMU 的头部运动信号是否可作为密集视频帧动态的代理,以降低模型推理成本。
- 开发一种基于蒸馏的方法,利用 IMU 和稀疏视觉帧重建来自重型视频模型的完整视频片段特征。
- 通过一种新颖的自监督预训练策略改进 IMU 特征学习,以提升下游视频理解性能。
- 在准确率与效率的权衡上优于现有方法,这些方法通过自适应采样视频帧实现优化。
提出的方法
- 训练一个轻量级学生模型,利用来自强大教师视频模型的知识蒸馏,从单帧 RGB 图像和时间上稀疏的 IMU 读数中重建密集的视频片段特征。
- 在蒸馏前引入一种新颖的自监督预训练阶段,以提升 IMU 特征的表征质量。
- 将蒸馏过程同时基于稀疏帧的视觉语义和 IMU 的运动动态,以保留外观与运动信息。
- 采用知识蒸馏结合对比损失,使学生模型的输出特征与教师模型的密集片段级表示对齐。
- 设计端到端可训练且高效的的学生模型,使其能够在低资源设备上实现实时推理。
- 不将 IMU 数据作为融合模态使用,而是将其作为动态信号,实现从极少量视觉输入中重建具有运动感知能力的视频特征。

实验结果
研究问题
- RQ1IMU 数据是否能有效替代密集视频帧以重建复杂的自指视频特征?
- RQ2将稀疏视觉帧与 IMU 信号结合,是否能实现比仅使用视觉帧更优的视频特征重建效果?
- RQ3针对 IMU 的自监督预训练策略是否能提升基于蒸馏的视频理解模型的性能?
- RQ4与当前最先进的高效视频模型相比,EgoDistill 在保持或提升准确率的同时,能在多大程度上降低计算成本?
- RQ5在哪些类型的自指动作中,基于 IMU 的蒸馏能带来最大的性能提升?
主要发现
- 与原始 MotionFormer 模型相比,EgoDistill 将推理 GFLOPs 降低 200 倍,效率提升 200 倍。
- 对于一段 50 分钟的自指视频,EgoDistill 将推理时间从 25 分钟缩短至 36 秒,证明了其具备实时可行性。
- 在 EPIC-Kitchens 数据集上,EgoDistill 的准确率比 STTS 高 4.4%,同时推理速度更快 6.5 倍,优于当前最先进的自适应采样方法。
- 通过利用 IMU 消除场景运动的歧义,EgoDistill 在模糊动作(如 'close')上将动作识别准确率提升 20.3%,在 'put' 动作上提升 10.4%。
- 该模型在具有可预测头部运动的动作(如 'cut'、'close')上表现最佳,在头部运动微弱或无关联的动作(如 'press'、'fill')上表现较差。
- 定性结果表明,EgoDistill 生成的特征具有明确的运动感知性,且受 IMU 条件控制,能够检索具有稳定相机运动的视频片段,而仅使用视觉帧的模型则无法实现这一点。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。