[论文解读] IMU2CLIP: Multimodal Contrastive Learning for IMU Motion Sensors from Egocentric Videos and Text
IMU2CLIP 提出了一种多模态对比学习框架,通过将惯性测量单元(IMU)运动传感器数据与第一视角视频及文本叙述投影到一个受 CLIP 启发的共享表征空间中,实现三者之间的对齐。该方法在动作识别任务中显著提升了下游性能,并实现了基于运动的检索和零样本多模态推理等新型应用,微调后的模型相较于随机初始化最高可实现 16 个百分点的准确率提升。
We present IMU2CLIP, a novel pre-training approach to align Inertial Measurement Unit (IMU) motion sensor recordings with video and text, by projecting them into the joint representation space of Contrastive Language-Image Pre-training (CLIP). The proposed approach allows IMU2CLIP to translate human motions (as measured by IMU sensors) into their corresponding textual descriptions and videos -- while preserving the transitivity across these modalities. We explore several new IMU-based applications that IMU2CLIP enables, such as motion-based media retrieval and natural language reasoning tasks with motion data. In addition, we show that IMU2CLIP can significantly improve the downstream performance when fine-tuned for each application (e.g. activity recognition), demonstrating the universal usage of IMU2CLIP as a new pre-trained resource. Our code will be made publicly available.
研究动机与目标
- 为解决 IMU 传感器信号缺乏大规模预训练模型的问题,从而限制可穿戴设备在真实场景中的部署。
- 通过在多模态间学习一个通用表征空间,实现基于 IMU 的任务的零样本和少样本迁移学习。
- 证明仅使用 IMU 数据即可实现新型应用的可行性,例如基于运动的媒体检索和多模态推理,而无需依赖视频数据。
- 发布一个大规模、公开可用的预训练 IMU 编码器,以支持未来研究。
提出的方法
- 微调一个基于 CLIP 的架构,将 IMU 信号、第一视角视频片段和文本叙述联合嵌入到一个共享的对比表示空间中。
- 使用对比学习方法,通过正样本对和负样本对的对比损失,将 IMU 嵌入与对应的视频和文本嵌入对齐。
- 利用 CLIP 的预训练视觉和文本编码器作为冻结主干网络,将语义知识迁移至 IMU 编码器。
- 通过使用来自第一视角数据集(如 Ego4D 和 Aria)的配对数据,端到端训练 IMU 编码器,基于对比优化。
- 通过使用 CLIP 的文本编码器将类别名称嵌入,并在 IMU 嵌入上通过最近邻搜索匹配,实现零样本推理。
- 支持下游微调,允许 IMU 编码器在带标签数据集上进行微调,以应用于动作识别等任务。
实验结果
研究问题
- RQ1能否通过对比学习,有效地将 IMU 信号与视频和文本对齐于共享嵌入空间?
- RQ2在大规模第一视角数据上进行预训练,是否能提升动作识别与检索任务的下游性能?
- RQ3IMU2CLIP 是否能够在仅使用传感器数据而无视频输入的情况下,实现零样本或少样本推理?
- RQ4IMU、视频与文本的联合建模在多模态之间如何保持传递性?
主要发现
- 微调后的 IMU2CLIP 在 Ego4D 动作识别基准上达到 65.87% 的准确率,相较于随机初始化模型绝对提升了 15.95 个百分点。
- 在 Aria 数据集上,IMU2CLIP 经微调后达到 82.31% 的准确率,较基线模型提升 6.19 个百分点。
- 在 Ego4D 数据集上进行 IMU 到视频的检索任务,IMU2CLIP 实现了 R@1 为 8.48% 和 R@50 为 77.67%,展现出强大的检索能力。
- 在视频到 IMU 的检索任务中,模型实现了 MRR 为 0.190 和 R@50 为 78.57%,证实了跨模态对齐的有效性。
- 通过零样本探测,IMU2CLIP 在 Ego4D 上实现了 42.16% 的 F1 分数,表明模型在无任务特定标签的情况下仍能捕捉有意义的语义结构。
- 该模型仅依赖 IMU 和音频日志即可实现零样本多模态推理,GPT-3 在无视频输入的情况下生成了与上下文一致的响应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。