[论文解读] In-Home Daily-Life Captioning Using Radio Signals
本文提出 RF-Diary,一种保护隐私的系统,利用射频(RF)信号和家庭平面图生成准确的日常生活描述,实现穿墙及在低光照或遮挡条件下的活动监测。通过融合来自 RF 信号的三维人体运动与以人物为中心的平面图表示,并利用视频字幕数据集中的多模态特征对齐,RF-Diary 即使在基于视频的方法失效时也能实现稳健性能。
This paper aims to caption daily life --i.e., to create a textual description of people's activities and interactions with objects in their homes. Addressing this problem requires novel methods beyond traditional video captioning, as most people would have privacy concerns about deploying cameras throughout their homes. We introduce RF-Diary, a new model for captioning daily life by analyzing the privacy-preserving radio signal in the home with the home's floormap. RF-Diary can further observe and caption people's life through walls and occlusions and in dark settings. In designing RF-Diary, we exploit the ability of radio signals to capture people's 3D dynamics, and use the floormap to help the model learn people's interactions with objects. We also use a multi-modal feature alignment training scheme that leverages existing video-based captioning datasets to improve the performance of our radio-based captioning model. Extensive experimental results demonstrate that RF-Diary generates accurate captions under visible conditions. It also sustains its good performance in dark or occluded settings, where video-based captioning approaches fail to generate meaningful captions. For more information, please visit our project webpage: http://rf-diary.csail.mit.edu
研究动机与目标
- 通过用射频(RF)信号替代视频来解决基于摄像头的家庭监控系统带来的隐私问题。
- 克服基于视频的字幕系统在低光照、遮挡或隐私敏感环境(如卧室和浴室)中的局限性。
- 仅使用 RF 信号和静态平面图,无需视觉数据,实现准确的家庭日常生活字幕生成。
- 开发一种训练框架,将大规模视频字幕数据集中的知识迁移至小规模基于 RF 的字幕数据集。
- 构建一个系统,使用非视觉、保护隐私的信号描述真实家庭环境中的人类活动及与物体的互动。
提出的方法
- 使用现有的 RF 感知技术从 RF 信号中提取三维人体骨骼,实现在墙体后和遮挡情况下的运动追踪。
- 通过将坐标系移动到人物当前位置,以人物为中心表示平面图,编码相对于人物的物体位置和朝向。
- 将 RF 运动数据与以人物为中心的平面图特征整合为统一表征,用于人类活动的时间建模。
- 实施一种多模态特征对齐训练方案,通过成对的 L2 损失和无配对判别器,将 RF-Diary 模型的特征与预训练视频字幕模型的特征对齐。
- 在对齐的特征上训练基于 Transformer 的语言模型,以生成自然语言形式的日常生活事件描述。
- 利用现有的视频字幕数据集(如 MS-COCO)预训练特征对齐模块,实现在 RF 标注数据有限的情况下实现知识迁移。
实验结果
研究问题
- RQ1结合 RF 信号和平面图是否可以在不依赖视频或摄像头的情况下实现准确的家庭日常生活字幕生成?
- RQ2在基于视频的系统完全失效的低光照或遮挡条件下,基于 RF 的模型表现如何?
- RQ3通过特征对齐,大规模视频字幕数据集中的知识在多大程度上可以被迁移至小规模基于 RF 的字幕数据集?
- RQ4该系统对平面图测量误差或 RF 信号噪声的鲁棒性如何?
- RQ5使用 RF 信号进行家庭监控的隐私影响是什么,又该如何缓解?
主要发现
- 在 RCD 测试集上,RF-Diary 的 BLEU-4 得分为 23.5,ROUGE-L 得分为 28.9,优于未使用特征对齐的基线模型。
- 在光照差或遮挡严重的条件下,模型仍保持强劲性能,而基于视频的字幕系统完全失效,如定性示例所示。
- 消融研究证实,特征对齐方案中的 L2 损失和判别器均至关重要:任一缺失都会显著降低性能。
- 系统对平面图测量误差具有鲁棒性,即使在存在噪声的情况下性能下降也极小,表明其具备实际部署潜力。
- 尽管性能出色,RF-Diary 无法区分物体的细节(如颜色、纹理或具体类型,例如巧克力与水),导致误识别饮料等错误。
- 模型始终使用 'he' 指代个体,表明其无法从 RF 信号中推断性别,从而限制了描述中的个性化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。