[论文解读] Online Feature Selection for Activity Recognition using Reinforcement Learning with Multiple Feedback
本文提出了一种基于强化学习(RL)的可穿戴设备活动识别在线特征选择方法,通过利用智能家居传感器的多种反馈源,动态平衡功耗与准确率。该方法通过在线反馈一致性估计加速学习过程,在SPHERE数据集上相比基线方法展现出更优的权衡性能,降低了功耗同时保持了较低的错误率。
Recent advances in both machine learning and Internet-of-Things have attracted attention to automatic Activity Recognition, where users wear a device with sensors and their outputs are mapped to a predefined set of activities. However, few studies have considered the balance between wearable power consumption and activity recognition accuracy. This is particularly important when part of the computational load happens on the wearable device. In this paper, we present a new methodology to perform feature selection on the device based on Reinforcement Learning (RL) to find the optimum balance between power consumption and accuracy. To accelerate the learning speed, we extend the RL algorithm to address multiple sources of feedback, and use them to tailor the policy in conjunction with estimating the feedback accuracy. We evaluated our system on the SPHERE challenge dataset, a publicly available research dataset. The results show that our proposed method achieves a good trade-off between wearable power consumption and activity recognition accuracy.
研究动机与目标
- 通过实现设备端、上下文感知的特征选择,解决基于可穿戴设备的活动识别中的能效权衡问题。
- 通过整合来自多个高层级传感器的反馈,克服标准强化学习在低资源可穿戴环境中的学习速度慢的问题。
- 通过实时估计多个反馈源的可靠性,而非假设反馈质量固定,来改进策略学习。
- 基于互补传感器提供的上下文线索,实现动态、在线的特征集自适应。
- 在能效与分类准确率之间实现优于静态或随机特征选择策略的更好平衡。
提出的方法
- 将在线特征选择建模为马尔可夫决策过程(MDP),其中智能体在可穿戴设备上选择低功耗或高功耗特征集。
- 扩展Advise算法以支持来自互补传感器(如PIR、RGB-D)的多个反馈源,加速策略学习。
- 使用基于反馈与智能体预测一致性的加权更新机制,在线估计每个反馈源的一致性(可靠性)。
- 采用基于Q-learning的强化学习框架并引入延迟奖励塑造,其中主机处理器的反馈引导智能体向最优特征选择策略靠拢。
- 仅在主机使用附加传感器进行分类的结果与智能体预测一致,且满足功耗约束时,才整合反馈。
- 对每种传感器模态持续维护反馈一致性的估计水平,使智能体能够自适应地信任更可靠的反馈源。
实验结果
研究问题
- RQ1来自高层级传感器的多个反馈源是否能提升基于强化学习的特征选择智能体在低功耗可穿戴设备上的学习速度与策略质量?
- RQ2在线估计反馈一致性的方法在动态、真实世界环境中对强化学习智能体的鲁棒性与收敛性有何影响?
- RQ3所提方法在多大程度上能实现优于固定或随机特征选择策略的功耗与分类准确率之间的更好权衡?
- RQ4智能体从多个潜在不可靠的反馈源中学习,是否相比单反馈或无反馈基线,能带来更稳定、更准确的策略学习?
主要发现
- 所提出的带在线一致性估计的Multi-Trainers方法在功耗与错误率之间实现了最佳平衡,优于所有基线方法。
- Multi-Trainers方法的学习曲线显示出更快的收敛速度和更高的渐近奖励,相比Q-learning需超过15,000轮才能达到相似性能水平。
- 随机基线的错误率(约0.19)低于固定低功耗基线,但功耗超过两倍,凸显了随机选择的低效性。
- 固定低功耗基线维持了最低的功耗,但错误率最高(约0.81),表明尽管节省了能量,但准确率极差。
- Q-learning虽将功耗降低至低于所提方法,但代价是错误率上升,表明其未能有效优化双重目标。
- 一致性水平估计机制成功识别出RGB-D传感器比PIR传感器更可靠,实证显示其一致性水平更高,验证了在线估计的必要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。