Skip to main content
QUICK REVIEW

[论文解读] Occupancy Detection in Room Using Sensor Data

Mohammadhossein Toutiaee|arXiv (Cornell University)|Jan 10, 2021
Video Surveillance and Tracking Methods参考文献 11被引用 5
一句话总结

本研究在传感器数据(温度、湿度、光照、CO2)上评估了七种机器学习模型——决策树、随机森林、梯度提升、逻辑回归、朴素贝叶斯、核化SVM和K近邻——以检测房间占用状态。基于公开可用的数据集(通过摄像头标注获得真实标签),所有模型的准确率均超过98%,其中光照和CO2为最具预测力的变量,表明即使在极简特征集下也能实现高性能表现。

ABSTRACT

With the advent of Internet of Thing (IoT), and ubiquitous data collected every moment by either portable (smart phone) or fixed (sensor) devices, it is important to gain insights and meaningful information from the sensor data in context-aware computing environments. Many researches have been implemented by scientists in different fields, to analyze such data for the purpose of security, energy efficiency, building reliability and smart environments. One study, that many researchers are interested in, is to utilize Machine Learning techniques for occupancy detection where the aforementioned sensors gather information about the environment. This paper provides a solution to detect occupancy using sensor data by using and testing several variables. Additionally we show the analysis performed over the gathered data using Machine Learning and pattern recognition mechanisms is possible to determine the occupancy of indoor environments. Seven famous algorithms in Machine Learning, namely as Decision Tree, Random Forest, Gradient Boosting Machine, Logistic Regression, Naive Bayes, Kernelized SVM and K-Nearest Neighbors are tested and compared in this study.

研究动机与目标

  • 评估并比较七种成熟机器学习算法在仅使用传感器数据情况下检测室内占用状态的性能。
  • 评估单个及组合传感器变量(温度、湿度、光照、CO2)对占用检测的预测能力。
  • 使用相同数据集复现并扩展先前研究,包括测试原始研究中未涉及的模型。
  • 确定是否可通过简化特征集(如仅使用光照和CO2)实现高准确率,从而实现在低资源环境中的部署。

提出的方法

  • 本研究使用一个公开数据集,包含三个划分:训练集(8,143个样本)、验证集(2,665个)和测试集(9,752个),数据在开门和关门状态下采集。
  • 传感器变量包括温度、湿度、光照(照度)、CO2浓度以及一个比率变量;占用状态为二元目标变量(0 = 未占用,1 = 占用)。
  • 所有模型均在训练集上进行训练,并在验证集和测试集上进行评估,排除'日期'变量以避免数据泄露。
  • 测试了多种特征组合,包括光照和CO2、CO2和温度等,以评估变量重要性与模型鲁棒性。
  • 性能通过准确率衡量,采用交叉验证与超参数调优以优化每种模型。
  • 模型包括:决策树、随机森林、梯度提升机、逻辑回归、朴素贝叶斯、核化SVM和K近邻,所有模型均使用Python实现。

实验结果

研究问题

  • RQ1在仅使用环境传感器数据的情况下,哪种机器学习算法在占用检测中达到最高准确率?
  • RQ2与完整特征集相比,仅使用两个传感器变量(光照和CO2)进行占用预测的性能如何?
  • RQ3模型在开门状态(验证集)与关门状态(测试集)下的性能是否存在显著差异?
  • RQ4不同模型在训练集、验证集和测试集上的鲁棒性与泛化能力如何比较?
  • RQ5仅基于传感器数据训练的模型是否能实现高准确率,而无需依赖人员存在追踪或复杂融合技术?

主要发现

  • 决策树模型在所有三个数据集(训练集、验证集和测试集)上的准确率均超过98%,优于大多数其他模型。
  • 随机森林与梯度提升机在使用光照和CO2作为特征时,于训练集和测试集上的准确率均超过99%。
  • 朴素贝叶斯仅使用光照和CO2即达到98%的准确率,表明其在极简输入特征下仍具强大性能。
  • K近邻在验证集上达到98%的准确率,在测试集上达到97%的准确率,使用光照和CO2作为输入,显示出优异的泛化能力。
  • 使用CO2与温度组合的模型表现较差,准确率显著低于光照-CO2组合。
  • 仅光照和CO2的组合在多个模型与数据集上均实现了超过98%的准确率,表明它们是最具信息量的预测变量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。