[论文解读] MrSQM: Fast Time Series Classification with Symbolic Representations
MrSQM 是一种快速的时间序列分类器,通过使用多种符号化表示(SAX 和 SFA)并结合高效的序列挖掘,以极低的计算成本提取判别性特征。其准确率达到当前最优水平,与 ROCKET 和 MiniROCKET 相当,同时将训练和预测时间缩短至 2 小时以内——远快于现有符号化方法(如 MrSEQL 和 HIVE-COTE),并通过可配置的符号化变换实现可调的性能-速度权衡。
Symbolic representations of time series have proven to be effective for time series classification, with many recent approaches including SAX-VSM, BOSS, WEASEL, and MrSEQL. The key idea is to transform numerical time series to symbolic representations in the time or frequency domain, i.e., sequences of symbols, and then extract features from these sequences. While achieving high accuracy, existing symbolic classifiers are computationally expensive. In this paper we present MrSQM, a new time series classifier which uses multiple symbolic representations and efficient sequence mining, to extract important time series features. We study four feature selection approaches on symbolic sequences, ranging from fully supervised, to unsupervised and hybrids. We propose a new approach for optimal supervised symbolic feature selection in all-subsequence space, by adapting a Chi-squared bound developed for discriminative pattern mining, to time series. Our extensive experiments on 112 datasets of the UEA/UCR benchmark demonstrate that MrSQM can quickly extract useful features and learn accurate classifiers with the classic logistic regression algorithm. Interestingly, we find that a very simple and fast feature selection strategy can be highly effective as compared with more sophisticated and expensive methods. MrSQM advances the state-of-the-art for symbolic time series classifiers and it is an effective method to achieve high accuracy, with fast runtime.
研究动机与目标
- 开发一种快速、准确的时间序列分类器,利用符号化表示,同时避免现有方法的高计算成本。
- 探究在符号化时间序列分类中,简单的特征选择策略是否能超越复杂且昂贵的替代方案。
- 通过控制所用符号化表示的数量和类型,实现可调的性能-速度权衡。
- 证明通过线性分类器实现高效符号化特征提取,可达到或超越深度学习与集成模型的性能。
提出的方法
- MrSQM 对原始时间序列应用多种符号化变换——符号聚合近似(SAX)和符号傅里叶近似(SFA),将其转换为符号序列。
- 在训练数据的所有子序列上执行高效的序列挖掘,以识别判别性模式。
- 提出一种新颖的监督特征选择方法,将判别性模式挖掘中的卡方边界适配至时间序列任务,实现对非有希望特征的快速剪枝。
- 该方法支持混合、监督和无监督的特征选择策略,其中简单的策略已被证明极为有效。
- MrSQM 使用逻辑回归作为最终分类器,利用经过筛选的大型特征空间实现高准确率。
- 该框架允许用户通过控制符号化表示的数量和类型(例如 MrSQM-k1、MrSQM-k5)来平衡速度与准确率。
实验结果
研究问题
- RQ1结合快速符号化变换与简单特征选择策略,是否能在时间序列分类中实现高准确率?
- RQ2MrSQM 在准确率和运行时间方面与 ROCKET、MiniROCKET 和 HIVE-COTE 等最先进方法相比表现如何?
- RQ3使用多种符号化表示(SAX 和 SFA)对特征多样性与分类准确率有何影响?
- RQ4在所有子序列空间中实现高效的特征选择,是否能优于更复杂的过滤方法?
- RQ5在不牺牲性能的前提下,能否在符号化分类器中实现对速度与准确率权衡的精细控制?
主要发现
- MrSQM 在 112 个 UEA/UCR 基准数据集上达到最先进准确率,与 ROCKET 的平均准确率差异仅为 0.002%,与 MiniROCKET 的差异为 0.007%。
- MrSQM 在全部 112 个数据集上完成训练与预测仅耗时 1.5 小时,显著快于 MrSEQL(10 小时),且与 ROCKET(2.5 小时)相当,同时准确率高于 WEASEL 和 MrSEQL。
- MrSQM-k1 变体仅用 20 分钟(0.33 小时)即实现高准确率,速度超过 MiniROCKET,准确率与之相当,且在成对准确率比较中相关系数达 0.97。
- 简单的特征选择策略优于更复杂的方案,表明高性能并不依赖于复杂的过滤机制。
- 该方法表明,符号化表示结合高效挖掘与线性分类器,可达到或超越 InceptionTime 等深度学习模型及 HIVE-COTE 等集成模型的准确率,但训练速度高出数个数量级。
- MrSQM 的性能与 ROCKET 和 MiniROCKET 相当,表明通过 SFA 提取的频域特征在符号化形式下被有效捕捉与利用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。