[论文解读] Uncertainty-aware Evaluation of Time-Series Classification for Online Handwriting Recognition with Domain Shift
本文通过SWAG和Deep Ensembles方法,在领域偏移(右撇子与左撇子写作者之间)的在线手写识别任务中评估了不确定性感知的时间序列分类,结果表明熵和互信息与模型准确率高度相关,能够有效检测分布外样本,尤其在区分右撇子与左撇子写作者方面表现突出。
For many applications, analyzing the uncertainty of a machine learning model is indispensable. While research of uncertainty quantification (UQ) techniques is very advanced for computer vision applications, UQ methods for spatio-temporal data are less studied. In this paper, we focus on models for online handwriting recognition, one particular type of spatio-temporal data. The data is observed from a sensor-enhanced pen with the goal to classify written characters. We conduct a broad evaluation of aleatoric (data) and epistemic (model) UQ based on two prominent techniques for Bayesian inference, Stochastic Weight Averaging-Gaussian (SWAG) and Deep Ensembles. Next to a better understanding of the model, UQ techniques can detect out-of-distribution data and domain shifts when combining right-handed and left-handed writers (an underrepresented group).
研究动机与目标
- 评估在右撇子与左撇子写作者之间存在领域偏移的在线手写识别(OnHW)任务中,不确定性量化(UQ)技术的表现。
- 通过置信度校准、期望校准误差(ECE)和可靠性图,评估异方差不确定性与认知不确定性估计的可靠性。
- 探究不确定性分解是否能够有效检测分布外样本,并提升模型在真实部署中的鲁棒性。
- 比较SWAG与Deep Ensembles在具有领域偏移的时空多变量时间序列(MTS)分类任务中的性能与计算成本。
- 评估不确定性度量在组合大写、小写及混合字符分类任务中的泛化能力。
提出的方法
- 采用随机权重平均-高斯分布(SWAG)和Deep Ensembles方法进行贝叶斯推理,以估计OnHW模型的预测不确定性。
- 基于Kwon等人(2018)和Smith等人(2018)的方法,通过熵和互信息实现不确定性分解,以分离异方差不确定性与认知不确定性。
- 采用置信度校准与期望校准误差(ECE)评估模型可靠性及校准偏差。
- 在右撇子写作者数据上进行模型训练,并在左撇子写作者数据上进行评估,以模拟领域偏移。
- 通过可靠性图与熵分布可视化不确定性,评估不确定预测的阈值策略。
- 将配备传感器的笔所采集的多变量时间序列(MTS)数据(包括加速度计、陀螺仪、磁力计与力传感器)作为分类模型的输入。
实验结果
研究问题
- RQ1SWAG与Deep Ensembles在具有领域偏移的OnHW任务中的不确定性估计表现如何比较?
- RQ2在OnHW任务中,熵与互信息与分类准确率的相关性有多强?
- RQ3不确定性分解是否能有效检测分布外样本,尤其是左撇子写作者的样本?
- RQ4当在右撇子写作者数据上训练并在左撇子写作者数据上测试时,模型性能与校准情况如何变化?
- RQ5不确定性阈值在真实手写识别系统部署中具有哪些实际影响?
主要发现
- SWAG与Deep Ensembles在不确定性估计方面表现相近,但SWAG计算效率更高。
- 熵与互信息与模型准确率高度相关,当熵超过2.0比特阈值时,准确率约为82%;低于该阈值时,准确率约为31%。
- 仅在右撇子写作者数据上训练的模型在左撇子写作者数据上评估时表现出过度自信与校准偏差,表明存在领域偏移的影响。
- 与单一大小写任务相比,组合大写与小写字母分类任务的准确率更低,不确定性更高。
- 通过熵与互信息进行的不确定性分解无法清晰区分异方差与认知不确定性来源,限制了可解释性。
- 由于传感器数据解释的复杂性以及与书写风格或运动特征之间缺乏直接关联,预先定义可靠的不确定性阈值具有挑战性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。