[论文解读] WOODS: Benchmarks for Out-of-Distribution Generalization in Time Series
WOODS 提出一个包含10个多样化时间序列数据集的基准,涵盖视频、脑电信号和传感器数据,用于研究分布外(OOD)泛化。作者将OOD算法适配至时间序列任务,系统性地评估其性能,揭示了在分布外设置下与分布内设置之间存在显著的性能差距——凸显了在使用经验风险最小化和现有方法时,时间序列OOD泛化面临重大未解决挑战。
Machine learning models often fail to generalize well under distributional shifts. Understanding and overcoming these failures have led to a research field of Out-of-Distribution (OOD) generalization. Despite being extensively studied for static computer vision tasks, OOD generalization has been underexplored for time series tasks. To shine light on this gap, we present WOODS: eight challenging open-source time series benchmarks covering a diverse range of data modalities, such as videos, brain recordings, and sensor signals. We revise the existing OOD generalization algorithms for time series tasks and evaluate them using our systematic framework. Our experiments show a large room for improvement for empirical risk minimization and OOD generalization algorithms on our datasets, thus underscoring the new challenges posed by time series tasks. Code and documentation are available at https://woods-benchmarks.github.io .
研究动机与目标
- 解决时间序列领域中分布外(OOD)泛化缺乏标准化基准的紧迫问题,该领域与静态计算机视觉相比严重缺乏探索。
- 识别并量化现有OOD泛化算法在时间序列数据上应用时的失败模式,特别是在分布偏移情况下的表现。
- 开发一个系统化的评估框架,以实现对时间序列任务中OOD泛化算法的一致性基准测试。
- 突出时间序列数据带来的独特挑战,如时间依赖性和多样化模态,这些特性使其与静态图像任务区分开来。
- 通过开放源代码、数据集和文档,加速鲁棒时间序列表征学习研究。
提出的方法
- 提出 WOODS:一个包含10个时间序列数据集的基准,包括3个合成数据集和7个真实世界数据集,涵盖视频、EEG、智能设备传感器和能效信号等多种模态。
- 设计一个系统化的评估框架,支持在各种分布偏移下进行模型训练、验证和测试,并为合成数据与真实世界数据分别制定模型选择策略。
- 通过调整网络架构和损失函数以尊重时间结构,将现有OOD泛化算法(如分布偏移感知方法和不变风险最小化)适配至时间序列任务。
- 实施两种不同的模型选择协议:针对具有相关性偏移的合成数据集采用测试域验证;针对真实世界数据集采用原始训练域验证,以避免对测试数据过拟合。
- 应用领域不变表示学习技术于时间序列,包括对比学习和领域对抗训练,以促进跨领域的泛化能力。
- 使用领域特定的数据划分来模拟分布偏移,确保OOD性能在训练过程中未见过的真实分布领域上进行评估。
实验结果
研究问题
- RQ1现有OOD泛化算法在时间序列数据上的表现与在静态图像上的表现相比如何?
- RQ2在真实世界时间序列数据中,哪些类型的分布偏移最为普遍且具有挑战性?
- RQ3经验风险最小化(ERM)在时间序列的OOD设置下性能如何退化,泛化差距的幅度有多大?
- RQ4在测试数据不可用于训练的情况下,哪些模型选择策略在时间序列OOD泛化中最为有效?
- RQ5当前OOD方法在涵盖多样化模态和偏移类型的时序基准上,能在多大程度上缓解性能下降?
主要发现
- 经验风险最小化(ERM)在 WOODS 基准上表现出巨大的泛化差距,例如在 TCM Time 数据集上性能最高下降达79.3个百分点。
- 在 Spur.-Fourier 合成数据集上,ERM 在分布内准确率达到74.5%,但在分布外仅达9.8%,表明其严重依赖虚假相关性。
- OOD泛化算法在时间序列上的改进有限,性能增益在不同数据集间不一致,表明当前方法对时间序列特有的偏移不具鲁棒性。
- 即使是最先进的OOD方法也无法在真实世界时间序列数据(如 LSA64 数据集)上弥合泛化差距,其中OOD性能从ID的86.6%下降至53.4%。
- IEMOCAP 数据集在OOD偏移下性能下降11.4个百分点,表明情感语音识别模型对时间序列语音模式的分布偏移具有脆弱性。
- 测试域验证在具有相关性偏移的合成数据集中有效,但在真实世界数据中失效,因缺乏早停指导;原始训练域验证被证明在真实世界基准中更为可靠。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。