Skip to main content
QUICK REVIEW

[论文解读] MixRL: Data Mixing Augmentation for Regression using Reinforcement Learning.

Seonghyeon Hwang, Steven Euijong Whang|arXiv (Cornell University)|Jun 7, 2021
Machine Learning and Data Classification参考文献 28被引用 5
一句话总结

MixRL 是一种基于强化学习的回归数据增强框架,通过蒙特卡洛策略梯度方法为每个样本学习最优混合策略。它通过仅在学习到的距离阈值范围内混合附近的训练样本,选择性地进行混合,从而在合成数据集和真实世界回归数据集上优于当前最先进基线方法。

ABSTRACT

Data augmentation is becoming essential for improving regression accuracy in critical applications including manufacturing and finance. Existing techniques for data augmentation largely focus on classification tasks and do not readily apply to regression tasks. In particular, the recent Mixup techniques for classification rely on the key assumption that linearity holds among training examples, which is reasonable if the label space is discrete, but has limitations when the label space is continuous as in regression. We show that mixing examples that either have a large data or label distance may have an increasingly-negative effect on model performance. Hence, we use the stricter assumption that linearity only holds within certain data or label distances for regression where the degree may vary by each example. We then propose MixRL, a data augmentation meta learning framework for regression that learns for each example how many nearest neighbors it should be mixed with for the best model performance using a small validation set. MixRL achieves these objectives using Monte Carlo policy gradient reinforcement learning. Our experiments conducted both on synthetic and real datasets show that MixRL significantly outperforms state-of-the-art data augmentation baselines. MixRL can also be integrated with other classification Mixup techniques for better results.

研究动机与目标

  • 解决现有数据增强技术的局限性,这些技术主要针对分类任务设计,假设标签空间具有全局线性性,因此在具有连续标签的回归任务中表现不佳。
  • 克服在回归中混合数据或标签距离较大的样本所带来的负面影响,此类混合会降低模型性能。
  • 提出一种元学习框架,为每个训练样本学习应混合多少个以及与哪些最近邻进行混合,以最大化验证性能。
  • 将强化学习与数据增强相结合,为每个样本动态适应混合策略,从而提升回归任务中的泛化能力。
  • 实现与现有分类 Mixup 方法的兼容性,以在混合设置中进一步提升性能。

提出的方法

  • 将回归中的数据混合建模为一个序列决策问题,其中智能体为每个训练样本选择与之混合的邻居。
  • 使用蒙特卡洛策略梯度强化学习优化混合策略,以验证损失作为奖励信号。
  • 定义一种状态表示,包含目标样本的输入特征和标签,以及与候选邻居的距离。
  • 应用随机策略网络采样邻居集合,其中策略经过训练以最大化预期验证性能。
  • 将混合限制在通过强化学习学习到的、与样本相关的距离阈值范围内,以保持局部线性性并避免有害的插值。
  • 将 MixRL 与现有的 Mixup 风格增强技术集成,支持在多任务或迁移学习场景中的混合使用。

实验结果

研究问题

  • RQ1强化学习能否有效用于学习回归任务中的最优数据混合策略?
  • RQ2通过基于学习到的数据和标签距离限制仅混合附近样本,是否相比全局混合能提升回归性能?
  • RQ3在回归数据集上,MixRL 与当前最先进基线方法相比,在泛化能力和鲁棒性方面表现如何?
  • RQ4MixRL 能否与现有的分类 Mixup 方法结合,以在混合或迁移学习设置中进一步提升性能?

主要发现

  • MixRL 在合成数据集和真实世界回归数据集上均显著优于现有数据增强基线方法,表现出持续提升的回归准确率。
  • 通过避免混合距离较远的样本,模型实现了更好的泛化能力,而这类混合在标准 Mixup 方法中会降低性能。
  • 通过强化学习学习到的样本特定混合阈值,相比固定或全局距离约束,能实现更有效且更稳定的增强。
  • MixRL 与现有分类 Mixup 技术兼容并能进一步增强其性能,表明其在多任务学习中具有更广泛的应用潜力。
  • 实验表明,基于策略梯度的方法能有效学习到与验证性能提升相关的有意义混合策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。