[论文解读] Regularising Non-linear Models Using Feature Side-information
本文提出了一种用于非线性模型的新正则化框架,通过利用特征的辅助信息,通过强制模型对相似特征的相对变化保持不变性,从而提升预测性能。该方法使用基于敏感度的正则化项,通过雅可比行列式或数据增强进行近似,相较于ℓ₂和dropout在基准数据集上取得了显著提升,尤其当辅助信息相关时效果更明显。
Very often features come with their own vectorial descriptions which provide detailed information about their properties. We refer to these vectorial descriptions as feature side-information. In the standard learning scenario, input is represented as a vector of features and the feature side-information is most often ignored or used only for feature selection prior to model fitting. We believe that feature side-information which carries information about features intrinsic property will help improve model prediction if used in a proper way during learning process. In this paper, we propose a framework that allows for the incorporation of the feature side-information during the learning of very general model families to improve the prediction performance. We control the structures of the learned models so that they reflect features similarities as these are defined on the basis of the side-information. We perform experiments on a number of benchmark datasets which show significant predictive performance gains, over a number of baselines, as a result of the exploitation of the side-information.
研究动机与目标
- 解决在非线性模型学习中整合特征辅助信息(即特征的向量描述)以提升预测性能这一尚未被充分探索的问题。
- 克服现有方法的局限性,即要么忽略辅助信息,要么仅在预处理阶段或针对低阶多项式以临时方式应用。
- 开发一种通用的正则化技术,强制模型对根据辅助信息判断为相似的特征的相对变化保持不变。
- 提供两种实用的近似方法——解析方法(基于雅可比)和随机方法(基于数据增强)——使正则化项在深度神经网络中计算上可行。
- 在合成数据集和真实世界数据集上展示该方法的有效性,表明性能提升取决于辅助信息的相关性。
提出的方法
- 定义一种敏感度度量,量化在所有可能的特征值相对变化下模型输出范数的变化,对数据分布和相对变化进行积分。
- 通过一阶泰勒展开对敏感度度量进行解析近似,将其简化为偏导数差值的平方范数,从而导出模型输入特征雅可比矩阵上的拉普拉斯正则化项。
- 通过生成具有相对特征值变化的增强数据样本来实现随机近似,仅在这些样本上估计正则化项。
- 通过将正则化项加入损失函数并引入超参数λ控制其强度,将正则化项整合到神经网络训练中。
- 利用从辅助信息导出的特征相似度矩阵,定义用于解析正则化项中的拉普拉斯矩阵。
- 在多个基准数据集上训练采用所提正则化项的模型,并与ℓ₂权重衰减和dropout的性能进行对比。
实验结果
研究问题
- RQ1能否在一般非线性模型的训练过程中有效利用特征辅助信息以提升预测性能?
- RQ2如何设计一种正则化策略,确保模型以一致的方式对待根据辅助信息定义为相似的特征?
- RQ3在深度学习设置中,有哪些有效且可扩展的近似方法可用于所提出的基于敏感度的正则化项?
- RQ4所提方法在多种数据集上的性能与ℓ₂和dropout等成熟正则化技术相比如何?
- RQ5辅助信息的相关性在多大程度上影响正则化项的有效性?
主要发现
- 所提方法(ST,即随机方法)在八组数据集中的六组上显著优于ℓ₂权重衰减,在一组上表现相当,剩余一组无显著差异。
- ST在八组数据集中的四组上显著优于dropout,三组表现更差,一组无显著差异。
- 在两层隐藏层设置下,ST在三组数据集中显著优于ℓ₂,在三组中表现更差,在两组中相当,表明其性能提升具有一致性但并非普遍占优。
- 在BBCSport数据集上,ST在两层隐藏层下分类误差为2.04%,而ℓ₂为2.85%,dropout为2.99%,显示出明显改进。
- 该方法在人工数据集上表现最佳,此时辅助信息与数据生成过程一致,证实性能提升取决于辅助信息的相关性。
- 当辅助信息无关时,正则化项处于非活跃状态,因为此时超参数λ被调至零,表明对无关辅助信息具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。