Skip to main content
QUICK REVIEW

[论文解读] Regularizing Towards Permutation Invariance in Recurrent Models

Edo Cohen-Karlik, Avichai Ben David|arXiv (Cornell University)|Oct 25, 2020
Computational Geometry and Mesh Generation参考文献 20被引用 7
一句话总结

本文提出一种新颖的正则化方法——子集不变性正则化(SIRE),用于在循环神经网络(RNN)中引入排列不变性,使其能够以更少的参数建模基于集合的函数,优于非循环架构。通过惩罚输入子集排列下模型输出的变化,SIRE在合成数据集和真实世界数据集上均表现出色,尤其在先前方法失效的半排列不变性设置中表现更优。

ABSTRACT

In many machine learning problems the output should not depend on the order of the input. Such "permutation invariant" functions have been studied extensively recently. Here we argue that temporal architectures such as RNNs are highly relevant for such problems, despite the inherent dependence of RNNs on order. We show that RNNs can be regularized towards permutation invariance, and that this can result in compact models, as compared to non-recurrent architectures. We implement this idea via a novel form of stochastic regularization. Existing solutions mostly suggest restricting the learning problem to hypothesis classes which are permutation invariant by design. Our approach of enforcing permutation invariance via regularization gives rise to models which are extit{semi permutation invariant} (e.g. invariant to some permutations and not to others). We show that our method outperforms other permutation invariant approaches on synthetic and real world datasets.

研究动机与目标

  • 解决机器学习中排列不变函数学习的挑战,特别是当数据表现出部分或无严格不变性时。
  • 证明尽管RNN本身具有顺序依赖性,但可通过有效正则化实现排列不变性。
  • 提出一种软正则化方法,实现半排列不变性——适用于全不变性不必要或不可行的场景。
  • 表明使用SIRE正则化的RNN在样本效率和准确率方面优于标准RNN和完全不变架构(如DeepSets)。
  • 通过利用数据内在的排列结构,在半监督设置中实现未标记数据的有效利用。

提出的方法

  • 提出一种新颖的正则化项SIRE(子集不变性正则化),通过惩罚同一输入序列以不同顺序处理时模型输出的差异,特别关注输入子集的排列。
  • 将正则化损失定义为所有输入子集排列下预测差异的平均值,目标是在训练过程中最小化该差异。
  • 使用随机梯度下降优化标准RNN损失加上SIRE正则化项,使模型能够学习一种对输入顺序不敏感的隐藏状态表示。
  • 将正则化应用于RNN、LSTM和GRU,证明其在不同循环架构中的有效性。
  • 证明SIRE使RNN能够以远少于DeepSets的参数量学习排列不变函数,尤其在复杂函数(如奇偶函数)上表现显著。
  • 提出SIRE的一种变体,作用于局部扰动数据(如局部扰动MNIST),在部分不变性设置中表现出色。

实验结果

研究问题

  • RQ1RNN是否可在不改变架构的前提下,通过有效正则化实现排列不变性?
  • RQ2SIRE正则化与完全不变架构(如DeepSets)相比,在参数效率和性能方面如何?
  • RQ3SIRE能否应用于全不变性不适当或不可行的半排列不变问题?
  • RQ4SIRE正则化是否能提升优化稳定性与泛化能力,特别是在低数据量场景下?
  • RQ5SIRE能否通过利用具有内在排列结构的未标记数据,在半监督学习中发挥作用?

主要发现

  • SIRE正则化显著提升了RNN在排列不变任务上的性能,在局部扰动MNIST上测试准确率达到0.977,而标准GRU仅为0.833。
  • 正则化后的RNN在合成奇偶函数和集合分类任务上优于标准RNN,并与DeepSets性能相当或更优。
  • 对于奇偶函数,使用SIRE正则化的RNN仅需O(1)参数,而DeepSets需要O(n)参数,展现出显著的样本复杂度优势。
  • SIRE能有效建模部分不变数据,如局部扰动MNIST,其中CNN准确率为0.963,标准RNN为0.833,而SIRE正则化RNN达到0.977。
  • 与Murphy等人提出的子采样排列方法相比,SIRE扩展性更优,避免了指数级复杂度,即使在更大集合规模下仍保持高效。
  • 实证结果表明,SIRE正则化可能通过作用于更短、更稳定的序列,减轻梯度消失问题,从而改善优化过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。