Skip to main content
QUICK REVIEW

[论文解读] Which Learning Algorithms Can Generalize Identity-Based Rules to Novel Inputs?

Paul Tupper, Bobak Shahriari|arXiv (Cornell University)|May 12, 2016
Neural Networks and Applications被引用 6
一句话总结

本文提出一个形式化框架,用以确定学习算法在何种情况下无法将基于身份的规则(例如要求单词中包含两个相同元素)泛化到新输入。该文证明,对称算法(包括采用局部编码和分布式编码的多层前馈神经网络)除非在几乎所有可能输入上进行训练,否则无法学习此类规则,从而解释了为何尽管深层神经网络架构深度足够,其在代数泛化方面仍表现不佳。

ABSTRACT

We propose a novel framework for the analysis of learning algorithms that allows us to say when such algorithms can and cannot generalize certain patterns from training data to test data. In particular we focus on situations where the rule that must be learned concerns two components of a stimulus being identical. We call such a basis for discrimination an identity-based rule. Identity-based rules have proven to be difficult or impossible for certain types of learning algorithms to acquire from limited datasets. This is in contrast to human behaviour on similar tasks. Here we provide a framework for rigorously establishing which learning algorithms will fail at generalizing identity-based rules to novel stimuli. We use this framework to show that such algorithms are unable to generalize identity-based rules to novel inputs unless trained on virtually all possible inputs. We demonstrate these results computationally with a multilayer feedforward neural network.

研究动机与目标

  • 建立一个形式化标准,以判断学习算法在何种情况下无法将基于身份的规则泛化到未见输入。
  • 识别出阻止标准神经网络等算法学习此类规则的核心结构性限制——对称性不变性。
  • 证明即使具有多隐藏层的深层前馈网络,在出现新片段时也无法泛化基于身份的语法。
  • 将算法的局限性与人类般的泛化能力进行对比,表明人类受试者能从有限训练数据中轻易推断出身份规则。
  • 为先前关于“变量实例化”和“训练空间外泛化”的非正式主张提供严谨的形式化基础。

提出的方法

  • 作者将学习算法定义为从训练数据映射到模型参数,再映射到新输入输出得分的函数。
  • 引入对称性不变性的概念:若算法在输入经由该对称性变换后输出保持不变,则称该算法对该变换具有不变性。
  • 一个关键的理论结果证明:若算法和训练数据均在某一对称性下不变,则该算法无法学习破坏该对称性的语法。
  • 本文将该框架应用于基于身份的规则,识别出一种特定对称性(即相同片段的置换)是此类规则所不遵守的。
  • 通过使用具有局部编码和分布式编码(k=26)的多层前馈神经网络,在双字母单词任务上对框架进行计算验证。
  • 实验采用L-BFGS优化,使用1–3个隐藏层(256–1024个单元),并在如YY、ZZ、YZ和ZY等新输入上评估得分。

实验结果

研究问题

  • RQ1在何种条件下,学习算法会无法将基于身份的规则泛化到新输入?
  • RQ2为何标准连接主义模型和前馈神经网络尽管具有深层架构,仍无法学习基于身份的规则?
  • RQ3何种形式化标准可区分能够与无法泛化此类规则的算法?
  • RQ4为何算法的对称性不变性会阻止其学习非不变语法,即使经过大量训练?
  • RQ5分布式表征或权重共享能否克服神经网络中的这一根本性限制?

主要发现

  • 采用局部编码的神经网络对语法正确的单词如YY和语法错误的单词如YZ分配相似得分(~0.3–0.5),无法区分基于身份的规则。
  • 即使使用分布式编码,网络对YY和YZ均给出高分(>0.5),表明对语法正确与错误的新输入无区分能力。
  • 增加隐藏层数量(最多三层)也无法改善泛化性能,YY、ZZ、YZ和ZY的得分在统计上无显著差异。
  • 失败原因并非仅源于输入表征,因为相同性能低下在局部编码和分布式编码下均持续存在。
  • 理论分析确认,任何在片段置换对称性下不变的算法,若其训练数据未打破该对称性,则无法学习基于身份的规则。
  • 尽管具备强大容量,深度学习架构仍无法克服这一基于对称性的根本性限制,无法泛化代数规则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。