Skip to main content
QUICK REVIEW

[论文解读] It's Not What Machines Can Learn, It's What We Cannot Teach

Gal Yehuda, Moshe Gabel|arXiv (Cornell University)|Feb 21, 2020
Machine Learning and Algorithms参考文献 42被引用 8
一句话总结

本文证明,NP-hard 问题的多项式时间数据生成器不可避免地在 NP ∩ coNP 中产生有偏见的、更简单的子问题,导致无法在具有代表性的、均匀采样的数据上训练深度神经网络。在广泛接受的假设 NP ≠ coNP 下,此类生成器无法从完整的 NP-hard 问题空间中采样,从而导致在诸如合取查询包含(Conjunctive Query Containment)等任务上对模型性能的高估。

ABSTRACT

Can deep neural networks learn to solve any task, and in particular problems of high complexity? This question attracts a lot of interest, with recent works tackling computationally hard tasks such as the traveling salesman problem and satisfiability. In this work we offer a different perspective on this question. Given the common assumption that $ extit{NP} eq extit{coNP}$ we prove that any polynomial-time sample generator for an $ extit{NP}$-hard problem samples, in fact, from an easier sub-problem. We empirically explore a case study, Conjunctive Query Containment, and show how common data generation techniques generate biased datasets that lead practitioners to over-estimate model accuracy. Our results suggest that machine learning approaches that require training on a dense uniform sampling from the target distribution cannot be used to solve computationally hard problems, the reason being the difficulty of generating sufficiently large and unbiased training sets.

研究动机与目标

  • 调查使用多项式时间数据生成器在 NP-hard 问题上训练深度神经网络的根本限制。
  • 证明在 NP ≠ coNP 的假设下,任何高效的数据生成器都仅从 NP ∩ coNP 中的严格更简单子问题中采样。
  • 通过实证方法展示,有偏见的数据生成如何导致在 NP-hard 任务(如合取查询包含)上对模型准确率的高估。
  • 挑战大规模、均匀采样自 NP-hard 问题的数据集在监督深度学习中可行性的假设。
  • 探讨依赖于为计算难题生成合成数据的机器学习方法的含义。

提出的方法

  • 基于复杂性理论假设 NP ≠ coNP 的理论分析。
  • 证明任何针对 NP-hard 决策问题的多项式时间采样过程,必然从一个 NP ∩ coNP 子问题中采样。
  • 对合取查询包含(CQC)的实证案例研究,使用数据增强生成大规模训练集。
  • 在增强后的 CQC 数据集上训练神经网络,以评估其对更复杂实例的泛化能力。
  • 通过特征检查分析数据集偏差,表明分类基于表面模式而非问题复杂度。
  • 对比模型在生成数据与完整问题空间上的性能,以暴露对子问题的过拟合。

实验结果

研究问题

  • RQ1多项式时间数据生成器能否从完整的 NP-hard 问题空间中产生具有代表性的均匀样本?
  • RQ2在何种复杂性理论假设下,多项式时间数据生成器会无法从完整的 NP-hard 问题空间中采样?
  • RQ3NP-hard 问题的常见数据生成技术在多大程度上导致数据集有偏,从而偏好简单、表面的特征?
  • RQ4通过高效采样产生的数据集偏差如何影响深度学习模型在 NP-hard 任务上的泛化能力和感知准确率?
  • RQ5这些发现对在计算难题中使用监督学习有何影响?

主要发现

  • 在 NP ≠ coNP 的假设下,任何 NP-hard 问题的多项式时间数据生成器都仅从 NP ∩ coNP 子问题中采样,而该子问题严格比原始 NP-hard 问题更简单。
  • 本文构建了一个 NP-hard 语言,其中任何多项式时间数据生成器产生的实例均可通过表面特征(如长度或结构)轻松分类。
  • 合取查询包含的实证结果表明,基于增强的、多项式时间生成数据训练的模型在训练分布上表现高准确率,但无法泛化到更复杂、更困难的实例。
  • 该研究揭示,诸如数据增强和基于种子的采样等数据生成技术会产生有偏数据集,无法反映目标问题空间的全部复杂性。
  • 结果表明,使用合成数据进行监督深度学习在 NP-hard 问题上存在根本性限制,因为训练数据分布本质上不具备代表性。
  • 研究结果表明,为克服高效数据生成中固有的采样偏差,可能需要采用结合确定性求解器或可证明近似方法的混合模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。