[论文解读] It's Not What Machines Can Learn, It's What We Cannot Teach
本文证明,NP-hard 问题的多项式时间数据生成器不可避免地在 NP ∩ coNP 中产生有偏见的、更简单的子问题,导致无法在具有代表性的、均匀采样的数据上训练深度神经网络。在广泛接受的假设 NP ≠ coNP 下,此类生成器无法从完整的 NP-hard 问题空间中采样,从而导致在诸如合取查询包含(Conjunctive Query Containment)等任务上对模型性能的高估。
Can deep neural networks learn to solve any task, and in particular problems of high complexity? This question attracts a lot of interest, with recent works tackling computationally hard tasks such as the traveling salesman problem and satisfiability. In this work we offer a different perspective on this question. Given the common assumption that $ extit{NP} eq extit{coNP}$ we prove that any polynomial-time sample generator for an $ extit{NP}$-hard problem samples, in fact, from an easier sub-problem. We empirically explore a case study, Conjunctive Query Containment, and show how common data generation techniques generate biased datasets that lead practitioners to over-estimate model accuracy. Our results suggest that machine learning approaches that require training on a dense uniform sampling from the target distribution cannot be used to solve computationally hard problems, the reason being the difficulty of generating sufficiently large and unbiased training sets.
研究动机与目标
- 调查使用多项式时间数据生成器在 NP-hard 问题上训练深度神经网络的根本限制。
- 证明在 NP ≠ coNP 的假设下,任何高效的数据生成器都仅从 NP ∩ coNP 中的严格更简单子问题中采样。
- 通过实证方法展示,有偏见的数据生成如何导致在 NP-hard 任务(如合取查询包含)上对模型准确率的高估。
- 挑战大规模、均匀采样自 NP-hard 问题的数据集在监督深度学习中可行性的假设。
- 探讨依赖于为计算难题生成合成数据的机器学习方法的含义。
提出的方法
- 基于复杂性理论假设 NP ≠ coNP 的理论分析。
- 证明任何针对 NP-hard 决策问题的多项式时间采样过程,必然从一个 NP ∩ coNP 子问题中采样。
- 对合取查询包含(CQC)的实证案例研究,使用数据增强生成大规模训练集。
- 在增强后的 CQC 数据集上训练神经网络,以评估其对更复杂实例的泛化能力。
- 通过特征检查分析数据集偏差,表明分类基于表面模式而非问题复杂度。
- 对比模型在生成数据与完整问题空间上的性能,以暴露对子问题的过拟合。
实验结果
研究问题
- RQ1多项式时间数据生成器能否从完整的 NP-hard 问题空间中产生具有代表性的均匀样本?
- RQ2在何种复杂性理论假设下,多项式时间数据生成器会无法从完整的 NP-hard 问题空间中采样?
- RQ3NP-hard 问题的常见数据生成技术在多大程度上导致数据集有偏,从而偏好简单、表面的特征?
- RQ4通过高效采样产生的数据集偏差如何影响深度学习模型在 NP-hard 任务上的泛化能力和感知准确率?
- RQ5这些发现对在计算难题中使用监督学习有何影响?
主要发现
- 在 NP ≠ coNP 的假设下,任何 NP-hard 问题的多项式时间数据生成器都仅从 NP ∩ coNP 子问题中采样,而该子问题严格比原始 NP-hard 问题更简单。
- 本文构建了一个 NP-hard 语言,其中任何多项式时间数据生成器产生的实例均可通过表面特征(如长度或结构)轻松分类。
- 合取查询包含的实证结果表明,基于增强的、多项式时间生成数据训练的模型在训练分布上表现高准确率,但无法泛化到更复杂、更困难的实例。
- 该研究揭示,诸如数据增强和基于种子的采样等数据生成技术会产生有偏数据集,无法反映目标问题空间的全部复杂性。
- 结果表明,使用合成数据进行监督深度学习在 NP-hard 问题上存在根本性限制,因为训练数据分布本质上不具备代表性。
- 研究结果表明,为克服高效数据生成中固有的采样偏差,可能需要采用结合确定性求解器或可证明近似方法的混合模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。