[论文解读] Inductive Learning of Answer Set Programs from Noisy Examples
本文提出 ILP_LOAS^noise,一种针对从噪声示例中学习答案集程序(ASPs)的噪声容忍框架,扩展了 ILASP3 系统以处理不完美数据。即使在 20% 的示例为噪声的情况下,该方法仍能实现超过 90% 的准确率,通过成本函数保证最优解,且无需事先知晓噪声水平,优于其他 ILP 系统。
In recent years, non-monotonic Inductive Logic Programming has received growing interest. Specifically, several new learning frameworks and algorithms have been introduced for learning under the answer set semantics, allowing the learning of common-sense knowledge involving defaults and exceptions, which are essential aspects of human reasoning. In this paper, we present a noise-tolerant generalisation of the learning from answer sets framework. We evaluate our ILASP3 system, both on synthetic and on real datasets, represented in the new framework. In particular, we show that on many of the datasets ILASP3 achieves a higher accuracy than other ILP systems that have previously been applied to the datasets, including a recently proposed differentiable learning framework.
研究动机与目标
- 解决认知系统中从现实世界噪声数据中学习可解释、人类可理解知识的挑战。
- 扩展 ILASP 框架以处理噪声示例,同时保持学习非单调知识(含默认、例外和偏好)的能力。
- 开发一种系统,保证找到最优解,且无需事先知晓数据中的噪声水平。
- 评估 ILASP3 在不同噪声条件下对合成数据集和真实世界数据集的性能。
- 证明基于最优假设搜索的方法在准确率上优于非优化型 ILP 系统。
提出的方法
- 提出 ILP_LOAS^noise,作为从答案集(LAS)框架的泛化,通过引入平衡覆盖度与假设复杂度的成本函数,以处理噪声示例。
- 使用结合示例覆盖度与假设长度的成本函数,引导最优假设的搜索,最小化成本,且无需预设噪声阈值。
- 采用假设空间生成策略,预先计算所有可能的假设,从而实现对最优解的穷举搜索。
- 将 ILASP3 系统应用于具有可控噪声水平的数据集,包括合成数据集(哈密顿图、旅程偏好)和真实世界数据集(事件理论、句子切分、偏好学习)。
- 引入一种噪声容忍的学习策略,即假设基于其覆盖多数示例的能力并最小化复杂度进行评估,即使部分示例标签错误亦可适用。
- 依赖答案集语义表示和学习非单调知识,包括“失败即否定”机制,从而支持默认和例外的建模。
实验结果
研究问题
- RQ1噪声容忍型 ILP 系统能否从最多 20% 示例被错误标注的数据集中学习到高准确率的 ASP 程序?
- RQ2通过成本函数保证最优解搜索,是否能提升在噪声数据上的准确率,相比非优化型 ILP 系统?
- RQ3ILASP3 在真实世界数据集上的表现是否优于现有 ILP 系统,包括可微学习框架?
- RQ4该系统能否在无需事先估计噪声水平的情况下,从噪声示例中学习到包含默认、例外和偏好的复杂知识?
- RQ5假设空间大小对可扩展性有何影响?未来系统如何提升效率?
主要发现
- 在合成数据集(哈密顿图和旅程偏好)中,即使 20% 的示例被错误标注,ILASP3 的准确率仍超过 90%。
- 在真实世界数据集(事件理论、句子切分、偏好学习)上,ILASP3 表现优于其他 ILP 系统,包括近期提出的可微学习框架。
- 由于基于成本函数保证找到最优解,该系统始终比非优化型 ILP 系统具有更高的准确率。
- 与需要输入噪声比例的系统(如 HYPER/N)不同,ILASP3 无需事先知晓噪声水平。
- 尽管有所改进,可扩展性仍受限于在开始时即计算完整的假设空间,尤其在大规模或复杂问题上。
- 结果表明,基于成本函数的优化能带来更好的泛化能力和更高的准确率,即使最优假设不能完全泛化到未见数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。