Skip to main content
QUICK REVIEW

[论文解读] Using Abduction in Markov Logic Networks for Root Cause Analysis

Joerg Schoenfisch, Janno von Stülpnagel|arXiv (Cornell University)|Nov 18, 2015
Software System Performance and Reliability参考文献 17被引用 3
一句话总结

本文提出了一种新颖的方法,通过将归谬推理与马尔可夫逻辑网络(MLNs)相结合,实现从不完整观测中计算最可能的根本原因,从而在IT基础设施中进行根本原因分析。通过将系统依赖关系和故障风险建模为加权一阶逻辑公式,该方法利用MLN推理识别故障的最可能原因,并在真实场景中得到验证,实现了准确的根本原因识别。

ABSTRACT

IT infrastructure is a crucial part in most of today's business operations. High availability and reliability, and short response times to outages are essential. Thus a high amount of tool support and automation in risk management is desirable to decrease outages. We propose a new approach for calculating the root cause for an observed failure in an IT infrastructure. Our approach is based on Abduction in Markov Logic Networks. Abduction aims to find an explanation for a given observation in the light of some background knowledge. In failure diagnosis, the explanation corresponds to the root cause, the observation to the failure of a component, and the background knowledge to the dependency graph extended by potential risks. We apply a method to extend a Markov Logic Network in order to conduct abductive reasoning, which is not naturally supported in this formalism. Our approach exhibits a high amount of reusability and enables users without specific knowledge of a concrete infrastructure to gain viable insights in the case of an incident. We implemented the method in a tool and illustrate its suitability for root cause analysis by applying it to a sample scenario.

研究动机与目标

  • 解决在复杂、相互依赖的IT基础设施中识别最可能根本原因的挑战,其中故障可能源于非显而易见的来源。
  • 在统一框架中结合概率推理与逻辑归谬,支持不确定性处理和可重用的领域知识。
  • 通过将基础设施依赖关系和风险建模为带权重的一阶逻辑公式,实现根本原因诊断的自动化。
  • 支持一种迭代的、对话式的诊断过程,通过引入新观测不断优化计算出的根本原因解释。
  • 通过涉及实际基础设施故障的真实世界场景,证明该方法的可行性与实际效用。

提出的方法

  • 将IT基础设施建模为一阶逻辑网络,其中硬公式表示组件之间的依赖关系。
  • 为表示各种风险和故障模式的概率,分配软性加权公式,其权重来源于专家知识或统计数据。
  • 采用Kate等人提出的归谬推理框架扩展MLN,以实现对观测到故障的最可能解释的推理。
  • 将观测到的症状(例如服务中断)作为证据输入系统,即使其不完整或存在噪声。
  • 使用RockIt MLN推理引擎,通过归谬推理计算最大后验解释。
  • 通过不断引入新观测,迭代优化解释,支持一种对话式的诊断过程。

实验结果

研究问题

  • RQ1如何有效将归谬推理集成到马尔可夫逻辑网络中,以支持IT系统中的根本原因分析?
  • RQ2在观测不完整的情况下,带有加权一阶逻辑公式的MLN能否准确识别故障的最可能根本原因?
  • RQ3与纯粹的逻辑方法或纯粹的概率方法相比,该方法在表达能力和诊断准确性方面有何差异?
  • RQ4可重用的领域知识(例如来自IT Grundschutz目录的知识)在多大程度上可以被编码并应用于诊断过程?
  • RQ5在真实故障场景中,迭代的、以观测为导向的优化过程在缩小根本原因范围方面的有效性如何?

主要发现

  • 该方法在研究团队基础设施中的两个真实故障场景中成功识别出正确的根本原因,证明了其实际适用性。
  • 将归谬推理与MLNs结合,能够计算出最可能的解释,避免了枚举所有可能解释的需要。
  • 使用一阶逻辑支持对不同组件和基础设施中风险与依赖关系的可扩展、可重用建模。
  • 该方法通过计算与证据和背景知识最一致的解释,有效处理了不完整或可能不准确的观测。
  • RockIt MLN求解器在该问题规模上表现出良好性能,支持该方法在大规模基础设施中的可行性。
  • 与纯粹的逻辑方法相比,该方法在处理不确定性方面表现更优;与命题模型相比,其在表达结构化、关系型知识方面更具优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。