[论文解读] Automatic Root Cause Analysis via Large Language Models for Cloud Incidents
本文提出 RCACopilot,一种基于大语言模型(LLM)的系统,通过聚合多源诊断数据(日志、指标、链路追踪)并利用大语言模型预测和解释根本原因类别,实现对云环境故障的根本原因分析(RCA)自动化。在真实世界微软数据集上的评估显示,RCACopilot 的 RCA 准确率最高达到 0.766,显著降低了值班工程师的手动工作量。
Ensuring the reliability and availability of cloud services necessitates efficient root cause analysis (RCA) for cloud incidents. Traditional RCA methods, which rely on manual investigations of data sources such as logs and traces, are often laborious, error-prone, and challenging for on-call engineers. In this paper, we introduce RCACopilot, an innovative on-call system empowered by the large language model for automating RCA of cloud incidents. RCACopilot matches incoming incidents to corresponding incident handlers based on their alert types, aggregates the critical runtime diagnostic information, predicts the incident's root cause category, and provides an explanatory narrative. We evaluate RCACopilot using a real-world dataset consisting of a year's worth of incidents from Microsoft. Our evaluation demonstrates that RCACopilot achieves RCA accuracy up to 0.766. Furthermore, the diagnostic information collection component of RCACopilot has been successfully in use at Microsoft for over four years.
研究动机与目标
- 解决复杂云系统中手动根本原因分析(RCA)耗时且易出错的问题。
- 通过自动化收集和解释来自日志、指标和链路追踪的诊断数据,减轻值班工程师的认知负担。
- 通过利用大语言模型(LLMs)进行根本原因预测和解释,提升 RCA 的准确性和速度。
- 通过预定义的故障处理模块和 LLM 驱动的诊断,实现可扩展、可泛化的故障处理。
- 将诊断数据收集与基于 LLM 的 RCA 集成到一个统一的、可投入生产的系统中,适用于真实世界的云环境。
提出的方法
- RCACopilot 使用故障处理模块——由工程师定义的逻辑模块——将传入的告警匹配到相应的值班团队,并启动诊断数据收集。
- 根据告警类型和系统上下文,聚合来自日志、指标和链路追踪的关键运行时诊断信息。
- 系统采用大语言模型(LLM)处理收集到的诊断数据,利用思维链推理预测根本原因类别。
- LLM 为预测的根本原因生成解释性叙述,提升透明度并辅助工程师理解。
- 诊断数据收集组件已在微软生产环境中稳定运行超过四年,确保了系统的鲁棒性与可扩展性。
- 系统基于微软云服务一年的故障真实数据集进行评估。

实验结果
研究问题
- RQ1基于大语言模型的系统能否有效利用聚合的多源诊断数据,预测云故障的根本原因类别?
- RQ2在真实生产环境中,基于大语言模型的 RCA 与传统手动方法相比,准确率如何?
- RQ3预定义的故障处理模块在多大程度上提升了诊断数据收集的一致性与效率?
- RQ4该系统在不同类型的故障和云服务工作负载上泛化能力如何?
- RQ5LLM 生成的解释对值班工程师的决策制定和故障处理速度有何影响?
主要发现
- RCACopilot 在微软云故障的真实数据集上实现了高达 0.766 的根本原因分析准确率。
- RCACopilot 的诊断信息收集组件已在微软生产环境中稳定运行超过四年,证明了其长期稳定性和可靠性。
- 该系统通过根据告警类型和故障上下文自动聚合日志、指标和链路追踪,显著减少了人工工作量。
- 基于 LLM 的根本原因预测阶段利用思维链推理生成可解释的说明,提升了透明度与信任感。
- 当监控系统未能检测到故障,或针对特定告警类型缺乏对应处理模块时,系统性能受到限制。
- 尽管 LLM 在多轮运行中存在不稳定性,但评估结果表现出一致性,且通过仔细的代码验证有效缓解了实现偏差。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。