Skip to main content
QUICK REVIEW

[论文解读] Extracting Self-Consistent Causal Insights from Users Feedback with LLMs and In-context Learning

Sara Abdali, Anjali Parikh|arXiv (Cornell University)|Dec 11, 2023
Software Engineering Research被引用 4
一句话总结

本文提出了一种基于大语言模型(LLMs)的自洽、上下文学习框架,用于从 Windows 反馈中心的用户反馈中提取因果变量和事件序列。通过利用 LLM 的推理能力及改进的自洽方法,该方法在零幻觉的情况下识别出处理因素、结果、混杂因素和因果链,实现了 81% 的已知问题发现率和 19% 的新型错误发现率,同时对反馈的可操作性进行评分。

ABSTRACT

Microsoft Windows Feedback Hub is designed to receive customer feedback on a wide variety of subjects including critical topics such as power and battery. Feedback is one of the most effective ways to have a grasp of users' experience with Windows and its ecosystem. However, the sheer volume of feedback received by Feedback Hub makes it immensely challenging to diagnose the actual cause of reported issues. To better understand and triage issues, we leverage Double Machine Learning (DML) to associate users' feedback with telemetry signals. One of the main challenges we face in the DML pipeline is the necessity of domain knowledge for model design (e.g., causal graph), which sometimes is either not available or hard to obtain. In this work, we take advantage of reasoning capabilities in Large Language Models (LLMs) to generate a prior model that which to some extent compensates for the lack of domain knowledge and could be used as a heuristic for measuring feedback informativeness. Our LLM-based approach is able to extract previously known issues, uncover new bugs, and identify sequences of events that lead to a bug, while minimizing out-of-domain outputs.

研究动机与目标

  • 解决在高容量用户反馈中诊断 Windows 操作系统问题根本原因的挑战,特别是针对电源和电池耗尽等复杂、多因素问题。
  • 通过 LLM 生成启发式先验知识,克服双机器学习(DML)流程中对专家提供的因果图和领域知识的依赖。
  • 通过使用集成提示工程的改进自洽框架,最小化 LLM 在因果变量提取中的幻觉现象。
  • 设计因果启发式规则,基于处理-结果关系和序列复杂性对反馈的丰富性进行评分。
  • 通过提取可操作的因果摘要并识别先前未知的因果链,帮助工程师更高效地对反馈进行分类。

提出的方法

  • 采用少样本和零样本思维链提示的上下文学习(ICL),引导 LLM 识别因果变量:处理因素、结果、混杂因素和工具变量。
  • 实施一种改进的自洽框架,通过集成多种提示变体并采用贪心选择策略,提升一致性并减少幻觉。
  • 利用 LLM 从反馈中提取事件序列,以重建导致报告错误的因果叙事。
  • 设计两种因果启发式规则:(1) 唯一因果变量(处理因素、结果、混杂因素)的总和,以及 (2) 提取事件链的累计长度,用于评分反馈的可操作性。
  • 通过已知工程分类数据验证提取的因果变量和因果链,确保域内准确性并最小化域外输出。
  • 将双机器学习(DML)作为下游因果推断流程,利用 LLM 生成的先验知识指导模型结构和混杂因素选择。

实验结果

研究问题

  • RQ1LLM 配合上下文学习能否在无专家提供的因果图情况下,可靠地从非结构化用户反馈中提取自洽的因果变量(处理因素、结果、混杂因素)?
  • RQ2与标准提示方法相比,改进的自洽提示策略在多大程度上减少了基于 LLM 的因果推理中的幻觉?
  • RQ3LLM 能否在用户反馈中发现与操作系统级错误(如电池耗尽或睡眠失败)诊断相关的先前未知因果链?
  • RQ4与人工分类标准相比,所提出的因果启发式规则在预测反馈可操作性方面的有效性如何?
  • RQ5所提取洞察中,有多少比例属于预先分类的已知问题,或经工程师验证的新型错误?

主要发现

  • 改进的自洽框架将因果变量提取中的幻觉降低至 0%,确保所有输出均在域内。
  • 81% 的提取因果变量对应于先前已知的问题,而 19% 揭示了此前未记录的新型错误。
  • 44% 的提取因果事件链是工程师此前未知的,表明该方法具备发现新型诊断路径的能力。
  • 使用启发式规则 2(累计序列长度)评分的反馈表现出更高的可操作性,尤其在从单条反馈中提取多个因果链时更为显著。
  • 该方法成功生成了用于因果推断的先验模型,即使在缺乏显式领域知识的情况下,也能支持下游 DML 流程。
  • 所有提取的因果洞见均与目标主题(如“Modern Standby”)相关,未观察到域外响应。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。