[論文レビュー] Extracting Self-Consistent Causal Insights from Users Feedback with LLMs and In-context Learning
本稿では、大規模言語モデル(LLMs)を用いた自己整合性のあるイン・コンテキスト・ラーニングフレームワークを提案し、Windows Feedback Hubのユーザーからのフィードバックから因果変数および出来事の順序を抽出する。LLMの推論と修正された自己整合性アプローチを活用することで、幻覚を0%に抑えた状態で治療要因、結果、交絡要因、因果鎖を特定し、既知の問題を81%、新規バグを19%発見する一方で、フィードバックの実行可能性をスコア化した。
Microsoft Windows Feedback Hub is designed to receive customer feedback on a wide variety of subjects including critical topics such as power and battery. Feedback is one of the most effective ways to have a grasp of users' experience with Windows and its ecosystem. However, the sheer volume of feedback received by Feedback Hub makes it immensely challenging to diagnose the actual cause of reported issues. To better understand and triage issues, we leverage Double Machine Learning (DML) to associate users' feedback with telemetry signals. One of the main challenges we face in the DML pipeline is the necessity of domain knowledge for model design (e.g., causal graph), which sometimes is either not available or hard to obtain. In this work, we take advantage of reasoning capabilities in Large Language Models (LLMs) to generate a prior model that which to some extent compensates for the lack of domain knowledge and could be used as a heuristic for measuring feedback informativeness. Our LLM-based approach is able to extract previously known issues, uncover new bugs, and identify sequences of events that lead to a bug, while minimizing out-of-domain outputs.
研究の動機と目的
- Windows OSの問題、特に電源やバッテリー消費の複雑で要因が多岐にわたる問題のような、高頻度のユーザーからのフィードバックにおける根本原因の特定の課題に対処すること。
- 二重機械学習(DML)パイプラインにおいて、専門家が提供する因果グラフやドメイン知識に依存するのを回避するため、LLMを用いてヒューリスティックな事前知識を生成すること。
- アンサンブル・プロンプトを用いた修正された自己整合性フレームワークにより、因果変数抽出におけるLLMの幻覚を最小限に抑えること。
- 治療要因と結果の関係および出来事の順序の複雑さに基づいて、フィードバックの情報量をスコア化するための因果ヒューリスティクスを開発すること。
- 因果的要約の抽出と、以前に未知の因果鎖の特定により、エンジニアがフィードバックをより効率的にトライエージできるようにすること。
提案手法
- 少量の例(few-shot)およびゼロショットの思考の道筋(chain-of-thought)プロンプトを用いたイン・コンテキスト・ラーニング(ICL)を活用し、LLMが治療要因、結果、交絡要因、および道具的変数を特定するのを支援する。
- 複数のプロンプトバリエーションをアンサンブル化し、グリーディ選択戦略を用いることで、一貫性を向上させ、幻覚を低減する修正された自己整合性フレームワークを実装する。
- LLMを用いてフィードバックから出来事の順序を抽出し、報告されたバグに至る因果的ナラティブを再構築する。
- 2つの因果ヒューリスティクスを設計する:(1) 因果変数(治療要因、結果、交絡要因)のユニークな合計数、および(2) 抽出された出来事の順序の累積長。これらを用いてフィードバックの実行可能性をスコア化する。
- 抽出された因果変数および因果鎖が、既知のエンジニアリングトライエージデータと一致するかを検証し、ドメイン内での正確性を保証するとともに、ドメイン外の出力を最小限に抑える。
- 二重機械学習(DML)を下流の因果推論パイプラインとして採用し、LLMが生成する事前知識がモデル構造および交絡要因の選択に影響を与える。
実験結果
リサーチクエスチョン
- RQ1専門家が提供する因果グラフがなくても、イン・コンテキスト・ラーニングを用いたLLMが、非構造化されたユーザーのフィードバックから自己整合性のある因果変数(治療要因、結果、交絡要因)を信頼性高く抽出できるか?
- RQ2標準的なプロンプトと比較して、修正された自己整合性プロンプト戦略は、LLMを用いた因果推論における幻覚をどの程度低減するか?
- RQ3LLMは、バッテリー消費やスリープ障害などのOSレベルのバグを診断するために関連する、以前に未知の因果鎖をユーザーのフィードバックから発見できるか?
- RQ4提案された因果ヒューリスティクスは、人間によるトライエージ基準と比較して、フィードバックの実行可能性をどの程度効果的に予測できるか?
- RQ5抽出されたインサイトのうち、事前に分類済みの既知の問題またはエンジニアが検証済みの新規バグである割合はどの程度か?
主な発見
- 修正された自己整合性フレームワークにより、因果変数抽出における幻覚が0%にまで低減され、すべての出力がドメイン内に保たれた。
- 抽出された因果変数の81%が、以前に既知の問題に対応しており、残りの19%が、以前に文書化されていなかった新規バグを示した。
- 抽出された因果出来事の順序の44%が、エンジニアにとって以前に未知であったものであり、この方法が新しい診断的経路を同定できることを示している。
- ヒューリスティクス2(累積的順序長)を用いてスコア化されたフィードバックは、特に1つのフィードバックから複数の順序が抽出された場合に、より高い実行可能性を示した。
- ドメイン知識が明示的に存在しない状況下でも、この方法は因果推論のための事前モデルを効果的に生成し、下流のDMLパイプラインを支援できた。
- 抽出されたすべての因果的インサイトが、ターゲットトピック(例:「モダンスタンバイ」)に関連しており、ドメイン外の応答は観察されなかった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。