[論文レビュー] Interpretable Online Log Analysis Using Large Language Models with Prompt Strategies
本論文では、大規模言語モデル(LLMs)を活用し、自己プロンプト、チェーン・オブ・トゥキャスト、コンテキスト内プロンプトといった高度なプロンプト戦略を用いることで、ドメイン内微調整を必要とせず、ログパースと異常検出において最先端の性能を達成する解釈可能なオンラインログ分析フレームワークであるLogPromptを提案する。LogPromptは、単純なプロンプトに比べてLLMの性能を最大380.7%向上させ、数千件のログで微調整された既存手法に比べ最大55.9%優れる。また、人間による評価で読みやすさと有用性が高く(5段階中4.42点)、解釈可能な説明を生成する。
Automated log analysis is crucial in modern software-intensive systems for facilitating program comprehension throughout software maintenance and engineering life cycles. Existing methods perform tasks such as log parsing and log anomaly detection by providing a single prediction value without interpretation. However, given the increasing volume of system events, the limited interpretability of analysis results hinders analysts' comprehension of program status and their ability to take appropriate actions. Moreover, these methods require substantial in-domain training data, and their performance declines sharply (by up to 62.5%) in online scenarios involving unseen logs from new domains, a common occurrence due to rapid software updates. In this paper, we propose LogPrompt, a novel interpretable log analysis approach for online scenarios. LogPrompt employs large language models (LLMs) to perform online log analysis tasks via a suite of advanced prompt strategies tailored for log tasks, which enhances LLMs' performance by up to 380.7% compared with simple prompts. Experiments on nine publicly available evaluation datasets across two tasks demonstrate that LogPrompt, despite requiring no in-domain training, outperforms existing approaches trained on thousands of logs by up to 55.9%. We also conduct a human evaluation of LogPrompt's interpretability, with six practitioners possessing over 10 years of experience, who highly rated the generated content in terms of usefulness and readability (averagely 4.42/5). LogPrompt also exhibits remarkable compatibility with open-source and smaller-scale LLMs, making it flexible for practical deployment. Code of LogPrompt is available at https://github.com/lunyiliu/LogPrompt.
研究の動機と目的
- 自動化されたログ分析における解釈性の欠如という課題に対処する。既存手法は予測結果のみを提供し、根拠を示さない。
- 新規ドメインからの未学習ログや稀なログが存在するオンライン環境において、ログ分析モデルの性能低下を克服する。
- ドメイン内微調整を一切不要としない、高い適応性を持つゼロショットログ分析手法を構築し、新サービスへの即時導入を可能にする。
- ログ分析予測のための人間が読みやすい、根拠に基づいた説明を生成することで、プログラムの理解と運用意思決定を向上させる。
- 経験豊富な実務者による人的評価を厳密に実施し、LLMベースのログ分析の有効性と解釈可能性を検証する。
提案手法
- ログ分析タスクに特化した3つのプロンプト戦略を採用:自己プロンプト(自己生成されたタスク記述)、チェーン・オブ・トゥキャスト(段階的推論)、コンテキスト内プロンプト(少数の例示によるデモンストレーション)。
- これらのプロンプト戦略をログパースとログ異常検出の両タスクに適用し、LLMがテンプレートと変数を抽出するか、ログを正常/異常として分類できるようにする。
- ログの内容とタスク要件に基づき、文脈に応じた動的プロンプト生成を行うプロンプト工学パイプラインを設計する。
- ドメイン内微調整を一切行わず、ゼロショット推論を活用することで、新ドメインや未学習のログタイプに対しても高い適応性を確保する。
- 構造化されたプロンプトを統合し、論理的整合性と意味的意味を持つ説明をLLMが生成するように誘導する。
- 効率性とパフォーマンス最適化を図ることで、オープンソースおよび小規模なLLMとも互換性を持たせ、多様なインfra環境での実用的導入を可能にする。
実験結果
リサーチクエスチョン
- RQ1高度なプロンプト戦略は、ドメイン内微調整を伴わずに、LLMのログパースおよび異常検出における性能を顕著に向上させることができるか?
- RQ2LLMベースのログ分析モデルは、新ドメインからの未学習ログを含むオンライン環境において、どの程度一般化性能を発揮できるか?
- RQ3生成された説明は、経験豊富なO&Mエンジニアのプログラム理解と意思決定支援にどの程度有効か?
- RQ4チェーン・オブ・トゥキャストやコンテキスト内学習といったプロンプト工学戦略は、ログ分析におけるLLM予測の信頼性とトレーサビリティを向上させることができるか?
- RQ5実運用環境において、LLMが生成する説明の解釈性は、従来のブラックボックス型ログ分析モデルに比べてどのように優れているか?
主な発見
- LogPromptは、ログパースおよび異常検出の両タスクで最先端の性能を達成し、数千件のドメイン内ログで微調整された既存手法に比べ最大55.9%優れる。
- 高度なプロンプト戦略を用いることで、LLMのログ分析における性能は、単純なプロンプトに比べ最大380.7%向上する。
- 6名の経験豊富な実務者による人的評価では、LogPromptが生成する説明は非常に有用かつ読みやすく、平均して5段階中4.42点を獲得した。
- LogPromptはオンライン環境でも優れた一般化性能を示し、ドメイン内学習データが存在しない状況でも高い正確性を維持する。
- オープンソースおよび小規模なLLMとも互換性があるため、多様なインfra環境での実用的導入が可能である。
- 本研究では、生成された根拠による解釈性が、根本原因分析や誤検知の特定といった運用意思決定を顕著に向上させることを確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。