Skip to main content
QUICK REVIEW

[論文レビュー] TransLog: A Unified Transformer-based Framework for Log Anomaly Detection

Hongcheng Guo, Xingyu Lin|arXiv (Cornell University)|Dec 31, 2021
Software System Performance and Reliability被引用数 16
ひとこと要約

TransLogは、事前学習されたTransformerエンコーダーを用い、アダプタベースの微調整フレームワークを統合することで、クロスドメインのログ異常検出を実現する。ソースドメインで事前学習し、ターゲットドメインで効率的なアダプタモジュールを適用することで、顕著に少ない可学習パラメータ数と低い学習コストで最先端の性能を達成し、特にリソースが限られた環境下でも優れた効果を示す。

ABSTRACT

Log anomaly detection is a key component in the field of artificial intelligence for IT operations (AIOps). Considering log data of variant domains, retraining the whole network for unknown domains is inefficient in real industrial scenarios especially for low-resource domains. However, previous deep models merely focused on extracting the semantics of log sequence in the same domain, leading to poor generalization on multi-domain logs. Therefore, we propose a unified Transformer-based framework for log anomaly detection (\ourmethod{}), which is comprised of the pretraining and adapter-based tuning stage. Our model is first pretrained on the source domain to obtain shared semantic knowledge of log data. Then, we transfer the pretrained model to the target domain via the adapter-based tuning. The proposed method is evaluated on three public datasets including one source domain and two target domains. The experimental results demonstrate that our simple yet efficient approach, with fewer trainable parameters and lower training costs in the target domain, achieves state-of-the-art performance on three benchmarks.

研究の動機と目的

  • 複数のITシステムドメインに跨るログ異常検出における一般化性能の低さという課題に対処すること。
  • 新しいリソースが限られたドメインにモデルを展開する際の学習コストとパラメータのオーバーヘッドを低減すること。
  • 完全な再学習を伴わずに、ソースドメインからターゲットドメインへ共有される意味的知識を効率的に転送できること。
  • リソースが限られた学習状況下でも、モデルのロバスト性と性能を向上させること。

提案手法

  • 2段階のフレームワーク:まず、ソースドメインのログデータセットでTransformerエンコーダーを事前学習し、共有される意味的表現を学習する。
  • 軽量なアダプタモジュールをTransformer層の間に挿入することで、ターゲットドメインでのパラメータ効率的な微調整を可能にする。
  • 事前学習済みモデルの重みを固定し、微調整時にはアダプタパラメータのみを更新することで、計算コストと過学習のリスクを最小限に抑える。
  • ログパース(Drainを介して)を用いて、生のログを構造化されたテンプレートに変換し、その後Transformerエンコーダーに供給する。
  • HDFS、BGL、Thunderbirdの複数のベンチマークで評価し、アダプタサイズ、エンコーダー層数、学習データサイズに関するアブレーションスタディを実施。
  • 公平な比較と一貫性のある評価を確保するため、すべてのデータセットで同じ学習率とモデルアーキテクチャを適用する。

実験結果

リサーチクエスチョン

  • RQ1共有される意味的パターンを持つ多様なログドメインに跨る、統合されたTransformerベースのモデルが、効果的に異常検出を実行できるか?
  • RQ2パラメータ効率性、性能、収束速度の観点から、アダプタベースの微調整は、フル微調整に比べてどのように優れているか?
  • RQ3ソースドメインで事前学習することで、リソースが限られたターゲットドメインでの性能がどの程度向上するか?
  • RQ4特にリソースが限られた状況下で、学習データ量の変化に伴いモデルの性能がどのように変化するか?

主な発見

  • TransLogは、HDFS、BGL、Thunderbirdの3つの公開ベンチマークで最先端の性能を達成し、F1スコアはそれぞれ0.998、0.997、0.996を記録した。
  • アダプタベースの微調整により、可学習パラメータ数がフルモデルの3.5–5.5%にまで削減されたが、競争力のある性能を維持した。
  • 特にリソースが限られたデータセット(例:5万件未満)で微調整する場合、完全に再学習する場合よりも収束が早く、一般化性能も優れた。
  • 事前学習による性能向上はドメインに依存するが、BGLで事前学習したモデルはHDFSでより大きな向上を示したのに対し、Thunderbirdで事前学習したモデルはそれほど顕著ではなかった。
  • エンコーダー層数を増やしても、アダプタ微調整はフル微調整よりも高いロバスト性を示し、1層、2層、4層のすべてで一貫した性能を発揮した。
  • 更新パラメータ数が5%未満でも、性能低下はわずか1%にとどまり、極めて高いパラメータ効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。