[論文レビュー] An Explainable Transformer-based Model for Phishing Email Detection: A Large Language Model Approach
本稿では、説明可能なAI(XAI)技術—LIMEおよびTransformer Interpret—を統合した微調整済みDistilBERTモデルを提案する。マスクド言語モデルからの文脈的埋め込みを活用し、クラス不均衡の緩和を施した結果、バランスの取れたデータセット上で98.48%のテスト精度を達成した。XAI手法により、分類意思決定の透明性があり人間が理解可能な説明が提供された。
Phishing email is a serious cyber threat that tries to deceive users by sending false emails with the intention of stealing confidential information or causing financial harm. Attackers, often posing as trustworthy entities, exploit technological advancements and sophistication to make detection and prevention of phishing more challenging. Despite extensive academic research, phishing detection remains an ongoing and formidable challenge in the cybersecurity landscape. Large Language Models (LLMs) and Masked Language Models (MLMs) possess immense potential to offer innovative solutions to address long-standing challenges. In this research paper, we present an optimized, fine-tuned transformer-based DistilBERT model designed for the detection of phishing emails. In the detection process, we work with a phishing email dataset and utilize the preprocessing techniques to clean and solve the imbalance class issues. Through our experiments, we found that our model effectively achieves high accuracy, demonstrating its capability to perform well. Finally, we demonstrate our fine-tuned model using Explainable-AI (XAI) techniques such as Local Interpretable Model-Agnostic Explanations (LIME) and Transformer Interpret to explain how our model makes predictions in the context of text classification for phishing emails.
研究の動機と目的
- 従来の検出手法を回避する高度なフィッシング攻撃の増加に対処すること。
- 最先端のトランスフォーマー基盤の巨大言語モデル(LLM)を活用して、フィッシングメール検出の正確性を向上させること。
- 前処理および再サンプリング技術を用いて、フィッシングメールデータセットにおけるクラス不均衡を軽減すること。
- 説明可能なAI(XAI)技術を統合することで、信頼性と透明性を高めるモデルの解釈可能性を向上させること。
- 高精度なフィッシングメール検出が、微調整済みDistilBERTとXAI手法を用いて、正確かつ説明可能に実現可能であることを示すこと。
提案手法
- フィッシングメール対合法メールの二値テキスト分類を目的とした、BERTの縮小版である微調整済みDistilBERT。
- テキストクリーニング、トークン化、およびオーバー・アンダーサンプリングによるクラス不均衡の処理を含むデータ前処理技術の適用。
- バッチサイズ、学習率、最適化関数(例:AdamW)などのハイパーパrameterを最適化し、モデルの収束性と性能を向上。
- 微調整中にマスクド言語モデル(MLM)の目的関数を用いて、語とサブワードの文脈的理解を保持。
- LIMEおよびTransformer Interpretを用いて、個々の語またはサブワードに予測信頼度を割り当てる局所的・インスタンスレベルの説明を生成。
- 不均衡およびバランスの取れた両方のデータセット上で、正確性、適合率、再現率、F1スコアといった標準的な自然言語処理指標を用いてモデル性能を評価。

実験結果
リサーチクエスチョン
- RQ1既存の手法と比較して、微調整済みDistilBERTモデルはフィッシングメール検出においてどの程度有効であるか?
- RQ2クラス不均衡は、トランスフォーマー基盤モデルのフィッシング検出性能にどの程度影響を及えるか?
- RQ3LIMEおよびTransformer Interpretは、モデルの予測に対して、実行可能で人間が理解可能な説明をどのように提供するか?
- RQ4解釈可能性技術は、サイバーセキュリティ応用におけるユーザーの信頼性とモデルの透明性を向上させることができるか?
- RQ5フィッシングメール分類において、LIMEとTransformer Interpretの間で説明の忠実度および語の帰属割り当てにどのような差異があるか?
主な発見
- 微調整済みDistilBERTモデルは、不均衡データセット上でトレーニング精度98.90%、テスト精度97.50%を達成し、クラスの偏りがある中でも強力な一般化性能を示した。
- バランスの取れたデータセットでは、トレーニング精度99.07%、テスト精度98.48%に到達し、データのバランス化に伴う性能向上を確認した。
- 不均衡データでもモデルの性能は安定しており、テスト精度がわずか1%低下にとどまったことから、クラス不均衡の効果的な対処ができたことが示された。
- LIMEおよびTransformer Interpretは、語やサブワードに正または負の帰属スコアを割り当てることで、補完的な説明を提供し、重要な予測特徴を強調した。
- より高い正の帰属スコアを持つ語は、常に「緊急を要する」ような言語や「疑わしいURL」などのフィッシングコンテンツに関連しており、負のスコアは健全な用語に関連していた。
- 説明技術により、モデルの意思決定が意味的に意味のある言語的パターンに基づいていることが明らかになり、予測に対する解釈可能性と信頼性が向上した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。