[논문 리뷰] Explaining Tree Model Decisions in Natural Language for Network Intrusion Detection
이 논문은 결정트리 기반 네트워크 침입 탐지(NID) 시스템에 대한 자연어 설명을 생성하기 위해 대규모 언어모델(LLM)을 활용하는 Large Language Model Decision Tree Explanations (LLM-DTE)를 제안한다. 이는 비전문가가 이해할 수 있도록 설명을 제공한다. 인간 평가에서 LLM-DTE는 규칙 기반 설명보다 뛰어나며, 퀴즈 점수에서 39.5% 높은 성과를 기록했고, 난이도, 품질, 배경 지식 활용도 측면에서도 뛰어난 평가를 받았다.
Network intrusion detection (NID) systems which leverage machine learning have been shown to have strong performance in practice when used to detect malicious network traffic. Decision trees in particular offer a strong balance between performance and simplicity, but require users of NID systems to have background knowledge in machine learning to interpret. In addition, they are unable to provide additional outside information as to why certain features may be important for classification. In this work, we explore the use of large language models (LLMs) to provide explanations and additional background knowledge for decision tree NID systems. Further, we introduce a new human evaluation framework for decision tree explanations, which leverages automatically generated quiz questions that measure human evaluators' understanding of decision tree inference. Finally, we show LLM generated decision tree explanations correlate highly with human ratings of readability, quality, and use of background knowledge while simultaneously providing better understanding of decision boundaries.
연구 동기 및 목표
- 기계학습 전문지식이 없는 사용자들이 결정트리 기반 네트워크 침입 탐지(NID) 시스템의 결과를 이해할 수 있도록 하는 데 도전하는 것.
- 단순한 규칙 추출을 넘어서 특성 중요도와 결정 경계에 대한 배경 지식을 포함한 자연어 설명을 생성하는 것.
- 자동으로 생성된 반성적 퀴즈 질문을 활용해 설명 품질을 평가하는 새로운 인간 평가 프레임워크를 개발하는 것.
- LLM 기반 설명이 기존의 규칙 기반 설명보다 NID 환경에서 사용자의 이해도를 향상시키는지 평가하는 것.
제안 방법
- 네트워크 트래픽 데이터를 기반으로 훈련된 결정트리 모델을 구축하여 트래픽을 정상 또는 악성으로 분류한다.
- 입력에 대해 결정트리의 경로 및 구조적 정보를 추출하여 결정 경로를 추적한다.
- 작업 설명, 특성 정의, 트리 구조, 노드 임계값, 클래스 분포, 입력 특성 값 등을 포함한 대규모 언어모델(LLM)용 프롬프트를 설계한다.
- LLM에게 간단하고 기술적인 언어를 피하기 위해, 결정트리가 입력을 정상 또는 악성으로 분류한 이유를 자연어로 설명하도록 지시한다.
- 규칙 기반 템플릿을 기반으로 반성적 퀴즈 질문을 자동으로 생성하여 인간 평가자들이 설명을 이해하고 있는지 테스트한다.
- 10명의 참가자(반은 기계학습 배경, 반은 정보보안 배경)를 대상으로 인간 평가를 수행하여, LLM-DTE와 규칙 기반 설명 간의 퀴즈 성과 및 정성적 평가를 비교한다.

실험 결과
연구 질문
- RQ1LLM 기반 자연어 설명은 규칙 기반 설명보다 결정트리 기반 네트워크 침입 탐지 결정에 대한 사용자 이해도를 향상시키는가?
- RQ2LLM 기반 설명은 특성 관련성과 결정 경계에 대한 배경 지식을 얼마나 잘 통합하는가?
- RQ3퀴즈 기반 인간 평가 프레임워크는 결정트리 설명의 품질을 측정하는 데 얼마나 효과적인가?
- RQ4LLM 기반 설명은 규칙 기반 설명보다 읽기 쉬움, 품질, 배경 지식 활용도 측면에서 뛰어나다고 평가되는가?
주요 결과
- LLM-DTE 설명은 평균 퀴즈 점수 17.3점(만점 25점)을 기록하여, 규칙 기반 설명의 12.4점(만점 25점)보다 39.5% 높은 성과를 보였다.
- 인간 평가자들은 LLM-DTE 설명을 규칙 기반 설명보다 15% 더 자주 높은 난이도로 평가했으며, LLM-DTE 설명의 42%가 높은 난이도로 평가된 반면, 규칙 기반 설명은 30%에 그쳤다.
- LLM-DTE 설명은 52%의 비율로 높은 품질로 평가되었고, 규칙 기반 설명은 30%에 그쳐, 인식된 품질 향상 정도가 거의 두 배에 이르렀다.
- LLM-DTE 설명은 배경 지식 활용도 측면에서 52%가 높은 수준으로 평가되었고, 규칙 기반 설명은 30%에 그쳐, 인식된 맥락적 관련성 향상 정도가 상대적으로 70% 증가했다.
- 자동으로 생성된 퀴즈 질문을 활용한 인간 평가 프레임워크는 정성적 선호도와 강한 상관관계를 보였으며, 설명 효과성 평가에의 유효성을 입증했다.
- 성능 향상에도 불구하고, LLM-DTE 생성은 규칙 기반 방법보다 느리고 비용이 더 들며, 결정트리 깊이가 증가함에 따라 입력 프롬프트 길이가 길어져 설명 품질이 저하되는 경향이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.