[논문 리뷰] SEvenLLM: Benchmarking, Eliciting, and Enhancing Abilities of Large Language Models in Cyber Threat Intelligence
이 논문은 LLM-자동 작업 선택과 인간 검토를 통해 고품질 이중어(영어/중국어) 지침 데이터셋인 SEvenLLM-Instruct를 생성함으로써, 대규모 언어 모델(LM)의 사이버 위협 지능(CTI) 분석 및 응답 능력을 벤치마킹, 유도 및 향상시키는 프레임워크인 SEvenLLM을 소개한다. 28개의 다중 작업 목적에 맞춰 미세조정된 SEvenLLM은 GPT-3.5와 같은 일반 LLM보다 위협 분석 및 대응에서 뛰어난 성능을 보이며, 정제된 SEvenLLM-Bench 벤치마크를 통해 검증되어 실제 사이버보안 사고 이해 및 대응 능력에서 뛰어난 성능을 입증한다.
To address the increasing complexity and frequency of cybersecurity incidents emphasized by the recent cybersecurity threat reports with over 10 billion instances, cyber threat intelligence (CTI) plays a critical role in the modern cybersecurity landscape by offering the insights required to understand and combat the constantly evolving nature of cyber threats. Inspired by the powerful capability of large language models (LLMs) in handling complex tasks, in this paper, we introduce a framework to benchmark, elicit, and improve cybersecurity incident analysis and response abilities in LLMs for Security Events (SEvenLLM). Specifically, we create a high-quality bilingual instruction corpus by crawling cybersecurity raw text from cybersecurity websites to overcome the lack of effective data for information extraction. Then, we design a pipeline to auto-select tasks from the tasks pool and convert the raw text into supervised corpora comprised of question and response. The instruction dataset SEvenLLM-Instruct is used to train cybersecurity LLMs with the multi-task learning objective (27 well-designed tasks) for augmenting the analysis of cybersecurity events. Extensive experiments in our curated benchmark (SEvenLLM-bench) demonstrate that SEvenLLM performs more sophisticated threat analysis and fortifies defenses against the evolving landscape of cyber threats.
연구 동기 및 목표
- LLM 훈련을 위한 고품질의 작업 특화 데이터셋 부족 문제를 해결한다.
- 도메인 특화 지침 미세조정을 통해 LLM의 사이버보안 사고 분석 및 대응 능력을 향상시킨다.
- 일반적이고 보안 특화된 능력 간 격차를 메우기 위해 CTI 작업에서의 LLM 성능 평가를 위한 종합적 평가 벤치마크를 개발한다.
- 미세조정된 오픈소스 LLM을 통해 인간 전문 지식 의존도를 줄이고 자동화되고 정확하며 전문적인 위협 분석을 가능하게 한다.
- LLM과 전문가 검토를 활용한 원시 사이버보안 보고서에서 지침 데이터셋을 구축하는 확장 가능한 파이프라인을 구축한다.
제안 방법
- 공개된 소스에서 원시 사이버보안 사고 보고서를 크롤링하여 이중어(영어/중국어) 사이버보안 텍스트 코퍼스를 구축한다.
- GPT-4를 사용해 원시 텍스트에서 후보 작업을 생성하고, MITRE ATT&CK 및 OASIS CTI TC 기준에 기반해 인간 전문가가 작업 풀을 구성하기 위해 이를 정제한다.
- 선택-지시(Select-Instruct) 파이프라인을 구현하여 작업 풀에서 가장 관련성이 높은 작업을 자동으로 선택하고, 지도 미세조정을 위한 질문-답변 쌍을 생성한다.
- 도메인 특화 LLM 훈련을 위한 28개의 잘 설계된 다중 작업 지침 예제를 포함하는 SEvenLLM-Instruct 데이터셋을 구성한다.
- LLaMA 및 Qwen와 같은 오픈소스 LLM을 SEvenLLM-Instruct에 다중 작업 학습 목표를 적용해 미세조정하여 CTI 특화 능력을 향상시킨다.
- 다중 선택 및 질의-응답 질문을 포함한 SEvenLLM-Bench 평가 벤치마크를 구축하여 사이버보안 맥락에서 모델 성능을 종합적으로 평가한다.
실험 결과
연구 질문
- RQ1자기지도 학습 기반의 LLM 지원 데이터 구축 파이프라인이 사이버 위협 지능을 위한 고품질의 작업 특화 지침 데이터를 효과적으로 생성할 수 있는가?
- RQ2정제된 지침 데이터셋에서 다중 작업 미세조정을 통해 일반 목적 LLM과 비교해 LLM의 사이버보안 사고 분석 및 대응 능력이 얼마나 향상되는가?
- RQ3실제 CTI 작업에서 GPT-3.5와 같은 강력한 베이스라인과 비교해 SEvenLLM의 성능은 특히 응답의 완전성과 전문성 측면에서 어떻게 나타나는가?
- RQ4SEvenLLM-Bench와 같은 벤치마크가 사이버보안 위협 지능 시나리오에서 LLM의 능력을 효과적으로 평가하고 차별화할 수 있는가?
- RQ5이중어(영어/중국어) 데이터 정제가 CTI 중심 LLM의 일반화 능력과 실용적 활용도에 어떤 영향을 미치는가?
주요 결과
- SEvenLLM-Instruct 데이터셋에 미세조정된 SEvenLLM은 파rameter 수가 적음에도 불구하고 GPT-3.5보다 더 완전하고 전문적인 응답을 생성한다.
- SEvenLLM-Bench 벤치마크는 다양한 CTI 작업을 통해 LLM의 성능을 종합적으로 평가하며 표준화되고 종합적인 평가 프레임워크를 제공한다.
- 28개의 잘 설계된 작업에서의 다중 작업 학습 목표는 사이버보안 사고 맥락에서 LLM의 분석 및 대응 능력을 크게 향상시킨다.
- Select-Instruct 파이프라인은 원시 사이버보안 보고서에서 인간 검증된 고품질 지침 데이터를 자동으로 생성함으로써 관련성과 실용성을 보장한다.
- 이중어(영어/중국어) 지침 데이터셋은 다국어 사이버보안 환경에서 모델의 적용 가능성을 향상시켰지만, 다국어 확장은 향후 과제로 남아 있다.
- 이 프레임워크는 위협 지능 작업에서 뛰어난 일반화 능력과 강건성을 보이며, 사고 분석에서 전문가 노고 의존도를 감소시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.