[논문 리뷰] A RAG-Based Question-Answering Solution for Cyber-Attack Investigation and Attribution
이 논문은 공격자 추적을 위한 맞춤형 질문-답변 시스템을 제안하며, 공격자 식별 지식 기반(AttackER)과 미스트랄 기반의 대규모 언어 모델(LLM)을 활용하여 정확하고 근거가 명시된 답변을 제공한다. 이는 환각 현상을 줄이고 신뢰성을 높여 GPT-3.5와 GPT-4o보다 뛰어난 성능을 발휘한다.
In the constantly evolving field of cybersecurity, it is imperative for analysts to stay abreast of the latest attack trends and pertinent information that aids in the investigation and attribution of cyber-attacks. In this work, we introduce the first question-answering (QA) model and its application that provides information to the cybersecurity experts about cyber-attacks investigations and attribution. Our QA model is based on Retrieval Augmented Generation (RAG) techniques together with a Large Language Model (LLM) and provides answers to the users' queries based on either our knowledge base (KB) that contains curated information about cyber-attacks investigations and attribution or on outside resources provided by the users. We have tested and evaluated our QA model with various types of questions, including KB-based, metadata-based, specific documents from the KB, and external sources-based questions. We compared the answers for KB-based questions with those from OpenAI's GPT-3.5 and the latest GPT-4o LLMs. Our proposed QA model outperforms OpenAI's GPT models by providing the source of the answers and overcoming the hallucination limitations of the GPT models, which is critical for cyber-attack investigation and attribution. Additionally, our analysis showed that when the RAG QA model is given few-shot examples rather than zero-shot instructions, it generates better answers compared to cases where no examples are supplied in addition to the query.
연구 동기 및 목표
- 비표준화된 위협 지능 보고서로 인해 수작업 기반의 공격자 추적 과정이 시간이 많이 소요되는 문제를 해결하기 위해.
- 선택된 지식 기반에 근거하여 응답을 제한함으로써 LLM의 환각 현상과 오래된 지식 문제를 줄이기 위해.
- 사이버 보안 분석가가 검증 가능한 근거를 바탕으로 공격을 조사하고 추적할 수 있도록 신뢰성 있고 투명한 QA 시스템을 개발하기 위해.
- 다양한 지표를 사용하여 전문화된 공격자 추적 질문에 대해 RAG 기반 QA의 성능을 평가하기 위해.
- 공격자 추적 맥락에서 소수의 예시를 활용한 프롬프팅이 답변 품질에 어떤 영향을 미치는지 탐색하기 위해.
제안 방법
- 시스템은 공격자 식별 지식 기반(AttackER) 데이터셋에서 유래한 지식 기반과 미스트랄 기반의 LLM을 사용하는 RAG 아키텍처를 채택한다. 이 지식 기반에는 정제된 사이버 공격 조사 및 공격자 추적 보고서가 포함되어 있다.
- 밀도 기반 벡터 임베딩과 의미적 유사도 매칭을 활용하여 지식 기반에서 관련된 컨텍스트 청크를 검색한다.
- 수집된 컨텍스트를 바탕으로 LLM이 응답을 생성함으로써 근거 명시와 환각 현상 감소를 보장한다.
- 모델은 지식 기반 쿼리, 개인 저장소 쿼리, 외부 자료에서의 검색을 통한 웹 기반 쿼리의 세 가지 입력 유형을 지원한다.
- 정확도와 관련성을 향상시키기 위해 소수의 예시를 포함한 프롬프팅을 적용한다.
- 평가에는 자체 제작된 QA 쌍 데이터셋과 신뢰성, 답변 관련성, 컨텍스트 정밀도, 정확도 등의 지표를 사용한다.
실험 결과
연구 질문
- RQ1RAG 기반 QA 시스템은 일반 목적의 LLM인 GPT-3.5와 GPT-4o보다 사이버 공격자 추적에 대해 정확하고 근거가 명시된 답변을 제공하는 데서 뛰어나게 성능을 발휘할 수 있는가?
- RQ2소수의 예시를 활용한 프롬프팅은 사이버 공격자 추적 맥락에서 답변의 품질과 신뢰성에 어떤 영향을 미치는가?
- RQ3RAG 모델은 파인튜닝 또는 제로샷 LLM에 비해 환각 현상을 얼마나 줄이는가?
- RQ4여러 유사한 컨텍스트가 존재할 경우 시스템은 관련 컨텍스트를 얼마나 효과적으로 검색하는가?
- RQ5현재 RAG 모델의 검색 정확도와 응답 지연 측면에서의 한계는 무엇인가?
주요 결과
- RAG 기반 QA 모델은 제로샷 설정에서 85%의 답변 관련성, 소수의 예시를 활용한 설정에서는 91%의 답변 관련성을 기록하여 지시에 잘 따르고 예시 제공으로 응답 품질이 향상됨을 보여준다.
- GPT-3.5와 GPT-4o보다 근거 명시를 통해 환각 현상을 크게 줄이고 정확도를 높여 성능이 뛰어나다. 특히 분포 외 쿼리에서 두드러진다.
- GPT-3.5는 지식 마감일 이후에도 CVE-2023-34362에 대해 잘못된 정보를 생성하는 등 뚜렷한 환각 현상을 보였다.
- GPT-4o는 정확한 답변을 제공했지만 근거 명시가 부족했고 API 레이트 리밋으로 인해 실용성에 제약이 있었다.
- 잘못된 컨텍스트 검색으로 인해 일부 사례에서 정확한 답변이 나오지 않았다. 예를 들어, '샤프슈터' 캠프에 관여한 행위자를 잘못 식별하는 등 검색 편향의 영향을 받았다.
- 모델은 참값과 높은 유사도를 보이며 일관성 있고 신뢰할 수 있는 응답 생성 능력을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.