[논문 리뷰] Lens: A Knowledge-Guided Foundation Model for Network Traffic
Lens는 네트워크 트래픽를 위한 기초 모델로, T5 인코더-디코더 아키텍처를 활용하여 마스킹 스펜 예측, 패킷 순서 예측, 동형 트래픽 예측을 조합한 새로운 다중 작업 미리 훈련 목적함수를 사용해 대규모 비라벨 트래픽 데이터로부터 표현을 학습한다. 이는 트래픽 이해 및 생성 작업에서 최신 기술 수준의 성능을 달성하며, 이전 방법에 비해 피니튜닝에 필요한 데이터를 50%~95% 감소시킨다.
Network traffic refers to the amount of data being sent and received over the Internet or any system that connects computers. Analyzing network traffic is vital for security and management, yet remains challenging due to the heterogeneity of plain-text packet headers and encrypted payloads. To capture the latent semantics of traffic, recent studies have adopted Transformer-based pretraining techniques to learn network representations from massive traffic data. However, these methods pre-train on data-driven tasks but overlook network knowledge, such as masking partial digits of the indivisible network port numbers for prediction, thereby limiting semantic understanding. In addition, they struggle to extend classification to new classes during fine-tuning due to the distribution shift. Motivated by these limitations, we propose \Lens, a unified knowledge-guided foundation model for both network traffic classification and generation. In pretraining, we propose a Knowledge-Guided Mask Span Prediction method with textual context for learning knowledge-enriched representations. For extending to new classes in finetuning, we reframe the traffic classification as a closed-ended generation task and introduce context-aware finetuning to adapt to the distribution shift. Evaluation results across various benchmark datasets demonstrate that the proposed Lens~achieves superior performance on both classification and generation tasks. For traffic classification, Lens~outperforms competitive baselines substantially on 8 out of 12 tasks with an average accuracy of extbf{96.33\%} and extends to novel classes with significantly better performance. For traffic generation, Lens~generates better high-fidelity network traffic for network simulation, gaining up to extbf{30.46\%} and extbf{33.3\%} better accuracy and F1 in fuzzing tests. We will open-source the code upon publication.
연구 동기 및 목표
- 이질적이고 암호화된, 의미적으로 풍부하지 않은 네트워크 트래픽 데이터 분석의 과제를 해결하기 위해.
- 트래픽 이해와 생성 모두에서 뛰어난 성능을 발휘하는 통합 기초 모델을 개발하여 인코더 전용 또는 디코더 전용 아키텍처의 한계를 극복하기 위해.
- 라벨이 부여된 대규모 데이터에 대한 의존도를 줄이기 위해 비라벨 트래픽에서 효과적인 미리 훈련을 활용하여 후행 작업에 적용하기 위해.
- 네트워크 트래픽의 전반적 구조, 순서, 상관 관계 패턴을 포괄하는 다중 작업 미리 훈련 목적함수를 설계하기 위해.
- 프롬프트 기반 피니튜닝을 통해 다양한 네트워크 트래픽 작업에 대해 강력한 제로샷 및 피처샷 일반화를 가능하게 하기 위해.
제안 방법
- 네트워크 트래픽을 16진수 시퀀스로 토크나이즈하고, 사전 정의된 어휘를 사용한 WordPiece를 포함한 여러 토크나이제이션 방법을 평가한다.
- 인코더-디코더 어텐션을 통해 이해와 생성 모두에 대한 표현을 동시에 학습하기 위해 T5 아키텍처를 백본 모델로 활용한다.
- 세 가지 작업을 조합한 다중 작업 미리 훈련 목적함수를 설계한다: 마스킹 스펜 예측(MSP), 패킷 순서 예측(POP), 동형 트래픽 예측(HTP).
- MSP(노이즈 제거), POP(순서 모델링), HTP(다중 흐름 간 관계 학습)를 동시에 최적화하는 복합 손실 함수를 사용한다.
- 최소한의 라벨이 부여된 데이터로도 후행 작업에 적응하기 위해 피니튜닝 시 작업별 프롬프트를 적용한다.
- 표준 평가 지표를 사용해 성능을 평가한다: 이해 작업에는 정확도/F1, 생성 작업에는 JSD/TVD를 사용한다.
실험 결과
연구 질문
- RQ1T5 아키텍처 기반의 기초 모델이 원시적이고 비라벨 트래픽 데이터로부터 잠재 표현을 효과적으로 학습할 수 있는가?
- RQ2MSP, POP, HTP를 조합한 다중 작업 미리 훈련 목적함수가 트래픽 이해 및 생성 성능을 향상시키는가?
- RQ3Lens는 기존의 미리 훈련 방법에 비해 피니튜닝에 필요한 라벨 데이터의 양을 어느 정도 줄일 수 있는가?
- RQ4모델은 예측 훈련을 하지 않은 다양한 데이터셋과 네트워크 트래픽 작업으로도 일반화되는가?
- RQ5각 미리 훈련 작업(MSP, POP, HTP)이 최종 모델 성능에 기여하는 상대적 기여도는 얼마인가?
주요 결과
- Lens는 패킷 수준 이해 작업에서 기준 모델 대비 평균 10.75% 향상된 정확도를 달성했고, 플로우 수준 작업에서는 0.59% 향상되었다.
- 트래픽 생성 작업에서 Lens는 NetShare 대비 평균적으로 제닝-섀넌 발산(JSD)을 62% 감소시키고, 총 변동 거리(TVD)를 77% 감소시켰다.
- CrossPlatform 데이터셋에서 예측 훈련을 하지 않았음에도 불구하고, Lens는 모든 생성 작업에서 NetShare를 능가했다.
- ET-BERT 및 YaTC와 같은 최신 기술 수준의 방법에 비해 피니튜닝에 필요한 라벨 데이터를 50%에서 95%까지 줄일 수 있었다.
- 제거 실험 결과, 미리 훈련과 MSP가 생성 성능에 핵심적인 역할을 하며, MSP를 제거할 경우 JSD가 77% 증가함을 확인했다.
- 세 가지 미리 훈련 작업을 모두 포함한 전체 모델이 가장 높은 성능를 보였고, 이는 MSP, POP, HTP가 상호 보완적임을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.