Skip to main content
QUICK REVIEW

[论文解读] Robust Machine Learning for Encrypted Traffic Classification

Amit Dvir, Yehonatan Zion|arXiv (Cornell University)|Mar 15, 2016
Internet Traffic Analysis and Secure E-voting参考文献 67被引用 5
一句话总结

本文提出了一种鲁棒的机器学习框架,用于在存在对抗性反制措施的情况下,通过加密的HTTPS流量分类来推断用户身份(操作系统、浏览器、应用程序)。通过利用SSL/TLS握手行为以及浏览器流量突发的新型特征,该系统实现了96.06%的准确率,并在协议变更(94%准确率,密钥套件改变时)和网络混淆(使用VPN时为83%)情况下仍保持高度鲁棒性,即使训练数据极少或会话时间极短。

ABSTRACT

Desktops and laptops can be maliciously exploited to violate privacy. In this paper, we consider the daily battle between the passive attacker who is targeting a specific user against a user that may be adversarial opponent. In this scenario, while the attacker tries to choose the best vector attack by surreptitiously monitoring the victims encrypted network traffic in order to identify users parameters such as the Operating System (OS), browser and apps. The user may use tools such as a Virtual Private Network (VPN) or even change protocols parameters to protect his/her privacy. We provide a large dataset of more than 20,000 examples for this task. We run a comprehensive set of experiments, that achieves high (above 85) classification accuracy, robustness and resilience to changes of features as a function of different network conditions at test time. We also show the effect of a small training set on the accuracy.

研究动机与目标

  • 解决端到端加密下被动流量分析对加密HTTPS流量日益增长的威胁。
  • 开发一种机器学习系统,能够在用户主动尝试规避检测的情况下,可靠地从加密流量中推断出用户的操作系统、浏览器和应用程序。
  • 评估系统在使用VPN或更改密钥套件等对抗性行为下的鲁棒性。
  • 在有限训练数据和短会话时长等现实约束条件下评估系统性能。
  • 为威胁情报和隐私分析提供一种实用且可实时运行的分类系统。

提出的方法

  • 系统从SSL/TLS握手模式和应用层流量突发中提取新特征,重点关注到达时间间隔和数据包大小分布。
  • 使用监督机器学习分类器(KNN、带RBF核的SVM、随机森林)进行训练,数据集为20,633个自动标注的加密流量会话。
  • 特征包括数据包到达时间间隔中的峰值检测、流量突发的统计摘要,以及常见的协议层统计量。
  • 在对抗性条件下评估该框架:测试期间用户更改密钥套件或使用VPN,而模型在标准配置下进行训练。
  • 训练过程采用自动标注以减少人工标注负担,模型在逐步缩短的会话窗口(1秒至10分钟)上进行测试。
  • 通过协议变更和数据减少导致的准确率下降来评估鲁棒性,性能在多种分类器上进行测量。

实验结果

研究问题

  • RQ1在强加密保护下,机器学习能否准确分类用户的操作系统、浏览器和应用程序?
  • RQ2当用户使用如VPN等工具主动规避检测时,系统性能如何?
  • RQ3有限的训练数据或短会话时长对分类准确率有何影响?
  • RQ4从SSL/TLS行为和流量突发性中提取的新型特征如何提升分类鲁棒性?
  • RQ5在推理阶段面对对抗性操纵时,系统在多大程度上能保持高准确率?

主要发现

  • 所提出的系统利用SSL/TLS握手和流量突发模式的新型特征,实现了96.06%的分类准确率,可识别用户的操作系统、浏览器和应用程序。
  • 当用户在测试期间更改密钥套件(一种常见反制措施)时,系统仍保持94%的准确率,表明对协议级混淆具有强大鲁棒性。
  • 在测试期间使用VPN时,系统准确率降至83%,但仍具有效性,表明网络级混淆无法完全击败分类器。
  • 即使仅使用500个训练样本(全数据集的2.4%),系统仍达到85%的准确率,表明其在小样本数据上具有强大的泛化能力。
  • 短会话时间(最低至1秒)对性能影响极小,10秒会话的准确率接近94%,与1秒结果相当,支持实时部署。
  • 所有分类器的测试时间均低于1秒,证实其适用于实时网络监控和部署。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。