Skip to main content
QUICK REVIEW

[論文レビュー] Accurate TLS Fingerprinting using Destination Context and Knowledge Bases

Blake Anderson, David McGrew|arXiv (Cornell University)|Sep 3, 2020
Internet Traffic Analysis and Secure E-voting参考文献 23被引用数 12
ひとこと要約

本稿では、TLSクライアントHelloのフィンガープrint文字列と宛先コンテキスト(IP、ポート、server_name)を組み合わせ、重み付きナイーブベイズ分類器を用いて、非常に高い精度のプロセス同定およびマルウェア検出を実現するTLSフィンガープrintインガリングシステムを提案する。リアルタイムのネットワークおよびホストデータを統合して継続的に更新される知識ベースを構築することで、プロセス同定のF₁スコアが0.99以上、マルウェア検出では99.9%の精度と88.7%の再現率を達成した。

ABSTRACT

Network fingerprinting is used to identify applications, provide insight into network traffic, and detect malicious activity. With the broad adoption of TLS, traditional fingerprinting techniques that rely on clear-text data are no longer viable. TLS-specific techniques have been introduced that create a fingerprint string from carefully selected data features in the client_hello to facilitate process identification before data is exchanged. Unfortunately, this approach fails in practice because hundreds of processes can map to the same fingerprint string. We solve this problem by presenting a TLS fingerprinting system that makes use of the destination address, port, and server name in addition to a carefully constructed fingerprint string. The destination context is used to disambiguate the set of processes that match a fingerprint string by applying a weighted naive Bayes classifier, resulting in far greater performance.

研究の動機と目的

  • 従来のTLSフィンガープリントの限界に対処する。これは、多くのプロセスが同じフィンガープリント文字列にマッピングされ、誤検出率が高くなるという問題である。
  • 宛先コンテキスト(IP、ポート、server_name)をフィンガープリントプロセスに組み込むことで、プロセス同定の精度を向上させる。
  • リアルワールドのネットワークおよびホストデータを用いて、TLSフィンガープリント、プロセス、宛先特徴を関連付ける、継続的に更新される大規模な知識ベースを構築する。
  • コンテキストによる曖昧性解消を活用して、TLSフィンガープリントを用いた高精度でリアルタイムのマルウェア検出を実現する。
  • オープンソースのツールと週次で更新される公開TLSフィンガープリント知識ベースを通じて、再現可能性とコミュニティによる採用を支援する。

提案手法

  • システムは、暗号スイート、圧縮手法、拡張子などのclient_hello内のメタデータからTLSフィンガープリント文字列を構築する。
  • IPアドレスや自律システムなどの宛先特徴に対して同値クラスを用いることで、未確認の宛先への一般化を図り、スパarsityを低減する。
  • 重み付きナイーブベイズ分類器がフィンガープリント文字列と宛先コンテキストを統合し、プロセスファミリーの事後確率を計算する。
  • ホストログとネットワークログの継続的統合により、1日5000万件以上のリアルワールドTLSセッションから知識ベースを構築する。
  • 正確なフィンガープリントマッチが見つからない場合、近似マッチングとしてファジーハッシュを用いる。
  • 本アプローチはオープンソースツールmercuryに実装されており、週次で更新される公開可能なTLSフィンガープリント知識ベースを併用する。

実験結果

リサーチクエスチョン

  • RQ1TLSフィンガープリント文字列と宛先コンテキストを組み合わせることで、単独でのフィンガープリントに比べて、プロセス同定の精度が顕著に向上するか?
  • RQ2TLSクライアントHelloメタデータと宛先コンテキストのみを用いて、マルウェア検出はどの程度効果的か?
  • RQ3知識ベースは、地理的および組織的に異なるネットワーク間でどの程度転送可能か?
  • RQ4標準化されたTLSライブラリを多く使用するクラウドオーケストレーションおよびプロセッシングツールの同定において、本システムはどの程度の性能を示すか?
  • RQ5進化するTLS使用パターンを伴う本番環境でも、本システムは高い精度と低い誤検出率を維持できるか?

主な発見

  • TLSフィンガープリント文字列と宛先コンテキストの組み合わせを用いることで、プロセスファミリー同定のF₁スコアが0.99以上を達成した。
  • 本システムを用いたマルウェア検出では、99.9%の精度と88.7%の再現率を達成し、悪意あるTLSトラフィックの同定において高い有効性を示した。
  • クラウドオーケストレーションおよびプロセッシングツールの分野では、いくつかの代表的なプロセスで精度と再現率が0.99を上回り、企業ワークロードの同定において優れた性能を示した。
  • 正確なフィンガープリントマッチが得られない場合、ファジーハッシュによる近似マッチングでもF₁スコア0.90を達成し、フィンガープリントの変動に強いことが示された。
  • 本システムはスケーラビリティと転送性を示し、第二の地理的に異なるサイト(GMT+8)でも良好な性能を示したが、最適なパフォーマンスを得るにはサイト固有の知識ベースの調整が有効であることがわかった。
  • オープンソースのmercuryツールと週次で更新される公開知識ベースにより、本システムの能力の再現可能性とコミュニティによる拡張が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。