Skip to main content
QUICK REVIEW

[論文レビュー] Limitless HTTP in an HTTPS World: Inferring the Semantics of the HTTPS Protocol without Decryption

Blake Anderson, Andrew Chi|arXiv (Cornell University)|May 29, 2018
Internet Traffic Analysis and Secure E-voting参考文献 20被引用数 3
ひとこと要約

本稿では、暗号化を解除せずに、HTTPの意味的特性——メソッド、ステータスコード、Content-Type、ヘッダーの有無など——を受動的なHTTPSトラフィックから推論するための新規フレームワークを提示する。ブラウザおよびマルウェアサンドボックスからのTLS暗号化トラフィックを用いた反復的で多クラスおよび二値分類を実施した結果、ほとんどの分野でF₁スコアが0.900を超えることを確認した。暗号化されてもプロトコルレベルの情報は顕著に抽出可能であり、マルウェア検出やプライバシーのトレードオフに影響を及ぼす可能性を示している。

ABSTRACT

We present new analytic techniques for inferring HTTP semantics from passive observations of HTTPS that can infer the value of important fields including the status-code, Content-Type, and Server, and the presence or absence of several additional HTTP header fields, e.g., Cookie and Referer. Our goals are twofold: to better understand the limitations of the confidentiality of HTTPS, and to explore benign uses of traffic analysis such as application troubleshooting and malware detection that could replace HTTPS interception and static private keys in some scenarios. We found that our techniques improve the efficacy of malware detection, but they do not enable more powerful website fingerprinting attacks against Tor. Our broader set of results raises concerns about the confidentiality goals of TLS relative to a user's expectation of privacy, warranting future research. We apply our methods to the semantics of both HTTP/1.1 and HTTP/2 on data collected from automated runs of Firefox 58.0, Chrome 63.0, and Tor Browser 7.0.11 in a lab setting, and from applications running in a malware sandbox. We obtain ground truth plaintext for a diverse set of applications from the malware sandbox by extracting the key material needed for decryption from RAM post-execution. We developed an iterative approach to simultaneously solve several multi-class (field values) and binary (field presence) classification problems, and we show that our inference algorithm achieves an unweighted $F_1$ score greater than 0.900 for most HTTP fields examined.

研究の動機と目的

  • 受動的なHTTPSトラフィックから、暗号化解除なしに意味的なHTTPプロトコルの特性を推論できるかどうかを調査すること。
  • ネットワーク監視やセキュリティタスクにおいて、TLSの復号をトラフィック解析に置き換える可能性を評価すること。
  • これらの推論手法が、ウェブサイトのファイガープリンティングや脱匿名化といった悪意ある状況において、プライバシーに与える影響を評価すること。
  • 暗号化トラフィック解析を用いたマルウェア検出、ネットワークデバッグ、ポリシー管理への実用的応用を検討すること。
  • Torのようなプライバシー保護システム(固定長セルや多重化を含む防御を採用)に対して、これらの手法の耐性を評価すること。

提案手法

  • 著者らは、メソッド、ステータスコード、Content-Type、ヘッダーの有無(例:Cookie、Referer)といったHTTPフィールドのセットとして問題を定式化している。
  • 同じTLS接続内での関連トランザクションからの推論を活用することで、精度を向上させる反復的分類戦略を採用している。
  • Firefox 58.0、Chrome 63.0、Torブラウザ 7.0.11、およびマルウェアサンドボックスからの暗号化HTTPSトラフィックを収集し、学習(第1週)とテスト(第2週)のデータに分割して訓練している。
  • マルウェアデータの正解ラベル(プレーンテキスト)は、実行後におけるRAMからのTLS鍵素材の抽出により得られており、実世界の暗号化トラフィックにおける教師あり学習を可能としている。
  • まず、HTTP/1.1とHTTP/2のレコードをTLSストリーム内で検出するが、F₁スコアはそれぞれ0.99および0.98以上であり、レコード境界検出の高精度を示している。
  • 特徴量の重要度とモデルの頑健性を時間経過とともに評価しており、特徴量の関連性が変化する可能性があることから、継続的な再訓練が不可欠であると認識している。

実験結果

リサーチクエスチョン

  • RQ1暗号化解除なしで、受動的なHTTPSトラフィックから、メソッド、ステータスコード、ヘッダー項目といったHTTPプロトコルの意味的特性を正確に推論できるか?
  • RQ2これらの推論手法は、暗号化トラフィックにおけるマルウェア検出性能をどの程度向上させられるか。また、一般的なオフスカレーション技術によって回避可能か?
  • RQ3これらの推論手法は、Torネットワークにおけるウェブサイトファイガープリンティング攻撃を強化するか。もしそうでなければ、その理由は何か?
  • RQ4異なるブラウザおよびネットワーク環境(動的トラフィックおよびサンドボックス環境を含む)において、推論システムの性能はどのように変動するか?
  • RQ5暗号化トラフィックからHTTPの意味的特性を推論することの倫理的・プライバシー的影響は何か。特に、ユーザーの脱匿名化やポリシー管理の観点から検討すること。

主な発見

  • 推論フレームワークは、Content-Type、Server、ステータスコードなど、調査された大多数のHTTPフィールドで未加重F₁スコアが0.900を超える。メソッドフィールドは0.717、ステータスコードフィールドは0.492を記録した。
  • TLSストリーム内でのHTTP/1.1およびHTTP/2レコードの検出において、F₁スコアはそれぞれ0.99および0.98を達成しており、レコード境界検出の高精度を示している。
  • マルウェアトラフィックにおけるHTTPヘッダー項目の分布の特徴を活用することで、マルウェア検出性能が向上するが、回避戦略によりその有効性が低下する可能性がある。
  • Torネットワークにおけるウェブサイトファイガープリンティング攻撃は改善されなかった。これは、Torが固定長セルと多重化を用いることで、推論手法が効果を発揮しなくなるように効果的に防御しているためである。
  • アクティブスキャンやTLS終端なしで、受動的ネットワーク監視およびデバッグが可能となり、ネットワーク管理者にとってスケーラブルな代替手段を提供する。
  • NATされたユーザーの脱匿名化が、タイムスタンプと参照元/オリジン/Cookieフィールドの有無の相関を用いて可能になる。また、HTTP/2フレームタイプからファイルサイズを推論することで、ポリシー違反のファイル転送を検出可能となる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。