Skip to main content
QUICK REVIEW

[論文レビュー] Embedding Secret Data in HTML Web Page

Sandipan Dey, Hameed Al-Qaheri|arXiv (Cornell University)|Apr 3, 2010
Advanced Malware Detection Techniques参考文献 8被引用数 16
ひとこと要約

この論文では、HTMLタグの大小文字非区別性を活用して、WebページのHTMLに秘密データを埋め込むステガノグラフィック技術を提案する。タグ内のアルファベット文字のケースを変更することで、表示内容に変更を加えずにビットを隠し込み、目に見える歪みを生じさせない。この方法により、『ソース表示』によっても容易に抽出可能であり、大小文字非区別のソースコードにおいて、耐性のあるデータ隠しを実現する。

ABSTRACT

In this paper, we suggest a novel data hiding technique in an HTML Web page. HTML Tags are case insensitive and hence an alphabet in lowercase and one in uppercase present inside an HTML tag are interpreted in the same manner by the browser,i.e., change in case in an web page is imperceptible to the browser. We basically exploit this redundancy and use it to embed secret data inside an web page, with no changes visible to the user of the web page, so that he can not even suspect about the data hiding. The embedded data can be recovered by viewing the source of the HTML page. This technique can easily be extended to embed secret message inside any piece of source-code where the standard interpreter of that language is case-insensitive.

研究の動機と目的

  • レンダリングされたコンテンツに目に見える変更を加えずに、HTMLウェブページに秘密データを隠すステガノグラフィック技術を開発すること。
  • HTMLタグの固有の大小文字非区別性を、データ埋め込みのための冗長性の源として活用すること。
  • 埋め込まれたデータが最終ユーザーには認識不能であり、かつソースコードにアクセスしない限り検出不能であることを保証すること。
  • この手法を他の大小文字非区別のプログラミング言語やソースコード形式へ拡張すること。
  • テキストベースのウェブコンテンツにおいて、シンプルで耐性があり、歪みのないステガノグラフィックデータ隠し手法を提供すること。

提案手法

  • 本手法は、HTMLタグ内のすべてのアルファベット文字を、データ埋め込みの候補として特定し、ケースの変更によって秘密ビットを符号化する。
  • 各タグ内の文字について、小文字を「0」、大文字を「1」として、秘密メッセージに従ってケースを変更する。
  • ステガノグラフィック関数は $ f_{stego}(c_i) = l(c_i) ar{b}_j + u(c_i) b_j $ で定義され、ここで $ l $ と $ u $ はそれぞれ小文字および大文字への変換を表す。
  • 秘密メッセージの長さ $ k $ は、HTMLヘッダ(例:<Header 25>)に埋め込むことで、正しく抽出可能となる。
  • 抽出は、ソースコードを表示し、タグ内のアルファベット文字のケースパターンに基づいてビットをデコードすることで実行される。
  • 本アプローチは、BASIC やパ스カル、C風言語のコメントなど、任意の大小文字非区別の言語やソースコードに拡張可能である。

実験結果

リサーチクエスチョン

  • RQ1HTMLタグの大小文字非区別性をどのように活用すれば、目に見える歪みを生じさせずに秘密データを埋め込めるか?
  • RQ2ユーザーに対して検出不能であり、かつHTMLソースコードにアクセス可能な者だけが抽出可能な、シンプルで耐性のあるデータ埋め込み・抽出手法は何か?
  • RQ3この技術を、他の大小文字非区別のプログラミング言語やスクリプト言語へ一般化できるか?
  • RQ4従来のステガノグラフィック手法と比較して、本手法は視覚的および構造的歪みの点でどのように異なるか?
  • RQ5事前にカバー・テキストの知識がなくても、埋め込まれたメッセージを信頼性高く抽出するためのメカニズムは何か?

主な発見

  • ブラウザがHTMLタグのケース変更を無視するため、レンダリングされたWebページに目に見える歪みは一切生じない。
  • ソースコードにアクセスできる者であれば、タグ内のアルファベット文字のケースパターンを分析することで、秘密メッセージを誰でも抽出可能である。
  • 埋め込まれたメッセージの長さはヘッダ(例:<Header 25>)に符号化されており、事前にメッセージサイズを知らなくても正しく抽出可能である。
  • 本手法は耐性があり、効率的であり、複雑な変換や画像処理を必要とせず、テキスト上で直接処理が可能である。
  • C言語のコメントやBASICのキーワードなど、任意の大小文字非区別の言語やソースコードに拡張可能である。
  • カバー版とステゴ版のHTMLのヒストグラム分析では、文字頻度の有意な変化が認められず、検出可能な歪みがないことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。