[논문 리뷰] Embedding Secret Data in HTML Web Page
이 논문은 HTML 태그의 대소문자 구분 없음 성질을 이용하여 웹 페이지의 HTML에 기밀 데이터를 숨기는 스테고그래피 기법을 제안한다. 태그 내 알파벳 문자의 대소문자를 변경함으로써 시각적 콘텐츠에 영향을 주지 않고 비밀 비트를 숨기며, 이는 눈에 띄는 왜곡을 유발하지 않으며 '소스 보기' 기능을 통해 추출이 가능하므로, 대소문자 구분이 없는 소스 코드에서 데이터를 숨기기에 강력하다.
In this paper, we suggest a novel data hiding technique in an HTML Web page. HTML Tags are case insensitive and hence an alphabet in lowercase and one in uppercase present inside an HTML tag are interpreted in the same manner by the browser,i.e., change in case in an web page is imperceptible to the browser. We basically exploit this redundancy and use it to embed secret data inside an web page, with no changes visible to the user of the web page, so that he can not even suspect about the data hiding. The embedded data can be recovered by viewing the source of the HTML page. This technique can easily be extended to embed secret message inside any piece of source-code where the standard interpreter of that language is case-insensitive.
연구 동기 및 목표
- 렌더링된 콘텐츠에 시각적 변화 없이 HTML 웹 페이지 내 기밀 데이터를 숨기는 스테고그래피 기법을 개발하는 것.
- HTML 태그의 본질적인 대소문자 구분 불가능성을 데이터 삽입을 위한 여유 자원으로 활용하는 것.
- 삽입된 데이터가 최종 사용자에게 인지되지 않으며 소스 코드에 접근하지 않으면 탐지되지 않도록 보장하는 것.
- 이 방법을 다른 대소문자 구분 불가능한 프로그래밍 언어나 소스 코드 형식으로 확장하는 것.
- 텍스트 기반 웹 콘텐츠에서 단순하고 강력하며 왜곡 없는 스테고그래피 기반 데이터 숨기기 방법을 제공하는 것.
제안 방법
- 모든 알파벳 문자가 HTML 태그 내에서 데이터 삽입 후보로 식별되며, 이는 대소문자 변형을 통해 기밀 비트를 인코딩하는 데 사용된다.
- 태그 내 각 문자에 대해 대소문자를 변경하여 비트를 표현: 소문자로는 '0', 대문자로는 '1'로 설정하며, 이는 기밀 메시지에 기반한다.
- 스테고그래피 함수는 $ f_{stego}(c_i) = l(c_i) ar{b}_j + u(c_i) b_j $ 로 정의되며, 여기서 $ l $ 과 $ u $ 는 각각 소문자로 변환하고 대문자로 변환하는 함수이다.
- 기밀 메시지의 길이 $ k $ 는 HTML 헤더에 삽입된다 (예: <Header 25>), 이를 통해 정확한 추출이 가능해진다.
- 추출은 소스 코드를 열어 태그 내 알파벳 문자의 대소문자 패턴을 분석함으로써 수행된다.
- 이 방법은 BASIC, 파스칼, 또는 C 유사 언어의 주석과 같이 대소문자 구분 불가능한 모든 언어나 소스 코드에 확장 가능하다.
실험 결과
연구 질문
- RQ1HTML 태그의 대소문자 구분 불가능성 특성을 어떻게 활용하여 가시적 왜곡 없이 기밀 데이터를 삽입할 수 있는가?
- RQ2사용자에게 감지되지 않으며 소스 코드에 접근하지 않으면 탐지되지 않는 HTML 소스 코드에서 기밀 데이터를 삽입하고 추출하는 단순하고 강력한 방법은 무엇인가?
- RQ3이 기법을 다른 대소문자 구분 불가능한 프로그래밍 또는 스크립트 언어로 일반화할 수 있는가?
- RQ4이 방법은 전통적인 스테고그래피 기법과 비교해 시각적 및 구조적 왜곡 측면에서 어떻게 다른가?
- RQ5삽입된 메시지의 정확한 추출을 위해 커버 텍스트에 대한 사전 지식 없이도 신뢰할 수 있는 메커니즘은 무엇인가?
주요 결과
- 제안된 방법은 브라우저가 HTML 태그 내 대소문자 변경을 무시하므로, 렌더링된 웹 페이지에 시각적 왜곡을 유발하지 않는다.
- 소스 코드에 접근한 사람은 태그 내 알파벳 문자의 대소문자 패턴을 분석함으로써 기밀 메시지를 누구나 추출할 수 있다.
- 삽입된 메시지의 길이는 헤더에 인코딩되어 있다 (예: <Header 25>), 이는 메시지 크기의 사전 지식 없이도 정확한 추출이 가능하게 한다.
- 이 방법은 강력하고 효율적이며, 복잡한 변환이나 이미지 처리가 필요 없고, 직접 텍스트에서 작동한다.
- 이 기법은 C의 주석이나 BASIC의 키워드와 같이 대소문자 구분 불가능한 모든 언어나 소스 코드로 확장 가능하다.
- 커버 HTML과 스테고 HTML의 히스토GRAM 분석 결과, 문자 빈도에 유의미한 변화가 없음을 확인하여, 탐지 가능한 왜곡이 없음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.