Skip to main content
QUICK REVIEW

[논문 리뷰] Randomized LU decomposition: An Algorithm for Dictionaries Construction

Aviv Rotbart, Gil Shabat|arXiv (Cornell University)|2015. 02. 17.
Algorithms and Data Compression참고 문헌 22인용 수 3
한 줄 요약

이 논문은 학습 데이터의 저질서 행렬 분해를 위한 확률적 LU 분해를 기반으로 한 빠르고 확장 가능하며 메모리 효율적인 사전 구축 알고리즘을 제안한다. 이는 과소 완성 사전 학습을 가능하게 하여 분류를 단순화하고, SVD보다 빠르고 메모리 사용량이 적으며, 최소한의 파일 조각조차도 높은 정확도로 콘텐츠 기반 파일 유형 검출을 달성한다. 이는 악성 코드가 포함된 PDF 파일을 식별하는 디지털 보안 응용 분야에서 강력한 성능을 보여준다.

ABSTRACT

In recent years, distinctive-dictionary construction has gained importance due to his usefulness in data processing. Usually, one or more dictionaries are constructed from a training data and then they are used to classify signals that did not participate in the training process. A new dictionary construction algorithm is introduced. It is based on a low-rank matrix factorization being achieved by the application of the randomized LU decomposition to a training data. This method is fast, scalable, parallelizable, consumes low memory, outperforms SVD in these categories and works also extremely well on large sparse matrices. In contrast to existing methods, the randomized LU decomposition constructs an under-complete dictionary, which simplifies both the construction and the classification processes of newly arrived signals. The dictionary construction is generic and general that fits different applications. We demonstrate the capabilities of this algorithm for file type identification, which is a fundamental task in digital security arena, performed nowadays for example by sandboxing mechanism, deep packet inspection, firewalls and anti-virus systems. We propose a content-based method that detects file types that neither depend on file extension nor on metadata. Such approach is harder to deceive and we show that only a few file fragments from a whole file are needed for a successful classification. Based on the constructed dictionaries, we show that the proposed method can effectively identify execution code fragments in PDF files. $ extbf{Keywords.}$ Dictionary construction, classification, LU decomposition, randomized LU decomposition, content-based file detection, computer security.

연구 동기 및 목표

  • 데이터 처리 및 분류 작업에서 효율적이고 확장 가능한 사전 구축 방법의 필요성을 해결한다.
  • 대규모 또는 희소 데이터셋에 특히 적합한 SVD와 같은 기존 방법의 속도, 메모리 사용량 및 확장성의 한계를 극복한다.
  • 다양한 응용 분야에 적용 가능한 일반적이고 병렬 처리 가능한 사전 구축 프레임워크를 개발한다.
  • 파일 확장자나 메타데이터에 의존하지 않고도 강력한 콘텐츠 기반 파일 유형 식별을 가능하게 한다.
  • 이 방법이 PDF와 같은 파일에서 임베디드 실행 코드 조각을 높은 정확도로 탐지할 수 있음을 입증한다. 이는 컴퓨터 보안 분야에서 관련성이 있다.

제안 방법

  • 학습 데이터에 대해 확률적 LU 분해를 적용하여 저질서 행렬 분해를 수행함으로써 효율적인 사전 학습을 가능하게 한다.
  • 확률적 LU 분해를 활용해 과소 완성 사전를 생성함으로써 학습 및 분류 과정을 단순화한다.
  • 확률적 알고리즘의 수치적 안정성과 계산 효율성을 활용하여 대규모 및 희소 행렬을 처리한다.
  • 메타데이터나 파일 확장자에 의존하지 않고 원시 데이터에서 그대로 사전을 구축한다.
  • 새로운 신호를 학습된 부분공간에 투영하여 사전을 활용해 신호 분류를 수행한다.
  • 병렬 처리 가능하고 메모리 효율적인 방법을 확보하여 실시간 또는 대규모 배포에 적합하게 한다.

실험 결과

연구 질문

  • RQ1확률적 LU 분해가 사전 구축에서 전통적인 SVD보다 속도, 메모리 사용량 및 확장성 측면에서 뛰어나게 작용할 수 있는가?
  • RQ2결과적으로 생성된 과소 완성 사전가 미리 보지 않은 신호의 정확한 분류를 얼마나 잘 가능하게 하는가?
  • RQ3파일 확장자나 메타데이터에 의존하지 않고 콘텐츠 기반 파일 유형 검출을 얼마나 잘 달성할 수 있는가?
  • RQ4제안된 사전 기반 방법을 사용할 때 신뢰할 수 있는 분류를 위해 최소한의 파일 조각이 얼마나 필요한가?
  • RQ5이 방법은 PDF와 같은 파일에서 임베디드 실행 코드 조각을 높은 정확도로 탐지할 수 있는가?

주요 결과

  • 확률적 LU 분해 방법은 특히 대규모 및 희소 행렬에서 SVD보다 뚜렷이 빠르고 메모리 사용량이 적다.
  • 구축된 사전는 과소 완성되어 있어 사전 학습 및 신호 분류 과정을 모두 단순화한다.
  • 전체 파일 내용에 의존하지 않고도 몇 개의 파일 조각만으로도 높은 정확도로 콘텐츠 기반 파일 유형 검출을 달성한다.
  • 이 방법은 PDF 파일 내 임베디드 실행 코드 조각을 성공적으로 식별하여 디지털 보안 분야에서의 유용성을 입증한다.
  • 알고리즘이 확장 가능하고 병렬 처리가 가능하여 실시간 또는 대규모 데이터 처리 응용 분야에 적합하다.
  • 희소 데이터에서도 우수한 성능을 보이며, 이러한 환경에서 전통적인 SVD보다 뛰어난 성능을 발휘한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.