Skip to main content
QUICK REVIEW

[논문 리뷰] Discretization of Temporal Data: A Survey

Pratik Chaudhari, Dipti P. Rana|arXiv (Cornell University)|2014. 02. 18.
Time Series Analysis and Forecasting참고 문헌 12인용 수 13
한 줄 요약

이 종합 검토는 시간적 데이터를 위한 데이터 이산화 기법을 검토하며, 시간 순서, 클래스 레이블, 스트림 처리를 유지하는 시간 인지 기반 방법에 중점을 둔다. 시간 순서와 클래스 레이블의 포함 여부에 따라 접근 방식을 분류하여, 시간에 민감한 간격 생성을 통해 정밀도와 간결성을 향상시킴으로써 시계열 데이터에 대한 데이터 마이닝 성능 향상을 위한 프레임워크를 제공한다.

ABSTRACT

In real world, the huge amount of temporal data is to be processed in many application areas such as scientific, financial, network monitoring, sensor data analysis. Data mining techniques are primarily oriented to handle discrete features. In the case of temporal data the time plays an important role on the characteristics of data. To consider this effect, the data discretization techniques have to consider the time while processing to resolve the issue by finding the intervals of data which are more concise and precise with respect to time. Here, this research is reviewing different data discretization techniques used in temporal data applications according to the inclusion or exclusion of: class label, temporal order of the data and handling of stream data to open the research direction for temporal data discretization to improve the performance of data mining technique.

연구 동기 및 목표

  • 데이터 마이닝 응용 프로그램의 맥락에서 시간적 데이터를 위한 기존 이산화 기법을 분석하기 위해.
  • 시간 순서, 클래스 레이블 사용, 스트림 데이터 처리에 관해 현재 기법들 사이의 격차를 특정하기 위해.
  • 시간적 및 클래스 관련 특징의 포함 여부에 기반한 이산화 접근 방식의 체계적 분류 체계를 제공하기 위해.
  • 시간적 데이터 이산화 분야에서 미처 탐색되지 않은 방향을 부각시켜 향후 연구를 안내하기 위해.
  • 시계열 데이터의 더 정밀하고 간결한 이산화를 가능하게 하여 데이터 마이닝 성능을 향상시키기 위해.

제안 방법

  • 클래스 레이블, 시간 순서, 스트림 처리 기능을 고려하는지 여부에 따라 이산화 방법을 분류하기 위해.
  • 등간격, 등빈도, 엔트로피 기반, 시간 인지 기반의 박스화 방법과 같은 기존 기법을 검토하기 위해.
  • 시간 순서가 이산화 과정에서 간격 형성과 데이터 품질에 미치는 영향을 분석하기 위해.
  • 지속적인 데이터 스트림을 처리하기 위해 동적으로 이산화 간격을 조정하는 방법을 평가하기 위해.
  • 클래스 정보를 통합하는(지도 학습) 방법과 통합하지 않는(비지도 학습) 방법을 비교하기 위해.
  • 핵심 설계 기준에 기반한 시간적 이산화 기법 분류를 위한 개념적 프레임워크를 제안하기 위해.

실험 결과

연구 질문

  • RQ1다양한 이산화 기법은 시계열 데이터에서 시간 순서를 어떻게 다루는가?
  • RQ2시간적 데이터 이산화에 클래스 레이블을 포함시키는 것이 후속 데이터 마이닝 성능에 미치는 영향은 무엇인가?
  • RQ3스트리밍 시간적 데이터에 가장 적합한 이산화 방법은 무엇인가?
  • RQ4시간 인지 기반 이산화 기법은 기존 방법에 비해 정밀도와 간결성 측면에서 어떻게 향상되는가?
  • RQ5현재 시간적 데이터 이산화 기법에서의 주요 제약 조건과 연구 격차는 무엇인가?

주요 결과

  • 이산화 과정에 시간 순서를 포함시키면 시계열 데이터에 대한 데이터 마이닝 결과의 해석 가능성과 정확도가 크게 향상된다.
  • 클래스 레이블을 고려하는 지도 학습 기반 이산화 방법은 더 정보가 풍부하고 구분력 있는 간격을 생성하는 경향이 있다.
  • 스트림 처리를 고려한 기법은 동적으로 이산화 간격을 조정할 수 있어 실시간 데이터 처리 성능을 향상시킨다.
  • 시간 인지 기반 이산화 기법은 비시간 기반 방법에 비해 더 간결하고 의미 있는 데이터 분할을 제공한다.
  • 시간 이산화 기법 간 비교를 위한 표준화된 평가 및 종합적인 프레임워크가 아직 부족한 상황이다.
  • 본 종합 검토는 변화하는 데이터 스트림를 대상으로 하는 적응형, 확장성 있고 시간에 민감한 이산화 알고리즘에 대한 향후 연구의 필요성을 규명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.