Skip to main content
QUICK REVIEW

[논문 리뷰] An Unified Definition of Data Mining

Christoph Schommer|ArXiv.org|2008. 09. 16.
Data Mining Algorithms and Applications참고 문헌 22인용 수 10
한 줄 요약

이 논문은 화학에서의 응집 상태인 고체, 액체, 기체에 대한 새로운 유사비를 활용하여 데이터 마이닝을 통합적으로 정의한다. 이는 원시 데이터(고체 상태)를 정보(액체 상태)로, 정보를 통찰력(기체 상태)으로, 통찰력을 지식(매우 구조화된 기체 상태)으로 전환하는 변형 과정으로 데이터 마이닝을 위치시킨다. 이 프레임워크는 데이터 수집, 알고리즘을 통한 정보로의 변환, 지식으로의 해석을 포함하는 다단계 과정으로 데이터 마이닝을 형식화하며, 웹 사용자 행동 분석에 대한 실제 적용을 통해 검증된다.

ABSTRACT

Since many years, theoretical concepts of Data Mining have been developed and improved. Data Mining has become applied to many academic and industrial situations, and recently, soundings of public opinion about privacy have been carried out. However, a consistent and standardized definition is still missing, and the initial explanation given by Frawley et al. has pragmatically often changed over the years. Furthermore, alternative terms like Knowledge Discovery have been conjured and forged, and a necessity of a Data Warehouse has been endeavoured to persuade the users. In this work, we pick up current definitions and introduce an unified definition that covers existing attempted explanations. For this, we appeal to the natural original of chemical states of aggregation.

연구 동기 및 목표

  • 학술계와 산업계에서 널리 사용되고 있음에도 불구하고 데이터 마이닝에 대한 일관되고 표준화된 정의가 부족한 문제를 해결하기 위해.
  • 데이터 마이닝의 개념적 경계를 흐리게 한 '지식 발견'과 '데이터 웨어하우스'와 같은 상충되는 정의 및 용어를 조율하기 위해.
  • 화학에서의 응집 상태 유사비를 기반으로 한 공식적이고 통합된 데이터 마이닝 모델을 제안하여 명확한 개념적 및 운영적 프레임워크를 제공하기 위해.
  • 연결 규칙 마이닝을 활용한 웹 사용자 행동 분석 사례 연구를 통해 모델의 실용적 적용 가능성을 입증하기 위해.
  • 자동화 도구를 초월하여 인간의 해석과 반복적 보완을 강조하는 다단계 과정을 포함하는 체계적인 데이터 마이닝 프로세스를 수립하기 위해.

제안 방법

  • 원시 데이터(고체), 정보(액체), 통찰력(기체), 지식(매우 구조화된 기체)의 네 단계 모델을 도입하여, 데이터 마이닝 기법에 의해 이행되는 전환을 설명한다.
  • 웹 로그 데이터에서 연관 규칙를 추출하기 위해 Apriori 알고리즘을 적용하며, 최소 지지도 및 신뢰도 임계값(support=2, confidence=2)을 설정하여 패턴을 식별한다.
  • 인간 분석을 통해 추출된 규칙를 해석 가능한 통찰력으로 전환한다. 예를 들어 '베이비' 페이지가 자주 '음료' 페이지로 연결된다는 사실을 확인한다.
  • 통계적 검증을 통해 통찰력을 지식으로 격상시킨다. 예를 들어 '베이비 → 음료' 상관관계가 유사한 시스템 전반에서 유지됨을 확인한다.
  • 데이터 수집, 사전 처리, 알고리즘 분석, 시각화, 해석을 포함하는 비결정적이고 탐색적인 과정으로 데이터 마이닝을 모델링한다.
  • 자동화 주장에 대비하여 인간 분석자가 작업 정의, 매개변수 선택, 결과 해석에 있어 대체 불가능한 역할을 한다고 강조한다.

실험 결과

연구 질문

  • RQ1통계, 기계 학습, 산업 분야에서 다양한 해석이 존재하는 상황에서도 데이터 마이닝에 대한 통합적이고 일관된 정의를 어떻게 수립할 수 있는가?
  • RQ2'지식 발견'이나 '데이터 웨어하우스'와 같은 대체 용어가 데이터 마이닝의 핵심 개념을 어느 정도 왜곡하는가?
  • RQ3고체, 액체, 기체와 같은 물리적 응집 상태의 유사비가 데이터에서 지식으로의 전환을 모델링하는 데 일관된 프레임워크를 제공할 수 있는가?
  • RQ4데이터 마이닝에서 데이터에서 통찰력으로, 그리고 궁극적으로 지식으로 전환하는 데 인간의 해석이 어떤 역할을 하는가?
  • RQ5실제 응용 사례를 통해 제안된 모델이 어떻게 데이터 마이닝 기법의 실용성과 타당성을 검증할 수 있는가?

주요 결과

  • 제안된 모델은 데이터 마이닝을 네 단계 전환 과정으로 성공적으로 매핑한다: 원시 데이터(고체) → 정보(액체) → 통찰력(기체) → 지식(매우 구조화된 기체).
  • 사례 연구에서 지지도=2 및 신뢰도=2인 연관 규칙가 웹 페이지에서 의미 있는 사용자 행동 패턴을 드러내었으며, '베이비'와 '음료' 페이지의 빈번한 동시 방문 패턴이 확인되었다.
  • 'wclothes'가 80%의 경우에서 종료 페이지로 사용되고, 'home'이 33%의 경우에서 진입 페이지로 사용된다는 통찰은 데이터 분석과 해석을 통해 도출되었다.
  • '베이비'와 '음료' 사이의 상관관계는 타당한 통찰으로 확인되었지만, 유사한 시스템 전반에서 검증되기 이전까지는 지식으로 격상되지 않았다.
  • 연구는 인간 분석자가 모든 단계에서 필수적임을 확인하였으며, 특히 작업 정의, 임계값 선택, 결과 해석에 있어 중요하다고 밝혔다.
  • 이 모델은 데이터 마이닝을 단순한 알고리즘적 추출이 아니라 촉매 작용을 하는 전환 과정으로 프레임워크화함으로써 다양한 정의를 효과적으로 조율하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.