Skip to main content
QUICK REVIEW

[논문 리뷰] Une adaptation des cartes auto-organisatrices pour des données décrites par un tableau de dissimilarités

Aïcha El Golli, Fabrice Rossi|ArXiv.org|2007. 09. 22.
Advanced Clustering Algorithms Research참고 문헌 29인용 수 7
한 줄 요약

이 논문은 텍스트, 기능 데이터 또는 기호 데이터와 같은 벡터가 아닌 데이터의 분석을 가능하게 하기 위해 이질성 행렬에 직접 작용하는 배치 알고리즘을 제안한다. 이 방법은 원형의 위상적 순서를 유지하며, 실제 웹 로그 데이터에 대해 검증되어 벡터 표현 없이 효과적인 군집화와 비선형 투영을 보여준다.

ABSTRACT

Many data analysis methods cannot be applied to data that are not represented by a fixed number of real values, whereas most of real world observations are not readily available in such a format. Vector based data analysis methods have therefore to be adapted in order to be used with non standard complex data. A flexible and general solution for this adaptation is to use a (dis)similarity measure. Indeed, thanks to expert knowledge on the studied data, it is generally possible to define a measure that can be used to make pairwise comparison between observations. General data analysis methods are then obtained by adapting existing methods to (dis)similarity matrices. In this article, we propose an adaptation of Kohonen's Self Organizing Map (SOM) to (dis)similarity data. The proposed algorithm is an adapted version of the vector based batch SOM. The method is validated on real world data: we provide an analysis of the usage patterns of the web site of the Institut National de Recherche en Informatique et Automatique, constructed thanks to web log mining method.

연구 동기 및 목표

  • 고정된 차원의 벡터로 표현할 수 없는 데이터, 예를 들어 텍스트, 기능적 데이터 또는 기호 데이터에 대해 자기조직화 지도(SOM)를 확장하는 것.
  • 사전에 계산된 이질성 행렬에만 기반하여 작동하는 방법을 개발하여, 벡터 표현과 관련된 정보 손실을 피하는 것.
  • 벡터 공간 연산 없이도 SOM의 위상적 순서와 군집 성질을 유지하는 것.
  • 실제 웹 사용 데이터의 로그 파일을 사용하여 이 접근법을 검증하고 실용적 적용 가능성을 입증하는 것.
  • 의미 있는 이질성 측정이 존재하는 한, 다양한 데이터 유형에 적용 가능한 일반적인, 재사용 가능한 SOM 프레임워크를 제공하는 것.

제안 방법

  • 기본 SOM 알고리즘의 배치 버전을 입력 벡터 대신 이질성 행렬에 직접 작용하도록 적응시킨다.
  • 벡터 기반의 거리 계산을 대체하기 위해 이질성 행렬을 사용하여 각 데이터 포인트가 원형에 미치는 영향을 계산한다.
  • 데이터 포인트와 그에 대응하는 최적의 원형 간의 이질성에 기반한 전역 오차 함수를 최소화하는 학습 규칙을 정의한다.
  • 기본적인 이질성 구조를 반영하도록 반복적으로 업데이트되는 고정된 원형 격자 유지.
  • 최적 매칭 원형뿐만 아니라 그 이웃까지도 업데이트하는 이웃 함수를 사용하여 위상적 순서를 유지한다.
  • 각 데이터 포인트가 가장 작은 이질성을 가지는 원형에 할당되는 재할당 단계를 도입하여 데이터의 분할을 형성한다.

실험 결과

연구 질문

  • RQ1벡터 입력이 필요 없이 이질성 행렬에 직접 작용하도록 자기조직화 지도 알고리즘을 효과적으로 적응시킬 수 있는가?
  • RQ2비벡터 데이터에 적용했을 때 제안된 배치 SOM이 위상적 구조를 얼마나 잘 유지하는가?
  • RQ3이 방법은 로그 파일에서 유래한 실제 웹 사용 패턴의 군집화 및 시각화에서 어떤 성능을 보이는가?
  • RQ4군집 품질과 위상 충실도 측면에서 기존의 벡터 기반 SOM과 비교해 성능이 뛰어나거나 유사한가?
  • RQ5의미 있는 이질성 측정이 존재하는 한, 다양한 데이터 유형으로 일반화될 수 있는가?

주요 결과

  • 제안된 배치 SOM 알고리즘은 이질성 행렬에서 효과적으로 작동하여 텍스트, 웹 로그와 같은 비벡터 데이터의 분석을 가능하게 한다.
  • 이 방법은 효과적인 군집화와 비선형 투영을 달성하며, 데이터 포인트 간의 위상적 관계를 유지한다.
  • 실제 웹 로그 데이터에 대한 검증을 통해 SOM은 의미 있는 사용 패턴과 사용자 행동 군집을 식별함을 보여준다.
  • 벡터 표현이 필요 없이 복잡한 비벡터 데이터에 적용해도 알고리즘이 안정적이고 수렴함을 입증한다.
  • 의미 있는 이질성 측정이 정의되어 있다면, 동일한 SOM 구현을 다양한 데이터 유형에 재사용할 수 있다.
  • 결과는 이질성 기반 SOM이 탐색적 데이터 분석을 위한 벡터 기반 방법에 비해 타당하고 강력한 대안임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.