[논문 리뷰] Clustering transformed compositional data using K-means, with applications in gene expression and bicycle sharing system data
이 논문은 유전자 발현 및 자전거 공유 데이터에서 조성 데이터의 군집화 성능을 햖थ기 위해 중심 로그 비율(CLR) 및 새로운 로그 중심 로그 비율(logCLR) 변환을 사용하는 K-means 군집 전략을 제안한다. 이 방법은 영 또는 근처 영일 확률이 높은 값을 더 잘 다루며, 비점근적 페널티 기준과 기울기 히우리스틱을 사용하여 최적의 군집 수를 선택함으로써 변환되지 않은 데이터보다 우수한 성능을 보인다.
Although there is no shortage of clustering algorithms proposed in the literature, the question of the most relevant strategy for clustering compositional data (i.e., data made up of profiles, whose rows belong to the simplex) remains largely unexplored in cases where the observed value of an observation is equal or close to zero for one or more samples. This work is motivated by the analysis of two sets of compositional data, both focused on the categorization of profiles but arising from considerably different applications: (1) identifying groups of co-expressed genes from high-throughput RNA sequencing data, in which a given gene may be completely silent in one or more experimental conditions; and (2) finding patterns in the usage of stations over the course of one week in the Velib' bicycle sharing system in Paris, France. For both of these applications, we focus on the use of appropriately chosen data transformations, including the Centered Log Ratio and a novel extension we propose called the Log Centered Log Ratio, in conjunction with the K-means algorithm. We use a nonasymptotic penalized criterion, whose penalty is calibrated with the slope heuristics, to select the number of clusters present in the data. Finally, we illustrate the performance of this clustering strategy, which is implemented in the Bioconductor package coseq, on both the gene expression and bicycle sharing system data.
연구 동기 및 목표
- 영 또는 근처 영일 확률이 높은 경우에도 체계적인 군집 전략이 부족한 조성 데이터 군집화 문제를 해결한다.
- 조성 데이터 환경에서 데이터 변환이 K-means 군집화 성능에 미치는 영향을 조사한다.
- 단순한 CLR보다 단순한 정점 근처의 극단적 관측치를 더 잘 분리할 수 있도록 향상된 새로운 변환인 로그 중심 로그 비율(logCLR)을 제안한다.
- 비점근적 페널티 기준과 기울기 히우리스틱을 활용하여 최적의 군집 수를 선택한다.
- 실제 데이터셋인 RNA-seq 유전자 발현 및 Velib’ 자전거 공유 시스템 데이터를 통해 방법의 효과성을 입증한다.
제안 방법
- 비변환된 조성 데이터, CLR 변환된 데이터, logCLR 변환된 데이터의 세 가지 형태에 대해 유클리드 거리 기반 K-means 군집화를 적용한다.
- 근처 영 성분을 가진 프로파일의 분리를 향상시키기 위해 CLR의 변형으로서 logCLR 변환을 도입한다.
- 과적합을 방지하기 위해 기울기 히우리스틱을 활용한 비점근적 페널티 기준(예: BIC 유사 기준)을 사용하여 군집 수를 선택한다.
- 재현 가능한 조성 데이터 분석을 위해 Bioconductor 패키지 coseq에 전체 파이프라인을 구현한다.
- 프로파일 시각화 및 공간 맵핑(예: 파리의 지리적 기지 군집)을 통해 군집 결과를 평가한다.
- 다양한 변환 간의 성능을 비교하여 생물학적 또는 행동적으로 의미 있는 군집을 가장 잘 포착하는 방법을 도출한다.

실험 결과
연구 질문
- RQ1비변환, CLR, logCLR 변환의 각각 다른 방식이 영 또는 근처 영 값을 포함하는 조성 데이터에서 K-means 군집화 성능에 어떻게 영향을 미치는가?
- RQ2제안된 logCLR 변환이 표준 CLR보다 고도로 특이적 또는 극단적인 조성 프로파일을 더 잘 포착할 수 있는가?
- RQ3희박하거나 단순형 정점에 위치한 프로파일을 포함한 진정한 구조를 가진 조성 데이터에서 최적의 군집 수는 무엇인가?
- RQ4기울기 히우리스틱 기반의 페널티 기준이 실세계 조성 데이터셋에서 군집 수를 얼마나 잘 선택하는가?
- RQ5유전자 공발현 또는 도시 이동 패턴과 같은 실제 세계 패턴 측면에서 군집 결과의 해석 가능성은 어느 정도인가?
주요 결과
- logCLR 변환은 RNA-seq 및 Velib’ 자전거 공유 데이터셋 양쪽에서 가장 만족스러운 군집 결과를 도출하였으며, 특히 행동적으로 일관된 사용자 또는 유전자 프로파일을 식별하는 데 뛰어났다.
- Velib’ 데이터의 군집 프로파일은 알려진 도시 지역과 강한 공간적 일관성을 보였다: 예를 들어 도심부에 위치한 클러스터 3, 주거 지역에 위치한 클러스터 7, 고도가 높고 야간 재분배가 필요한 V+ 기지에 위치한 클러스터 11.
- logCLR 변환을 적용한 K-means 알고리즘은 일부 조건에서 침묵하는 유전자를 포함하더라도 생물학적으로 의미 있는 공발현 그룹을 성공적으로 식별하였다.
- 비점근적 페널티 기준과 기울기 히우리스틱을 결합한 방법은 과적합을 방지하고 안정적인 모델 선택을 지원하여 신뢰할 수 있는 군집 수 선택을 가능하게 하였다.
- 이 방법의 결과는 원시 카운트에 대해 χ² 거리 사용과 유사한 성능을 보였으며, 이는 CLR/logCLR 변환이 조성 데이터 군집화에 효과적인 대안임을 시사한다.
- 특히 근처 영 성분을 가진 프로파일의 분리를 위해 logCLR 변환은 비변환 및 표준 CLR 방법보다도 극단적 케이스 탐지에서 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.