Skip to main content
QUICK REVIEW

[논문 리뷰] Tree-SNE: Hierarchical Clustering and Visualization Using t-SNE

Isaac Robinson, Emma Pierce‐Hoffman|arXiv (Cornell University)|2020. 02. 13.
Single-cell and spatial transcriptomics참고 문헌 32인용 수 5
한 줄 요약

Tree-SNE는 점차 감소하는 퍼플렉서티와 자유도(α < 1)를 적용하여 반복적으로 t-SNE를 적용함으로써 일차원 t-SNE 임베딩과 계층적 클러스터링을 통합한다. 알파-클러스터링은 다양한 척도에서 최적의 클러스터 할당을 자동으로 탐지하여, MNIST 및 COIL-20에서 최신 비지도 클러스터링 성능을 달성하며, 단일세포 유전체학에서 효율적이고 자동화된 데이터 서브셋 선택을 가능하게 한다.

ABSTRACT

t-SNE and hierarchical clustering are popular methods of exploratory data analysis, particularly in biology. Building on recent advances in speeding up t-SNE and obtaining finer-grained structure, we combine the two to create tree-SNE, a hierarchical clustering and visualization algorithm based on stacked one-dimensional t-SNE embeddings. We also introduce alpha-clustering, which recommends the optimal cluster assignment, without foreknowledge of the number of clusters, based off of the cluster stability across multiple scales. We demonstrate the effectiveness of tree-SNE and alpha-clustering on images of handwritten digits, mass cytometry (CyTOF) data from blood cells, and single-cell RNA-sequencing (scRNA-seq) data from retinal cells. Furthermore, to demonstrate the validity of the visualization, we use alpha-clustering to obtain unsupervised clustering results competitive with the state of the art on several image data sets. Software is available at https://github.com/isaacrob/treesne.

연구 동기 및 목표

  • 고차원 데이터에서 계층적 구조 탐색의 필요성을 해결한다. 특히 생물학적 및 이미지 데이터셋에서 적용한다.
  • 표준 t-SNE와 클러스터링의 한계를 극복하기 위해 다중 척도 t-SNE와 다양한 척도에서의 클러스터 안정성의 통합을 시도한다.
  • 사전 지식 없이도 자동으로 클러스터 수를 결정할 수 있는 비지도 클러스터링 방법을 개발한다.
  • 생물학적 또는 의미적으로 유의미한 하위집단을 효과적으로 탐색할 수 있도록 복잡한 데이터를 효율적이고 상호작용적으로 탐색할 수 있도록 한다.

제안 방법

  • 자유도 α를 점차 감소시키고, 퍼플렉서티를 조절함으로써 일차원 t-SNE 임베딩의 계층적 트리를 구성한다.
  • α < 1일 때 t-SNE 계산을 가속화하기 위해 FIt-SNE를 활용하여 세밀한 구조 탐지 가능하게 한다.
  • 각 일차원 임베딩에 스펙트럴 클러스터링을 적용하여 각 척도에서 클러스터를 식별한다.
  • 알파-클러스터링을 가장 넓은 α 값 범위에서 가장 안정적인 클러스터 할당으로 정의한다.
  • 대규모 데이터셋에서의 계산 효율성을 위해 서브샘플링된 SNN 기반 스펙트럴 클러스터링을 활용한다.
  • 알파-클러스터링 레이블을 사용하여 자동으로 데이터를 분할하고 서브셋을 추출함으로써 하위집단의 집중적 시각화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1감소하는 α를 적용한 일차원 t-SNE는 표준 t-SNE보다 고차원 데이터에서 계층적 구조를 더 효과적으로 드러내는가?
  • RQ2여러 개의 α 값에서 클러스터의 안정성이 K 값에 대한 사전 지식 없이도 최적의 클러스터 할당을 결정하는 신뢰할 수 있는 기준이 될 수 있는가?
  • RQ3알파-클러스터링은 벤치마크 데이터셋에서 최신 비지도 클러스터링 알고리즘과 경쟁 가능한 성능을 달성하는가?
  • RQ4Tree-SNE와 알파-클러스터링은 단일세포 옴리크스 데이터에서 생물학적으로 관련성이 높은 하위집단을 효율적이고 자동으로 식별하고 고립하는 데 기여하는가?

주요 결과

  • 알파-클러스터링은 MNIST 및 COIL-20 데이터셋에서 최신 기법과 경쟁하는 비지도 클러스터링 성능을 달성했다.
  • scRNA-seq 데이터에서 알파-클러스터링은 자동으로 세 가지 주요 클러스터를 식별했다: 멀러 글리아, 원추 수용체 bipolar 세포, 갈망 수용체 bipolar 세포로, 타겟팅된 데이터 서브셋 추출을 가능하게 하였다.
  • 알파-클러스터링을 통해 비필수 클러스터를 제거한 후, 콘 바이포라 세포 아형의 tree-SNE 시각화에서 더 명확한 계층적 조직이 드러났다.
  • 반복적인 필터링을 거친 후, 콘 바이포라 세포의 최종 tree-SNE 임베딩은 Shekhar 등(2016)에서 보고한 시각화 및 클러스터 구조와 매우 유사하게 나타났다.
  • 알파-클러스터링 레이블을 활용하여 샘플 외 데이터 서브셋 추출이 가능했으며, 생물학적으로 관련성이 높은 세포 유형만을 고립하고 재임베딩할 수 있었다.
  • α < 1을 적용한 Tree-SNE는 MNIST 데이터셋 내에서 숫자의 구분되는 손글씨 스타일까지도 더 세밀한 구조로 드러내는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.