Skip to main content
QUICK REVIEW

[논문 리뷰] Tropical Support Vector Machine and its Applications to Phylogenomics

Xiaoxian Tang, Houjie Wang|arXiv (Cornell University)|2020. 03. 02.
Genomics and Phylogenetic Studies참고 문헌 15인용 수 8
한 줄 요약

이 논문은 비유클리드적 트리 공간에 존재하는 계통발생수 나무를 분류하기 위해 트로픽 서포트 벡터 머신(Tropical SVMs)을 제안한다. 이는 트로픽 기하학과 최대-합 대수를 활용한다. 하드 및 소프트 마진 트로픽 SVM을 선형 프로그래밍 문제로 공식화하며, 타당성에 필요한 필수 조건과 충분 조건을 증명하고, 명시적인 최적 마진 공식을 유도함으로써, 계통유전 게놈 분석에서 다유전자 유전자 자료의 강건한 분류를 가능하게 한다.

ABSTRACT

Most data in genome-wide phylogenetic analysis (phylogenomics) is essentially multidimensional, posing a major challenge to human comprehension and computational analysis. Also, we can not directly apply statistical learning models in data science to a set of phylogenetic trees since the space of phylogenetic trees is not Euclidean. In fact, the space of phylogenetic trees is a tropical Grassmannian in terms of max-plus algebra. Therefore, to classify multi-locus data sets for phylogenetic analysis, we propose tropical support vector machines (SVMs). Like classical SVMs, a tropical SVM is a discriminative classifier defined by the tropical hyperplane which maximizes the minimum tropical distance from data points to itself in order to separate these data points into sectors (half-spaces) in the tropical projective torus. Both hard margin tropical SVMs and soft margin tropical SVMs can be formulated as linear programming problems. We focus on classifying two categories of data, and we study a simpler case by assuming the data points from the same category ideally stay in the same sector of a tropical separating hyperplane. For hard margin tropical SVMs, we prove the necessary and sufficient conditions for two categories of data points to be separated, and we show an explicit formula for the optimal value of the feasible linear programming problem. For soft margin tropical SVMs, we develop novel methods to compute an optimal tropical separating hyperplane. Computational experiments show our methods work well. We end this paper with open problems.

연구 동기 및 목표

  • 다유전자 계통발생수 나무의 분류 문제를 해결하기 위해, 비유클리드 공간에 존재하는 기존 SVM 기반 방법에 부적합한 문제를 다루기 위해.
  • 계통발생수 나무의 트로픽 그라스만다이언 공간에 특화된 판별 분류기 개발을 위해, 최대-합 대수를 활용한다.
  • 하드 및 소프트 마진 트로픽 SVM을 선형 프로그래밍 문제로 공식화하여 데이터 포인트를 섹터로 효과적으로 분리하기 위해.
  • 같은 클래스에 속한 점들이 동일한 섹터에 위치한다는 가정 하에, 선형 프로그래밍 공식화의 타당성에 필요한 필수 조건과 충분 조건을 설정하기 위해.
  • 하드 마진 경우의 최적 마진을 명시적으로 계산할 수 있도록 공식을 도출하기 위해.

제안 방법

  • 최대-합 대수를 사용하여 계통발생수 나무의 공간을 트로픽 그라스만다이언으로 모델링함으로써, 비유클리드 기하 분석을 가능하게 한다.
  • 트로픽 초평면을 트로픽 프로젝티브 토러스 내의 데이터 포인트 간의 분리 경계로 정의한다.
  • 하드 마진 트로픽 SVM의 경우, 초평면으로부터의 최소 트로픽 거리(마진)를 최대화하는 최적화 문제를 선형 프로그래밍 문제로 공식화한다.
  • 중첩된 데이터 포인트를 다룰 수 있도록 소프트 마진 트로픽 SVM을 도입하며, 마진 최대화와 분류 오차를 균형 잡는 복합 목표 함수를 사용한다.
  • 특히 인덱스 i_P, j, i_Q에 대한 나무 좌표 간의 쌍별 비교를 통해 타당성 조건을 유도하며, 섹터 정렬에 초점을 맞춘다.
  • 클래스 간 나무 좌표 값의 차이의 최솟값에 기반한 명시적 최적 마진 값 공식을 활용한다.

실험 결과

연구 질문

  • RQ1트로픽 그라스만다이언의 비유클리드 공간에서 트로픽 SVM이 두 클래스의 계통발생수 나무를 효과적으로 분리할 수 있는가?
  • RQ2하드 마진 트로픽 SVM의 선형 프로그래밍 공식화에 대한 타당성에 필요한 필수 조건과 충분 조건은 무엇인가?
  • RQ3섹터 정렬 조건이 성립할 경우, 하드 마진 트로픽 SVM에서 최적 마진을 명시적으로 어떻게 계산할 수 있는가?
  • RQ4중첩된 데이터가 존재하는 상황에서 마진 최대화와 분류 오차를 균형 잡는 소프트 마진 트로픽 SVM은 어떻게 공식화하고 해결할 수 있는가?
  • RQ5트로픽 SVM에서 달성 가능한 최대 마진의 이론적 상한은 무엇이며, 언제 그 값이 도달되는가?

주요 결과

  • 하드 마진 트로픽 SVM 선형 프로그래밍의 타당성에 필요한 필수 조건과 충분 조건은 식 (17)과 (18)로 주어지며, 이는 서로 다른 클래스에 속한 나무 간 좌표 차이의 최솟값과 최댓값을 포함한다.
  • 섹터 정렬 조건이 성립할 경우, 최적 마진 값에 대한 명시적 공식은 z = min{p∈P}(p_iP - p_j) + min{q∈Q}(q_j - q_iP)로 유도된다.
  • 최적 마진는 ω_iP - ω_j = min{q∈Q}(q_j - q_iP) 또는 ω_iQ - ω_j = min{p∈P}(p_j - p_iQ)일 때 도달하며, 이는 최대 분리 거리를 보장한다.
  • 최적 마진 z의 상한은 임의의 인덱스 쌍 k1, k2에 대해 z ≤ ½(min{p∈P}(p_k1 - p_k2) + min{q∈Q}(q_k2 - q_k1))로 주어진다.
  • 소프트 마진 트로픽 SVM의 경우, 복합 목표 함수를 통해 마진 최대화와 오차 최소화를 균형 잡음으로써, 데이터 포인트가 완전히 분리되지 않은 경우에도 강건한 분류를 가능하게 한다.
  • 계산 실험 결과는 제안된 방법의 효과성을 확인하였으며, R로 구현된 코드는 공개된 GitHub 저장소에서 제공된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.