Skip to main content
QUICK REVIEW

[論文レビュー] Metric learning for phylogenetic invariants

Nicholas Eriksson, Yuan Yao|ArXiv.org|Mar 15, 2007
Genomics and Phylogenetic Studies参考文献 17被引用数 8
ひとこと要約

本稿では、4種分岐木における系統樹再構築のための系統的不変量の最適化に機械学習的手法を導入し、線形計画法および半正定値計画法を用いて、不変量の進化モデルの区別能力に基づいて重みを学習するメトリックを構築する。この手法は、標準的な不変量ベースの手法やネイバー・ジョイニング法に比べて顕著に優れており、特に内部枝が短いFelsenstein領域において顕著な性能向上を示す。

ABSTRACT

We introduce new methods for phylogenetic tree quartet construction by using machine learning to optimize the power of phylogenetic invariants. Phylogenetic invariants are polynomials in the joint probabilities which vanish under a model of evolution on a phylogenetic tree. We give algorithms for selecting a good set of invariants and for learning a metric on this set of invariants which optimally distinguishes the different models. Our learning algorithms involve linear and semidefinite programming on data simulated over a wide range of parameters. We provide extensive tests of the learned metrics on simulated data from phylogenetic trees with four leaves under the Jukes-Cantor and Kimura 3-parameter models of DNA evolution. Our method greatly improves on other uses of invariants and is competitive with or better than neighbor-joining. In particular, we obtain metrics trained on trees with short internal branches which perform much better than neighbor joining on this region of parameter space.

研究の動機と目的

  • 系統的不変量の系統樹再構築における性能を、最適な重み付けスキームを学習することで向上させること。
  • すべての不変量に同一の重みを割り当てる均一な重み付け(例:l1またはl2ノルム)の限界を克服し、区別力に応じて不変量を適切に評価すること。
  • 進化モデル間の区別能力に応じて不変量を選択・重み付けするデータ駆動型の手法を開発すること。
  • 広範なパラメータ空間におけるシミュレートデータを用いてメトリックを学習し、Felsenstein領域のような困難な領域におけるロバストネスを高めること。
  • 学習されたメトリックが、ネイバー・ジョイニングなどの従来手法を上回ることを示し、特に短い配列や短い内部枝を有する場合に顕著である。

提案手法

  • 本手法は、Xingら(2003)にインspiredされたメトリック学習アルゴリズムを用い、系統的不変量の空間におけるマハラノビス距離メトリックを学習する。
  • 訓練データは、Jukes-CantorモデルおよびKimura 3パラメータモデルに基づく多様な進化パラメータにおけるシミュレート配列アラインメントから構成される。
  • 線形計画法および半正定値計画法を用いてメトリックを最適化し、真の木モデルと誤った木モデルとの分離を最大化する。
  • 本手法は、群に基づくモデルから導かれる不変量に焦点を当て、フーリエ座標を用いて多項式表現を簡略化する。
  • 学習されたメトリックは、より強力な不変量に高い重みを割り当て、事前の代数的選択を必要とせずに区別性能を向上させる。
  • 性能評価は、さまざまな配列長および進化パラメータを持つシミュレートデータセットにおける再構築精度を用いて行う。

実験結果

リサーチクエスチョン

  • RQ1機械学習を用いて、系統樹再構築のための最も強力な系統的不変量を特定・重み付けできるか?
  • RQ2不変量の空間にメトリックを学習することで、均一な重み付け(例:l1またはl2ノルム)に比べて性能が顕著に向上するか?
  • RQ3学習されたメトリックは、特にFelsenstein領域のような困難なパrameter領域において、標準的手法(例:ネイバー・ジョイニング)を上回るか?
  • RQ4学習されたメトリックの性能は、配列長やモデルパラメータにどのように依存するか?
  • RQ5顕著に情報量の多い不変量と弱い不変量を区別する構造的・対称性に基づく性質は存在するか?

主な発見

  • K81モデルにおける11,612個の不変量すべてに対して、学習されたメトリックはl2ノルムを上回り、配列長100で89.7%の精度を達成したのに対し、l2ノルムでは76.8%にとどまった。
  • 内部枝が短いFelsenstein領域では、学習されたメトリックがネイバー・ジョイニングを顕著に上回り、後者はこれらの条件下で失敗する。
  • 配列長100において、JC69モデルでは84.6%の精度、K81モデルでは89.7%の精度を達成し、後者の場合、ネイバー・ジョイニング(90.1%)を上回った。
  • 短い配列(例:25〜50部位)に対しても、学習されたメトリックはネイバー・ジョイニングと同等の性能を維持し、困難な領域では5〜10%の精度向上を示した。
  • 学習アルゴリズムが選択した上位52個の不変量が、性能向上の大部分を占めており、残りの不変量はほとんど寄与しない、あるいは負の寄与を示した。
  • 本研究では、対称性や代数的構造が、高パワー不変量を特定する鍵である可能性を示唆しているが、現在の代数的基準(例:[CFS07]からのもの)は、それらを信頼性高く予測できない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。