Skip to main content
QUICK REVIEW

[論文レビュー] Application of Support Vector Machine to detect an association between a disease or trait and multiple SNP variations

Gene Kim, Myung Ho Kim|ArXiv.org|Apr 17, 2001
Machine Learning in Bioinformatics参考文献 3被引用数 7
ひとこと要約

本論文は、複数のSNP変異と疾患または特徴との関連を検出するためのサポートベクターマシン(SVM)の新しい応用を提案する。リファレンスベースの差分スコアリングを用いて多-SNPゲノタイプをユークリッド空間内のベクトルとして表現することで、疾患群と対照群を分離する最適な超平面を特定し、個人のリスク予測の可能性を有する遺伝的関連検出を可能にする。

ABSTRACT

After the completion of human genome sequence was anounced, it is evident that interpretation of DNA sequences is an immediate task to work on. For understanding their signals, improvement of present sequence analysis tools and developing new ones become necessary. Along this current trend, we attack one of the fundamental questions, which set of SNP(single nucleotide polymorphism) variations is related to a specific disease or trait is. For, in the whole DNA sequence, it is known that people have different DNAs only at SNP locations, and moreover, the total SNPs are less than 5 millions, finding an association between SNP variations and certain disease or trait is believed to be one of the essential steps not only for genetic researches but for drug design and discovery. In this paper, we are going to present a method of detecting whether there is an association between multiple SNP variations and a trait or disease. The method exploits the Support Vector Machine which has been attracting lots of attentions recently.

研究の動機と目的

  • 複雑な遺伝的データにおける疾患関連SNP組み合わせの同定という課題に対処すること。
  • 多-SNPゲノタイプに基づいて、健康群と疾患群を体系的に区別する手法を開発すること。
  • SVMを用いて単一SNP分析を超える非線形的・多遺伝子座関連を検出すること。
  • 生物学的意味を保持したまま機械学習分類が可能なベクトルベースのSNPデータ表現を構築すること。

提案手法

  • リファレンスSNPデータセットからの乖離スコアを計算することで、個々の多-SNPゲノタイプをR^n空間内のベクトルとして表現する。
  • ゲノタイプに差分スコアを割り当てる(例:w/w 対 w/m では0.25、w/m 対 m/m では0.75)ことで、リファレンスからの遺伝的乖離を定量化する。
  • 疾患対対照群のラベル付き訓練データを用いてSVMを学習し、両群間のマージンを最大化する最適な分離超平面を特定する。
  • ラグランジュ乗数を用いた双対定式化により、二次計画問題を解く。
  • 不完全分離やノイズの多いデータのケースに対応するため、スラック変数と正則化パrameter Cを組み込む。
  • 多数派クラスが存在しない場合に、反復的SVMクラスタリングを用いてサブグループを特定し、疾患発症率の高いサブポピュレーションを同定する。

実験結果

リサーチクエスチョン

  • RQ1SVMは、複数のSNP変異と複雑な疾患または特徴との関連を効果的に検出できるか?
  • RQ2多-SNPゲノタイプを、機械学習に適した高次元空間内の意味のあるベクトルとして表現する方法は何か?
  • RQ3分類精度を向上させるために、リファレンス集団からの遺伝的距離を最適に定義する方法は何か?
  • RQ4遺伝的関連データにおける重複や分離不能なクラスをSVMはどのように処理できるか?
  • RQ5この手法は、疾患感受性を強く予測するSNPコンビネーションのサブグループパターンを同定できるか?

主な発見

  • SVMベースの手法は、多-SNPゲノタイプベクトルを用いて、疾患群と対照群を区別する分離超平面を効果的に特定した。
  • リファレンスベースの差分スコアリングにより、SNP変異の生物学的に意味のあるベクトル表現が可能になった。
  • 手法により、超平面の意思決定境界を通じて疾患関連のSNPパターンを同定できるようになった。
  • 反復的SVMの適用により、多数派クラスの割合が高いサブグループへのデータクラスタリングが可能となり、サブグループ特化型の予測精度が向上した。
  • 個々のSNPが全体の疾患関連に与える寄与スコアの計算が可能となり、優先順位付けに役立つ。
  • フレームワークはハプロタイプデータやリコネブランス解析へも拡張可能であり、遺伝的研究における応用範囲を広げた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。