Skip to main content
QUICK REVIEW

[論文レビュー] Diet Networks: Thin Parameters for Fat Genomics

Adriana Romero, Pierre Carrier|arXiv (Cornell University)|Nov 28, 2016
Cancer-related molecular mechanisms research被引用数 10
ひとこと要約

本論文は、高次元のゲノムデータ—特に単一塩基多型(SNPs)—を対象とした深層学習モデルにおける自由パラメータの数を著しく削減する、Diet Networkと呼ばれるニューラルネットワークのパrametrizationを提案する。特徴固有のパラメータ埋め込みをパラメータ予測ネットワークを用いて学習することで、15.8kパラメータ、誤分類誤差7.44%という状態を達成し、標準的な深層ネットワークやPCAベースの手法を上回る最先端の性能を実現した。

ABSTRACT

Learning tasks such as those involving genomic data often poses a serious challenge: the number of input features can be orders of magnitude larger than the number of training examples, making it difficult to avoid overfitting, even when using the known regularization techniques. We focus here on tasks in which the input is a description of the genetic variation specific to a patient, the single nucleotide polymorphisms (SNPs), yielding millions of ternary inputs. Improving the ability of deep learning to handle such datasets could have an important impact in precision medicine, where high-dimensional data regarding a particular patient is used to make predictions of interest. Even though the amount of data for such tasks is increasing, this mismatch between the number of examples and the number of inputs remains a concern. Naive implementations of classifier neural networks involve a huge number of free parameters in their first layer: each input feature is associated with as many parameters as there are hidden units. We propose a novel neural network parametrization which considerably reduces the number of free parameters. It is based on the idea that we can first learn or provide a distributed representation for each input feature (e.g. for each position in the genome where variations are observed), and then learn (with another neural network called the parameter prediction network) how to map a feature's distributed representation to the vector of parameters specific to that feature in the classifier neural network (the weights which link the value of the feature to each of the hidden units). We show experimentally on a population stratification task of interest to medical studies that the proposed approach can significantly reduce both the number of parameters and the error rate of the classifier.

研究の動機と目的

  • 入力特徴数が数百万にも達する高次元のゲノム入力(例:SNPs)に対して、学習例が著しく少ない状況における過学習の問題に対処すること。
  • 特に入力特徴数に比例して増加する最初の全結合層における自由パラメータ数を削減すること。
  • SNPデータを用いた集団の分層(population stratification)タスクにおける汎化性能と予測性能を向上させること。これは、遺伝的関連研究における主要な課題である。
  • データが高次元的ではあるが、サンプル数が限られている精度医療の応用に適したパラメータ効率の良いアーキテクチャを開発すること。

提案手法

  • 各入力特徴の埋め込み表現に基づいて重みを生成するパラメータ予測ネットワークを用いて、全結合層の再パrametrizationを提案する。
  • 各SNP(特徴)を値(例:AA、AG、GG)に依存しない分散表現にエンコードする共有埋め込み層を用い、パラメータの爆発を抑える。
  • 各SNPの埋め込みを、その特徴が分類器のすべての隠れユニットに接続する重みベクトルにマッピングするパラメータ予測ネットワークを学習する。
  • 各特徴のパラメータ生成を別々のタスクとして扱いながらも共有するマルチタスク学習の枠組みを導入する。
  • 1000 Genomesデータセットを用いて集団の祖先予測タスクに本手法を適用し、さまざまな埋め込み戦略とベースラインとの性能を比較する。
  • 再構成損失とエンドツーエンド学習を適用して、特に特徴埋め込みと組み合わせた場合に、埋め込みの質と汎化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1パラメータ効率の良いニューラルネットワークアーキテクチャは、サンプル数が限られた高次元のゲノムデータで学習される深層学習モデルにおける過学習を軽減できるか?
  • RQ2提案されたDiet Networkのパラメータ化は、標準的な深層ネットワークやPCAベースの次元削減手法と比較して、祖先予測の精度で優れているか?
  • RQ3事前学習済みまたは学習済みの特徴埋め込み(例:SNP2Vec、クラス別ヒストограм)を用いることで、自由パラメータ数をどれほど削減できるか、かつ性能を維持または向上できるか?
  • RQ4埋め込みから特徴固有の重みを生成するパラメータ予測ネットワークを用いることで、標準的な全結合層よりも優れた汎化性能が得られるか?
  • RQ5本手法は、集団の分層や遺伝的関連研究といった実世界の精度医療タスクに効果的に応用可能か?

主な発見

  • クラス別ヒストограм埋め込みを用いたDiet Networkは、平均誤分類誤差7.44% ± 0.45を達成し、他のすべてのモデルやPCAベースラインを上回った。
  • 本手法により自由パラメータ数はわずか15.8kにまで削減され、標準的な31.5Mパラメータモデルと比較して99.95%の削減が達成された。
  • 最も優れたモデル(クラス別ヒストグラム)は、5地域に分類された地理的祖先予測においてほぼ100%の精度を達成し、強力な汎化性能を示した。
  • PCAベースの手法は、Diet Network(15.8kパラメータ)の性能に追いつくために200個の主成分を必要とした。これは、線形次元削減の非効率性を示している。
  • 分類器に隠れ層を追加しても性能向上が見られなかったため、パラメータ効率の良いアーキテクチャが十分な表現能力を保持していることが示された。
  • 再構成損失を適用し、クラス別ヒストグラム埋め込みを用いたモデルは7.44%の誤差を達成し、埋め込みとパラメータ予測の共同最適化が耐性を高めることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。