Skip to main content
QUICK REVIEW

[論文レビュー] Selection of training populations (and other subset selection problems) with an accelerated genetic algorithm (STPGA: An R-package for selection of training populations with a genetic algorithm)

Deniz Akdemir|arXiv (Cornell University)|Feb 26, 2017
Genetic and phenotypic traits in livestock参考文献 50被引用数 3
ひとこと要約

本論文は、特にゲノム予測における訓練集団選択を目的として、高次元データにおける最適サブセット選択を実装する加速化された遺伝的アルゴリズム(LA-GA-T)を備えたRパッケージSTPGAを紹介する。この手法は、局所最適解を回避し収束性を向上させるために、タブー記憶とフィットネスに基づく先読みヒューリスティクスを統合している。変数選択、影響力のある観測値の特定、混合整数二次計画法など、多様な応用分野において優れた性能を示している。

ABSTRACT

Optimal subset selection is an important task that has numerous algorithms designed for it and has many application areas. STPGA contains a special genetic algorithm supplemented with a tabu memory property (that keeps track of previously tried solutions and their fitness for a number of iterations), and with a regression of the fitness of the solutions on their coding that is used to form the ideal estimated solution (look ahead property) to search for solutions of generic optimal subset selection problems. I have initially developed the programs for the specific problem of selecting training populations for genomic prediction or association problems, therefore I give discussion of the theory behind optimal design of experiments to explain the default optimization criteria in STPGA, and illustrate the use of the programs in this endeavor. Nevertheless, I have picked a few other areas of application: supervised and unsupervised variable selection based on kernel alignment, supervised variable selection with design criteria, influential observation identification for regression, solving mixed integer quadratic optimization problems, balancing gains and inbreeding in a breeding population. Some of these illustrations pertain new statistical approaches.

研究の動機と目的

  • 高次元データにおける最適サブセット選択の課題、特にゲノム予測における訓練集団設計の課題に取り組むこと。
  • 従来のヒューリスティック法および正確法よりも計算効率と解の品質で優れるスケーラブルで並列処理可能なアルゴリズムを開発すること。
  • 変数選択、影響力のある観測値の特定、混合整数二次計画法を含む、ゲノム学を超えた応用に適用可能な柔軟で拡張可能なフレームワークを提供すること。
  • ユーザーがカスタマイズ可能な目的関数を通じて、使いやすいRインターフェースを介して効率的に情報量の多いサブセットを選択できるようにすること。

提案手法

  • LA-GA-Tアルゴリズムは、遺伝的アルゴリズムにタブー記憶を組み合わせ、以前に評価された解とそのフィットネス値を追跡・再訪問を回避する。
  • 解の符号化に基づくフィットネス回帰モデルを用いて、理想的な解を予測し、高品質な領域へ向かう「先読み」戦略を可能にする。
  • 適応的突然変異とエリート保持を用いて多様性と収束性を維持し、集団サイズ、突然変異確率、停止基準などのパラメータをカスタマイズ可能にしている。
  • 「mc.cores」パラメータを介して並列実行をサポートし、マルチコアアーキテクチャを活用して計算を高速化する。
  • 拡張性を考慮して設計されており、ユーザーが「errorstat」パラメータを通じてカスタム目的関数を定義できる。
  • 純粋にRで実装されており、アクセス性とカスタマイズのしやすさを確保するとともに、既存のRワークフローとの統合をサポートしている。

実験結果

リサーチクエスチョン

  • RQ1タブー記憶と先読みヒューリスティクスを組み合わせた改良型遺伝的アルゴリズムは、標準的なヒューリスティック法および正確法よりも最適サブセット選択問題を効果的に解けるか?
  • RQ2LA-GA-Tアルゴリズムは、高次元マーカーデータにおけるゲノム予測精度を最大化するように訓練集団を選択する上でどの程度効果的か?
  • RQ3STPGAパッケージは、変数選択、影響力のある観測値の特定、混合整数二次計画法といった他のサブセット選択問題へどの程度一般化可能か?
  • RQ4並列処理は、大規模なゲノム的および統計的問題におけるLA-GA-Tアルゴリズムの性能とスケーラビリティにどのような影響を与えるか?
  • RQ5アルゴリズムは、回帰における係数の不安定性を最小化するサブセットを選択することで、影響力のある観測値を信頼性高く同定できるか?

主な発見

  • LA-GA-Tアルゴリズムは、144サンプルのサブセットから除外した際に基準値が急激に上昇することから、操作された6つの観測値(5, 30, 55, 80, 105, 130)が回帰モデルにおいて最も影響力を持つことを的確に同定した。
  • アルゴリズムは影響力のある観測値の同定において頑健な性能を示し、n=144の解がすべての6つの操作済みポイントを含んでおり、高 leverage ケースに対する感受性が確認された。
  • 並列処理効率がわずか1%向上した場合でも、256プロセッサを用いた際のスループットが最大3.5倍に向上し、アルゴリズムの優れた並列スケーラビリティが裏付けられた。
  • 複数回の実行において安定した収束性を示し、反復回数に伴う最良基準値の変動が最小限に抑えられており、信頼性の高い性能が裏付けられた。
  • 教師ありおよび教師なしの変数選択、近交度を考慮した交配集団設計、混合整数二次計画法など、多様な問題を効果的に解消できた。
  • ユーザー定義の目的関数の使用により、新たな統計的基準に柔軟に適応可能となり、デフォルトのゲノム選抜指標を超えた応用範囲が拡張された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。