Skip to main content
QUICK REVIEW

[論文レビュー] Transfer Learning for High-dimensional Linear Regression: Prediction, Estimation, and Minimax Optimality

Sai Li, Tommaso Cai|arXiv (Cornell University)|Jun 18, 2020
Statistical Methods and Inference参考文献 32被引用数 21
ひとこと要約

本稿は、関連する補助サンプルを活用することで予測と推定を向上させる高次元線形回帰のための転移学習フレームワークを提案する。Trans-Lasso を導入し、ターゲットと補助係数の差のスパarsityを用いて推定量を適応的に集約するデータ駆動型手法である。情報のあるソースが既知である場合、最小最大最適レートを達成し、実際の遺伝子発現データにおいても頑健性と性能向上を示す。

ABSTRACT

This paper considers the estimation and prediction of a high-dimensional linear regression in the setting of transfer learning, using samples from the target model as well as auxiliary samples from different but possibly related regression models. When the set of "informative" auxiliary samples is known, an estimator and a predictor are proposed and their optimality is established. The optimal rates of convergence for prediction and estimation are faster than the corresponding rates without using the auxiliary samples. This implies that knowledge from the informative auxiliary samples can be transferred to improve the learning performance of the target problem. In the case that the set of informative auxiliary samples is unknown, we propose a data-driven procedure for transfer learning, called Trans-Lasso, and reveal its robustness to non-informative auxiliary samples and its efficiency in knowledge transfer. The proposed procedures are demonstrated in numerical studies and are applied to a dataset concerning the associations among gene expressions. It is shown that Trans-Lasso leads to improved performance in gene expression prediction in a target tissue by incorporating the data from multiple different tissues as auxiliary samples.

研究の動機と目的

  • 関連するが異なるモデルからの補助サンプルを用いた高次元線形回帰の統計的に最適な転移学習手法の開発。
  • ターゲットモデルと補助モデルの類似性を、係数ベクトルの差のスパarsityによって特徴づける。
  • 情報のある補助サンプルの集合が既知である場合に、予測と推定の最小最大最適収束レートを確立する。
  • 未知の情報のある集合に適応するデータ駆動型手順、Trans-Lasso を設計し、非情報のある補助サンプルに対しても頑健性を保つ。
  • シミュレーションと GTEx プロジェクトからの実際の遺伝子発現データへの応用を通じて、手法の実証的検証を行う。

提案手法

  • ターゲットモデルをスパース係数を有する高次元線形回帰として定義し、関連するモデルからの補助サンプル(係数が異なる可能性あり)を用いる。
  • 補助研究が情報を持つとは、その係数差 δ(k) = β − w(k) が ℓq 範囲(q ∈ [0,1])でスパースである場合と定義し、類似性をスパarsityによって形式化する。
  • 情報のある集合が既知である場合に使用可能な Oracle Trans-Lasso 推定量を提案し、予測と推定において最小最大最適レートを達成する。
  • すべての補助研究からの推定量をスパarsityに基づく選択基準を用いて集約するデータ駆動型の集約手順として Trans-Lasso を開発する。
  • 補助サンプルのターゲットとの推定類似度に基づき、適応的 Lasso 型ペナルティを用いたペナルティ付き推定フレームワークを適用し、情報のある補助サンプルの選択と重み付けを行う。
  • 交差検証と理論的解析を用いて、非情報のある補助サンプルが存在する状況でも頑健性と効率性を示す。

実験結果

リサーチクエスチョン

  • RQ1関連するモデルからの補助サンプルが利用可能である場合、高次元線形回帰における予測と推定の正確性は転移学習によって向上するか?
  • RQ2高次元回帰のための転移学習における予測と推定の最適収束レートは何か? そして、それを達成できるか?
  • RQ3情報のある補助サンプルの集合が未知である場合、どのようにして適応的に同定し、活用できるか?
  • RQ4本手法は、非情報のある補助サンプルが含まれる場合、どの程度頑健性を保つのか?
  • RQ5理論的な利点が、例えば遺伝子発現ネットワークのような実際の生物学的データにおいて、実証的に検証可能か?

主な発見

  • 情報のある補助サンプルの集合が既知である場合、Oracle Trans-Lasso は予測と推定において最小最大最適レートを達成し、標準 Lasso よりも高速な収束レートを示す。
  • GTEx データの複数の組織において、Trans-Lasso は Lasso に比べて平均で17%の予測誤差削減を達成し、顕著な性能向上を示す。
  • 扁桃体や腹側被蓋野のような組織では、Trans-Lasso が顕著な改善を示しており、関連組織からの知識転送が効果的に行われていることを示す。
  • 垂体のような、ターゲットモデルが他のものと類似性が低い組織では、改善は限定的であり、転送が類似した文脈に限定されることが確認された。
  • 前頭前頭皮質のような組織では、ナードな Trans-Lasso(すべての補助サンプルを集約)は Lasso よりも性能が劣るが、Trans-Lasso はそれを上回り、非情報のあるソースに対しても頑健であることが証明された。
  • 21番染色体上の25個の遺伝子において、Trans-Lasso は全体の予測性能が最良であり、小脳側頭部や皮質などの組織で顕著な向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。