Skip to main content
QUICK REVIEW

[論文レビュー] Regularising Non-linear Models Using Feature Side-information

Amina Mollaysa, Pablo Strasser|arXiv (Cornell University)|Mar 7, 2017
Domain Adaptation and Few-Shot Learning参考文献 18被引用数 5
ひとこと要約

本稿では、類似する特徴の相対的変化に対するモデル不変性を強制することで、予測性能を向上させるために特徴の補助情報を利用する非線形モデルのための新しい正則化フレームワークを提案する。この手法は、ヤコビ安定性に基づく正則化子をヤコビアン・ラプラシアンまたはデータ拡張を用いて近似することで、ベンチマークデータセット上で ℓ₂ やドロップアウトを著しく上回る性能を達成する。特に補助情報が関連性を持つ場合に顕著な向上が見られる。

ABSTRACT

Very often features come with their own vectorial descriptions which provide detailed information about their properties. We refer to these vectorial descriptions as feature side-information. In the standard learning scenario, input is represented as a vector of features and the feature side-information is most often ignored or used only for feature selection prior to model fitting. We believe that feature side-information which carries information about features intrinsic property will help improve model prediction if used in a proper way during learning process. In this paper, we propose a framework that allows for the incorporation of the feature side-information during the learning of very general model families to improve the prediction performance. We control the structures of the learned models so that they reflect features similarities as these are defined on the basis of the side-information. We perform experiments on a number of benchmark datasets which show significant predictive performance gains, over a number of baselines, as a result of the exploitation of the side-information.

研究の動機と目的

  • 予測性能の向上を目的として、特徴の補助情報(特徴のベクトル的記述)を非線形モデル学習に統合するという未だ十分に検討されていない問題に取り組む。
  • 既存手法が補助情報を無視するか、または前処理段階や低次の多項式に限定してのみ適用するという限界を克服する。
  • 補助情報に基づいて類似するとされる特徴の相対的変化に対してモデルが不変であるように保証する、汎用的な正則化技術を開発する。
  • 深層ニューラルネットワークに適用可能であるように、計算的に実行可能な2つの実用的近似法(解析的(ヤコビアンベース)および確率的(データ拡張ベース))を提供する。
  • 合成データおよび実世界のデータセットを用いて、本手法の有効性を実証し、性能向上が補助情報の関連性に依存することを示す。

提案手法

  • すべての可能な相対的特徴値変化におけるモデル出力変化のノルムを定量化する感度測度を定義し、データ分布および相対的変化の上での統合を含める。
  • 一次のテイラー展開を用いて感度測度を解析的に近似し、偏微分の差のノルムの二乗に還元することで、入力特徴に関するモデルのヤコビアンに対するラプラシアン正則化子に帰着させる。
  • 相対的特徴値変化を加えた拡張データを生成することで確率的近似を実装し、正則化子をこれらのサンプルでのみ推定する。
  • 正則化子をハイパーパrameter λ を用いて損失関数に追加することで、ニューラルネットワーク学習に統合する。
  • 補助情報から導出される特徴類似度行列を用いて、解析的正則化子に使用するラプラシアン行列を定義する。
  • 提案された正則化子を用いてモデルを学習し、複数のベンチマークデータセットで ℓ₂ 重み減衰およびドロップアウトと性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1一般の非線形モデルの学習段階で、特徴の補助情報を効果的に活用することで、予測性能を向上させることができるか?
  • RQ2補助情報で定義される類似特徴をモデルが一貫して扱うようにする正則化戦略をどのように設計できるか?
  • RQ3深層学習環境に適用可能な、提案された感度ベース正則化子の効果的かつスケーラブルな近似法は何か?
  • RQ4本手法の性能は、ℓ₂ やドロップアウトといった確立された正則化手法と比較して、多様なデータセットでどのように異なるか?
  • RQ5補助情報の関連性が、正則化子の有効性にどの程度影響を与えるか?

主な発見

  • 提案手法(ST:確率的アプローチ)は、8つのデータセットのうち6つで ℓ₂ 重み減衰を著しく上回り、1つでは同等、残り1つでは差がない。
  • STは8つのデータセットのうち4つでドロップアウトを著しく上回り、3つでは著しく劣り、1つでは差がない。
  • 2層の隠れ層を用いた場合、STは3つのデータセットで ℓ₂ より著しく優れており、3つでは劣っており、2つでは同等であった。これは一貫したが、常に優位な向上を示すわけではないことを示している。
  • BBCSportデータセットでは、2層の隠れ層を用いた場合、STは分類誤差2.04%を達成したのに対し、ℓ₂ は2.85%、ドロップアウトは2.99%であった。これは明確な性能向上を示している。
  • 補助情報がデータ生成プロセスと整合する人工データセットで本手法は最も高い性能を発揮し、性能向上が補助情報の関連性に依存することを確認した。
  • 補助情報が無関係な場合、正則化子は無効となる。これは、そのような状況ではハイパーパrameter λ が0にチューニングされるためであり、無関係な補助情報に対してもロバストであることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。