Skip to main content
QUICK REVIEW

[論文レビュー] Evaluation of Tree Based Regression over Multiple Linear Regression for Non-normally Distributed Data in Battery Performance

Shovan Chowdhury, Yuxiao Lin|arXiv (Cornell University)|Nov 3, 2021
Fault Detection and Control Systems被引用数 5
ひとこと要約

本研究では、正規分布でなく、多重共線性を示すデータに対して、木構造回帰(ランダムフォレスト)と複数重回帰(MLR)を比較して、バッテリーのサイクル寿命を予測する手法を評価している。データ変換およびステップワイズ回帰を実施したが、MLRはR²が81.23%にとどまり、一方でランダムフォレストは変換なしで97.73%のR²を達成し、非パラメトリックな性質と多重共線性・正規性の不満たしに対するロバスト性により、歪度が高く次元数の多いバッテリーデータセットにおいて優れた性能を示した。

ABSTRACT

Battery performance datasets are typically non-normal and multicollinear. Extrapolating such datasets for model predictions needs attention to such characteristics. This study explores the impact of data normality in building machine learning models. In this work, tree-based regression models and multiple linear regressions models are each built from a highly skewed non-normal dataset with multicollinearity and compared. Several techniques are necessary, such as data transformation, to achieve a good multiple linear regression model with this dataset; the most useful techniques are discussed. With these techniques, the best multiple linear regression model achieved an R^2 = 81.23% and exhibited no multicollinearity effect for the dataset used in this study. Tree-based models perform better on this dataset, as they are non-parametric, capable of handling complex relationships among variables and not affected by multicollinearity. We show that bagging, in the use of Random Forests, reduces overfitting. Our best tree-based model achieved accuracy of R^2 = 97.73%. This study explains why tree-based regressions promise as a machine learning model for non-normally distributed, multicollinear data.

研究の動機と目的

  • 非正規分布で、多重共線性を示すバッテリー性能データに対して、木構造回帰と複数重回帰の性能を評価すること。
  • データ変換および変数選択手法がMLRモデルの精度と妥当性に与える影響を評価すること。
  • 古典的回帰仮定を満たさないデータセットにおいて、ランダムフォレストのような非パラメトリックモデルがパラメトリックモデルを上回る可能性を特定すること。
  • モデル解釈性技術を用いて、バッテリーのサイクル寿命に最も寄与する特徴量を同定すること。
  • 現実のデータ制約下でのバッテリー劣化予測におけるモデル選択の指針を提供すること。

提案手法

  • 非正規性を是正するためにボックス・コックス変換を施したモデルと、施さないモデルの2つの重回帰モデルを構築した。
  • MLRモデルにおける多重共線性の緩和のため、ステップワイズ回帰を適用した。
  • 木構造モデルの非パラメトリック性を活かし、データ変換なしで単一の決定木およびランダムフォレスト回帰(RFR)モデルを構築した。
  • モデルの汎化性能を評価するため、10分割交差検証を実施し、テスト精度および相関係数を算出した。
  • MLRモデルでは残差分析により仮定の妥当性を検証したが、RFRモデルには同様の仮定が不要であった。
  • RFRモデルを用いて特徴量の重要度分析を実施し、サイクル寿命予測への寄与度に基づく予測変数の順位付けを行った。
Figure 1: A binomial model describing the fading of the normalized capacity in cycle aging and life.
Figure 1: A binomial model describing the fading of the normalized capacity in cycle aging and life.

実験結果

リサーチクエスチョン

  • RQ1データ変換は、非正規分布・多重共線性を示すバッテリー性能データに対する重回帰モデルの性能を顕著に向上させるか?
  • RQ2歪度のあるバッテリーデータセットにおいて、ランダムフォレストのような木構造モデルは、変換済みおよびステップワイズ回帰を施したMLRモデルと比較して、R²の精度および過学習の度合いにおいてどのように異なるか?
  • RQ3木構造モデルは、パラメトリックモデルと比較して、多重共線性および非正規性の問題をどの程度軽減できるか?
  • RQ4どの入力特徴量がバッテリーのサイクル寿命に対して最も予測的か? また、MLRモデルとRFRモデルにおける重要度の違いは何か?
  • RQ5木構造モデルは、データ変換や仮定の検証なしに、バッテリーの終焉寿命を信頼性高く予測できるか?

主な発見

  • ボックス・コックス変換およびステップワイズ回帰を施した最良の重回帰モデルは、R²が81.23%に達し、多重共線性は解消されたが、依然として過学習と予測外れが見られた。
  • ランダムフォレスト回帰モデルは、97.73%の最高のテスト精度を達成し、過学習も予測外れも認められず、他のすべてのモデルを上回った。
  • 決定木モデルは、99.73%の訓練精度と97.54%のテスト精度を示したが、明確な過学習が認められ、アンサンブル化によりランダムフォレストに統合されたことで是正された。
  • 特徴量の重要度分析により、RFRモデルにおいて$d_{i}^{0.97}$が最も影響力のある予測変数(79%の重要度)であり、次いで$d_{i}^{0.98}$(16%)、$d_{i}^{0.99}$(5%)が続くことが判明した。
  • 予測値と実測値の間の相関係数は、木構造モデルでは両方とも0.99であり、MLRモデルで観察された0.88~0.91と比べて顕著に高い水準であった。
  • 特にランダムフォレストを含む木構造モデルは、データの歪度および多重共線性に対してロバストであり、データ変換や仮定の検証を要しないことが示された。
(a) $d_{i}^{0.99}$ vs $\frac{1}{n_{i}^{0.8}}$
(a) $d_{i}^{0.99}$ vs $\frac{1}{n_{i}^{0.8}}$

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。