Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning, Deep Learning, and Hedonic Methods for Real Estate Price Prediction

Mahdieh Yazdani|arXiv (Cornell University)|Oct 14, 2021
Housing Market and Economics参考文献 58被引用数 8
ひとこと要約

本研究では、コロラド州ボルダーにおける不動産価格予測のため、幸福回帰、ランダムフォレスト(RF)、ニューラルネットワーク(ANN)、k近傍法(kNN)を比較している。MLS、犯罪、学校、ウォーキングスコアのデータを統合した多様なデータセットを用い、RFとANNが非線形関係を捉える能力のおかげで、従来の幸福回帰モデルを上回ることが判明した。特にRFは予測精度が最も高く、R² > 0.90、RMSE ≈ 105kの結果を得た。

ABSTRACT

In recent years several complaints about racial discrimination in appraising home values have been accumulating. For several decades, to estimate the sale price of the residential properties, appraisers have been walking through the properties, observing the property, collecting data, and making use of the hedonic pricing models. However, this method bears some costs and by nature is subjective and biased. To minimize human involvement and the biases in the real estate appraisals and boost the accuracy of the real estate market price prediction models, in this research we design data-efficient learning machines capable of learning and extracting the relation or patterns between the inputs (features for the house) and output (value of the houses). We compare the performance of some machine learning and deep learning algorithms, specifically artificial neural networks, random forest, and k nearest neighbor approaches to that of hedonic method on house price prediction in the city of Boulder, Colorado. Even though this study has been done over the houses in the city of Boulder it can be generalized to the housing market in any cities. The results indicate non-linear association between the dwelling features and dwelling prices. In light of these findings, this study demonstrates that random forest and artificial neural networks algorithms can be better alternatives over the hedonic regression analysis for prediction of the house prices in the city of Boulder, Colorado.

研究の動機と目的

  • 従来の不動産鑑定における主観的バイアス、特に人種差別の懸念を是正すること。
  • 機械学習およびディープラーニングモデルが、従来の幸福回帰モデルに比べて予測精度を向上させられるかどうかを評価すること。
  • 解釈可能なモデルと解釈不能なモデルを用いて、ボルダー不動産市場における最も予測力のある住宅特徴を特定すること。
  • 標準的な指標を用いて、未観測のテストデータ上でのRF、ANN、kNNの性能を幸福回帰と比較すること。
  • ボルダーを越えて他の都市の不動産市場へ一般化可能なモデルの可能性を検討すること。

提案手法

  • 複数のソースからデータを収集・統合:複数物件リスト(MLS)、パブリックスクール評価、コロラド州の犯罪レート、CrimeReports、WalkScore、米国国勢調査局。
  • 対数変換を施した居住面積、カテゴリー変数(例:地域、近所)、派生変数(例:中央ビジネス地区(CBD)までのドライブ時間)を含む特徴量の前処理。
  • 未観測データのテストセット上で、幸福回帰、ランダムフォレスト(RF)、ニューラルネットワーク(ANN)、k近傍法(kNN)の4つのモデルを訓練および評価。
  • R²、RMSE、MAPEなどの性能指標を用いてモデルの精度を比較。RFでは変数重要度分析および限界効果の可視化を実施。
  • 小規模データセットでのロバストネス向上と過学習の低減のため、ブートストラップおよびバギングをRFに適用。
  • 部分従属プロットを用いて、主な特徴量(例:居住面積、CBDまでの距離、築年数)の非線形限界効果を可視化。

実験結果

リサーチクエスチョン

  • RQ1機械学習およびディープラーニングモデルは、ボルダー(コロラド州)における不動産価格予測において、従来の幸福回帰モデルを上回るか?
  • RQ2住宅特徴(例:面積、築年数、立地)と不動産価格の関係は線形か、非線形か?
  • RQ3RF、ANN、kNN、幸福回帰のうち、どのモデルが未観測のテストデータ上で予測精度が最も高いか?
  • RQ4ボルダーにおける不動産価格予測において、どの住宅特徴が最も影響力が大きく、その限界効果はどのように変化するか?
  • RQ5データ効率の良い機械学習モデルは、不動産鑑定における人為的バイアスと主観性を低減できるか?

主な発見

  • ランダムフォレスト(RF)が最高の予測性能を示し、テストセットでR² > 0.90、RMSE ≈ 105k、MAPE < 10%を達成。幸福回帰およびANNを上回った。
  • 幸福回帰モデルはR²が低く、RMSEが高いため、住宅データに含まれる複雑な非線形関係を捉える能力に制限があることが示された。
  • RFモデルは、対数変換を施した居住面積を最も重要な予測変数と特定。次に、中央ビジネス地区(CBD)までのドライブ時間、地域、物件の築年数の順に重要度が高かった。
  • 限界効果プロットから非線形関係が明らかになった:住宅価格は居住面積が増加するにつれて、その増加率は減少(減速)し、CBDまでの距離が離れるにつれて非線形に低下。また、築年数との関係はU字型であった(0〜50年は負の影響、それ以上の年数は正の影響)。
  • ニューラルネットワーク(ANN)も幸福回帰を上回ったが、特に高カーディナリティのカテゴリー変数を扱う際の過学習リスクのため、RFほど正確ではなかった。
  • kNNは中程度の性能を示したが、特に高次元の特徴空間ではRFおよびANNに劣った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。