[논문 리뷰] Machine Learning, Deep Learning, and Hedonic Methods for Real Estate Price Prediction
이 연구는 콜로라도 주 보울더에서 주택 가격 예측을 위해 허드닉 회귀, 랜덤 포레스트(RF), 인공 신경망(ANN), k-가까운 이웃(kNN)을 비교한다. 다각도의 데이터 세트(MLS, 범죄, 학교, 보행성 등)를 활용하여, 비선형 관계를 포착할 수 있는 능력 덕분에 RF와 ANN이 전통적인 허드닉 모델을 능가하는 것으로 나타났으며, 특히 RF가 가장 높은 예측 정확도를 보였다(R² > 0.90, RMSE ≈ 105만).
In recent years several complaints about racial discrimination in appraising home values have been accumulating. For several decades, to estimate the sale price of the residential properties, appraisers have been walking through the properties, observing the property, collecting data, and making use of the hedonic pricing models. However, this method bears some costs and by nature is subjective and biased. To minimize human involvement and the biases in the real estate appraisals and boost the accuracy of the real estate market price prediction models, in this research we design data-efficient learning machines capable of learning and extracting the relation or patterns between the inputs (features for the house) and output (value of the houses). We compare the performance of some machine learning and deep learning algorithms, specifically artificial neural networks, random forest, and k nearest neighbor approaches to that of hedonic method on house price prediction in the city of Boulder, Colorado. Even though this study has been done over the houses in the city of Boulder it can be generalized to the housing market in any cities. The results indicate non-linear association between the dwelling features and dwelling prices. In light of these findings, this study demonstrates that random forest and artificial neural networks algorithms can be better alternatives over the hedonic regression analysis for prediction of the house prices in the city of Boulder, Colorado.
연구 동기 및 목표
- 기존 주택 평가에서의 주관성과 편향, 특히 인종 차별 우려 문제를 해결하기 위해.
- 기계학습 및 딥러닝 모델이 전통적인 허드닉 가격 모델보다 예측 정확도를 향상시킬 수 있는지 평가하기 위해.
- 해석 가능한 및 비해석 가능한 모델을 활용해 보울더 주택 시장에서 가장 예측력 있는 주택 특성들을 특정하기 위해.
- 기존 테스트 데이터에 대한 표준 평가 지표를 사용해 RF, ANN, kNN의 성능을 허드닉 회귀와 비교하기 위해.
- 보울더 외의 도시 주택 시장으로 모델을 일반화할 수 있는지 탐색하기 위해.
제안 방법
- 다양한 출처에서 데이터를 수집하고 통합: 다수의 매물 목록(MLS), 공립학교 평가, 콜로라도 주 범죄율, CrimeReports, WalkScore, 미국 인구조사국.
- 로그 변환된 생활 면적, 범주형 변수(예: 지역, 동네), 파생 변수(예: 도심 중심가까지의 주행 시간) 등을 포함한 특성 전처리.
- 테스트 세트의 미사용 데이터에 대해 허드닉 회귀, 랜덤 포레스트(RF), 인공 신경망(ANN), k-가까운 이웃(kNN)의 네 가지 모델을 훈련 및 평가.
- 모델 정확도 비교를 위해 R², RMSE, MAPE 등의 성능 지표를 사용; RF에서는 변수 중요도 분석 및 경계 효과 시각화를 적용.
- 작은 데이터셋에서의 강건성 향상과 과적합 방지를 위해 RF에서 부트스트랩핑과 배깅을 활용.
- 상위 특성들(예: 생활 면적, 도심 중심가까지의 거리, 연식)의 비선형 경계 효과를 부분 의존도 플롯을 통해 시각화.
실험 결과
연구 질문
- RQ1기계학습 및 딥러닝 모델이 보울더, 콜로라도에서 주택 가격 예측에서 기존의 허드닉 회귀 모델을 능가하는가?
- RQ2주택 특성(예: 크기, 연식, 위치)과 부동산 가격 간의 관계는 선형인가 비선형인가?
- RQ3RF, ANN, kNN, 또는 허드닉 회귀 중 어느 모델이 미사용 테스트 데이터에서 가장 높은 예측 정확도를 달성하는가?
- RQ4보울더에서 부동산 가격을 예측하는 데 가장 영향력 있는 주택 특성들은 무엇이며, 그 경계 효과는 어떻게 변하는가?
- RQ5데이터 효율적인 기계학습 모델이 주택 평가에서 인간의 편향과 주관성을 줄일 수 있는가?
주요 결과
- 랜덤 포레스트(RF)는 테스트 세트에서 R² > 0.90, RMSE ≈ 105만, MAPE < 10%를 기록하며 가장 높은 예측 성능을 보였으며, 허드닉 회귀 및 ANN을 모두 능가했다.
- 허드닉 모델은 낮은 R²와 높은 RMSE를 보이며, 주택 데이터의 복잡한 비선형 관계를 포착하는 데 한계를 보였다.
- RF 모델은 로그 변환된 생활 면적을 가장 중요한 예측 변수로 식별했으며, 그 다음으로 도심 중심가(CBD)까지의 주행 시간, 지역, 부동산 연식이 뒤이었다.
- 경계 효과 플롯은 비선형 관계를 드러내었으며, 주택 가격은 생활 면적이 증가함에 따라 감소하는 비율로 상승했고, 도심 중심가까지의 거리가 멀어질수록 비선형적으로 감소했으며, 연식과의 관계는 U자형을 보였다(0–50년은 음성, 노후 주택은 양성).
- 인공 신경망(ANN) 역시 허드닉 회귀를 능가했지만, 고카디널리티를 가진 범주형 변수로 인한 과적합 위험이 있어 RF에 비해 정확도가 떨어졌다.
- kNN는 중간 수준의 성능을 보였지만, 특히 고차원 특성 공간에서 RF와 ANN에 비해 효과적이지 못했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.