[논문 리뷰] Missing Values Handling for Machine Learning Portfolios
이 논문은 159개의 횡단면 수익 예측 변수의 결측 구조를 분석하고, 간단한 교차섹션 평균 대치가 기계학습 포트폴리오에 대해 EM 기반 대치만큼 자주 동일하게 작동한다는 것을 보인다. 관찰된 데이터가 시간 구조화된 블록과 약한 횡단면 상관관계로 인해 결측값에 대한 정보를 제한적으로 제공하는 이유를 설명한다.
We characterize the structure and origins of missingness for 159 cross-sectional return predictors and study missing value handling for portfolios constructed using machine learning. Simply imputing with cross-sectional means performs well compared to rigorous expectation-maximization methods. This stems from three facts about predictor data: (1) missingness occurs in large blocks organized by time, (2) cross-sectional correlations are small, and (3) missingness tends to occur in blocks organized by the underlying data source. As a result, observed data provide little information about missing data. Sophisticated imputations introduce estimation noise that can lead to underperformance if machine learning is not carefully applied.
연구 동기 및 목표
- 159개의 횡단면 수익 예측 변수의 결측 구조와 기원을 특징화한다.
- 머신러닝으로 구성된 포트폴리오를 위한 결측값 처리 전략을 평가한다.
- 포트폴리오 맥락에서 고급 대치(imputations)가 예측 성능을 개선하거나 해칠 수 있는 조건을 평가한다.
제안 방법
- 예측 변수 데이터에서 결측 패턴과 기원을 특징화한다.
- 간단한 교차섹션 평균 대치를 기대값 최대화(EM) 대치와 비교한다.
- 대치(imputation)가 머신러닝 기반 포트폴리오 구성에 미치는 영향을 평가한다.
실험 결과
연구 질문
- RQ1예측 데이터의 결측 구조와 기원은 무엇인가?
- RQ2ML을 사용한 포트폴리오 구성에서 교차섹션 평균 대치는 EM 방법과 어떻게 비교되는가?
- RQ3복잡한 대치가 ML 포트폴리오의 성능을 향상시키거나 저하시킬 수 있는 조건은 무엇인가?
주요 결과
- 결측은 큰 시간으로 조직된 블록으로 발생한다.
- 교차섹션 상관관계가 작다.
- 결측은 기본 데이터 소스에 의해 조직된 블록으로 나타나는 경향이 있다.
- 이 맥락에서 교차섹션 평균 대치가 EM 방법에 비해 잘 수행된다.
- 고급 대치는 ML 방법이 신중하게 적용되지 않을 경우 성능을 해치는 추정 노이즈를 도입할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.