[논문 리뷰] Stock Embeddings: Learning Distributed Representations for Financial Assets
이 논문은 자연어 처리의 원리를 활용하여 역사적 일일 수익률 데이터만을 사용해 금융 자산의 분산 벡터 표현(임bedding)을 학습하는 신경망 기반 방법을 제안한다. 이 방법은 전통적인 상관계수 기반 방법보다 포트폴리오 변동성을 낮추는 데 성공하여 헤지 과제에서 평균 실현 변동성을 21.3%로 달성하였으며, 피어슨 상관계수를 사용한 기준선의 23.8%보다 유의미하게 낮았다.
Identifying meaningful relationships between the price movements of financial assets is a challenging but important problem in a variety of financial applications. However with recent research, particularly those using machine learning and deep learning techniques, focused mostly on price forecasting, the literature investigating the modelling of asset correlations has lagged somewhat. To address this, inspired by recent successes in natural language processing, we propose a neural model for training stock embeddings, which harnesses the dynamics of historical returns data in order to learn the nuanced relationships that exist between financial assets. We describe our approach in detail and discuss a number of ways that it can be used in the financial domain. Furthermore, we present the evaluation results to demonstrate the utility of this approach, compared to several important benchmarks, in two real-world financial analytics tasks.
연구 동기 및 목표
- 가격 예측이 아닌 자산 간 관계 모델링에 초점을 맞춘 기계학습 연구의 격차를 해소하기 위해.
- 역사적 수익률 데이터만을 사용해 금융 자산의 조밀하고 분산된 표현을 학습하는 방법을 개발하기 위해.
- 이러한 임베딩이 실질적인 금융 과제에서 전통적인 상관계수 기반 유사도 측정법보다 우수한 성능을 보일 수 있는지 평가하기 위해.
- 임베딩이 실제 응용 분야인 포트폴리오 헤지 및 산업 분류와 같은 과제에서 유용한지 입증하기 위해.
제안 방법
- 모델은 워드2벡과 유사한 신경망 아키텍처를 사용해 금융 자산의 시계열 수익률에서 임베딩을 학습한다.
- 학습 중에 음성 샘플링 전략을 적용하여 자산 간 수익률 패턴의 의미적 유사도를 최적화한다.
- 시간 순서의 역사를 기반으로 컨텍스트 윈도우를 정의하며, 각 자산은 시간적 이웃 자산을 기반으로 예측된다.
- 모델은 수익률의 분포 유사성에 기반해 자산 간 미묘한 관계를 코딩하는 저차원 조밀한 벡터를 학습한다.
- 정규화 및 일반화 능력을 향상시키기 위해 IQR 필터링과 같은 노이즈 감소 기법을 적용한다.
- 학습된 임베딩 간 코사인 유사도를 유사도 측정 기준으로 사용하여 기존의 피어슨 상관계수를 대체하거나 보완한다.
실험 결과
연구 질문
- RQ1역사적 수익률에서 학습된 주식의 분산 표현이 기존 상관계수보다 자산 간 의미 있는 관계를 더 잘 포착할 수 있는가?
- RQ2임베딩 기반 접근법이 포트폴리오 구성에 있어 유사하거나 상이한 자산을 식별하는 데 피어슨 및 스피어만 상관계수와 비교해 어떻게 성능을 냈는가?
- RQ3임베딩 기반 유사도가 두 자산 헤지 전략의 실현 변동성 측면에서 성능 향상에 기여하는가?
- RQ4컨텍스트 크기 및 임베딩 차원과 같은 하이퍼파ram터가 학습된 표현의 품질에 어떤 영향을 미치는가?
- RQ5수정된 컨텍스트 윈도우 설계를 통해 지연되거나 인과관계(예: 공급자 효과)를 포착할 수 있는가?
주요 결과
- 제안된 임베딩 방법은 두 자산 헤지 과제에서 평균 실현 변동성을 21.3%로 달성하였으며, 피어슨 상관계수를 사용한 기준선의 23.8%보다 유의미하게 낮았다.
- 임베딩 기반 접근법은 유의수준 α = 0.01에서 피어슨 기준선 대비 변동성 감소 측면에서 통계적으로 유의미한 개선을 보였다.
- IQR 노이즈 감소와 가중치 정규화를 조합한 최고 성능 버전이 100회의 무작위 시험에서 평균 변동성이 가장 낮았다.
- 임베딩 기반 방법에서 유도된 포트폴리오 변동성 분포는 낮은 값 쪽으로 더 집중되어 있어 더 높은 안정성과 일관성을 보였다.
- 후행 분석으로 수행된 푸루티 테스트는 모든 임베딩 기반 방법이 피어슨 상관계수 기준선보다 유의미하게 낮은 평균 변동성을 기록했다.
- 결과는 임베딩 기반 유사도 측정법이 실질적인 포트폴리오 리스크 관리 과제에서 표준 상관계수를 능가할 수 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.