Skip to main content
QUICK REVIEW

[논문 리뷰] Predicting Abnormal Returns From News Using Text Classification

Ronny Luss, Alexandre d’Aspremont|ArXiv.org|2008. 09. 16.
Stock Market Forecasting Methods참고 문헌 27인용 수 13
한 줄 요약

이 논문은 지침된 지원 벡터 기반의 다중 커널 학습(MKL) 프레임워크를 제안하며, 재무 뉴스의 텍스트와 이전의 절대 수익률을 조합하여 일내 비정상 가격 움직임을 예측한다. 지원 벡터 기반의 분류기(SVM)를 사용하여, 텍스트 특징이 단독으로 이전 수익률보다 비정상 수익률의 크기를 예측하는 데에 유의미하게 뛰어난 성능을 보임을 입증한다. 다만 수익률 방향은 여전히 예측이 어려우며, MKL을 통해 분류 정확도와 강인성을 향상시키기 위해 분석 중심 커팅 평면 최적화 기법을 효율적으로 적용한다.

ABSTRACT

We show how text from news articles can be used to predict intraday price movements of financial assets using support vector machines. Multiple kernel learning is used to combine equity returns with text as predictive features to increase classification performance and we develop an analytic center cutting plane method to solve the kernel learning problem efficiently. We observe that while the direction of returns is not predictable using either text or returns, their size is, with text features producing significantly better performance than historical returns alone.

연구 동기 및 목표

  • 재무 뉴스 텍스트가 이전 수익률만으로 가능한 예측을 초월하여 비정상 일내 주가 수익률을 예측할 수 있는지 조사한다.
  • 비정상 수익률 크기의 예측을 향상시키기 위해 텍스트 뉴스 데이터와 가격 수익률 데이터를 통합한 기계학습 프레임워크를 개발한다.
  • 텍스트 및 수익률 특징에서 유도된 선형 및 가우시안 커널을 최적의 가중치로 조합하여 분류 성능을 향상시키기 위해 다중 커널 학습(MKL)을 적용한다.
  • 대규모 MKL 문제를 효율적으로 해결하기 위해 분석 중심 커팅 평면 방법을 설계하고 구현한다.
  • 무의미하거나 노이즈가 많은 커널(예: 무작위 또는 잘못 설정된 가우시안 커널)의 포함에 대해 MKL 프레임워크의 강인성을 평가한다.

제안 방법

  • 뉴스 기사(예: 루터스, 더 월스트리트 저널)의 텍스트는 단어 빈도 특징으로 변환되어 텍스트 분류 모델의 입력으로 사용된다.
  • 다양한 시간 창(예: 10~250분) 동안의 이전 절대 수익률이 추가 예측 특징으로 사용된다.
  • 지정된 시간 창 내에서 비정상 수익률(75번째 백분위수를 초과하는 경우)이 발생할지를 예측하기 위해 지원 벡터 기반 분류기(SVM)가 훈련된다.
  • 텍스트 및 수익률 특징에서 유도된 선형 및 가우시안 커널을 조합하기 위해 다중 커널 학습(MKL)이 사용되며, 분류 성능을 극대화하기 위해 최적의 커널 가중치를 학습한다.
  • 대규모 MKL 문제를 효율적으로 해결하기 위해 분석 중심 커팅 평면 방법을 개발하여 표준 솔버 대비 계산 시간을 단축시켰다.
  • 뉴스 발표 후 다양한 시간 창(예: 10분에서 250분) 동안 정확도와 샤프 지수를 사용해 성능을 평가한다.

실험 결과

연구 질문

  • RQ1재무 뉴스 기사의 텍스트가 이전 가격 수익률만으로 가능한 예측을 초월하여 비정상 일내 주가 수익률을 더 효과적으로 예측할 수 있는가?
  • RQ2텍스트와 수익률 특징을 다중 커널 학습(MKL)을 통해 통합할 경우, 단독으로 사용하는 경우보다 예측 정확도가 유의미하게 향상되는가?
  • RQ3무의미하거나 노이즈가 많은 커널(예: 무작위 또는 잘못 설정된 가우시안 커널)이 포함되었을 때 MKL 프레임워크의 강인성은 어떻게 되는가?
  • RQ4MKL 모델의 성능은 커널 가중치의 정밀한 튜닝에 민감한가, 아니면 최적화되지 않은 가중치 조합이라도 강력한 성능을 유지하는가?
  • RQ5분석 중심 커팅 평면 방법과 같은 효율적인 최적화 알고리즘이 금융 텍스트 분류의 대규모 MKL 문제에 효과적으로 적용될 수 있는가?

주요 결과

  • 텍스트 특징 단독으로도 이전 수익률 단독보다 비정상 수익률의 크기를 예측하는 데에 유의미하게 뛰어난 성능을 보이며, MKL를 통해 두 특징을 조합할 경우 정확도가 크게 향상된다.
  • 수익률 방향은 텍스트나 수익률을 모두 사용해도 예측이 불가능하지만, 제안된 프레임워크를 통해 비정상 수익률의 크기(크기)는 높은 정확도로 예측 가능하다.
  • 고품질의 커널을 MKL 조합에 포함시키는 것이 강력한 성능을 내기 위해 필수적이며, 열악하게 설정된 또는 열악한 가우시안 커널을 사용할 경우 정확도가 크게 떨어진다.
  • MKL 프레임워크는 무의미한 커널의 포함에 강인하다. 최적의 커널 세트에 무작위 커널 3개를 추가하더라도 성능에 거의 영향을 주지 않으며, 이러한 커널들은 거의 0에 가까운 가중치를 받는다.
  • 분석 중심 커팅 평면 방법은 대규모 MKL 문제를 효율적으로 해결하며, 정확도를 유지하면서도 표준 솔버보다 계산 속도에서 뛰어난 성능을 보인다.
  • 커널 조합을 동일하게 가중치를 부여하는 경우에도 성능이 유지되므로, 고정밀도의 커널 가중치 최적화가 반드시 좋은 결과를 내기 위해 필요한 것은 아님을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.