[논문 리뷰] Stock trend prediction using news sentiment analysis
이 논문은 주식 가격 움직임을 예측하기 위해 금융 뉴스 기사의 정서를 분석하는 기계학습 접근법을 제안한다. 세 가지 분류 모델—랜덤 포레스트(RF), 서포트 벡터 머신(SVM), 나이브 베이즈—를 사용하여 뉴스 기사의 정서를 긍정 또는 부정으로 분류한다. 실험 결과 RF 및 SVM 모델은 80% 이상의 정확도를 기록하며, 무작위 레이블링(50%)보다 30个百分点 높은 성능을 보였다.
Efficient Market Hypothesis is the popular theory about stock prediction. With its failure much research has been carried in the area of prediction of stocks. This project is about taking non quantifiable data such as financial news articles about a company and predicting its future stock trend with news sentiment classification. Assuming that news articles have impact on stock market, this is an attempt to study relationship between news and stock trend. To show this, we created three different classification models which depict polarity of news articles being positive or negative. Observations show that RF and SVM perform well in all types of testing. Naïve Bayes gives good result but not compared to the other two. Experiments are conducted to evaluate various aspects of the proposed model and encouraging results are obtained in all of the experiments. The accuracy of the prediction model is more than 80% and in comparison with news random labeling with 50% of accuracy; the model has increased the accuracy by 30%.
연구 동기 및 목표
- 금융 뉴스 정서와 향후 주가 움직임 간의 관계를 조사하기 위해.
- 비정형 뉴스 데이터를 사용하여 주식 가격 움직임을 예측하는 데 자연어 처리 기법의 효과성을 평가하기 위해.
- 랜덤 포레스트(RF), 서포트 벡터 머신(SVM), 나이브 베이즈를 포함한 다수의 기계학습 모델이 정서 기반 주식 예측에서 어떻게 성능을 내는지 비교하기 위해.
- 뉴스 기사에서 추출한 정서가 주가 방향성에 통계적으로 유의미한 예측력을 가짐을 입증하기 위해.
- 모델의 정확도를 무작위 기준(50%)과 비교하여 실제 성능 향상 여부를 입증하기 위해.
제안 방법
- 특정 기업과 관련된 금융 뉴스 기사들을 수집하여 정서 분석을 수행하였다.
- 표준 NLP 기법인 토큰화, 불용어 제거, 표준화를 사용해 텍스트 데이터를 전처리하였다.
- 이진 정서 분류(긍정/부정)를 위해 세 가지 지도 학습 모델—랜덤 포레스트, SVM, 나이브 베이즈—를 적용하였다.
- 수동 또는 규칙 기반 레이블링을 통해 정해진 감성 레이블이 부여된 뉴스 기사 데이터를 기반으로 모델을 훈련시켰다.
- 표준 평가 지표를 사용해 모델 성능을 평가하였으며, 정확도를 주요 평가 기준으로 삼았다.
- 모델의 예측 정확도를 무작위 기준(50% 정확도)과 비교하여 실제 적용 가능성 여부를 평가하였다.
실험 결과
연구 질문
- RQ1금융 뉴스 기사에서 추출한 정서가 향후 주가 움직임을 신뢰성 있게 예측할 수 있는가?
- RQ2랜덤 포레스트(RF), 서포트 벡터 머신(SVM), 나이브 베이즈 등 다양한 기계학습 모델은 주가 예측을 위한 뉴스 정서 분류에서 어떻게 성능을 내는가?
- RQ3정서 기반 예측은 랜덤 추측(50% 정확도)에 비해 어느 정도 향상되는가?
- RQ4비수치적 텍스트 데이터(뉴스 기사)는 주식 시장 움직임 예측에 어떤 영향을 미치는가?
- RQ5어느 모델 아키텍처가 정서 기반 주가 방향성 예측에서 가장 높은 정확도를 낼 수 있는가?
주요 결과
- 랜덤 포레스트 및 SVM 모델은 뉴스 정서를 기반으로 주가 방향성을 분류하는 데 80% 이상의 예측 정확도를 기록하였다.
- 나이브 베이즈는 양호한 결과를 보였지만, 정서 기반 주가 예측에서 RF 및 SVM에 비해 성능이 열 劣하였다.
- 제안된 모델은 무작위 레이블링(50% 정확도) 대비 예측 정확도를 30个百分点 향상시켜 의미 있는 예측 능력을 입증하였다.
- 결과는 뉴스 정서와 이후 주가 움직임 사이에 유의미한 관계가 있음을 확인하며, 비정형 텍스트 데이터를 재무 예측에 활용할 수 있음을 지지한다.
- 강력한 기계학습 모델과 함께 금융 뉴스의 정서 분석이 주가 방향성 예측에 신뢰할 수 있는 신호가 될 수 있음을 연구가 검증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.