Skip to main content
QUICK REVIEW

[논문 리뷰] Company Similarity using Large Language Models

Dimitrios Vamvourellis, Máté Attila Tóth|arXiv (Cornell University)|2023. 08. 15.
Stock Market Forecasting MethodsDecision Sciences인용 수 3
한 줄 요약

이 논문은 SEC 10K 파일을 토대로 미세조정된 대규모 언어 모델(LLM)을 사용하여 비즈니스 유사성을 더 잘 반영하는 조밀하고 연속적인 기업 임베딩을 생성하는 것을 제안한다. 이는 엄격한 산업 분류 체계를 초월한 기업 유사성 측정을 가능하게 한다. 실험 결과, 전통적인 GICS 분류 방식보다 우수한 성능을 보이며, 최근접 이웃 간 수익률 상관관계가 10% 높고, 분산 수익률 변동성을 더 잘 설명함을 입증하였다.

ABSTRACT

Identifying companies with similar profiles is a core task in finance with a wide range of applications in portfolio construction, asset pricing and risk attribution. When a rigorous definition of similarity is lacking, financial analysts usually resort to 'traditional' industry classifications such as Global Industry Classification System (GICS) which assign a unique category to each company at different levels of granularity. Due to their discrete nature, though, GICS classifications do not allow for ranking companies in terms of similarity. In this paper, we explore the ability of pre-trained and finetuned large language models (LLMs) to learn company embeddings based on the business descriptions reported in SEC filings. We show that we can reproduce GICS classifications using the embeddings as features. We also benchmark these embeddings on various machine learning and financial metrics and conclude that the companies that are similar according to the embeddings are also similar in terms of financial performance metrics including return correlation.

연구 동기 및 목표

  • GICS와 같은 이산적인 산업 분류 체계의 한계를 극복하고, 연속적이고 해석 가능한 기업 유사성 측정법을 개발하는 것.
  • 비즈니스 기술서에서 유래한 LLM에 의한 임베딩이 기존의 부문 및 산업 분류 체계를 재현하거나 초월할 수 있는지 평가하는 것.
  • 이러한 임베딩이 실제 주식 수익률 상관관계와 리스크 요인 노출과 연결될 때 재무적 관련성을 어떻게 확보하는지 평가하는 것.
  • 사설 시장에서의 이상치 탐지 및 유사성 학습 지원을 위한 임베딩의 잠재력을 탐색하는 것.

제안 방법

  • SEC 10K의 비즈니스 기술서를 대상으로 GICS 레이블을 함께 사용해 대규모 언어 모델(GPT 기반 및 SBERT 등)을 미세조정하여 기업 임베딩을 생성하는 것.
  • 생성된 임베딩을 입력 특징으로 사용해 GICS 부문 및 산업 분류를 고정밀도로 재현하는 분류기 학습하는 것.
  • 기업 임베딩 간의 코사인 유사도를 계산하여 최근접 이웃을 식별하고 유사 기업 군집을 형성하는 것.
  • 최근접 이웃 간 수익률 상관관계와 군집 간 비교를 통해 임베딩의 재무적 관련성을 GICS 기반 동료와 비교 평가하는 것.
  • 임베딩을 시각화하고 이상치를 탐지하기 위해 차원 축소(UMAP)를 적용하여 GICS 부문과 다름없이 분류된 기업을 탐지하는 것.
  • 리스크 요인 모델을 사용해 임베딩과 GICS 분류가 분산 주식 수익률 변동성을 얼마나 잘 설명하는지 비교하는 것.

실험 결과

연구 질문

  • RQ1LLM에 의한 10K 파일에서 유도된 임베딩가 GICS 산업 분류를 높은 정확도로 재현할 수 있는가?
  • RQ2임베딩 기반의 기업 유사성 측정 방식이 GICS 기반 동료군과 비교해 수익률 상관관계 측면에서 어떻게 다른가?
  • RQ3임베딩이 GICS보다 더 재무적으로 의미 있는 동료군을 식별할 수 있는가, 특히 수익률 공동변동성과 리스크 요인 노출 측면에서?
  • RQ4임베딩을 통해 GICS의 구조적 오분류를 드러낼 수 있는가, 예를 들어 텍스트적으로 유사한데 다른 부문에 할당된 기업들이 있는가?
  • RQ5임베딩을 사용해 재무 이상치를 탐지하거나 사설 시장에서의 유사성 학습을 지원할 수 있는가?

주요 결과

  • 미세조정된 LLM은 일반적인 사전학습된 LLM보다 GICS 부문 및 산업 분류 재현 정확도가 높아, 지도 학습적 적응의 가치를 입증한다.
  • 임베딩 기반으로 식별한 최근접 이웃의 수익률 상관관계는 동일한 GICS 부문 내 평균 이웃보다 10% 높다.
  • 임베딩 기반으로 식별한 최근접 이웃의 수익률 상관관계는 동일한 GICS 산업 내 평균 이웃보다 6% 높다.
  • 임베딩 기반 군집은 GICS 부문이나 산업 분류보다 더 높은 비율의 분산 주식 수익률 변동성을 설명한다.
  • 임베딩 기반 이상치 탐지로 GICS에 의해 잘못 분류된 기업들(예: MASS, VREX)을 발견하였으며, 이들의 텍스트적 특성은 다른 부문과 더 유사하다.
  • 모델은 소프트, 확률적 부문 할당(예: 아마존는 소비자 여유소비 부문에 35.7% 확률)을 생성하여 단일 레이블 분류보다 더 세밀한 시각을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.