Skip to main content
QUICK REVIEW

[论文解读] Company Similarity using Large Language Models

Dimitrios Vamvourellis, Máté Attila Tóth|arXiv (Cornell University)|Aug 15, 2023
Stock Market Forecasting MethodsDecision Sciences被引用 3
一句话总结

本文提出使用在SEC 10K文件上微调的大语言模型(LLMs)生成密集的、连续的公司嵌入向量,以捕捉超越严格行业分类的业务相似性。实证表明,这些嵌入向量在同行业可比性方面优于传统的GICS分类标准,使最近邻的收益相关性提高10%,并更好地解释横截面收益变动。

ABSTRACT

Identifying companies with similar profiles is a core task in finance with a wide range of applications in portfolio construction, asset pricing and risk attribution. When a rigorous definition of similarity is lacking, financial analysts usually resort to 'traditional' industry classifications such as Global Industry Classification System (GICS) which assign a unique category to each company at different levels of granularity. Due to their discrete nature, though, GICS classifications do not allow for ranking companies in terms of similarity. In this paper, we explore the ability of pre-trained and finetuned large language models (LLMs) to learn company embeddings based on the business descriptions reported in SEC filings. We show that we can reproduce GICS classifications using the embeddings as features. We also benchmark these embeddings on various machine learning and financial metrics and conclude that the companies that are similar according to the embeddings are also similar in terms of financial performance metrics including return correlation.

研究动机与目标

  • 开发一种连续且可解释的公司相似性度量方法,以克服GICS等离散行业分类的局限性。
  • 评估基于业务描述的LLM生成嵌入向量是否能够再现或超越传统的行业与部门分类标准。
  • 通过将嵌入向量与实际股票收益相关性及风险因子暴露关联,评估其金融相关性。
  • 探索嵌入向量在识别金融异常值以及支持私募市场中的相似性学习方面的潜力。

提出的方法

  • 在SEC 10K业务描述及其对应GICS标签上微调大语言模型(如基于GPT和SBERT的模型),以生成公司嵌入向量。
  • 将所得嵌入向量作为输入特征,训练分类器以高精度重现GICS部门与行业分类。
  • 通过计算公司嵌入向量之间的成对余弦相似度,识别最近邻并形成相似公司的聚类。
  • 通过测量最近邻之间及聚类内部的收益相关性,与GICS定义的同行业公司进行对比,以基准化嵌入向量的金融相关性。
  • 使用降维方法(UMAP)可视化嵌入向量,检测与GICS所属部门存在偏差的异常值。
  • 使用风险因子模型比较嵌入向量与GICS分类在解释横截面股票收益变动方面的表现。

实验结果

研究问题

  • RQ1基于10K文件的LLM生成嵌入向量能否以高精度再现GICS行业分类?
  • RQ2通过嵌入向量衡量的公司相似性与基于传统GICS的同行业公司组相比,在收益相关性方面表现如何?
  • RQ3嵌入向量能否识别出比GICS更具金融意义的同行业公司组,特别是在收益联动性与风险因子暴露方面?
  • RQ4嵌入向量是否能揭示GICS中的结构性误分类问题,例如在文本上相似但被分配到不同部门的公司?
  • RQ5嵌入向量能否用于识别金融异常值,或支持私募市场中的相似性学习?

主要发现

  • 微调后的LLM在重现GICS部门与行业分类方面的准确率高于通用预训练LLM,证明了监督微调的价值。
  • 通过嵌入向量识别出的最近邻,其收益相关性比同一GICS部门内平均同行业公司的相关性高出10%。
  • 通过嵌入向量识别出的最近邻,其收益相关性比同一GICS行业内的平均同行业公司相关性高出6%。
  • 基于嵌入向量的聚类比GICS部门或行业分类能解释更大比例的横截面股票收益变动。
  • 通过嵌入向量进行异常值检测揭示了GICS分类错误的公司——如MASS和VREX——其文本特征更接近其他部门。
  • 该模型生成软性、概率性的部门分配(例如,亚马逊在非必需消费品部门的概率为35.7%),提供了比单标签分类更细致的视角。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。