[論文レビュー] Company Similarity using Large Language Models
本稿では、10K提出書類に微調整された大規模言語モデル(LLM)を用いて、業界分類の枠組みを越えた企業の類似性を捉える高密度で連続的な企業埋め込みを生成することを提案する。この埋め込みは、従来のGICS分類を上回る性能を示し、類似企業グループの特定においてより高い正確性を実現しており、最近隣の株式リターン相関が10%向上し、横断的リターン変動の説明力も向上している。
Identifying companies with similar profiles is a core task in finance with a wide range of applications in portfolio construction, asset pricing and risk attribution. When a rigorous definition of similarity is lacking, financial analysts usually resort to 'traditional' industry classifications such as Global Industry Classification System (GICS) which assign a unique category to each company at different levels of granularity. Due to their discrete nature, though, GICS classifications do not allow for ranking companies in terms of similarity. In this paper, we explore the ability of pre-trained and finetuned large language models (LLMs) to learn company embeddings based on the business descriptions reported in SEC filings. We show that we can reproduce GICS classifications using the embeddings as features. We also benchmark these embeddings on various machine learning and financial metrics and conclude that the companies that are similar according to the embeddings are also similar in terms of financial performance metrics including return correlation.
研究の動機と目的
- GICSのような離散的業界分類の限界を克服し、連続的かつ解釈可能な企業類似度の測定法を提供すること。
- 企業の説明文から生成されたLLM埋め込みが、従来のセクターや業界分類を再現または改善できるかどうかを評価すること。
- これらの埋め込みの金融的関連性を、実際の株式リターン相関やリスク要因への露出と結びつけて評価すること。
- 私企業市場における類似性学習の支援や、財務的異常値の特定に埋め込みを活用する可能性を検討すること。
提案手法
- 10K提出書類の企業説明文を、対応するGICSラベルとともに微調整し、大規模言語モデル(例:GPTベースおよびSBERT)を用いて企業埋め込みを生成する。
- 得られた埋め込みを入力特徴量として用い、GICSセクターおよび業界分類を高い正確性で再現する分類器を訓練する。
- 企業埋め込み間のペアワイズコサイン類似度を計算し、類似した企業ペア(最近隣)を特定し、類似企業のクラスタを形成する。
- 最近隣同士およびクラスタ内でのリターン相関を、GICSで定義された類似企業と比較することで、埋め込みの金融的関連性をベンチマークする。
- 埋め込みの可視化と外れ値検出のため、次元削減(UMAP)を適用し、GICSで所属させられたセクターとは異なるテキスト的類似性を示す企業を特定する。
- リスク要因モデルを用いて、埋め込みとGICS分類の両方が横断的株式リターン変動をどの程度説明できるかを比較する。
実験結果
リサーチクエスチョン
- RQ110K提出書類からのLLM生成埋め込みは、高い正確性でGICS業界分類を再現できるか?
- RQ2埋め込みによる類似度測定と、従来のGICSベースの類似企業グループとの間で、リターン相関に差は生じるか?
- RQ3埋め込みは、リターンの共動的変動やリスク要因露出の観点から、GICSよりもより金融的意味を持つ類似企業グループを特定できるか?
- RQ4GICSにおける構造的誤分類(テキスト的に類似しているが異なるセクターに所属している企業)を埋め込みが明らかにできるか?
- RQ5埋め込みは、財務的異常値の特定や、私企業市場における類似性学習の支援に利用できるか?
主な発見
- 微調整されたLLMは、一般の事前学習済みLLMよりも、GICSセクターおよび業界分類の再現精度が高いため、教師あり適応の価値が示された。
- 埋め込みによる最近隣の企業ペアは、同じGICSセクター内での平均ペアと比較して、10%高いリターン相関を示した。
- 埋め込みによる最近隣の企業ペアは、同じGICS業界内での平均ペアと比較して、6%高いリターン相関を示した。
- 埋め込みに基づくクラスタは、GICSセクターまたは業界分類よりも、横断的株式リターン変動のより高い割合を説明できた。
- 埋め込みによる外れ値検出により、GICSで誤って分類された企業(例:MASSやVREX)が特定され、それらのテキスト的プロファイルは異なるセクターとより一致していた。
- モデルは、例えばアマゾンが「消費財」セクターに35.7%の確率を持つなど、単一ラベル分類よりも洗練された確率的セクター割り当てを生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。