Skip to main content
QUICK REVIEW

[論文レビュー] Business Taxonomy Construction Using Concept-Level Hierarchical Clustering

Haodong Bai, Frank Xing|arXiv (Cornell University)|Jun 24, 2019
Web Data Mining and Analysis参考文献 21被引用数 6
ひとこと要約

本稿では、最小限の教師付き学習を要し、企業の年次報告書から動的ビジネス分類体系を自動的に構築するための概念レベル階層的クラスタリング手法を提案する。グリーディーなアフィニティプロパゲーションを用いて、従来の静的分類体系では捉えきれない細分化された、進化するビジネス概念(例:'オンライントレーニング' や '教育インフォメーション化')を同定する。これは、特に中国のNEXQのような新興市場において、革新性の高い小規模株式会社への投資をより正確かつ柔軟に行うための優れたツールを提供する。

ABSTRACT

Business taxonomies are indispensable tools for investors to do equity research and make professional decisions. However, to identify the structure of industry sectors in an emerging market is challenging for two reasons. First, existing taxonomies are designed for mature markets, which may not be the appropriate classification for small companies with innovative business models. Second, emerging markets are fast-developing, thus the static business taxonomies cannot promptly reflect the new features. In this article, we propose a new method to construct business taxonomies automatically from the content of corporate annual reports. Extracted concepts are hierarchically clustered using greedy affinity propagation. Our method requires less supervision and is able to discover new terms. Experiments and evaluation on the Chinese National Equities Exchange and Quotations (NEEQ) market show several advantages of the business taxonomy we build. Our results provide an effective tool for understanding and investing in the new growth companies.

研究の動機と目的

  • 新興市場における小規模・スタートアップ企業の動的で革新的なビジネスモデルを捉えきれない、従来の静的で専門家が作成したビジネス分類体系の限界を是正すること。
  • 初期のキーワードや事前ラベルなしに、非構造化テキストから新しい細分化されたビジネス概念を発見できる、最小限の教師付き学習を要する自動的分類体系構築手法を開発すること。
  • 投資家が同等企業を特定し、市場動向を検出できる、より正確で適応性のある分類システムを提供すること。
  • 今後のテキストマイニングおよび分類体系構築研究のためのベンチマークとして、NEEQの年次報告書データセットを公開すること。

提案手法

  • キーワードや事前ラベルに依存せず、言語的知識と統計的モデリングを用いて、企業の年次報告書から概念レベルの用語を抽出する。
  • テキスト内での共起性および意味的パターンに基づき、類似度行列を計算して用語の類似度を算出する。
  • 類似度に基づいて、グリーディーな階層的アフィニティプロパゲーションを用いて、再帰的に用語を多段階の分類体系構造にクラスタリングする。
  • 手動ラベル付け作業を削減し、まれなまたは新興の概念を効果的に発見できるように、正例と未ラベル例(PU)学習を採用する。
  • 個々の用語から広範なカテゴリへと段階的に分類体系を構築するボトムアップのクラスタリング戦略を採用し、階層的整合性を保証する。
  • 人間による評価と公式のNEEQ分類ラベルとの比較を通じて、分類体系の正確性と細分化度を検証する。

実験結果

リサーチクエスチョン

  • RQ1企業の年次報告書から自動的に構築された分類体系は、従来の分類体系に存在しない細分化された、進化するビジネス概念(例:'オンライントレーニング' や '教育インフォメーション化')を的確に捉えられるか?
  • RQ2提案手法の概念レベルクラスタリングは、実際の企業活動との関連性と細分化度において、専門家が作成した分類体系と比較してどの程度優れているか?
  • RQ3本手法は、'オンライントレーニング' や '教育インフォメーション化' のような、新興市場の動向を反映する新しいトレンド的ビジネス概念をどの程度効果的に発見できるか?
  • RQ4正例と未ラベル例(PU)学習の使用は、分類体系の品質を維持しつつ、教師付き学習の負荷をどの程度削減できるか?
  • RQ5構築された分類体系は、財務分析や評価のためのより正確な類似企業グループを提供できるため、投資意思決定をより効果的に支援できるか?

主な発見

  • 提案手法は、'オンライントレーニング' や '教育インフォメーション化' のような概念レベルの用語を的確に捉えたビジネス分類体系を構築できた。これらの用語は従来の分類体系には存在しない。
  • 分類体系は企業の分布がよりバランスが良く、各子孫用語が約10社の企業を管理しているのに対し、'インターネットソフトウェアおよびサービス' のような粗いカテゴリは、類似性の低い企業をまとめる。
  • 本手法は、未就学児向けトレーニングやスマート教育といった、文化的・市場的変化を反映する新興トレンドを同定した。これらの変化は、静的分類システムでは捉えきれない。
  • 正例と未ラベル例(PU)学習の活用により、手動ラベル付け作業を著しく削減しつつ、新しいまたはまれなビジネス概念の発見が可能になった。
  • 人間による評価では、公式のNEEQ分類ガイドよりも、投資分析に適したより正確で意味のある類似企業グループを提供していることが確認された。
  • 実際の企業モデルを反映する点で、本手法は従来の分類体系を上回っている。具体的には、同じサブコンセプトに属する企業同士は、類似した顧客、競合他社、市場ポジショニングを共有していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。