[论文解读] Business Taxonomy Construction Using Concept-Level Hierarchical Clustering
本文提出一种概念级层次聚类方法,利用贪心亲和传播算法,从企业年度报告中自动构建动态商业分类体系,仅需极少人工监督。该方法可发现传统静态分类体系所遗漏的细粒度、动态演化的商业概念,如“在线培训”和“教育信息化”,为投资创新型小盘股公司(尤其是在中国新三板等新兴市场)提供更精准、更具适应性的工具。
Business taxonomies are indispensable tools for investors to do equity research and make professional decisions. However, to identify the structure of industry sectors in an emerging market is challenging for two reasons. First, existing taxonomies are designed for mature markets, which may not be the appropriate classification for small companies with innovative business models. Second, emerging markets are fast-developing, thus the static business taxonomies cannot promptly reflect the new features. In this article, we propose a new method to construct business taxonomies automatically from the content of corporate annual reports. Extracted concepts are hierarchically clustered using greedy affinity propagation. Our method requires less supervision and is able to discover new terms. Experiments and evaluation on the Chinese National Equities Exchange and Quotations (NEEQ) market show several advantages of the business taxonomy we build. Our results provide an effective tool for understanding and investing in the new growth companies.
研究动机与目标
- 解决静态、人工构建的商业分类体系在捕捉新兴市场中小型企业及初创公司动态创新商业模式方面的局限性。
- 开发一种自动化方法,构建仅需极少人工监督的商业分类体系,能够从非结构化文本中发现新的细粒度商业概念。
- 为投资者提供更精准、更具适应性的分类系统,以识别可比公司并探测新兴市场趋势。
- 将新三板年报数据集公开,以供文本挖掘与分类体系构建领域的基准测试和未来研究使用。
提出的方法
- 利用语言学知识与统计建模从企业年度报告中提取概念级术语,避免依赖种子词或预标注关系。
- 基于文本中共现与语义模式构建相似性矩阵,计算术语之间的相似度。
- 应用贪心分层亲和传播算法,根据相似度递归聚类术语,形成多层级分类体系结构。
- 采用正样本与未标注样本(PU)学习方法,减少人工标注工作量,提升对稀有或新兴概念的发现能力。
- 采用自下而上的聚类策略,从单个术语逐步构建为更广泛的类别,确保分类体系的层次一致性。
- 通过人工评估与官方新三板分类标签对比,验证分类体系的准确性与粒度。
实验结果
研究问题
- RQ1能否通过自动化方法从企业年度报告中构建商业分类体系,以捕捉传统分类体系中缺失的细粒度、动态演化的商业概念?
- RQ2所提出的概念级聚类方法在粒度与与实际公司运营的相关性方面,相较于专家构建的分类体系表现如何?
- RQ3该方法在多大程度上能够发现新兴趋势商业概念(如“在线培训”或“教育信息化”),以反映新兴市场动态?
- RQ4正样本与未标注样本学习在减少人工监督的同时,对保持分类体系质量的有效性如何?
- RQ5所构建的分类体系是否能通过提供更精准的可比公司群体,更好地支持投资决策?
主要发现
- 所提方法成功构建了商业分类体系,能够捕捉传统分类体系中未涵盖的细粒度概念级术语,如“在线培训”和“教育信息化”。
- 该分类体系在公司分布上更具平衡性,每个子类术语平均管理约十家上市公司,而传统粗粒度类别(如“互联网软件与服务”)则将性质迥异的公司归为一类。
- 该方法识别出诸如“早教培训”和“智慧教育”等新兴趋势,反映出静态分类系统未能捕捉到的文化与市场变迁。
- 正样本与未标注样本学习的使用显著减少了人工标注工作量,同时实现了对新出现或稀有商业概念的有效发现。
- 人工评估证实,该分类体系为投资分析提供的可比公司群体比官方新三板分类指南更具准确性与实际意义。
- 实证表明,该方法在反映实际企业商业模式方面优于传统分类体系,因为同一子概念下的公司通常具有相似的客户、竞争对手与市场定位。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。