[论文解读] Patent Analytics Based on Feature Vector Space Model: A Case of IoT
本文提出了一种基于深度学习的特征向量空间模型(FVSM),通过使用卷积神经网络(CNN)从专利文本中提取句子级语义特征,以替代传统向量空间模型(VSM)在专利分析中的应用。该方法提升了专利相似性、聚类和映射的准确性——实现了约90%的相似性检测准确率——并通过T-SNE实现了更清晰的可视化,相较于基于TF-IDF的VSM,在处理语义复杂性和维度灾难问题上表现更优。
The number of approved patents worldwide increases rapidly each year, which requires new patent analytics to efficiently mine the valuable information attached to these patents. Vector space model (VSM) represents documents as high-dimensional vectors, where each dimension corresponds to a unique term. While originally proposed for information retrieval systems, VSM has also seen wide applications in patent analytics, and used as a fundamental tool to map patent documents to structured data. However, VSM method suffers from several limitations when applied to patent analysis tasks, such as loss of sentence-level semantics and curse-of-dimensionality problems. In order to address the above limitations, we propose a patent analytics based on feature vector space model (FVSM), where the FVSM is constructed by mapping patent documents to feature vectors extracted by convolutional neural networks (CNN). The applications of FVSM for three typical patent analysis tasks, i.e., patents similarity comparison, patent clustering, and patent map generation are discussed. A case study using patents related to Internet of Things (IoT) technology is illustrated to demonstrate the performance and effectiveness of FVSM. The proposed FVSM can be adopted by other patent analysis studies to replace VSM, based on which various big data learning tasks can be performed.
研究动机与目标
- 为解决传统向量空间模型(VSM)在专利分析中的局限性,如句子级语义的丢失和维度灾难问题。
- 利用深度学习构建更有效且语义丰富的专利文档表示方法。
- 提升专利相似性检测、聚类和可视化能力,以支持技术预测和研发规划。
- 在来自美国专利商标局(USPTO)的真实物联网(IoT)相关专利数据集上,验证所提出FVSM的有效性。
提出的方法
- FVSM构建一个高维特征空间,其中每个专利通过卷积神经网络(CNN)池化层提取的特征向量进行表示。
- CNN的输入为完整专利句子,而非孤立的关键词,从而能够捕捉句子级语义信息。
- 通过调整CNN池化层中的神经元数量,灵活控制特征空间的维度,缓解维度灾难问题。
- 以端到端训练方式学习上下文感知的特征表示,替代传统的TF-IDF加权方法。
- 应用主成分分析(PCA)和T-SNE等降维技术,将高维特征向量可视化于二维空间,用于生成专利地图。
- 对学习到的特征向量应用K-means聚类算法以分组相似专利,并通过T-SNE可视化提升聚类分离效果。
实验结果
研究问题
- RQ1与传统VSM相比,基于深度学习的特征向量空间模型能否提升专利相似性检测的准确性?
- RQ2FVSM在专利文本表示中能在多大程度上保持句子级语义?
- RQ3FVSM在维持专利聚类判别能力的同时,能否有效降低维度?
- RQ4FVSM能否生成更清晰、更具可解释性的专利地图,以支持技术格局分析?
主要发现
- 所提出的FVSM实现了约90%的专利相似性检测准确率,显著优于传统基于TF-IDF的VSM,在捕捉语义关系方面表现更优。
- FVSM特征向量的T-SNE可视化显示出分离良好且语义明确的聚类,表明其表示质量高且聚类效果优异。
- 使用FVSM生成的专利地图显示,相关技术领域(如音频、流媒体、图像处理)形成连贯的超聚类,与物联网(IoT)架构层级(如感知层、网络层)相一致。
- 专利地图中的重叠区域(如无线网络接入)表明多领域相关性,真实反映了技术交叉的现实。
- FVSM通过控制CNN池化层中的神经元数量,有效缓解了维度灾难问题,实现了可扩展且高效的分析。
- 该方法在专利分析领域展现出广泛的应用潜力,支持大数据学习任务,如趋势分析和研发规划。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。