Skip to main content
QUICK REVIEW

[论文解读] Innovation with and without patents

Josef Taalbi|arXiv (Cornell University)|Oct 8, 2022
Innovation Policy and R&D被引用 5
一句话总结

本研究利用1970–2015年间与13,561项国际专利匹配的4,460项瑞典创新成果数据集,分析了专利发明与实际商业化创新之间的重叠情况。研究发现,仅有17%的创新信息被专利数据捕获,意味着存在83%的信息损失,凸显了仅依赖专利来监测创新的局限性,即使经过质量调整亦是如此。

ABSTRACT

A long-standing discussion is to what extent patents can be used to monitor trends in innovation activity. This study quantifies the amount and quality of information about actual innovation contained in the patent system, based on 4,460 Swedish innovations (1970-2015) that have been matched to international patents. The results show that most innovations were not patented and that among those that were, 43.9% of all innovations, only a fraction can be identified with patent quality data. The best-performing models identify 17% of all information about innovations, equivalent to an information loss of at least 83%. Econometric tests also show that the fraction of innovations responding to strengthened patent laws during the period were on average 8% percent. The overlap between the patent and innovation systems is hence more modest than often assumed. This accentuates the need to, alongside patents, develop versatile approaches in order to induce and monitor various aspects of innovation.

研究动机与目标

  • 量化专利制度在多大程度上捕获了实际的商业化创新,以填补创新测度中的关键空白。
  • 评估将专利作为创新活动代理指标时的信息损失程度,尤其考虑到许多专利具有战略性或非商业性特征。
  • 评估专利质量指标(如引用次数)在专利体系中识别真正创新的有效性。
  • 挑战专利可靠反映创新趋势的假设,特别是在政策和经济分析中。
  • 倡导采用互补的、多源方法进行创新监测,超越基于专利的度量标准。

提出的方法

  • 通过在Google Patents中进行人工与机器学习辅助搜索,构建了来自LBIO数据库的4,460项商业化创新成果与13,561项国际专利的匹配数据集。
  • 应用噪声信道模型,将创新-专利关联视为信息传输过程,关键因素包括:专利倾向性(ρ)、召回率(α)和精确率(β),信息捕获量为ρ × α × β。
  • 使用机器学习(随机森林与多层感知机)进行三轮迭代预测,以随时间推移优化特征。
  • 整合了来自专利标题、摘要和说明书的文本特征(如关键词数量、占比、向量化表示),以及来自创新记录的命名实体特征(发明人、联系人等)。
  • 通过准确率、F1得分和错误率(假阳性和假阴性)校准模型性能,并在人工验证的配对样本上进行验证。
  • 对专利特征(如原创性、激进性、引用次数)进行主成分分析,以识别高影响力专利中的结构性模式。

实验结果

研究问题

  • RQ11970至2015年间,瑞典实际商业化创新中有多少比例被专利制度所捕获?
  • RQ2专利质量指标(如引用次数、原创性)在专利数据中识别真正创新的改善程度如何?
  • RQ3创新系统与专利系统之间的重叠程度在不同行业、时间段和专利局之间如何变化?
  • RQ4依赖专利作为创新代理指标时的信息损失程度是多少?不同质量调整选择方法下该损失如何变化?
  • RQ5机器学习模型在识别真实创新-专利关联方面的有效性如何?哪些特征驱动其预测性能?

主要发现

  • 仅有17%的商业化创新信息被专利制度捕获,表明信息损失至少为83%。
  • 在所有创新中,43.9%被申请了专利,但其中仅有少数专利包含质量数据(如引用次数),限制了其在创新监测中的实用性。
  • 表现最佳的机器学习模型F1得分为0.795,识别出11,694个潜在的创新-专利匹配,但仍遗漏了大量真实关联。
  • 专利倾向性(以专利形式提交的创新比例)在美利坚合众国和欧洲专利局最高,峰值出现在1990–2000年,但所有行业中均低于50%。
  • 与创新相关的专利平均被引用3.96次,显著高于未关联专利的平均1.93次,表明引用数据具有一定的预测能力。
  • 主成分分析显示,原创性、激进性和更新性是区分与高影响力创新相关专利的关键特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。