Skip to main content
QUICK REVIEW

[论文解读] Who is leading in AI? An analysis of industry AI research

Ben Cottier, Tamay Besiroglu|arXiv (Cornell University)|Nov 24, 2023
Big Data and Business Intelligence被引用 4
一句话总结

本文利用出版物、引用次数、训练计算量(FLOPs)以及算法创新采纳情况,分析了2010至2023年间产业界对人工智能研究的贡献。研究发现,谷歌、OpenAI和Meta在所有指标上均处于领先地位,其中OpenAI在GPT-4训练中达到最大规模(2e25 FLOPs),而中国公司如腾讯和百度尽管出版物数量高,但人均引用影响力较低。

ABSTRACT

AI research is increasingly industry-driven, making it crucial to understand company contributions to this field. We compare leading AI companies by research publications, citations, size of training runs, and contributions to algorithmic innovations. Our analysis reveals the substantial role played by Google, OpenAI and Meta. We find that these three companies have been responsible for some of the largest training runs, developed a large fraction of the algorithmic innovations that underpin large language models, and led in various metrics of citation impact. In contrast, leading Chinese companies such as Tencent and Baidu had a lower impact on many of these metrics compared to US counterparts. We observe many industry labs are pursuing large training runs, and that training runs from relative newcomers -- such as OpenAI and Anthropic -- have matched or surpassed those of long-standing incumbents such as Google. The data reveals a diverse ecosystem of companies steering AI progress, though US labs such as Google, OpenAI and Meta lead across critical metrics.

研究动机与目标

  • 评估2010至2023年间主要产业参与者对人工智能研究的相对影响。
  • 从多个维度比较公司表现:出版物、引用次数、训练计算量(FLOPs)以及关键算法创新的采纳情况。
  • 探究尽管中国学术机构出版物数量更高,美国公司是否在研究影响力方面优于其中国同行。
  • 评估新进入者如OpenAI和Anthropic在推动计算规模扩展和创新方面的作用。
  • 提供一个全面的多指标基准,以理解工业界在人工智能领域的领导地位,支持人工智能政策与研究方向决策。

提出的方法

  • 使用OpenAlex收集2010–2023年间按公司隶属关系分类的AI/ML出版物与引用数据。
  • 从PCD(机器学习中的参数、计算与数据趋势)数据库收集训练计算数据,重点关注大规模训练运行的公开宣布FLOP数量。
  • 构建一个新型数据集,涵盖按训练计算量排名前十的大型语言模型所依赖的关键算法创新,识别每项创新最早发表的文献。
  • 追踪每项创新在前十名大型语言模型中的采纳频率,统计每项创新在这些模型中被使用的次数。
  • 应用引用分析评估人均研究影响力,计算每名作者的引用次数以比较研究产出与影响力。
  • 通过优先考虑某项技术最早应用于Transformer架构的记录,并仔细审查引用树与模型架构,处理创新归属中的模糊性。

实验结果

研究问题

  • RQ12010至2023年间,哪些公司在人工智能研究产出和引用影响力方面处于领先地位?
  • RQ2主要人工智能公司之间的训练计算规模(以FLOPs衡量)如何比较?其随时间的变化趋势如何?
  • RQ3谷歌、OpenAI和Meta等公司所提出的创新,在最大型语言模型架构中所起的作用有多大?
  • RQ4美国与中国的AI公司之间,人均研究影响力(每名作者的引用次数)有何差异?
  • RQ5新公司如OpenAI和Anthropic在计算规模扩展与创新采纳方面,与长期存在的行业巨头如谷歌相比如何?

主要发现

  • 谷歌和微软在2010至2023年期间出版物和引用次数总量领先,其中谷歌保持最高出版量。
  • OpenAI在GPT-4训练中实现了有记录以来最大的训练规模,估计达2e25 FLOPs,超过所有其他公司。
  • OpenAI、Meta和DeepMind在每篇出版物的引用次数以及每人作者的引用次数上均居首位,表明其研究影响力相对于产出水平较高。
  • 中国公司如腾讯和百度的人均引用次数显著偏低(例如,腾讯:12,百度:10),远低于美国同行如OpenAI(37)和DeepMind(47)。
  • 商汤科技是中国企业中的例外,实现37次人均引用,高于微软(26)但低于DeepMind(47)。
  • 美国公司的训练计算规模迅速扩展:谷歌的最大训练规模从2012年到2023年增长了1000万倍,而OpenAI和Meta各自在六年内实现了百万倍的扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。