Skip to main content
QUICK REVIEW

[论文解读] Topics, Authors, and Institutions in Large Language Model Research: Trends from 17K arXiv Papers

Rajiv Movva, Sidhika Balachandar|arXiv (Cornell University)|Jul 20, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本研究分析了 16,979篇与大语言模型(LLM)相关的arXiv论文(2018–2023年),以追踪主题、作者和机构的趋势。研究发现,社会影响研究显著增长,2023年有50%的新作者来自非自然语言处理(NLP)领域,产业界论文占比下降(尤其是谷歌),且美国与中国机构之间出现明显分裂,跨国合作极少,尽管产业界与学术界在重叠主题上保持活跃合作。

ABSTRACT

Large language models (LLMs) are dramatically influencing AI research, spurring discussions on what has changed so far and how to shape the field's future. To clarify such questions, we analyze a new dataset of 16,979 LLM-related arXiv papers, focusing on recent trends in 2023 vs. 2018-2022. First, we study disciplinary shifts: LLM research increasingly considers societal impacts, evidenced by 20x growth in LLM submissions to the Computers and Society sub-arXiv. An influx of new authors -- half of all first authors in 2023 -- are entering from non-NLP fields of CS, driving disciplinary expansion. Second, we study industry and academic publishing trends. Surprisingly, industry accounts for a smaller publication share in 2023, largely due to reduced output from Google and other Big Tech companies; universities in Asia are publishing more. Third, we study institutional collaboration: while industry-academic collaborations are common, they tend to focus on the same topics that industry focuses on rather than bridging differences. The most prolific institutions are all US- or China-based, but there is very little cross-country collaboration. We discuss implications around (1) how to support the influx of new authors, (2) how industry trends may affect academics, and (3) possible effects of (the lack of) collaboration.

研究动机与目标

  • 了解2018年至2023年间大语言模型研究主题、作者背景和机构角色的演变。
  • 考察大语言模型研究在自然语言处理(NLP)之外的学科扩展,特别是来自计算机视觉和安全等领域的新作者的参与。
  • 评估产业界与学术界出版趋势的变化,尤其在大语言模型能力提升和保密性担忧加剧的背景下。
  • 研究机构合作的模式,包括跨国合作与产业-学术合作。
  • 评估这些趋势对大语言模型未来发展、公平性与合作的影响。

提出的方法

  • 使用元数据、主题标签、作者隶属关系和引用次数,收集并分析了2018年1月至2023年9月间16,979篇与大语言模型相关的arXiv论文。
  • 采用分层分类法为论文标注主题标签,以追踪主题随时间的流行度变化。
  • 将“新作者”定义为此前未在arXiv上以共同作者身份发表过NLP相关论文的作者,并分析其子arXiv类别与主题分布。
  • 追踪机构、国家和部门(产业界 vs. 学术界)的论文发表份额,重点关注2023年的趋势。
  • 构建20家最活跃机构之间的合作网络,以评估地理和部门层面的聚类现象。
  • 应用卡方检验等统计方法,识别新作者与资深作者在主题和子arXiv分布上的显著差异。

实验结果

研究问题

  • RQ12018–2022年与2023年相比,大语言模型文献中的主导研究主题有何变化,特别是在社会影响和非NLP应用方面?
  • RQ22023年新大语言模型作者中,来自非NLP子领域的比例是多少?他们的主题偏好与资深作者有何不同?
  • RQ32023年,产业界与学术界机构的论文发表份额发生了怎样的变化?产业界产出下降的原因是什么?
  • RQ4产业-学术合作在弥合学科或地理差异方面发挥了多大作用?还是仅强化了现有的主题与机构聚类?
  • RQ5机构合作模式如何反映出大语言模型研究中美之间的分裂?这对全球人工智能发展有何影响?

主要发现

  • 2023年,计算机与社会(Computers and Society)子arXiv的LLM论文提交量增长了20倍,表明研究重点向社会影响方向发生重大转变。
  • 2023年,50%的首作者和38.6%的末作者为首次涉足NLP领域,其中许多来自计算机视觉、安全和软件工程领域。
  • 产业界在LLM论文中的份额从2023年前的19.3%下降至2023年的13.0%,谷歌的产出显著下滑,表明产业界整体开放度下降的趋势。
  • 2023年,亚洲学术机构的论文发表份额上升,尽管产业-学术合作仍较普遍,但主要集中于产业界已优先关注的主题。
  • 20家最活跃的机构均位于美国或中国,且合作几乎全部为国内合作,微软是唯一跨越两国的大型例外。
  • 产业与学术界联合发表的论文高度集中于效率和模型性能等主题,而非社会或伦理议题,表明研究优先级的融合有限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。