Skip to main content
QUICK REVIEW

[論文レビュー] Topics, Authors, and Institutions in Large Language Model Research: Trends from 17K arXiv Papers

Rajiv Movva, Sidhika Balachandar|arXiv (Cornell University)|Jul 20, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本研究は、2018年から2023年までの16,979編のLLM関連arXiv論文を分析し、研究分野、著者、機関の動向を追跡した。研究では、社会的影響に関する研究の急増、2023年に50%にのぼる新規のNLP以外の分野の著者の流入、特にGoogleを含む大手企業の発表数の減少、米国・中国の機関間の亀裂が顕著で、国境を越えた協力は限定的であることが明らかになったが、重複する分野に注力した産学連携は活発である。

ABSTRACT

Large language models (LLMs) are dramatically influencing AI research, spurring discussions on what has changed so far and how to shape the field's future. To clarify such questions, we analyze a new dataset of 16,979 LLM-related arXiv papers, focusing on recent trends in 2023 vs. 2018-2022. First, we study disciplinary shifts: LLM research increasingly considers societal impacts, evidenced by 20x growth in LLM submissions to the Computers and Society sub-arXiv. An influx of new authors -- half of all first authors in 2023 -- are entering from non-NLP fields of CS, driving disciplinary expansion. Second, we study industry and academic publishing trends. Surprisingly, industry accounts for a smaller publication share in 2023, largely due to reduced output from Google and other Big Tech companies; universities in Asia are publishing more. Third, we study institutional collaboration: while industry-academic collaborations are common, they tend to focus on the same topics that industry focuses on rather than bridging differences. The most prolific institutions are all US- or China-based, but there is very little cross-country collaboration. We discuss implications around (1) how to support the influx of new authors, (2) how industry trends may affect academics, and (3) possible effects of (the lack of) collaboration.

研究の動機と目的

  • 2018年から2023年までのLLM研究分野、著者の背景、機関の役割の変化を理解すること。
  • 特に、コンピュータビジョンやセキュリティなどの分野から新たに参入した著者を通じて、LLM研究のNLPを超えた分野への拡大を検討すること。
  • LLMの能力向上や機密性の懸念が高まる中で、産業界と学術界の発表傾向の変化を評価すること。
  • 産学連携のパターンを調査し、国境を越えた連携や産学連携の関係を分析すること。
  • これらの動向が、将来的なLLM開発における研究、公平性、協力のあり方に与える影響を評価すること。

提案手法

  • 2018年1月から2023年9月までの16,979編のLLM関連arXiv論文を、メタデータ、トピックラベル、著者所属、引用回数などを用いて収集・分析した。
  • 階層的分類体系を用いて論文にトピックラベルを付与し、時間経過に伴うトピックの人気度の変化を追跡可能にした。
  • 「新規著者」として、arXiv上でNLP関連論文の共同著者としての経歴のない著者を定義し、そのサブ-arXivおよびトピック分布を分析した。
  • 機関、国、セクター(産業界 vs. 学術界)ごとの発表数の割合を追跡し、2023年の動向に焦点を当てた。
  • 最多発表機関20機関間の協力ネットワークを構築し、地理的・セクター的クラスタリングの程度を評価した。
  • カイ二乗検定などの統計的検定を用いて、新規著者と経験豊富な著者の間で、トピックおよびサブ-arXiv分布に顕著な差が認められるかを同定した。

実験結果

リサーチクエスチョン

  • RQ12018年から2022年までのLLM研究分野の主なトピックが2023年にどのように変化したか、特に社会的影響やNLP以外の応用分野について。
  • RQ22023年に登場したLLM研究の新規著者のうち、非NLP分野からの割合はどの程度で、そのトピックの好みは経験豊富な著者とどのように異なるか。
  • RQ32023年に産業界と学術界のLLM論文発表数の割合にどのような変化が見られ、大手テック企業の発表数減少の背景には何があるか。
  • RQ4産学連携は、分野的・地理的格差を是正するのか、それとも既存のトピックや機関のクラスタを強化するのか。
  • RQ5機関間の協力パターンは、LLM研究における米国・中国の亀裂をどのように反映しており、グローバルAI開発にどのような影響を及えるか。

主な発見

  • コンピュータと社会(Computers and Society)のサブ-arXivでは、2023年にLLM関連論文の提出が20倍に増加し、社会的影響への研究分野のシフトが顕著に表れた。
  • 2023年には、LLM論文の第一著者49.5%、最終著者38.6%がNLP経験のない新規著者であり、多くの著者がコンピュータビジョン、セキュリティ、ソフトウェア工学分野から参入した。
  • 産業界のLLM論文発表数の割合は、2023年以前の19.3%から13.0%に低下し、特にGoogleの発表数が著しく減少した。これは、産業界全体の開示姿勢の低下という広範な傾向を示している。
  • 2023年、アジアの学術機関の発表数割合が上昇したが、産学連携は一般的に継続しているものの、既に産業界が重視している分野に偏っている。
  • 最多発表機関20機関はすべて米国または中国に所在しており、協力関係はほぼ完全に国内内に限定されている。Microsoftを除き、両地域をつなぐ主要機関は存在しない。
  • 産業界と学術界が共同で発表した論文は、主に効率性やモデル性能といった分野に集中しており、社会的・倫理的問題にはあまり注力していない。これは、研究の優先順位に横断的ブリッジがほとんどないことを示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。