Skip to main content
QUICK REVIEW

[論文レビュー] Who is leading in AI? An analysis of industry AI research

Ben Cottier, Tamay Besiroglu|arXiv (Cornell University)|Nov 24, 2023
Big Data and Business Intelligence被引用数 4
ひとこと要約

この論文は、2010年から2023年までのAI研究における産業界の貢献を、出版物、被引用回数、トレーニング計算量(FLOPs)、アルゴリズム的イノベーションの採用に基づいて分析している。Google、OpenAI、Metaが全指標でリードしており、OpenAIはGPT-4のトレーニングで2e25 FLOPsという記録的な計算量を達成している。一方、騰訊(Tencent)やバイドゥ(Baidu)といった中国企業は、高い出版量を誇るが、研究者1人あたりの被引用回数は低く抑えられている。

ABSTRACT

AI research is increasingly industry-driven, making it crucial to understand company contributions to this field. We compare leading AI companies by research publications, citations, size of training runs, and contributions to algorithmic innovations. Our analysis reveals the substantial role played by Google, OpenAI and Meta. We find that these three companies have been responsible for some of the largest training runs, developed a large fraction of the algorithmic innovations that underpin large language models, and led in various metrics of citation impact. In contrast, leading Chinese companies such as Tencent and Baidu had a lower impact on many of these metrics compared to US counterparts. We observe many industry labs are pursuing large training runs, and that training runs from relative newcomers -- such as OpenAI and Anthropic -- have matched or surpassed those of long-standing incumbents such as Google. The data reveals a diverse ecosystem of companies steering AI progress, though US labs such as Google, OpenAI and Meta lead across critical metrics.

研究の動機と目的

  • 2010年から2023年までの主要な産業界プレーヤーのAI研究への相対的影響を評価すること。
  • 出版物、被引用回数、トレーニング計算量(FLOPs)、主要なアルゴリズム的イノベーションの採用という複数の次元で企業を比較すること。
  • 中国の大学機関の出版量が高水準であるにもかかわらず、米国企業が中国企業を上回る研究インパクトを示しているかどうかを調査すること。
  • OpenAI や Anthropic のような新興企業が、計算量のスケーリングとイノベーションの推進に果たす役割を評価すること。
  • AI政策や研究方針の意思決定を支援するため、産業界のAIリーダーシップを包括的かつ多指標で評価するベンチマークを提供すること。

提案手法

  • 2010年から2023年までのAI/ML関連の出版物と被引用回数を、OpenAlexを用いて企業の所属別に収集した。
  • 大規模なトレーニングランのFLOP数を公表したデータに基づき、PCD(Parameter, Compute and Data Trends in Machine Learning)データベースからトレーニング計算量のデータを収集した。
  • 大規模言語モデル(LM)で最も計算量の大きい10モデルの背後にある主要なアルゴリズム的イノベーションを特定し、各イノベーションを導入した最初の出版物を同定する、新しいデータセットを構築した。
  • 各イノベーションが、これらの10大モデル内でどれだけの頻度で採用されたかを追跡し、各イノベーションが何回使用されたかを数えた。
  • 研究者1人あたりの影響力を評価するため、被引用回数分析を実施し、被引用回数/研究者数を計算した。
  • イノベーションの帰属に曖昧さがある場合、変換アーキテクチャへの最初の適用を優先し、引用ツリーとモデルアーキテクチャの詳細なレビューを通じて、適切な帰属を確保した。

実験結果

リサーチクエスチョン

  • RQ12010年から2023年までの間、どの企業がAI研究の生産性と被引用インパクトでリードしていたか?
  • RQ2主なAI企業間で、トレーニング計算量(FLOPsで測定)はどのように比較されるか。また、時間経過とともにどのように変化したか?
  • RQ3Google、OpenAI、Meta が開発したイノベーションは、最大の言語モデルのアーキテクチャにどの程度組み込まれていたか?
  • RQ4米国企業と中国企業の研究者1人あたりの研究インパクト(被引用回数/研究者)は、どのように比較されるか?
  • RQ5OpenAI や Anthropic のような新興企業は、Google や他の長年のプレーヤーと比較して、計算量スケーリングとイノベーション採用の面で、どのように差をつけていたか?

主な発見

  • Google と Microsoft が 2010 年から 2023 年にかけて、出版物と被引用回数の両方でリードしており、特に Google が最も高い出版量を維持した。
  • OpenAI は GPT-4 のトレーニングで、記録的な 2e25 FLOPs の計算量を達成し、他社を上回った。
  • OpenAI、Meta、DeepMind は、出版物1件あたりの被引用回数と研究者1人あたりの被引用回数が最も高く、出力に比して強い研究インパクトを示した。
  • 中国企業の騰訊(Tencent)やバイドゥ(Baidu)は、研究者1人あたりの被引用回数が顕著に低く、それぞれ 12 と 10 であったのに対し、米国企業の OpenAI(37)や DeepMind(47)は顕著に高い水準を維持した。
  • センスタイム(SenseTime)は中国企業の中でも例外的で、研究者1人あたり 37 の被引用回数を記録した。これはマイクロソフト(26)を上回ったが、DeepMind(47)には及ばなかった。
  • 米国企業におけるトレーニング計算量のスケーリングは急速に進展した。Google の最大トレーニングランは 2012 年から 2023 年にかけて 1000 万倍に拡大した。一方、OpenAI と Meta はそれぞれ 6 年間で 100 万倍に拡大した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。