Skip to main content
QUICK REVIEW

[論文レビュー] Foundation models in brief: A historical, socio-technical focus

Johannes Schneider|arXiv (Cornell University)|Dec 17, 2022
Machine Learning and Data Classification被引用数 5
ひとこと要約

この論文は、AI分野における基盤的モデル(foundation models)を、スケーリング、文脈内学習の出現、社会的技術的影響という観点から変革的要因として提示する。従来のディープラーニングモデルとは、広範な適応性、AI開発の均質化、リソース集約的トレーニングという点で区別され、パワー集中、プライバシー、持続可能性に関するリスクが強調されている。

ABSTRACT

Foundation models can be disruptive for future AI development by scaling up deep learning in terms of model size and training data's breadth and size. These models achieve state-of-the-art performance (often through further adaptation) on a variety of tasks in domains such as natural language processing and computer vision. Foundational models exhibit a novel {emergent behavior}: {In-context learning} enables users to provide a query and a few examples from which a model derives an answer without being trained on such queries. Additionally, {homogenization} of models might replace a myriad of task-specific models with fewer very large models controlled by few corporations leading to a shift in power and control over AI. This paper provides a short introduction to foundation models. It contributes by crafting a crisp distinction between foundation models and prior deep learning models, providing a history of machine learning leading to foundation models, elaborating more on socio-technical aspects, i.e., organizational issues and end-user interaction, and a discussion of future research.

研究の動機と目的

  • 基盤的モデルと従来のディープラーニングモデルとの間の概念的違いを明確化すること。
  • 基盤的モデルに至るまでの機械学習の歴史的発展をたどること。
  • 組織的構造、エンドユーザーとのインタラクション、パワーのダイナミクスを含む社会的技術的側面を分析すること。
  • スケーラビリティ、ガバナンス、持続可能性に関連する主な課題と今後の研究方向性を特定すること。

提案手法

  • 初期のディープラーニングから現代のスケールの大きなアーキテクチャに至るまでの歴史的視点から、基盤的モデルを分析する。
  • 微調整なしにプロンプトからタスクを推論できる、文脈内学習のような出現的行動を検討する。
  • 少数の基盤的モデル、限定されたトレーニングデータソース、少数の企業による支配という3つの経路を通じた均質化を調査する。
  • 教師あり学習から自己教師付き事前学習へのシフトを評価し、BERTのマスクド言語モデリングを例に挙げる。
  • プライバシー侵害、著作権問題、計算およびデータの障壁によるアクセス制限といった社会的技術的リスクを評価する。
  • グリーンAIの原則(リユースとデータ/計算の削減)を含む、ガバナンスおよび持続可能性のフレームワークを提言する。

実験結果

リサーチクエスチョン

  • RQ1基盤的モデルは、技術的および概念的に、以前のディープラーニングモデルとどのように異なるか?
  • RQ2文脈内学習が、人間とAIの相互作用およびプロンプトベースのタスク実行に与える影響は何か?
  • RQ3モデルの均質化が、AI開発におけるパワー分配、イノベーション、アクセスに与える影響は何か?
  • RQ4基盤的モデルに関連する主な社会的技術的リスク(プライバシー、著作権、責任)は何か?
  • RQ5リソース集約的特性に対処し、持続可能なAI開発を促進するために必要な研究方向性は何か?

主な発見

  • 基盤的モデルは、自然言語プロンプトによるゼロショットタスク実行を可能にする出現的文脈内学習を示しており、明示的に学習されていない算術タスクに対しても機能する。
  • 数学的推論におけるパフォーマンスは限定的である—2桁の加算に対しては高い性能を示すが、3桁の演算では正答率が80%未満に低下する。
  • 少数の大規模モデル、データセット、企業プロバイダーへの依存を通じて均質化が進行しており、中央集権的管理とモデル多様性の低下を招いている。
  • 膨大な量のラベルなしデータに対する自己教師付き事前学習により、BERTがタスク固有の微調整なしにNLPタスクで広範な適用性を示したように、広範な下流適用が可能になる。
  • GPT-3のようなモデルのトレーニングには推定で数百万ドルのコストがかかるため、少数のリソースが豊富な組織にしかアクセスできない。
  • 基盤的モデルは、AI生成コンテンツの責任、知的財産権、AI発言における最初修正権の影響を含む、新たな法的・倫理的課題を提起する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。