[논문 리뷰] Foundation models in brief: A historical, socio-technical focus
이 논문은 인공지능 분야에서 기초 모델을 전환적 요소로 도입하며, 그 규모, 임베디드 컨텍스트 학습의 부상, 사회기술적 영향을 강조한다. 이들은 이전의 딥러닝 모델들과는 달리 광범위한 적응 가능성, AI 개발의 동질화, 자원 집약적인 훈련을 특징으로 하며, 권력 집중, 개인정보 보호, 지속 가능성과 같은 위험 요소를 제기한다.
Foundation models can be disruptive for future AI development by scaling up deep learning in terms of model size and training data's breadth and size. These models achieve state-of-the-art performance (often through further adaptation) on a variety of tasks in domains such as natural language processing and computer vision. Foundational models exhibit a novel {emergent behavior}: {In-context learning} enables users to provide a query and a few examples from which a model derives an answer without being trained on such queries. Additionally, {homogenization} of models might replace a myriad of task-specific models with fewer very large models controlled by few corporations leading to a shift in power and control over AI. This paper provides a short introduction to foundation models. It contributes by crafting a crisp distinction between foundation models and prior deep learning models, providing a history of machine learning leading to foundation models, elaborating more on socio-technical aspects, i.e., organizational issues and end-user interaction, and a discussion of future research.
연구 동기 및 목표
- 기초 모델과 이전의 딥러닝 모델 간 개념적 차이를 명확히 하기 위해.
- 기초 모델로 이르는 기계학습의 역사적 발전 과정을 추적하기 위해.
- 조직 구조, 최종 사용자 상호작용, 권력 다이나믹스를 포함한 사회기술적 차원을 분석하기 위해.
- 확장성, 거버넌스, 지속 가능성과 관련된 주요 과제와 향후 연구 방향을 규명하기 위해.
제안 방법
- 기초 모델을 역사적 관점에서 분석하여, 초기 딥러닝에서 현대의 대규모 아키텍처로 이르는 유전적 배경을 추적한다.
- 프롬프트를 통한 태스크 추론 능력인 컨텍스트 기반 학습과 같은 부상하는 행동을 분석한다. 이는 미세조정 없이도 태스크를 인식할 수 있다.
- 세 가지 길을 통해 동질화를 조사한다: 소수의 기초 모델에 의존하는 것, 제한된 훈련 데이터 소스, 몇몇 기업에 의한 통제.
- 지도 학습에서 자기지도 사전 훈련으로의 전환을 평가하며, BERT의 마스킹 언어 모델링을 사례로 제시한다.
- 개인정보 침해, 저작권 문제, 계산 및 데이터 접근 장벽으로 인한 접근 제한과 같은 사회기술적 위험을 평가한다.
- 녹색 AI 원칙, 예를 들어 자원 재사용 및 데이터/계산 자원 감소를 포함한 거버넌스 및 지속 가능성 프레임워크를 제안한다.
실험 결과
연구 질문
- RQ1기초 모델은 이전의 딥러닝 모델과 기술적·개념적으로 어떻게 다릅니까?
- RQ2컨텍스트 기반 학습은 인간-AI 상호작용과 프롬프트 기반 작업 실행에 어떤 영향을 미칩니까?
- RQ3모델의 동질화가 AI 개발의 권력 분포, 혁신, 접근성에 어떤 영향을 미칩니까?
- RQ4기초 모델과 관련된 주요 사회기술적 위험 요소는 무엇이며, 개인정보 보호, 저작권, 책임 문제를 포함합니까?
- RQ5자원 집약적인 문제를 해결하고 지속 가능한 AI 개발을 촉진하기 위해 어떤 연구 방향이 필요합니까?
주요 결과
- 기초 모델은 임베디드 컨텍스트 학습을 보이며, 자연어 프롬프트를 통해 사전 훈련 없이도 제로샷 태스크 실행이 가능하다. 이는 명시적으로 훈련되지 않은 산술 작업조차도 가능하다.
- 수학적 추론 능력은 여전히 제한되어 있다. 두 자리 수 덧셈에서는 높은 성능를 보이지만, 세 자리 수 연산에서는 정확도가 80% 이하로 떨어진다.
- 소수의 대규모 모델, 데이터셋, 기업 제공자에 의존함으로써 동질화가 진행되고 있으며, 이는 중앙집중화된 통제와 함께 모델 다양성 감소를 초래한다.
- 거대한 비라벨 데이터에 대한 자기지도 사전 훈련은 BERT가 태스크 특화 미세조정 없이도 자연어 처리 작업 전반에서 성공을 거두었듯이 광범위한 후행 적용 가능성을 제공한다.
- GPT-3와 같은 모델의 훈련은 수백만 달러에 달하는 비용이 들며, 이는 오직 자원이 풍부한 소수의 기관에만 접근 가능하게 한다.
- 기초 모델은 책임 소재, 지적 재산권, AI 발언의 첫 수정권 관련 법적 및 윤리적 도전 과제를 야기한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.