Skip to main content
QUICK REVIEW

[논문 리뷰] Coordinated pausing: An evaluation-based coordination scheme for frontier AI developers

Jide Alaga, Jonas Schuett|arXiv (Cornell University)|2023. 09. 30.
Ethics and Social Impacts of AI인용 수 5
한 줄 요약

이 논문은 위험한 능력이 확장된 모델에서 감지될 경우 선도적인 AI 개발자들이 공동으로 연구를 일시 정지할 수 있도록 평가 기반의 조율 체계를 제안한다. 이 체계는 표준화된 평가, 실패 시 의무적 정지, 개발자 간 통보, 안전성 분석, 안전 기준을 충족한 후에만 재개하는 것을 포함하며, 잠재적인 AI 위험에 대응하기 위한 체계적이고 확장 가능한 대응 수단을 제공한다.

ABSTRACT

As artificial intelligence (AI) models are scaled up, new capabilities can emerge unintentionally and unpredictably, some of which might be dangerous. In response, dangerous capabilities evaluations have emerged as a new risk assessment tool. But what should frontier AI developers do if sufficiently dangerous capabilities are in fact discovered? This paper focuses on one possible response: coordinated pausing. It proposes an evaluation-based coordination scheme that consists of five main steps: (1) Frontier AI models are evaluated for dangerous capabilities. (2) Whenever, and each time, a model fails a set of evaluations, the developer pauses certain research and development activities. (3) Other developers are notified whenever a model with dangerous capabilities has been discovered. They also pause related research and development activities. (4) The discovered capabilities are analyzed and adequate safety precautions are put in place. (5) Developers only resume their paused activities if certain safety thresholds are reached. The paper also discusses four concrete versions of that scheme. In the first version, pausing is completely voluntary and relies on public pressure on developers. In the second version, participating developers collectively agree to pause under certain conditions. In the third version, a single auditor evaluates models of multiple developers who agree to pause if any model fails a set of evaluations. In the fourth version, developers are legally required to run evaluations and pause if dangerous capabilities are discovered. Finally, the paper discusses the desirability and feasibility of our proposed coordination scheme. It concludes that coordinated pausing is a promising mechanism for tackling emerging risks from frontier AI models. However, a number of practical and legal obstacles need to be overcome, especially how to avoid violations of antitrust law.

연구 동기 및 목표

  • 선도적인 AI 모델이 확장 과정에서 위험한 능력이 발생할 경우 체계적인 대응 절차가 부족한 문제를 해결하기 위해.
  • AI 모델을 확장함에 있어 의도하지 않은 고위험 행동(예: 조작, 사이버 침해, 자율적 복제 등)을 유발할 수 있다는 점에 대한 우려에 대응하기 위해.
  • 여러 개발자가 위험한 능력을 감지했을 때 단합된 행동을 할 수 있도록 실현 가능하고 확장 가능한 조율 메커니즘을 개발하기 위해.
  • 공동 정지 조치를 시행할 수 있는 실용적이고 법적 경로를 탐색하여 반경쟁법 위반을 피하기 위해.
  • 안전 평가를 AI 개발 생애주기 내에 통합할 수 있는 프레임워크를 제공하고, 평가 결과에 따라 연구 일시 정지 및 재개의 명확한 트리거를 설정하기 위해.

제안 방법

  • 다섯 단계 평가 기반 조율 체계를 구현한다: (1) 위험한 능력에 대해 선도 모델을 평가하고, (2) 어떤 모델이라도 실패하면 개발을 일시 정지하며, (3) 다른 개발자들에게 통보하고, (4) 위험을 분석하고 안전 조치를 시행하며, (5) 안전 기준을 충족한 후에만 재개한다.
  • 체계의 네 가지 버전을 제안한다: 자발적 공공 압력, 공동 합의, 제3자 감사, 법적 의무 이행.
  • 기존의 위험한 능력 평가(예: 권력 획득 행동에 대한 평가)를 기반으로 하되, 새로운 표준화된 평가 개발을 촉구한다.
  • 위험 평가 기반으로 안전 기준을 설정하여 언제 정지를 시작하고 언제 재개할 수 있는지를 정의한다.
  • 기존 법률에 근거한 법적 타당성을 검토하여, 예를 들어 미국 방위생산법 제708조에 근거한 안전 보호 조항을 탐색한다.
  • 애널리틱스의 책임 있는 확장 정책과 ARC Evals의 프레임워크를 모델로 삼아 각 연구소 내부의 대응 정책을 장려한다.
Figure 1: The main steps of our proposed evaluation-based coordination scheme
Figure 1: The main steps of our proposed evaluation-based coordination scheme

실험 결과

연구 질문

  • RQ1선도적인 AI 개발자들이 한 모델에서 위험한 능력을 감지했을 때 어떻게 공동으로 개발을 일시 정지할 수 있는가?
  • RQ2공동 정지 조치를 구현하기 위해 가장 실현 가능하고 바람직한 제도적 형태는 무엇인가?
  • RQ3특히 반경쟁법 관련 우려를 포함한 주요 법적 및 실무적 장애물은 무엇인가?
  • RQ4위험한 능력에 대한 신뢰할 수 있고 표준화된 평가를 어떻게 개발하고 검증할 수 있는가?
  • RQ5개발 일시 정지 및 재개의 결정을 내리는 데 사용할 안전 기준은 무엇이어야 하는가?

주요 결과

  • 공동 정지는 선도적인 AI 모델이 잠재적인 위험 능력을 보일 경우, 특히 자율적 복제나 자율적 목표 추구 능력이 감지될 경우, 잠재적 위험을 완화하는 데 효과적인 수단으로 여겨진다.
  • 설문 조사한 전문가 다수(98%)가 AI 연구소가 위험한 능력 평가를 실시해야 한다고 동의했으며, 93%는 이러한 위험이 발견될 경우 개발을 일시 정지해야 한다고 지지했다.
  • 제안된 체계는 네 가지 별도의 모델로 구현될 수 있다: 자발적 공공 압력, 공동 합의, 제3자 감사, 법적 의무 이행.
  • 기존의 위험한 능력 평가(예: 권력 획득 행동에 대한 평가)는 제한적이지만, 향후 개발을 위한 기초 자료로 기능한다.
  • 법적 우려, 특히 반경쟁법 관련 문제는 여전히 주요 장애물이지만, 미국 방위생산법에 근거한 안전 보호 조항 등 잠재적 해결 경로가 존재한다.
  • 이 프레임워크는 집단적 조율과 각 연구소 내부의 대응 정책을 동시에 요구하며, 평가 결과에 따라 명확한 정지 및 재개 트리거를 설정한다.
Figure 2: Collective pausing agreement (a) and individual pausing agreements with a third party (b)
Figure 2: Collective pausing agreement (a) and individual pausing agreements with a third party (b)

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.