Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Publicly Accountable Frontier LLMs: Building an External Scrutiny Ecosystem under the ASPIRE Framework

Markus Anderljung, Everett Thornton Smith|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 외부 감시를 체계화하기 위해 접근성(접근성), 검색 태도, 위험 비례성, 독립성, 자원, 전문성의 여섯 가지 요소로 구성된 ASPIRE 프레임워크를 제안한다. 이는 선도적 대규모 언어 모델(LLM)에 대한 외부 감시를 통해 공적 책임을 강화하고자 한다. 민주화된 신뢰할 수 있는 평가가 감사사, 연구자, 시민사회 등 외부 주체들에 의해 이루어져야 한다고 주장하며, 인공지능 생명주기 전반에 걸친 체계적 감시가 강력한 인공지능 시스템의 체계적 위험을 줄이고 거버넌스를 향상시킬 수 있음을 설명한다.

ABSTRACT

With the increasing integration of frontier large language models (LLMs) into society and the economy, decisions related to their training, deployment, and use have far-reaching implications. These decisions should not be left solely in the hands of frontier LLM developers. LLM users, civil society and policymakers need trustworthy sources of information to steer such decisions for the better. Involving outside actors in the evaluation of these systems - what we term 'external scrutiny' - via red-teaming, auditing, and external researcher access, offers a solution. Though there are encouraging signs of increasing external scrutiny of frontier LLMs, its success is not assured. In this paper, we survey six requirements for effective external scrutiny of frontier AI systems and organize them under the ASPIRE framework: Access, Searching attitude, Proportionality to the risks, Independence, Resources, and Expertise. We then illustrate how external scrutiny might function throughout the AI lifecycle and offer recommendations to policymakers.

연구 동기 및 목표

  • 위상적 사회적 위험(예: 가짜 뉴스, 감시, 악용 등)으로 인해 선도적 LLM 개발의 공적 책임이 점점 더 필요로 하고 있음을 다루기 위해.
  • 개발자들이 위험 평가를 담당할 경우 이해관계 충돌과 정보 비대칭 문제로 인해 단지 개발자 의존에 한계가 있음을 밝히기 위해.
  • 독립된 주체들이 효과적이고 신뢰할 수 있는 외부 감시를 수행할 수 있도록 하는 체계적 거버넌스 프레임워크인 ASPIRE를 제안하기 위해.
  • 정책 입안자들이 외부 감시가 체계적이고 자원이 충분하며 규제 및 감독에 영향을 줄 수 있도록 하는 메커니즘을 설계하는 데 도움을 주기 위해.
  • 연구자, 시민사회, 감사사 등 다양한 이해관계자가 선도적 AI 시스템의 평가 및 설계에 기여할 수 있도록 AI 거버넌스의 민주화를 촉진하기 위해.

제안 방법

  • 접근성, 검색 태도, 위험 비례성, 독립성, 자원, 전문성의 여섯 가지 차원으로 구성된 거버넌스 도구로서 ASPIRE 프레임워크를 개발하기 위해.
  • 감시에 핵심적인 정보 유형을 분류하고 분석하기 위해: 모델 능력, 제어 가능성, 영향, 모델 가중치, 내부 구조, 훈련 데이터, 시스템 구성 요소, 제3자 영향 데이터.
  • 안전성과 투명성의 균형을 고려해 API 기반의 기본 모델 및 메타데이터 접근 방식을 포함한 계층적 접근 모델을 제안하기 위해.
  • 실제 영향(예: 가짜 뉴스)을 연구하기 위해 제3자(예: 소셜미디어 플랫폼)와의 개인정보 보호 기반 데이터 공유 메커니즘을 제안하기 위해.
  • 훈련 데이터, 컴퓨팅 자원, 테스트 결과 등의 메타정보를 표준화된 방식으로 공유하기 위해 모델 카드와 시스템 카드를 통합하기 위해.
  • 개발, 배포, 배포 후 단계를 포함한 인공지능 생명주기 전반에 걸쳐 빨간팀 훈련, 감사, 독립적 연구를 통해 외부 감시를 지속적 과정으로 프레임워크화하기 위해.
Towards Publicly Accountable Frontier LLMs: Building an External Scrutiny Ecosystem under the ASPIRE Framework

실험 결과

연구 질문

  • RQ1어떻게 외부 감시를 체계화하여 선도적 LLM 개발의 공적 책임을 확보할 수 있는가?
  • RQ2외부 주체들이 선도적 LLM을 의미 있게 평가하기 위해 필요한 특정 정보 유형과 접근 수준는 무엇인가?
  • RQ3개발자 제공 위험 평가에서 발생하는 정보 비대칭성과 은폐 경향을 어떻게 극복할 수 있는가?
  • RQ4외부 감시가 독립적이고 자원이 충분하며 기술적으로 가능하도록 하기 위해 필요한 구조적 및 절차적 보호 조치는 무엇인가?
  • RQ5외부 감시는 정책 결정에 어떻게 기여하고 선도적 LLM의 안전성 및 사회적 영향을 어떻게 향상시킬 수 있는가?

주요 결과

  • 빨간팀 훈련, 감사, 독립적 연구를 포함한 외부 감시는 개발자 주장의 진위를 검증하고 개발자가 간과하거나 숨길 수 있는 위험을 드러내기 위해 필수적이다.
  • 기본 모델, 모델 패밀리, 내부 구조, 훈련 데이터, 시스템 구성 요소에의 접근은 모델 행동, 능력, 고장 양상에 대한 깊은 이해를 가능하게 한다.
  • ASPIRE 프레임워크는 위험 비례성에 비례하고 독립성과 전문성에 기반한 효과적인 외부 감시 시스템 설계를 위한 종합적이고 실행 가능한 구조를 제공한다.
  • 심지어 잘 설계된 감시도 모든 위험을 식별하지 못하며, 그 영향력은 실제 의사결정에 영향을 주는 데 달려 있다. 이는 감시 외에도 더 넓은 제도적 장치가 필요함을 시사한다.
  • 특히 소셜미디어 기업과 같은 플랫폼과의 제3자 데이터 공유가 가짜 뉴스와 같은 실제 영향을 평가하는 데 필수적이지만, 개인정보 보호 기반 메커니즘이 필요하다.
  • 모델 카드와 시스템 카드는 투명성 향상에 유용한 도구이지만, 확산 및 악용 위험을 고려해 공개 가능성과의 균형을 맞춰야 한다.
Towards Publicly Accountable Frontier LLMs: Building an External Scrutiny Ecosystem under the ASPIRE Framework

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.