Skip to main content
QUICK REVIEW

[논문 리뷰] Actionable Guidance for High-Consequence AI Risk Management: Towards Standards Addressing AI Catastrophic Risks

Anthony M. Barrett, Dan Hendrycks|arXiv (Cornell University)|2022. 06. 17.
Ethics and Social Impacts of AI인용 수 8
한 줄 요약

이 논문은 고위험 AI 위험—특히 파국적 사회적 규모의 피해—를 관리하기 위한 실천 중심의 지침을 제공한다. NIST AI 위험 관리 프레임워크(AI RMF)를 구체적인 위험 관리 관행으로 번역함으로써, 악용 및 뜻하지 않은 사용을 식별하고, 파국적 위험 요소를 평가에 통합하며, 인권 침해를 완화하고, 위험 요소를 보고하는 데 대해 구체적인 권고안을 제시한다. 이는 AI 기준을 강화하고 체계적 AI 안전성에 대한 대화를 촉진하기 위한 것이다.

ABSTRACT

Artificial intelligence (AI) systems can provide many beneficial capabilities but also risks of adverse events. Some AI systems could present risks of events with very high or catastrophic consequences at societal scale. The US National Institute of Standards and Technology (NIST) has been developing the NIST Artificial Intelligence Risk Management Framework (AI RMF) as voluntary guidance on AI risk assessment and management for AI developers and others. For addressing risks of events with catastrophic consequences, NIST indicated a need to translate from high level principles to actionable risk management guidance. In this document, we provide detailed actionable-guidance recommendations focused on identifying and managing risks of events with very high or catastrophic consequences, intended as a risk management practices resource for NIST for AI RMF version 1.0 (released in January 2023), or for AI RMF users, or for other AI risk management guidance and standards as appropriate. We also provide our methodology for our recommendations. We provide actionable-guidance recommendations for AI RMF 1.0 on: identifying risks from potential unintended uses and misuses of AI systems; including catastrophic-risk factors within the scope of risk assessments and impact assessments; identifying and mitigating human rights harms; and reporting information on AI risk factors including catastrophic-risk factors. In addition, we provide recommendations on additional issues for a roadmap for later versions of the AI RMF or supplementary publications. These include: providing an AI RMF Profile with supplementary guidance for cutting-edge increasingly multi-purpose or general-purpose AI. We aim for this work to be a concrete risk-management practices contribution, and to stimulate constructive dialogue on how to address catastrophic risks and associated issues in AI standards.

연구 동기 및 목표

  • 고위험 AI 위험 원칙을 파급 효과가 큰 위험을 초래할 수 있는 실질적이고 실행 가능한 관행으로 번역하는 데 있어 빈도가 높은 격차를 메우기 위해.
  • NIST AI RMF 1.0을 지원하기 위해 고위험 위험에 특화된 구체적이고 실행 가능한 권고안을 제공하기 위해.
  • 기존의 AI 위험 및 영향 평가 프로세스에 파국적 위험 요소를 통합함으로써 위험 평가 프레임워크를 강화하기 위해.
  • AI 개발 및 배포 전반에서 파국적 위험 요소를 체계적으로 보고함으로써 AI 거버넌스를 강화하기 위해.
  • 향후 AI RMF 버전에서 일반 목적 및 다목적 AI 시스템을 대상으로 하여 표준화를 위한 길을 마련하기 위해.

제안 방법

  • NIST AI RMF 원칙을 특정하고 실행 가능한 위험 관리 관행으로 구현하기 위한 체계적인 방법론을 개발하였다.
  • 고급 AI 시스템으로부터 발생할 수 있는 의도하지 않은 사용, 악용, 체계적 사회적 피해와 같은 핵심 위험 유형을 식별하였다.
  • AI RMF 프레임워크 내에서 기존의 AI 위험 및 영향 평가 프로세스에 파국적 위험 요소를 통합하는 것을 제안하였다.
  • 고위험 AI 응용 분야에 중점을 두어 인권 영향 평가 지침을 제작하였다.
  • 파국적 잠재력을 지닌 위험 요소를 포함한 AI 위험 요소를 공개하는 보고 프레임워크를 도입하였다.
  • 향후 표준화를 안내하기 위해 최첨단 다목적 또는 일반 목적 AI 시스템을 대상으로 한 AI RMF 프로필을 제안하였다.

실험 결과

연구 질문

  • RQ1NIST AI RMF의 고위험 위험 원칙은 어떻게 실질적이고 실행 가능한 위험 관리 관행으로 번역될 수 있는가?
  • RQ2AI 개발 과정에서 체계적으로 식별하고 관리해야 할 파국적 사회적 결과를 초래할 수 있는 특정 위험 요소는 무엇인가?
  • RQ3위험 관리 프레임워크 내에서 AI 시스템의 악용 및 뜻하지 않은 사용을 사전에 평가하고 완화하는 방법은 무엇인가?
  • RQ4인권 영향 평가는 고위험 AI 위험을 관리하는 데 있어 어떤 역할을 해야 하는가?
  • RQ5AI 개발자 및 조직은 파국적 위험 요소를 효과적으로 보고하여 투명성과 책임성을 지원하기 위해 어떻게 해야 하는가?

주요 결과

  • 논문은 NIST AI RMF 프레임워크 내에서 파국적 AI 위험을 식별하고 관리하기 위한 포괄적인 실행 가능한 권고안을 제공한다.
  • 기존의 AI 위험 및 영향 평가에 파국적 위험 요소를 통합하는 명확한 길을 마련함으로써 체계적 위험 인식을 향상시켰다.
  • 고위험 사회적 영향을 지닌 위험 요소를 포함한 AI 위험 요소에 대한 체계적인 보고 지침을 제안함으로써 투명성을 강화하였다.
  • 일반 목적 및 다목적 AI 시스템을 대상으로 한 AI RMF 프로필을 제안하여 향후 표준화 노력에 기여하였다.
  • 체계적이고 고위험 영향을 지닌 위험을 다루는 데 실질적이고 근거 기반의 프레임워크를 제공함으로써 AI 위험 관리의 진화에 기여하였다.
  • 권고안은 NIST AI RMF 1.0의 최종 버전과 일치하며, 개발자와 규제 당국가 실용적 유용성을 높이기 위해 의도되어 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.