Skip to main content
QUICK REVIEW

[논문 리뷰] Auditing large language models: a three-layered approach

Jakob Mökander, Jonas Schuett|arXiv (Cornell University)|2023. 02. 16.
Natural Language Processing Techniques인용 수 5
한 줄 요약

이 논문은 기술 제공자, 모델, 응용 프로그램 수준에서의 감사 기반으로 구성된 세 층 구조의 감사 프레임워크를 제안한다. 이는 기술 제공자에 대한 거버넌스 감사, 사전 훈련 후, 출시 전의 모델 감사, 그리고 하류 응용 프로그램에 대한 감사로 이루어지며, 기술적, 윤리적, 법적 차원에서 위험을 조율되고 실현 가능하며 효과적으로 식별할 수 있도록 한다. 이는 LLM의 잠재적 위험을 관리하기 위한 이해관계자들을 위한 체계적인 도구상자를 제공한다.

ABSTRACT

Large language models (LLMs) represent a major advance in artificial intelligence (AI) research. However, the widespread use of LLMs is also coupled with significant ethical and social challenges. Previous research has pointed towards auditing as a promising governance mechanism to help ensure that AI systems are designed and deployed in ways that are ethical, legal, and technically robust. However, existing auditing procedures fail to address the governance challenges posed by LLMs, which display emergent capabilities and are adaptable to a wide range of downstream tasks. In this article, we address that gap by outlining a novel blueprint for how to audit LLMs. Specifically, we propose a three-layered approach, whereby governance audits (of technology providers that design and disseminate LLMs), model audits (of LLMs after pre-training but prior to their release), and application audits (of applications based on LLMs) complement and inform each other. We show how audits, when conducted in a structured and coordinated manner on all three levels, can be a feasible and effective mechanism for identifying and managing some of the ethical and social risks posed by LLMs. However, it is important to remain realistic about what auditing can reasonably be expected to achieve. Therefore, we discuss the limitations not only of our three-layered approach but also of the prospect of auditing LLMs at all. Ultimately, this article seeks to expand the methodological toolkit available to technology providers and policymakers who wish to analyse and evaluate LLMs from technical, ethical, and legal perspectives.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)의 잠재적이고 일반적인 능력을 고려하지 못하는 기존 감사 관행의 격차를 해소하기 위해.
  • 모델 개발 및 배포 단계에서의 위험을 다루기 위해 응용 수준 감사에 보완이 되는 거버넌스 메커니즘을 개발하기 위해.
  • 기초 모델 및 LLMs가 유발하는 고유한 과제에 맞게 조율되고 실현 가능한 감사 접근법을 체계화하기 위해.
  • 기술 제공자, 정책 입안자, 감사 기관이 LLM을 기술적, 윤리적, 법적 관점에서 평가하기 위한 실용적인 블루프린트를 제공하기 위해.
  • LLM 맥락에서 감사가 거버넌스 도구로서의 역할에 대해 제한점을 인정하고 논의하여 현실적인 기대를 설정하기 위해.

제안 방법

  • AI 감사, 공정성, 투명성, 언어 모델 등과 관련된 关련 키워드를 사용하여 Google Scholar, Scopus, SSRN, Web of Science, arXiv 등 다섯 개의 데이터베이스에서 체계적인 문헌 리뷰를 수행하였다.
  • 포함된 연구의 인용문을 분석하여 비학술적 감사 절차를 식별하기 위해 스노우볼링 기법을 활용하여 학술 자료 외부의 커버리지 확장을 도모하였다.
  • 위험/준수, 내부/외부, 사전/사후, 功能성/코드/영향 감사 등의 차원을 기반으로 감사 절차의 유형 체계를 수립하였다.
  • LLM 전용 거버넌스 과제와 기존 감사 수단 간의 격차 분석을 수행하여 효과적인 LLM 감사에 필요한 여섯 가지 핵심 설계 주장 도출.
  • 모든 주요 위험을 커버하고, 구현 가능하며, 비용 효율적인 절차를 선택하여 최소화된 효과적인 감사 절차 세트를 통합하였다.
  • 20개 이상의 반구조화된 인터뷰를 통해 연구자, 감사 기관, AI 개발자, 정책 입안자 등 다양한 지역의 이해관계자들과의 삼중 검증을 통해 초안 블루프린트를 검증하였다.
Figure 1: Blueprint for how to audit LLMs: A three-layered approach.
Figure 1: Blueprint for how to audit LLMs: A three-layered approach.

실험 결과

연구 질문

  • RQ1대규모 언어 모델(Large Language Models)의 잠재적 능력과 광범위한 적응 가능성에 기반해 윤리적 및 사회적 위험을 효과적으로 다룰 수 있도록 감사를 어떻게 체계화할 수 있는가?
  • RQ2LLM 전체 수명 주기(모델 개발에서 하류 배포에 이르기까지) 동안 책임성과 위험 완화를 확보하기 위해 어떤 감사 층이 필수적인가?
  • RQ3거버넌스, 모델, 응용 감사가 중복된 노력을 피하면서도 투명성, 탄력성, 준수성을 향상시키기 위해 어떻게 조율될 수 있는가?
  • RQ4LLM 감사를 실현 가능하게 제한하는 실질적 및 제도적 제약 조건은 무엇이며, 거버넌스 프레임워크 내에서 이를 어떻게 해결할 수 있는가?
  • RQ5감사는 기초 모델에 대해 얼마나 실현 가능한 거버넌스 메커니즘이 될 수 있으며, 그 내재적 한계는 무엇인가?

주요 결과

  • 거버넌스, 모델, 응용 감사로 구성된 세 층 구조 접근법은 LLM 개발 및 배포 전 단계에서의 위험을 포괄적이고 조율된 방식으로 다루는 프레임워크를 제공한다.
  • 이 프레임워크는 모델 출시 이전에 제공자 수준에서 감사를 통합함으로써 사전적 위험 식별을 가능하게 하여 윤리적 및 기술적 보호 조치를 초기 단계부터 시스템에 통합함을 보장한다.
  • 사전 훈련 후, 출시 전에 수행되는 모델 감사는 안전성, 공정성, 탄력성에 대한 체계적인 평가를 가능하게 하여 대중 배포 이전에 보장한다.
  • 응용 감사는 하류 사용 사례에 따라 구체적인 방식으로 LLM의 사용을 평가함으로써 모델 수준 평가에서 드러나지 않는 위험을 포착한다.
  • 이 접근법은 실현 가능하고 확장 가능하도록 설계되었으며, 중복되지 않는 감사 기능이 겹쳐져 자원 활용을 최적화하고 책임 소재를 명확히 한다.
  • 그럼에도 불구하고, 이 프레임워크는 모델의 투명성 부족, 잠재적 행동의 발생, 책임 공백 등의 문제를 감사만으로는 완전히 해결할 수 없다는 점을 인정하며, 특히 모델과 환경 간 복잡한 상호작용에서 비롯된 피해의 경우에 더욱 그러하다.
Figure 2: Outputs from audits on one level become inputs for audits on other levels.
Figure 2: Outputs from audits on one level become inputs for audits on other levels.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.