Skip to main content
QUICK REVIEW

[논문 리뷰] Reclaiming the Digital Commons: A Public Data Trust for Training Data

Alan Chan, Herbie Bradley|arXiv (Cornell University)|2023. 03. 16.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 기초 모델의 훈련 데이터를 규제하기 위해 국가 차원의 공공 데이터 신뢰 기구를 제안한다. 이 기구는 인터넷에서 크롤링한 데이터를 상업적 개발자들에게 라이센스 제공함으로써 수익 공유를 수수하며, AI 개발에 대한 집단적 통제를 가능하게 한다. 이 신뢰 기구는 경제적 가치를 재분배하고, 부정적인 외부효과를 줄이며, 검증, 인센티브, 규제 일치를 통해 민주적 감시를 구축하고자 한다.

ABSTRACT

Democratization of AI means not only that people can freely use AI, but also that people can collectively decide how AI is to be used. In particular, collective decision-making power is required to redress the negative externalities from the development of increasingly advanced AI systems, including degradation of the digital commons and unemployment from automation. The rapid pace of AI development and deployment currently leaves little room for this power. Monopolized in the hands of private corporations, the development of the most capable foundation models has proceeded largely without public input. There is currently no implemented mechanism for ensuring that the economic value generated by such models is redistributed to account for their negative externalities. The citizens that have generated the data necessary to train models do not have input on how their data are to be used. In this work, we propose that a public data trust assert control over training data for foundation models. In particular, this trust should scrape the internet as a digital commons, to license to commercial model developers for a percentage cut of revenues from deployment. First, we argue in detail for the existence of such a trust. We also discuss feasibility and potential risks. Second, we detail a number of ways for a data trust to incentivize model developers to use training data only from the trust. We propose a mix of verification mechanisms, potential regulatory action, and positive incentives. We conclude by highlighting other potential benefits of our proposed data trust and connecting our work to ongoing efforts in data and compute governance.

연구 동기 및 목표

  • AI 개발 및 훈련 데이터에 대한 사적 기업의 권력 집중 문제를 해결하기 위해.
  • 디지털 공공재의 악화와 경제적 불평등과 같은 AI의 부정적 외부효과를 보완하기 위해.
  • AI가 생성한 경제적 가치를 데이터 기여자에게 재분배할 수 있는 메커니즘을 마련하기 위해.
  • 시민들이 AI 시스템의 훈련 및 배포 방식에 대해 공동 의사결정 권한을 가지도록 하기 위해.
  • 공공의 이해와 민주적 감시를 지원하는 지속 가능하고 확장 가능한 훈련 데이터 거버넌스 모델을 구축하기 위해.

제안 방법

  • 공개 인터넷에서 크롤링한 사전 훈련 데이터와 애너테이터로부터 수집한 인간 피드백 데이터를 수집하고 라이센스 제공하는 국가 공공 데이터 신뢰 기구를 설립하기 위해.
  • 상업적 모델 개발자가 데이터 접근 권한을 얻기 위해 배포 수익의 일정 비율을 신뢰 기관에 지불하는 수익 공유 모델을 구현하기 위해.
  • 암호학적 증명, 데이터 유산 추적, 제3자 감사 등을 통해 개발자가 신뢰 기관에서 라이센스된 데이터만 사용하고 있음을 보장하는 검증 체제를 개발하기 위해.
  • 규제 인centives(예: 데이터 거버넌스 법규 준수), 긍정적 인센티브(예: 우선 접근, 인증), 기술적 강제 조치를 조합하여 도입을 장려하기 위해.
  • 기존의 데이터 책임자 제도와 컴퓨팅 거버넌스 노력과 연계하여, 보다 넓은 AI 거버넌스 프레임워크에 통합하기 위해.
  • 지속 가능한 데이터 생성과 장기적인 디지털 공공재 보존을 지원하는 공공재 제공자로서의 역할을 확보하기 위해.

실험 결과

연구 질문

  • RQ1어떻게 공공 데이터 신뢰 기구가 사적 기업으로부터 훈련 데이터의 통제권을 회복하고 민주적 감시를 복원할 수 있는가?
  • RQ2모델 개발자가 오직 신뢰 기관에서 라이센스된 데이터만 사용하도록 보장할 수 있는 메커니즘은 무엇이며, 준수 여부는 어떻게 검증할 수 있는가?
  • RQ3어떻게 데이터 신뢰 기구가 지속 가능한 자금을 확보하고 AI가 생성한 가치를 공정하게 재분배할 수 있는가?
  • RQ4국가 차원의 공공 데이터 신뢰 기구는 AI 배포의 부정적 외부효과를 완화하는 데 어떤 역할을 할 수 있는가?
  • RQ5어떻게 데이터 신뢰 기구는 기존의 데이터 거버넌스 및 컴퓨팅 거버넌스 프레임워크와 공존하고 보완할 수 있는가?

주요 결과

  • 공공 데이터 신뢰 기구는 디지털 공공재를 회복하고 AI 개발에서 발생하는 경제적 가치를 재분배하는 실현 가능한 제도적 메커니즘으로 기능할 수 있다.
  • 암호학적 증명과 데이터 유산 추적과 같은 검증 메커니즘은 모델 개발자가 오직 신뢰 기관에서 라이센스된 데이터만 사용하고 있음을 효과적으로 보장할 수 있다.
  • 수익 공유 모델은 AI 배포 수익을 공공에 재분배하는 직접적인 경로를 제공하여, 외부효과를 완화하고 정의를 증진시킨다.
  • 제안된 신뢰 모델은 규제 일치, 인증 혜택, 고품질 데이터에 대한 우선 접근 등의 방식으로 준수를 유도한다.
  • 제안된 신뢰 기구는 훈련 데이터 생성을 공공재로 지원하여 디지털 공공재의 쇠퇴 위험을 줄이고 장기적인 지속 가능성을 향상시킨다.
  • 이 신뢰 기구는 특히 데이터 책임자 제도와 컴퓨팅 거버넌스 분야에서 기존 거버넌스 프레임워크와 보완적으로 작용하며, 국가 차원의 AI 정책에 대해 확장 가능한 모델을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.