Skip to main content
QUICK REVIEW

[논문 리뷰] Tournesol: A quest for a large, secure and trustworthy database of reliable human judgments

Lê Nguyên Hoang, Louis Faucon|arXiv (Cornell University)|2021. 05. 29.
Ethics and Social Impacts of AI참고 문헌 61인용 수 5
한 줄 요약

Tournesol은 인공지능의 윤리적 기준과 사회적 가치에 부합하기 위해, 내용 품질에 대한 인간 평가의 대규모이고 안정적이며 신뢰할 수 있는 데이터베이스를 구축하기 위한 오픈소스 플랫폼을 제안한다. 이 시스템은 탈중앙화되고 개인정보 보호를 고려한 접근 방식을 통해 윤리적인 추천 및 모더레이션 알고리즘을 훈련시키며, 집단적 인간 평가를 브래드리-테리 모델을 통해 활용해 강력하고 확장 가능하며 신뢰할 수 있는 점수를 생성한다. 그 목표는 AI를 사회적 가치와 일치시키기 위한 기초 자원이 되는 데 있다.

ABSTRACT

Today's large-scale algorithms have become immensely influential, as they recommend and moderate the content that billions of humans are exposed to on a daily basis. They are the de-facto regulators of our societies' information diet, from shaping opinions on public health to organizing groups for social movements. This creates serious concerns, but also great opportunities to promote quality information. Addressing the concerns and seizing the opportunities is a challenging, enormous and fabulous endeavor, as intuitively appealing ideas often come with unwanted {\it side effects}, and as it requires us to think about what we deeply prefer. Understanding how today's large-scale algorithms are built is critical to determine what interventions will be most effective. Given that these algorithms rely heavily on {\it machine learning}, we make the following key observation: \emph{any algorithm trained on uncontrolled data must not be trusted}. Indeed, a malicious entity could take control over the data, poison it with dangerously manipulative fabricated inputs, and thereby make the trained algorithm extremely unsafe. We thus argue that the first step towards safe and ethical large-scale algorithms must be the collection of a large, secure and trustworthy dataset of reliable human judgments. To achieve this, we introduce \emph{Tournesol}, an open source platform available at \url{https://tournesol.app}. Tournesol aims to collect a large database of human judgments on what algorithms ought to widely recommend (and what they ought to stop widely recommending). We outline the structure of the Tournesol database, the key features of the Tournesol platform and the main hurdles that must be overcome to make it a successful project. Most importantly, we argue that, if successful, Tournesol may then serve as the essential foundation for any safe and ethical large-scale algorithm.

연구 동기 및 목표

  • 통제되지 않은 데이터에 의해 이끌리는 신뢰할 수 없는 대규모 추천 및 모더레이션 알고리즘으로 인한 증가하는 사회적 위험을 해결하기 위해.
  • 윤리적 AI 개발의 기초가 되는 대규모, 안정적이고 신뢰할 수 있는 인간 평가 데이터베이스를 구축하기 위해.
  • 기자나 공중보건 관계자와 같은 중간 사회 기관이 확장 가능하고 투명하며 책임감 있는 알고리즘 평가 도구를 제공받을 수 있도록 지원하기 위해.
  • 기계 학습에서의 데이터 오염, 조작 및 편향 위험을 줄이기 위해 알고리즘을 인간이 검증한 신뢰할 수 있는 평가에 기반하게 하기 위해.
  • 언어 모델과 추천 엔진을 포함한 윤리적인 AI 시스템을 구축하여, 인간의 가치와 잘 맞고 강력하게 유익한 결과를 낼 수 있도록 하기 위해.

제안 방법

  • 플랫폼은 이원분포 브래드리-테리 모델을 사용하여 콘텐츠 간의 대비 평가를 계산하고, 인간의 평가를 확장 가능하고 정규화된 점수로 변환한다.
  • 기여자는 익명으로 콘텐츠 쌍을 평가하여 사생활 보호와 개인적 선호에 의한 편향을 줄인다.
  • 시스템은 탈중앙화되어 설계되었으며, 향후 기여자의 장치에 데이터와 계산을 저장하여 단일 장애 지점 방지를 목표로 한다.
  • Tournesol은 데이터 무결성과 기밀 보장을 위해 영지식 증명과 검증 가능한 비밀 공유 기법 같은密码 기법을 사용한다.
  • 플랫폼은 향후 비디오 메타데이터에 대한 자연어 처리(NLP) 통합을 지원하여 평가되지 않은 콘텐츠로도 평가를 일반화할 수 있도록 하며, 확장성을 향상시킨다.
  • 사용자마다 여러 개의 로컬 학습 모델을 구동할 수 있도록 하여 개인화를 가능하게 하되, 기밀 보장과 신뢰 유지에 기여한다.

실험 결과

연구 질문

  • RQ1대규모, 안정적이고 신뢰할 수 있는 인간 평가 데이터베이스를 어떻게 대규모로 수집하고 유지 관리할 수 있는가?
  • RQ2탈중앙화된 인간 평가 시스템에서 기밀 보장과 바이진트리 안정성(Byzantine resilience)을 확보하기 위한 기술적 및 암호 기법은 무엇인가?
  • RQ3메타데이터와 NLP를 활용해 평가되지 않은 콘텐츠로 인간 평가를 얼마나 일반화할 수 있는가?
  • RQ4Tournesol의 데이터베이스는 대규모 언어 모델을 윤리적이고 사회적으로 유익한 출력으로 일치시키는 데 어떻게 활용될 수 있는가?
  • RQ5인간 평가에 기반한 목표 함수 최적화 시 굿하르트의 법칙(Goodhart’s law)과 리워드 해킹을 방지하기 위한 가장 효과적인 방법은 무엇인가?

주요 결과

  • Tournesol은 https://tournesol.app 에서 기능하는 오픈소스 플랫폼을 성공적으로 출시하여 콘텐츠 품질에 대한 인간 평가를 수집하고 정제하고 있다.
  • 플랫폼은 이원분포 브래드리-테리 모델을 사용하여 이원 비교 평가를 정규화되고 확장 가능한 점수로 변환하여 집단적 판단을 반영한다.
  • Tournesol은 영지식 증명과 검증 가능한 비밀 공유 기법을 지원하여 기여자 보호와 데이터 오염 방지를 위한 강력한 기밀 보장 조치를 갖추고 있다.
  • 프로젝트는 탈중앙화를 장기적 핵심 목표로 삼고 있으며, 완전히 바이진트리에 강건한 탈중앙화 학습 시스템에 대한 지속적인 연구를 진행 중이다.
  • Tournesol은 향후 비디오 설명과 메타데이터에 대한 NLP를 활용해 평가를 일반화할 수 있도록 설계되어 있으나, 현재 가용한 데이터셋보다 더 큰 데이터셋이 필요로 한다.
  • 플랫폼은 추천 및 모더레이션 시스템과 같은 AI의 정렬 문제를 해결하는 데 기초 자원으로 위치지어 있으며, 목표 함수를 인간이 검증한 가치에 기반하게 함으로써 AI의 윤리적 기준을 확립하는 데 기여한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.