Skip to main content
QUICK REVIEW

[논문 리뷰] Opportunities and Risks of LLMs for Scalable Deliberation with Polis

Christopher Small, Ivan Vendrov|arXiv (Cornell University)|2023. 06. 20.
Ethics and Social Impacts of AI인용 수 18
한 줄 요약

이 논문은 대형 언어 모델(LLMs)이 Polis를 확장된 심의에 어떻게 보강할 수 있는지 조사하며, 주제 모델링, 요약, 투표 예측에서의 역량을 보여주고, 위험 및 완화 전략을 강조합니다.

ABSTRACT

Polis is a platform that leverages machine intelligence to scale up deliberative processes. In this paper, we explore the opportunities and risks associated with applying Large Language Models (LLMs) towards challenges with facilitating, moderating and summarizing the results of Polis engagements. In particular, we demonstrate with pilot experiments using Anthropic's Claude that LLMs can indeed augment human intelligence to help more efficiently run Polis conversations. In particular, we find that summarization capabilities enable categorically new methods with immense promise to empower the public in collective meaning-making exercises. And notably, LLM context limitations have a significant impact on insight and quality of these results. However, these opportunities come with risks. We discuss some of these risks, as well as principles and techniques for characterizing and mitigating them, and the implications for other deliberative or political systems that may employ LLMs. Finally, we conclude with several open future research directions for augmenting tools like Polis with LLMs.

연구 동기 및 목표

  • LLMs가 Polis를 보강하여 심의 프로세스의 확장성을 개선하는 방법을 평가한다.
  • Polis에서 주제 모델링, 요약, 중재, 합의 발견과 같은 LLM 기반 작업을 평가한다.
  • 편향, 환각, 오해 표현 등의 위험을 식별하고 완화 전략을 제안한다.
  • Anthropic의 Claude를 사용한 파일럿 실험으로 Polis 워크플로를 보강하는 것을 시연한다.
  • 심의 플랫폼에 LLM을 통합하기 위한 향후 방향을 제시한다.

제안 방법

  • Anthropic Claude를 사용하여 Polis 워크플로 내에서 작동하는 파일럿 실험을 수행한다.
  • 코멘트 묶음에 주제를 배정하도록 LLM에 프롬프트를 주어 주제 모델링을 수행한다.
  • Polis 데이터로 자동 요약 및 합의 진술을 생성한다.
  • 보지 않은 코멘트에 대한 참가자 동의 여부를 LLM에 질의하여 투표 예측을 평가한다.
  • 대규모 대화를 처리하기 위한 긴 컨텍스트 윈도우(8K~100K 토큰)의 사용을 조사한다.
  • LLM 출력에 대한 인간-개입 평가 및 안전 완화 대책에 대해 논의한다.

실험 결과

연구 질문

  • RQ1LLMs가 Polis 대화에서 주제를 신뢰성 있게 식별하고 보고에 도움을 줄 수 있는가?
  • RQ2LLMs가 Polis 데이터에서 일관된 요약을 생성하고 집단 합의를 식별하는 정도는 어느 수준인가?
  • RQ3이전 투표 기록을 고려할 때 LLM은 투표를 얼마나 정확하게 예측할 수 있는가?
  • RQ4LLM-보조 Polis의 위험(편향, 잘못된 정보, 중재)은 무엇이며 어떻게 완화할 수 있는가?
  • RQ5확장된 컨텍스트 윈도우가 대규모 Polis 대화에서 LLM 성능에 어떤 영향을 미치는가?

주요 결과

  • Claude가 생성한 주제가 수동 분석과 일치했고 계층적 주제 구조를 도출했다.
  • LLMs은 수동 분석 경향과 일치하는 간결한 요약을 자동으로 생성할 수 있었으나 컨텍스트 윈도우 한계 및 잠재적 부정확성으로 인해 세심한 프롬프트와 인간 검토가 필요하다.
  • 일반 LLM은 주어진 댓글에 대해 참가자가 동의할지 여부를 높은 확신으로 예측하는 데 보정할 수 있었고 강한 예측력을 보였다.
  • 합의 초안 작성에 LLM을 사용하면 예시 합의 진술을 제시했지만 윤리적 사용을 위한 실시간 테스트와 거버넌스가 필요했다.
  • 주제 모델링과 요약은 새로운 댓글에 적응하기 위해 온라인 대화에서 반복적으로 업데이트될 수 있다.
  • 위험으로는 잠재적 허위정보, 편향된 표현, 투명한 공시와 인간-개입 감독의 필요성이 포함된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.