Skip to main content
QUICK REVIEW

[논문 리뷰] Citation: A Key to Building Responsible and Accountable Large Language Models

Jie Huang, Kevin Chen–Chuan Chang|arXiv (Cornell University)|2023. 07. 05.
FinTech, Crowdfunding, Digital Finance인용 수 11
한 줄 요약

이 논문은 투명성, 책임성, IP/윤리적 거버넌스를 개선하기 위해 LLM에 인용 메커니즘을 내재화할 것을 주장하며, 비파라메트릭 콘텐츠와 파라메트릭 콘텐츠 모두를 다룬다. 구현 전략, 함정, 그리고 연구 로드맹을 다룬다.

ABSTRACT

Large Language Models (LLMs) bring transformative benefits alongside unique challenges, including intellectual property (IP) and ethical concerns. This position paper explores a novel angle to mitigate these risks, drawing parallels between LLMs and established web systems. We identify "citation" - the acknowledgement or reference to a source or evidence - as a crucial yet missing component in LLMs. Incorporating citation could enhance content transparency and verifiability, thereby confronting the IP and ethical issues in the deployment of LLMs. We further propose that a comprehensive citation mechanism for LLMs should account for both non-parametric and parametric content. Despite the complexity of implementing such a citation mechanism, along with the potential pitfalls, we advocate for its development. Building on this foundation, we outline several research problems in this area, aiming to guide future explorations towards building more responsible and accountable LLMs.

연구 동기 및 목표

  • 웹과 검색 엔진에 비유해 LLM에서 IP 및 윤리적 이슈를 관리할 필요성을 동기화한다.
  • 투명성과 책임성을 높이기 위한 누락된 필수 구성요소로서 인용의 개념을 도입한다.
  • 비파라메트릭 콘텐츠에 대한 인용과 파라메트릭 콘텐츠를 귀속시키는 잠재적 전략을 개략적으로 제시한다.
  • 책임 있는 LLM 개발을 가이드하기 위한 주요 도전과 연구 질문을 식별한다.

제안 방법

  • LLM 출력에서 인용이 언제, 어떻게 사용되어야 하는지 정의한다(비파라메트릭 콘텐츠의 경우 선행-구성(pre-hoc) 및 사후-구성(post-hoc)).
  • 비파라메트릭 인용을 제공하기 위해 정보 검색과 결합한 하이브리드 시스템을 제안한다.
  • 핵심 소스까지 파라메트릭 콘텐츠를 추적하기 위한 소스 식별자나 토큰의 아이디어를 논의한다.
  • 환영/헛소통, 인용 편향, 법적 함의 등을 포함한 잠재적 함정과 제약을 조사한다.

실험 결과

연구 질문

  • RQ1생성된 정보에 대해 LLM이 인용을 제공해야 하는 시점은 언제인가?
  • RQ2검색 증강 방법을 통해 비파라메트릭 콘텐츠를 어떻게 인용할 수 있는가?
  • RQ3훈련 데이터 소스로 파라메트릭 콘텐츠를 어떻게 귀속시킬 수 있는가?
  • RQ4LLM의 인용 메커니즘에서 주요 함정은 무엇이며 이를 어떻게 완화할 수 있는가?
  • RQ5신뢰할 수 있고 최신이며 편향되지 않은 인용을 가능하게 하려면 어떤 연구 문제를 해결해야 하는가?

주요 결과

  • 인용은 소스를 신호하고 검증 가능하게 하여 IP 및 윤리 이슈를 다루는 데 도움이 될 수 있다.
  • 비파라메트릭 콘텐츠는 선행 검색으로 인용하거나 사후 삽입으로 인용할 수 있으며, 로버스트니스 위해 이 둘이 결합될 수 있다.
  • 파라메트릭 콘텐츠는 고차원적 훈련 표현으로 인한 귀속 문제를 제기하므로 소스 식별자가 잠재적 해결책이다.
  • 인용은 과다 인용, 부정확하거나 구식 소스, 오정보의 확산, 편향, 창의성 저하 등의 위험을 동반한다.
  • 인용 가능 LLM에서 타이밍, 정확성, 신뢰성, 편향 및 법적 이슈를 다루는 광범위한 연구 로드맹이 제시된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.