[논문 리뷰] Amplifying Limitations, Harms and Risks of Large Language Models
이 논문은 대규모 언어 모델(Large Language Models, LLMs)에 내재된 한계, 해로움, 그리고 위험을 철저히 분석하며, 과도한 기대감이 환상, 편향, 사실 기반 부족과 같은 근본적인 결함을 가리키는 데서 비롯된다고 주장한다. 저자들은 인간의 참여를 통한 감시와 다양한 배경을 가진 개발 팀을 통해 위험을 완화할 것을 권고하며, 인간의 검증이 없이는 LLM이 정확성이나 안전성을 보장할 수 없다고 강조한다.
We present this article as a small gesture in an attempt to counter what appears to be exponentially growing hype around Artificial Intelligence (AI) and its capabilities, and the distraction provided by the associated talk of science-fiction scenarios that might arise if AI should become sentient and super-intelligent. It may also help those outside of the field to become more informed about some of the limitations of AI technology. In the current context of popular discourse AI defaults to mean foundation and large language models (LLMs) such as those used to create ChatGPT. This in itself is a misrepresentation of the diversity, depth and volume of research, researchers, and technology that truly represents the field of AI. AI being a field of research that has existed in software artefacts since at least the 1950's. We set out to highlight a number of limitations of LLMs, and in so doing highlight that harms have already arisen and will continue to arise due to these limitations. Along the way we also highlight some of the associated risks for individuals and organisations in using this technology.
연구 동기 및 목표
- 대규모 언어 모델(LLMs)에 대한 과도한 기대감을 줄이기 위해 그들의 근본적인 한계와 위험을 폭 드러내는 것.
- 사기, 편향, 그리고 위험한 출력을 포함한 LLM이 초래하는 기존 및 잠재적 해로움을 부각하는 것.
- 현재 LLM이 인간의 검토 없이 사실 정확성이나 안전성을 보장할 수 없다는 점을 강조하는 것.
- 모델의 공정성 향상과 체계적 편향 감소를 위해 다양성이 확보된 개발 팀을 주장하는 것.
- 모델의 제약을 인정하고 AI가 생성한 콘텐츠에 맹신하지 않음으로써 LLM의 책임감 있는 도입을 촉구하는 것.
제안 방법
- 공개 보고서, 기술 문서(예: GPT-4 Technical Report), 미디어 보도를 분석하여 LLM의 능력과 한계를 평가하는 것.
- GPT-4와 같은 모델의 성능 향상 배경이 되는 아키텍처 및 훈련 요소를 분석하는 것. 이는 스케일(파라미터 수, 컨텍스트 길이), 훈련 데이터 볼륨, 믹스처 오브 엑스퍼트( mixture-of-experts) 설계 등을 포함한다.
- 주요 AI 제공업체(예: OpenAI)의 기존 사용 정책을 검토하여 금지된 사용 사례(예: 법적, 재정적, 의료 상담)를 식별하는 것.
- 규칙 기반 가드레일과 인간 피드백을 통한 강화 학습(RLHF)이 부분적인 완화 전략으로서의 역할을 강조하는 것.
- AI의 역사적이고 다학제적 관점을 바탕으로 LLM을 보다 넓은 AI 연구 전통 내에서 맥락화하는 것.
- LLM의 자기 질문(self-queries)을 활용하여 모델이 자신의 한계를 인지하고 있음을 보여주는 것(예: ChatGPT에게 '당신은 무엇에 사용해서는 안 되는가?' 라고 질문하기).
실험 결과
연구 질문
- RQ1현재 대규모 언어 모델의 核심적 한계는 무엇이며, 이는 신뢰성과 안전성에 어떤 영향을 미치는가?
- RQ2모델 크기, 컨텍스트 길이, 데이터 볼륨과 같은 아키텍처 및 훈련 요소는 LLM의 성능과 위험에 어떤 영향을 미치는가?
- RQ3개발 팀의 다양성 부족은 LLM 출력물에서 편향과 체계적 해로움을 어떻게 증가시키는가?
- RQ4규칙 기반 시스템이나 인간 피드백은 LLM의 환상과 유해 콘텐츠 위험을 어느 정도 완화할 수 있는가?
- RQ5LLM이 생성한 콘텐츠가 향후 훈련 데이터를 오염시키며, 오해의 소재와 편향의 피드백 루프를 만들어내는 장기적 위험은 무엇인가?
주요 결과
- GPT-4와 같은 대규모 언어 모델은 유창하고 자연스러운 텍스트를 생성함에도 불구하고, 심각한 환상과 사실 오류를 보여준다.
- 고급 능력이 있다고 주장함에도 불구하고, GPT-4의 출력은 인간 검토 없이 법적, 재정적, 의료 상담과 같은 고위험 응용 분야에 신뢰할 수 없다.
- 모델의 성능 향상은 파라미터 수가 약 1조 개에 이르거나 8개의 2200억 파라미터 모델을 조합한 믹스처 오브 엑스퍼트 설계를 포함한 스케일 증가 덕분으로 기인된다.
- GPT-4의 훈련에 약 1억 달러 이상의 비용이 소요된 것으로 보고되어, 현재 LLM이 요구하는 막대한 재정적 및 컴퓨팅 투자를 반영한다.
- LLM은 본질적으로 안전하거나 편향이 없는 것이 아니며, 훈련 데이터에 존재하는 편향과 개발 팀의 다양성 부족이 반영되어 있다.
- LLM이 생성한 콘텐츠(예: 사기 정보 포함)가 향후 훈련 데이터의 품질을 악화시키며, 오랜 시간에 걸쳐 오해와 편향을 악화시키는 부정적 피드백 루프가 발생할 위험이 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.