[논문 리뷰] Where's the Liability in Harmful AI Speech?
이 논문은 대규모 언어 모델이 생성한 해로운 발언에 대한 미국 법적 책임을 분석하며, 기존의 법적 규제인 제230조가 모호한 면책을 제공하고 있으며, 책임 소재가 기술적 설계 선택에 따라 결정된다고 주장한다. 이는 안전한 AI 개발을 유도하기 위해 설계에 민감한 규제 접근 방식을 제안하며, 맞춤형 법적 기준과 최선의 실천 방안을 포함한다.
Generative AI, in particular text-based "foundation models" (large models trained on a huge variety of information including the internet), can generate speech that could be problematic under a wide range of liability regimes. Machine learning practitioners regularly "red team" models to identify and mitigate such problematic speech: from "hallucinations" falsely accusing people of serious misconduct to recipes for constructing an atomic bomb. A key question is whether these red-teamed behaviors actually present any liability risk for model creators and deployers under U.S. law, incentivizing investments in safety mechanisms. We examine three liability regimes, tying them to common examples of red-teamed model behaviors: defamation, speech integral to criminal conduct, and wrongful death. We find that any Section 230 immunity analysis or downstream liability analysis is intimately wrapped up in the technical details of algorithm design. And there are many roadblocks to truly finding models (and their associated parties) liable for generated speech. We argue that AI should not be categorically immune from liability in these scenarios and that as courts grapple with the already fine-grained complexities of platform algorithms, the technical details of generative AI loom above with thornier questions. Courts and policymakers should think carefully about what technical design incentives they create as they evaluate these issues.
연구 동기 및 목표
- 생성형 AI 모델이 유해하거나 허위 발언에 대해 법적으로 책임을 질 수 있는지 여부와 그 방식을 평가하는 것.
- 검색 기반 증강 생성 또는 인간 피드백을 통한 강화 학습과 같은 기술적 설계 결정이 법적 책임과 제230조 면책에 어떤 영향을 미치는지 검토하는 것.
- AI 모델 행동의 기술적 세부 사항을 고려하지 못하는 현재의 법적 프레임워크의 격차를 특정하는 것.
- 책임 기준을 책임감 있는 AI 개발 및 기술적 완화 전략과 조율하는 보완된 법적 접근 방식을 제안하는 것.
제안 방법
- 명예 훼손, 범죄 행위와 관련된 발언, 사망에 대한 불법행위의 세 가지 핵심 책임 제도를 분석한다.
- 예를 들어, 허위 고소 또는 폭탄 제조 지침과 같은 특정 레드팀 시나리오를 법적 이론과 기술적 모델 행동에 대응시킨다.
- 추출형, 검색 기반 증강형, 미세조정된 모델를 포함한 다양한 모델 아키텍처에서 제230조 면책을 평가한다.
- 특히 허위 사실 진술의 경우에서 의도 또는 '심지어의 상태'가 책임 할당에 어떤 역할을 하는지 분석한다.
- 공식적으로 수용된 경우 법적 면책이 되는 기술적 최선의 실천 방안(예: 경고 문구, 지속적인 출력에 대한 통보 및 삭제, 주제별 제한)을 프레임워크로 제안한다.
- 광범위한 면책에서 세밀한 책임 제도로의 전환을 권고하며, 이는 기술적으로 타당하고 안전을 고려한 설계 선택을 보상한다.
실험 결과
연구 질문
- RQ1기초 모델의 기술적 아키텍처가 미국법 하에서 법적 책임에 어떤 영향을 미치는가?
- RQ2제230조 면책이 생성형 AI 출력에 얼마나 적용되며, 다양한 모델 설계에 따라 어떻게 다를 수 있는가?
- RQ3의도 또는 '심지어의 상태'가 의식이 없는 AI의 경우에 해로운 발언에 대한 책임 할당에 어떤 역할을 하는가?
- RQ4검색 기반 증강 생성 또는 RLHF와 같은 기술적 완화 전략이 법적 면책이 될 수 있는가?
- RQ5어떻게 법적 책임 제도를 재설계하여 더 안전하고 정확한 AI 시스템 개발을 유도할 수 있는가?
주요 결과
- 제230조 면책은 기초 모델에 대해 일률적으로 적용되지 않으며, 출력이 제3자 콘텐츠로 간주되는지 아니면 모델 자체가 생성한 것으로 간주되는지에 따라 크게 달라진다.
- 검색 기반 증강 생성 또는 추출 기반 방법을 사용하는 모델는 순수 생성형 모델보다 제230조 보호를 더 잘 충족할 가능성이 높다.
- 명예 훼손, 범죄 행위, 사망에 대한 불법행위 제도 하에서 허위 또는 해로운 발언에 대한 책임은 가능하지만, 이는 기술적 설계와 의도 할당에 따라 달라진다.
- AI가 의식이 없기 때문에 전통적인 '의도' 요건을 충족시키는 데 어려움이 있으며, 이는 책임 할당이 시스템 설계와 제어 메커니즘에 크게 의존하게 된다.
- 경고 문구, 지속적인 출력에 대한 통보 및 삭제, 주제별 제한과 같은 최선의 실천 방안은 공식적으로 수용된 경우 법적 면책이 될 수 있다.
- 현재 법은 면책을 유지하기 위해 안전 기능을 회피하는 등의 최적의 기술적 선택을 피할 수 없게 하며, 이는 더 안전한 AI 개발에 대한 공익을 해칠 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.