Skip to main content
QUICK REVIEW

[논문 리뷰] Automated Speech Generation from UN General Assembly Statements: Mapping Risks in AI Generated Texts

Joseph Aylett-Bullock, Miguel Luengo-Oroz|arXiv (Cornell University)|2019. 06. 05.
Topic Modeling참고 문헌 11인용 수 13
한 줄 요약

이 논문은 1970~2015년도의 유엔 총회 연설 자료를 기반으로 미세조정된 AWD-LSTM 언어 모델을 훈련시켜 세계 지도자들의 스타일을 반영한 매우 현실적이며 정치적으로 敏감한 텍스트를 생성하는 것이 가능함을 입증한다. 이 연구는 이러한 모델이 논리적이고 맥락에 부합하는 발언, 심지어 논란의 여지가 있는 주제에 대해서도 생성할 수 있음을 보여주며, 인공지능 기반의 위성 정보 허위정보, 위임, 증오 발언 등의 심각한 위험을 드러낸다. 이는 글로벌 평화와 인권에 영향을 미칠 수 있다.

ABSTRACT

Automated text generation has been applied broadly in many domains such as marketing and robotics, and used to create chatbots, product reviews and write poetry. The ability to synthesize text, however, presents many potential risks, while access to the technology required to build generative models is becoming increasingly easy. This work is aligned with the efforts of the United Nations and other civil society organisations to highlight potential political and societal risks arising through the malicious use of text generation software, and their potential impact on human rights. As a case study, we present the findings of an experiment to generate remarks in the style of political leaders by fine-tuning a pretrained AWD- LSTM model on a dataset of speeches made at the UN General Assembly. This work highlights the ease with which this can be accomplished, as well as the threats of combining these techniques with other technologies.

연구 동기 및 목표

  • 미세조정된 언어 모델을 사용하여 유엔 총회 연설 자료를 기반으로 정치적으로 현실적인 텍스트를 생성하는 데의 용이성과 가능성을 조사하기 위해.
  • 자동화된 텍스트 생성이 국제 정치적 논의에서 허위정보, 위임, 증오 발언 등의 위험을 초래하는지를 평가하기 위해.
  • 인공지능 기반 콘텐츠의 악용 가능성을 통해 정치적 안정성과 인권을 약화시킬 수 있음을 강조하기 위해.
  • 과학계 및 정책권자들이 인공지능 기반 텍스트와 관련된 위험을 완화하기 위한 실질적인 권고안을 제공하기 위해.
  • 글로벌 거버넌스 및 다자기구의 맥락에서 인공지능 기반 정치 콘텐츠의 확장성과 현실성에 대한 인식을 제고하기 위해.

제안 방법

  • 위키텍스트-103에서 사전 훈련된 AWD-LSTM 언어 모델을 사용하여 1970~2015년도의 7,507건의 유엔 총회 연설 자료를 기반으로 미세조정하였다.
  • 데이터셋을 283,593개의 단락으로 분할하고, 노이즈를 제거하며, spaCy를 사용해 토크나이징 처리하였다.
  • 주제 프롬프트나 부분 문장을 '시드'로 삼아 모델에 입력한 후, 2~5문장(50~100단어)으로 자동 완성하여 텍스트를 생성하였다.
  • 세 가지 시나리오에서 모델 성능을 평가하였다: 최소 입력(주제만 제공), 유엔 사무총장 연설의 자동 완성, 민감한 문제에 대한 이탈 발언.
  • 기존의 언어 지식을 활용하기 위해 유도적 전이 학습을 적용하여 훈련 복잡도와 자원 요구량을 감소시켰다.
  • 공식적이고 외교적인 어조를 중심으로, 실제 정치 연설의 어조와 구조를 반영한 텍스트 생성에 집중하였다.

실험 결과

연구 질문

  • RQ1미세조정된 언어 모델이 유엔 총회 연설자들의 목소리로 일관되고 스타일적으로 정확한 정치적 발언을 얼마나 잘 생성할 수 있는가?
  • RQ2특히 민감하거나 논란의 여지가 있는 주제에서 실제 지도자들을 모방하는 AI 기반 정치 콘텐츠 생성의 위험은 무엇인가?
  • RQ3이러한 모델이 개인이나 단체에 의해 얼마나 쉽게 배포되어 대규모 위성 정보나 증오 발언을 생성할 수 있는가?
  • RQ4AI 기반 텍스트가 다자간 외교에서 정치적 안정성, 인권, 기관 신뢰에 어떤 영향을 미칠 수 있는가?
  • RQ5AI 기반 정치 콘텐츠의 확산을 탐지하고 모니터링하며 억제하기 위해 필요한 기술적 및 정책적 조치는 무엇인가?

주요 결과

  • 미세조정된 AWD-LSTM 모델은 핵군비통제 및 국제협력 등 다양한 주제에서 일관되고 스타일적으로 적절한 정치적 발언을 성공적으로 생성하였다.
  • 모델이 생성한 텍스트는 어조와 구조 면에서 인간이 작성한 연설과 구분되지 않아, 최소한의 입력으로도 매우 높은 현실감을 보였다.
  • 모델은 증오 발언과 정치적 갈등과 같은 민감한 주제에 대해도 신뢰할 수 있고 맥락에 부합하는 콘텐츠를 생성하여 악용 가능성을 보여주었다.
  • 고품질의 도메인 특화 언어 모델을 훈련시키는 데에는 최소한의 자원으로도 충분히 가능함을 확인하여, 개인 수준의 악용 가능성도 높아 보였다.
  • 결과는 인공지능 기반 콘텐츠가 합성 미디어 및 가짜 뉴스 유포와 같은 조작된 위성 정보 캠페인에 사용될 수 있음을 시사한다.
  • 연구 결과는 인공지능 기반 정치 텍스트의 위험을 대비하기 위해 체계적 모니터링, 규제 프레임워크, 다분야 협력의 긴급한 필요성을 강조한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.