Skip to main content
QUICK REVIEW

[논문 리뷰] Detecting egregious responses in neural sequence-to-sequence models

Tianxing He, James Glass|arXiv (Cornell University)|2018. 09. 11.
Cell Image Analysis Techniques인용 수 17
한 줄 요약

이 논문은 우수한 훈련을 받은 신경망 순서-순서 모델이 극악스러운(예: 공격적, 모욕적인) 응답을 생성하도록 유도하는 트리거 입력을 탐지하기 위해 이산 최적화 방법인 Gibbs-enum을 제안한다. 악성 출력의 수작업으로 작성된 목록을 대상으로 하며, 언어 모델을 사용해 입력의 타당성을 제약 조건으로 삼음으로써, Ubuntu, Switchboard, OpenSubtitles 데이터셋에 훈련된 대화 모델에서 고확률의 극악스러운 출력을 유도하는 입력을 성공적으로 식별하였다.

ABSTRACT

In this work, we attempt to answer a critical question: whether there exists some input sequence that will cause a well-trained discrete-space neural network sequence-to-sequence (seq2seq) model to generate egregious outputs (aggressive, malicious, attacking, etc.). And if such inputs exist, how to find them efficiently. We adopt an empirical methodology, in which we first create lists of egregious output sequences, and then design a discrete optimization algorithm to find input sequences that will cause the model to generate them. Moreover, the optimization algorithm is enhanced for large vocabulary search and constrained to search for input sequences that are likely to be input by real-world users. In our experiments, we apply this approach to dialogue response generation models trained on three real-world dialogue data-sets: Ubuntu, Switchboard and OpenSubtitles, testing whether the model can generate malicious responses. We demonstrate that given the trigger inputs our algorithm finds, a significant number of malicious sentences are assigned large probability by the model, which reveals an undesirable consequence of standard seq2seq training.

연구 동기 및 목표

  • 잘 훈련된 신경망 순서-순서 모델이 모욕이나 위협과 같은 극악스러운 응답을 생성할 수 있는지 조사하기 위해.
  • 이러한 바람직하지 않은 응답을 유도하는 입력 시퀀스를 효율적으로 발견하는 방법을 개발하기 위해.
  • 언어 모델 제약 조건을 사용해 발견된 트리거 입력이 실제 사용자 입력과 유사하고 타당한지 보장하기 위해.
  • 최첨단 대화 응답 생성 모델이 악성 출력을 유도하는 대비 입력에 얼마나 취약한지 평가하기 위해.
  • 심지어 고품질의 비독성 데이터에 훈련된 모델도 특정 트리거 입력을 통해 악성 응답을 생성하도록 유도될 수 있음을 보여주기 위해.

제안 방법

  • 책임감 있는 대화 모델이 절대 생성해서는 안 되는 극악스러운 목표 출력(예: 모욕어, 위협어) 목록을 구성하기 위해.
  • 기울기 정보를 사용해 검색을 안내하면서도 유효한 one-hot 입력 표현을 유지하는 이산 최적화 알고리즘인 Gibbs-enum을 제안하기 위해.
  • 입력 시퀀스가 의미적으로 타당하고 실제 사용자 입력과 유사하도록 보장하기 위해 언어 모델을 사용해 검색을 강화하기 위해.
  • 마지막-히idden 상태(last-h) 및 어텐션 기반 컨텍스트 벡터 메커니즘을 모두 사용하는 인코더-디코더 RNN 모델에 알고리즘을 적용하기 위해.
  • 모델의 출력 확률 분포를 사용해 트리거 입력 하에서 극악스러운 응답이 적절한 응답보다 더 높은 가능성도를 가질 수 있는지 평가하기 위해.
  • 모델의 내부 파rameter가 필요로 하지 않는 블랙박스 공격 프레임워크를 사용하여, 입력-출력 행동에만 의존하기 위해.

실험 결과

연구 질문

  • RQ1특정 입력을 제공받는 잘 훈련된 순서-순서 모델이 모욕이나 위협과 같은 극악스러운 응답을 생성할 수 있는가?
  • RQ2어떤 종류의 입력 시퀀스(트리거)가 이러한 극악스러운 응답을 고확률로 유도하는가?
  • RQ3발견된 트리거 입력은 실제 사용자 입력과 유사하고 의미적으로 타당한가, 아니면 문법적 또는 의미적으로 비현실적인가?
  • RQ4기본 방법 대비 Gibbs-enum 알고리즘이 이러한 트리거를 찾는 데 얼마나 효과적인가?
  • RQ5고품질의 비독성 대화 데이터에 훈련된 모델가 악성 입력에 의해 악성 응답을 생성하는 데 얼마나 취약한가?

주요 결과

  • Ubuntu, Switchboard, OpenSubtitles 데이터셋에 훈련된 모델에서 특정 트리거 입력을 통해 모욕이나 위협과 같은 극악스러운 응답을 고확률로 유도할 수 있다.
  • Gibbs-enum 알고리즘이 극악스러운 응답에 대해 더 높은 가능도를 부여하는 트리거 입력을 성공적으로 식별하였다.
  • 입력 시퀀스를 제약 조건으로 삼는 언어 모델의 사용은 발견된 트리거가 의미적으로 타당하고 실제 사용자 입력과 유사하게 유지됨을 보장한다.
  • 다양한 어텐션 메커니즘(마지막-히든 상태 및 어텐션 기반)에서 이 취약성이 관찰되어 순서-순서 모델 설계의 일반적인 문제임을 시사한다.
  • 심지어 대규모의 고품질 비독성 대화 데이터에 훈련된 모델도 악성 입력에 의해 악성 응답을 생성하도록 유도될 수 있음을 확인하였다.
  • 이 연구는 이러한 트리거 존재의 실증적 검증 가능성을 보여주며, 대화 에이전트의 실세계 구현에서 중요한 보안 및 안전 문제를 드러낸다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.