[논문 리뷰] A Survey of Adversarial Defences and Robustness in NLP
이 종합적 서베이는 NLP 분야에서의 적대적 방어 기법을 포괄적으로 검토하며, 단어 수준, 문자 수준, 문장 수준의 변형에 대한 강건성 향상을 목표로 하는 새로운 분류 체계를 제안한다. 동의어 인코딩, 방향 제약이 있는 적대적 훈련, 미분 가능(private)을 통한 인증된 강건성 등 방어 기법들을 평가하여, 표준 NLP 작업에서의 성능을 유지하면서 모델의 저항력을 향상시키는 데 효과적임을 강조한다.
In the past few years, it has become increasingly evident that deep neural networks are not resilient enough to withstand adversarial perturbations in input data, leaving them vulnerable to attack. Various authors have proposed strong adversarial attacks for computer vision and Natural Language Processing (NLP) tasks. As a response, many defense mechanisms have also been proposed to prevent these networks from failing. The significance of defending neural networks against adversarial attacks lies in ensuring that the model's predictions remain unchanged even if the input data is perturbed. Several methods for adversarial defense in NLP have been proposed, catering to different NLP tasks such as text classification, named entity recognition, and natural language inference. Some of these methods not only defend neural networks against adversarial attacks but also act as a regularization mechanism during training, saving the model from overfitting. This survey aims to review the various methods proposed for adversarial defenses in NLP over the past few years by introducing a novel taxonomy. The survey also highlights the fragility of advanced deep neural networks in NLP and the challenges involved in defending them.
연구 동기 및 목표
- 딥 네ural 네트워크가 입력의 최소한의 변화에도 불구하고 잘못된 분류를 유도하는 적대적 변형에 대한 점점 증가하는 취약성을 다루기 위해.
- 방어 기제, 변형 유형, 강건성 인증을 기반으로 한 새로운 다차원 분류 체계를 통해 기존의 NLP 분야의 적대적 방어 기법들을 체계화하고 분류하기 위해.
- 적대적 훈련, 동의어 인코딩, 인증된 강건성 등의 방어 기법이 단어 대체 및 기타 적대적 공격에 대한 모델의 저항력을 향상시키는 데 얼마나 효과적인지 평가하기 위해.
- 일부 방어 기법이 모델 훈련 중 과적합을 줄이는 정규화 메커니즘으로서의 双중 이점을 강조하기 위해.
- 자연스럽고 눈에 띄지 않는 적대적 예제를 생성하는 데서의 열린 과제들과 이산적이고 고차원적인 텍스트 데이터에 대해 인증된 강건성을 달성하는 데서의 과제를 식별하기 위해.
제안 방법
- 방어 기제(예: 적대적 훈련, 입력 변환), 변형 유형(단어, 문자, 문장), 강건성 인증을 기반으로 한 새로운 분류 체계를 제안하여 NLP 분야의 적대적 방어 기법을 분류한다.
- 유사 의미의 단어를 공유되는 임베딩으로 매핑함으로써, 이웃 영역 내에서 레이블 일관성을 강제함으로써 동의어 대체에 대한 민감도를 감소시키는 동의어 인코딩 방법을 검토한다.
- 기존 어휘 공간 내의 방향으로만 변형을 제한하는 방향 제약이 있는 적대적 훈련(iAdvT)을 분석하여, 설명 가능성과 강건성을 향상시키며 성능을 손상시키지 않는다.
- GLOVE 임베딩 공간 내의 동의어 집합과 가장 가까운 이웃을 이용해 변형 집합을 정의하고, 모델을 공식적인 강건성 보장을 갖도록 훈련시키는 구조 무관한 인증된 강건성(SAFER)을 분석한다.
- 문장을 데이터베이스로 간주하고, 에프실론-DP를 사용하여 강건성을 인증하는 미분 가능(private) 기반의 인증(WordDP)을 평가하며, 입력이 에프실론-DP 조건을 만족할 경우 예측이 단어 대체 공격에 대해 안정됨을 보장한다.
- 인간과 모델이 함께 참여하는 프레임워크를 사용해 고품질의 도전적인 적대적 예제를 생성하는 ANLI와 같은 적대적 벤치마크 데이터셋을 검토한다.
실험 결과
연구 질문
- RQ1어떤 기반 기제와 변형 유형을 기반으로 NLP 분야의 적대적 방어 기법을 체계적으로 분류할 수 있는가?
- RQ2동의어 인코딩과 임베딩 이웃 영역 내 레이블 일관성은 단어 대체 공격에 대한 모델의 강건성을 얼마나 향상시키는가?
- RQ3방향 제약이 있는 적대적 훈련은 성능을 희생시키지 않고도 모델의 강건성과 설명 가능성을 향상시킬 수 있는가?
- RQ4기존의 인증된 강건성 기법들은 서브워드 및 문자 수준의 모델을 다룰 때 어떤 한계를 가지며, SAFER는 이를 어떻게 극복하는가?
- RQ5미분 가능(private) 기반의 인증 방식은 텍스트 분류 및 NLI 작업에서 단어 대체 공격에 대해 공식적인 인증된 강건성을 제공하는 데 얼마나 효과적인가?
주요 결과
- 동의어 인코딩 기법은 의미적으로 유사한 단어를 공유되는 표현으로 매핑함으로써, 동의어 기반 변형에 대한 민감도를 감소시켜 강건성을 크게 향상시킨다.
- 방향 제약이 있는 적대적 훈련(iAdvT)은 표준 적대적 훈련보다 더 높은 강건성을 달성하면서도, 유효한 단어 임베딩으로만 변형을 제한함으로써 모델의 설명 가능성을 유지한다.
- SAFER는 GLOVE 임베딩 공간 내의 동의어 집합과 가장 가까운 이웃을 이용해 변형 집합을 정의함으로써, 임의의 모델에 대해 구조 없는 인증된 강건성을 제공하며, 단어 대체 공격에 대한 공식적인 보장을 제공한다.
- WordDP 프레임워크는 미분 가능(private)을 사용하여 강건성에 대한 공식적인 인증을 제공하며, 입력이 에프실론-DP 조건을 만족할 경우 예측이 단어 대체 공격에 대해 안정됨을 보장한다.
- ANLI 벤치마크는 인간과 모델이 함께 참여하는 프로세스를 통해 고품질의 적대적 예제를 성공적으로 생성하였으며, 이를 적대적 훈련에 활용함으로써 NLI 모델의 강건성이 향상된다.
- 적대적 훈련과 동의어 인코딩을 포함한 여러 방어 기법들은 과적합을 줄이고 청소된 데이터에서 일반화 능력을 향상시키는 정규화 기능을 동시에 수행한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.