Skip to main content
QUICK REVIEW

[논문 리뷰] Defending Against Disinformation Attacks in Open-Domain Question Answering

Orion Weller, Aleem Ahmed Khan|arXiv (Cornell University)|2022. 12. 20.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 기존의 ODQA 시스템에 재학습이 필요 없이 적용 가능한 간단하면서도 효과적인 방식으로, 질문 증강을 통해 다양하고 덜 오염된 문단을 검색하고, 답변의 중복성에서 유래한 신뢰도 측정 방법인 Confidence from Answer Redundancy (CAR)를 제안함으로써 데이터 오염 공격에 대비한 방어 기법을 제시한다. 이 방법은 기울기 업데이트 없이도 다양한 오염 수준에서 정확도 매칭 지표에 약 20점의 향상을 이룩하며, 기존의 ODQA 시스템에 쉽게 통합할 수 있다.

ABSTRACT

Recent work in open-domain question answering (ODQA) has shown that adversarial poisoning of the search collection can cause large drops in accuracy for production systems. However, little to no work has proposed methods to defend against these attacks. To do so, we rely on the intuition that redundant information often exists in large corpora. To find it, we introduce a method that uses query augmentation to search for a diverse set of passages that could answer the original question but are less likely to have been poisoned. We integrate these new passages into the model through the design of a novel confidence method, comparing the predicted answer to its appearance in the retrieved contexts (what we call Confidence from Answer Redundancy, i.e. CAR). Together these methods allow for a simple but effective way to defend against poisoning attacks that provides gains of nearly 20% exact match across varying levels of data poisoning/knowledge conflicts.

연구 동기 및 목표

  • 악성 사용자가 위키백과와 같은 지식 소스를 조작하여 모델 성능을 떨어뜨리는 오픈 도메인 질의응답(ODQA)에서의 데이터 오염 공격 증가 추세에 대응하기 위해.
  • 재학습이 필요 없고 기존의 ODQA 파이프라인에 쉽게 통합할 수 있는 실용적인 비기울기 기반 방어 기법을 개발하기 위해.
  • 대규모 코퍼스 내 중복성을 활용하여 지식 충돌과 위조 정보에 대한 강건성을 향상시키기 위해.
  • 실제 공격 시나리오에서 질문 증강과 새로운 신뢰도 메커니즘의 효과를 평가하기 위해.

제안 방법

  • 다양하고 의미적으로 관련된 질문을 생성하여 오염 확률이 낮은 대체 문단을 검색할 수 있도록 하는 질문 증강 전략을 제안한다.
  • 검색된 맥락 간 답변 일관성을 비교하여 신뢰도를 평가하는 방법으로 Confidence from Answer Redundancy (CAR)를 도입한다.
  • CAR를 활용해 원본 질문 또는 증강된 질문에서의 예측을 신뢰할지 결정하며, 다양한 소스에서 높은 중복성을 보이는 예측을 우선시한다.
  • 간단한 해결 전략을 적용: 여러 증강된 문단에서 동일한 답변이 일관되게 예측되면 그 답변을 선택하고, 그렇지 않으면 원본 답변을 사용한다.
  • 모델 미세조정이나 기울기 업데이트 없이 FiD 및 Atlas와 같은 기존의 ODQA 모델에 적용한다.
  • GPT-3를 활용해 증강된 질문을 생성하고, 표준 검색 및 추론 단계를 유지하며, 계산 오버헤드를 최소화한다.

실험 결과

연구 질문

  • RQ1데이터 오염 공격 상황에서 질문 증강이 오픈 도메인 QA에서 대체로 덜 오염된 문단을 검색하는 데 도움이 될 수 있는가?
  • RQ2증거가 상충되거나 오염되었을 경우 Confidence from Answer Redundancy (CAR)가 신뢰할 수 있는 예측을 효과적으로 식별할 수 있는가?
  • RQ3대규모 코퍼스 내 중복성이 오픈 도메인 QA에서 위조 정보 공격에 대한 강건성을 얼마나 향상시킬 수 있는가?
  • RQ4제안된 방어 기법은 다양한 수준의 데이터 오염과 다양한 ODQA 모델에서 어떻게 성능을 발휘하는가?

주요 결과

  • 제안된 방어 기법은 다양한 오염 수준에서 정확도 매칭 지표에 약 20점의 절대적 향상을 이룩하며, 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 증강된 질문이 하나뿐이더라도 기준 수준을 초월한 성능을 보이며, 질문 수가 늘어날수록 성능 향상도 증가했다.
  • CAR 신뢰도 점수는 중복 기준을 충족하는 질문과 충족하지 못하는 질문 간 정확도 매칭 지표에 약 65%p의 큰 격차를 보였다.
  • 100개의 오염된 기사가 존재하더라도 매개변수 지식과 답변 문자 별칭 기능 덕분에 성능이 0%로 떨어지지 않아, 일부 경우에서 모델 자체의 강건성이 확인되었다.
  • 기사 수준의 편집에 국한된 오염 공격이라도, 공유된 내용으로 인해 여러 문단에 영향을 줄 수 있으나, 본 방법은 여전히 효과를 발휘했다.
  • 다수결 투표나 CAR 전용 필터링과 같은 대안적 답변 처리 전략은 제안된 중복 기반 방법에 비해 성능이 열등했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.