Skip to main content
QUICK REVIEW

[논문 리뷰] SWAG: A Large-Scale Adversarial Dataset for Grounded Commonsense Inference

Rowan Zellers, Yonatan Bisk|arXiv (Cornell University)|2018. 08. 15.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 비디오 캡션에서 유래한 113,000개의 실질적 공통지식 추론 예제로 구성된 대규모 악성 데이터셋인 Swag를 소개한다. 이 데이터셋은 악성 필터링을 통해 annotation 아티팩트를 제거하였다. 이 방법은 언어 모델이 생성한 반대가치(가짜) 문장을 스타일 기반 분류기의 위원회와 결합하여 편향이 제거된 다중 선택 문제를 생성하며, 인간의 정확도는 88%에 이를 뿌리지만 최신 모델의 정확도는 60% 미만에 그쳐 자연어 처리 시스템이 겪는 심각한 과제를 드러낸다.

ABSTRACT

Given a partial description like "she opened the hood of the car," humans can reason about the situation and anticipate what might come next ("then, she examined the engine"). In this paper, we introduce the task of grounded commonsense inference, unifying natural language inference and commonsense reasoning. We present SWAG, a new dataset with 113k multiple choice questions about a rich spectrum of grounded situations. To address the recurring challenges of the annotation artifacts and human biases found in many existing datasets, we propose Adversarial Filtering (AF), a novel procedure that constructs a de-biased dataset by iteratively training an ensemble of stylistic classifiers, and using them to filter the data. To account for the aggressive adversarial filtering, we use state-of-the-art language models to massively oversample a diverse set of potential counterfactuals. Empirical results demonstrate that while humans can solve the resulting inference problems with high accuracy (88%), various competitive models struggle on our task. We provide comprehensive analysis that indicates significant opportunities for future research.

연구 동기 및 목표

  • 자연어 처리 데이터셋에서 흔히 발생하는 annotation 아티팩트와 인간의 편향이 모델이 진정한 추론이 아닌 스타일적 신호에 의존하게 하는 문제를 해결하기 위해.
  • 실질적 공통지식 추론을 위한 고품질의 편향이 제거된 데이터셋을 만드는 가용성 있고 자동화된 방법을 개발하기 위해.
  • 언어적 함의를 넘어서 신체적 및 상황적 추론이 요구되는 벤치마크를 만들기 위해.
  • 현재 모델들이 실질적 공통지식 작업에서 인간의 성능에 비해 뚜렷하게 뒤처지는 것으로 보여주기 위해.

제안 방법

  • ActivityNet과 LSMDC에서 113,000개의 비디오 캡션 쌍을 수집하여 다중 선택 추론을 위한 맥락-동사어구 쌍을 구성한다.
  • 최신 언어 모델을 미세조정하여 다양한, 타당한 반대가치(부정적) 동사어구 끝말을 대량으로 초과 샘플링한다.
  • 악성 필터링(AF) 적용: 편향된 언어 패턴을 가진 끝말을 식별하고 제거하기 위해 스타일 기반 분류기의 앙상블을 훈련시킨다.
  • 필터링된 데이터를 기반으로 분류기를 재학습하여 스타일적 아티팩트를 제거하면서도 의미적 타당성을 유지하는 방식으로 데이터셋을 반복적으로 개선한다.
  • 품질과 다양성을 확보하기 위해 커뮤니티 기반의 검증을 통해 최종 필터링된 반대가치 문장을 검증한다.
  • 각 맥락에 대해 하나의 정답과 세 개의 편향이 제거된, 악성 필터링된 반대가치 문장을 포함한 균형 잡힌 데이터셋을 구성한다.

실험 결과

연구 질문

  • RQ1악성 필터링은 대규모 공통지식 추론 데이터셋에서 annotation 아티팩트를 효과적으로 줄일 수 있는가?
  • RQ2Swag 데이터셋은 현재 자연어 처리 모델이 실질적 공통지식 추론에서 겪는 한계를 어느 정도 드러내는가?
  • RQ3실질적 공통지식 추론에서 인간의 성능는 최신 모델의 성능와 비교해 어떻게 다를까?
  • RQ4언어 모델이 생성한 반대가치 문장은 추론 데이터셋의 부정적 예제의 강건성과 다양성을 향상시키는가?

주요 결과

  • 인간은 Swag 데이터셋에서 88%의 정확도를 기록하여, 복잡함에도 불구하고 이 작업이 인간에게 직관적으로 다가오는 것을 보여준다.
  • 최신 NLI 모델은 Swag에서 60% 이하의 정확도를 기록하여 인간 성능에 비해 뚜렷한 성능 격차가 있음을 입증한다.
  • 악성 필터링은 스타일적 아티팩트를 효과적으로 줄였음을 입증하며, 여러 분류기가 정답과 오답을 신뢰성 있게 구분하지 못한다는 점에서 이를 확인할 수 있다.
  • 데이터셋은 동사와 주제 면에서 높은 다양성을 보이며, 특정 동사가 분포를 지배하지 않아 실제 세계의 상황을 넓게 커버하고 있음을 시사한다.
  • 가장 뛰어난 성능을 보이는 모델(ESIM+ELMo)조차도 높은 신뢰도로 잘못된 답을 자주 선택함으로써 신체적 타당성에 대한 추론에 실패하고 있음을 보여준다.
  • Swag의 동사 누적 분포는 MultiNLI보다 더 왜소하지 않아, 비디오 기반임에도 불구하고 더 넓은 도메인 커버리지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.