Skip to main content
QUICK REVIEW

[논문 리뷰] Back to Square One: Bias Detection, Training and Commonsense Disentanglement in the Winograd Schema

Yanai Elazar, Hongming Zhang|arXiv (Cornell University)|2021. 04. 16.
Topic Modeling참고 문헌 64인용 수 12
한 줄 요약

이 논문은 윈오그라드 스키마(Winograd Schema, WS) 평가에 대한 핵심적인 결함을 규명하며, 쌍문장 평가 방법과 두 가지 새로운 베이스라인을 제안하여 데이터셋 편향을 드러낸다. 또한 최신 언어 모델이 제로샷 WS 유사 작업에서 무작위로 작동함을 보여주며, WS 벤치마크에서 관찰되는 성능 향상은 본질적인 공통지식 추론보다는 지도학습 데이터 패턴에 기인해 있음을 시사한다.

ABSTRACT

The Winograd Schema (WS) has been proposed as a test for measuring commonsense capabilities of models. Recently, pre-trained language model-based approaches have boosted performance on some WS benchmarks but the source of improvement is still not clear. We begin by showing that the current evaluation method of WS is sub-optimal and propose a modification that makes use of twin sentences for evaluation. We also propose two new baselines that indicate the existence of biases in WS benchmarks. Finally, we propose a method for evaluating WS-like sentences in a zero-shot setting and observe that popular language models perform randomly in this setting. We conclude that much of the apparent progress on WS may not necessarily reflect progress in commonsense reasoning, but much of it comes from supervised data, which is not likely to account for all the required commonsense reasoning skills and knowledge.

연구 동기 및 목표

  • 현재 윈오그라드 스키마 평가 방법의 결함을 폭 드러내어 모델 능력을 잘못 해석할 수 있는 가능성을 제거하기 위해.
  • 새로운 베이스라인 모델을 사용하여 기존 WS 벤치마크의 편향을 식별하고 정량화하기 위해.
  • 더 신뢰할 수 있는 공통지식 추론 평가를 위해 쌍문장 기반 수정된 평가 프레임워크를 제안하기 위해.
  • 사전 훈련된 언어 모델이 제로샷 설정에서 진정으로 공통지식 추론을 일반화하는지 평가하기 위해.

제안 방법

  • 윈오그라드 스키마 벤치마킹의 신뢰성을 향상시키기 위해 쌍문장 평가 방법을 제안한다.
  • WS 데이터셋에 존재하는 언어적 및 통계적 편향을 악용하는 두 가지 새로운 베이스라인을 도입한다.
  • 피팅된 패턴을 초월한 일반화 능력을 테스트하기 위해 WS 유사 문장에 대한 제로샷 평가 프로토콜을 설계한다.
  • 이러한 방법을 사용하여 WS 벤치마크에서의 성능 향상이 공통지식 추론에서 비롯되는지, 아니면 데이터 기반 히وري스틱에서 비롯되는지 평가한다.
  • 표준 사전 훈련된 언어 모델(예: BERT, RoBERTa)을 새로운 평가 환경에 적용하여 제로샷 성능을 측정한다.
  • 다양한 WS 변형에서 모델 예측을 분석하여 추론이 아닌 표면적 신호에 의존하는지 탐지한다.

실험 결과

연구 질문

  • RQ1현재 윈오그라드 스키마 평가 방법이 모델의 데이터셋 편향 의존성을 얼마나 많이 가림으로써 모델 능력을 잘못 해석하게 하는가?
  • RQ2새로운 베이스라인이 기존 WS 벤치마크의 체계적 편향을 드러내는 데 성공할 수 있는가?
  • RQ3최신 언어 모델이 제로샷 WS 유사 설정에서 진정으로 공통지식 추론 능력을 보여주는가?
  • RQ4WS 벤치마크에서 보고된 성능 향상의 어느 정도가 공통지식 이해보다는 지도학습 데이터 패턴에 기인한 것인가?
  • RQ5쌍문장 기반 수정된 평가 프레임워크가 공통지식 능력 평가의 신뢰도를 높일 수 있는가?

주요 결과

  • 표준 윈오그라드 스키마 평가 방법은 최적화되지 않았으며, 모델 편향을 가림으로써 위험에 노출되어 있다.
  • 두 가지 새로운 베이스라인이 데이터셋 편향을 성공적으로 악용하여, 현재의 벤치마크가 이러한 패턴에 대해 강건하지 않음을 시사한다.
  • 유명한 사전 훈련된 언어 모델은 제안된 제로샷 평가 설정에서 무작위로 작동함을 보여주며, 공통지식 추론의 진정한 일반화가 이루어지지 않음을 시사한다.
  • WS 벤치마크에서 관찰된 성능 향상은 진정한 공통지식 이해보다는 지도학습 데이터 패턴에 기인해 있다.
  • 쌍문장 평가 방법은 모호성과 편향을 줄여 공통지식 추론 평가의 신뢰도를 향상시킨다.
  • 이 연구는 WS 벤치마크에서의 대부분의 진전이 공통지식 추론의 발전을 반영하지 못하고, 오히려 훈련 데이터의 인과적 편향 때문임을 결론짓는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.