Skip to main content
QUICK REVIEW

[논문 리뷰] When Choosing Plausible Alternatives, Clever Hans can be Clever

Pride Kavumba, Naoya Inoue|arXiv (Cornell University)|2019. 11. 01.
Topic Modeling참고 문헌 23인용 수 5
한 줄 요약

이 논문은 BERT가 진정한 이해 없이도 높은 정확도를 달성할 수 있도록 해주는 COPA 공공의리 추론 벤치마크 내의 표면적인 토큰 수준의 신호를 규명한다. Balanced COPA—이러한 신호를 중화시키는 COPA의 거울 반영된 버전—을 도입함으로써, BERT가 신호가 없는 어려운 예시들에서도 여전히 잘 수행됨을 보여주며, 이는 작업 학습을 의미한다. 반면 RoBERTa 는 이러한 신호가 존재하더라도 의존하지 않음을 보여주며, 더 강한 일반화 능력을 갖추고 있음을 시사한다.

ABSTRACT

Pretrained language models, such as BERT and RoBERTa, have shown large improvements in the commonsense reasoning benchmark COPA. However, recent work found that many improvements in benchmarks of natural language understanding are not due to models learning the task, but due to their increasing ability to exploit superficial cues, such as tokens that occur more often in the correct answer than the wrong one. Are BERT's and RoBERTa's good performance on COPA also caused by this? We find superficial cues in COPA, as well as evidence that BERT exploits these cues. To remedy this problem, we introduce Balanced COPA, an extension of COPA that does not suffer from easy-to-exploit single token cues. We analyze BERT's and RoBERTa's performance on original and Balanced COPA, finding that BERT relies on superficial cues when they are present, but still achieves comparable performance once they are made ineffective, suggesting that BERT learns the task to a certain degree when forced to. In contrast, RoBERTa does not appear to rely on superficial cues.

연구 동기 및 목표

  • BERT의 COPA에서 뛰어난 성능이 진정한 공공의리 추론이 아니라 표면적인 신호를 악용하기 때문인지 조사하기.
  • COPA 데이터셋 내에서 맥락과 무관하게 정답을 예측할 수 있는 토큰 수준의 신호가 존재하는지 및 그 영향을 분석하기.
  • 원래의 대안들 사이의 토큰 분포를 균형 잡기 위해 각 예시를 반사시켜 정답과 오답이 동일하게 나타나도록 하는 방식으로, 이러한 신호를 제거한 수정된 벤치마크인 Balanced COPA를 개발하기.
  • BERT와 RoBERTa 같은 모델들이 표면적 신호가 제거된 상황에서 기반이 되는 작업을 학습할 수 있는지 평가하기.
  • 원본 COPA와 Balanced COPA에서의 모델 행동을 비교하여, 히ュ리스틱에 의존하는지 진정된 추론을 하는지 평가하기.

제안 방법

  • fine-tuned BERT에 전제 없이 두 개의 대안만 제공함으로써 데이터셋 아블레이션을 수행하여, 비균형적인 토큰 분포로 인해 랜덤 추측을 초월한 성능을 유지함을 확인함.
  • 정답에 더 자주 나타나는 특정 단일 토큰들(예: 'woman', 'mother')을 식별하여 표면적 신호로 규명함.
  • Balanced COPA를 구성하기 위해, 각 원본 COPA 예시에 대해 기존의 잘못된 대안이 정답이 되도록 새로운 전제를 생성함. 이를 통해 각 대안이 정답과 오답으로 동일한 빈도로 나타나도록 함.
  • BERT와 RoBERTa를 원본 COPA와 Balanced COPA 양쪽에서 학습한 후, 신호가 많은 쉬운 예시와 신호가 없는 어려운 예시에서의 성능을 비교함.
  • 기울기 기반의 감도 분석을 사용하여 개별 토큰에 대한 모델의 민감도를 측정하고, 원본 데이터와 균형 잡힌 데이터에서 학습된 모델을 비교함.
  • 신호의 생산성(productive)을 정량화하고, Balanced COPA에서의 학습 후 신호 민감도 변화를 분석하여, 신호를 얼마나 악용하는지 평가함.

실험 결과

연구 질문

  • RQ1COPA 내의 표면적 토큰 수준의 신호가 BERT와 같은 모델이 기초적인 인과적 추론 작업을 이해하지 못한 채 높은 정확도를 달성하는 데 기여하는가?
  • RQ2BERT는 이러한 신호에 얼마나 의존하는가? 이러한 신호가 중화되었을 때도 여전히 잘 수행할 수 있는가?
  • RQ3RoBERTa 는 COPA 내에서 이러한 표면적 신호가 존재할 경우 유사한 의존성을 보이는가?
  • RQ4표면적 신호가 제거된 상황, 즉 Balanced COPA에서 모델은 진정한 추론 작업을 학습할 수 있는가?
  • RQ5왜 RoBERTa 는 어려운 예시에서 BERT 보다 더 잘 수행하고, 조건이 제공되더라도 신호에 민감도를 보이지 않는가?

주요 결과

  • BERT는 표면적 신호가 있는 쉬운 COPA 예시에서 83.9%의 정확도를 기록하지만, 이러한 신호가 없는 어려운 예시에서는 71.9%로 떨어지며, 이는 강한 신호 의존성을 시사한다.
  • Balanced COPA에서의 학습 후 BERT는 원본 COPA와 유사한 전체 성능을 유지하며, 이는 신호가 중화되었을 때도 작업을 학습할 수 있음을 의미한다.
  • 기울기 분석 결과, Balanced COPA에서 학습한 BERT는 원본 COPA에서 학습한 BERT보다 'woman', 'mother'와 같은 매우 생산적인 표면적 신호에 대해 훨씬 덜 민감한 것으로 나타났다.
  • RoBERTa 는 원본 COPA에서조차도 표면적 신호에 눈에 띄게 민감하지 않음을 보여주며, 이는 이러한 신호를 악용하지 않음을 의미한다.
  • RoBERTa 는 Balanced COPA에서 원본 COPA보다 더 높은 성능을 보이며, 이는 신호 제거가 성능 향상에 기여할 수 있음을 시사한다. 이는 아마도 잘못된 패tern에 대한 의존도 감소 때문일 것이다.
  • 결과적으로 BERT는 COPA에서 표면적 신호를 악용하지만, 강제로 그러한 신호를 제거당하면 여전히 기초적인 추론 작업을 학습할 수 있다. 반면 RoBERTa 는 처음부터 더 강건하게 작업을 학습하는 것처럼 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.