[논문 리뷰] WANLI: Worker and AI Collaboration for Natural Language Inference Dataset Creation
이 논문은 다수의 NLI 데이터셋에서 발견된 어려운 추론 패턴을 데이터셋 지ap도를 통해 식별하고, 이를 바탕으로 GPT-3를 활용해 예시를 생성한 후 자동 필터링과 인간 검토를 거쳐 다양하고 고도로 품질이 높은 자연어 추론(NLI) 데이터셋을 만드는 인간-AI 협업 프레임워크 WaNLI를 제안한다. 결과적으로 107,885개의 예시로 구성된 데이터셋은 모델의 일반화 능력을 향상시켜 MultiNLI의 네 배 더 큰 데이터셋으로 훈련한 경우에 비해 HANS에서 11% 높은 정확도와 Adversarial NLI에서 9% 높은 정확도를 달성한다.
A recurring challenge of crowdsourcing NLP datasets at scale is that human writers often rely on repetitive patterns when crafting examples, leading to a lack of linguistic diversity. We introduce a novel approach for dataset creation based on worker and AI collaboration, which brings together the generative strength of language models and the evaluative strength of humans. Starting with an existing dataset, MultiNLI for natural language inference (NLI), our approach uses dataset cartography to automatically identify examples that demonstrate challenging reasoning patterns, and instructs GPT-3 to compose new examples with similar patterns. Machine generated examples are then automatically filtered, and finally revised and labeled by human crowdworkers. The resulting dataset, WANLI, consists of 107,885 NLI examples and presents unique empirical strengths over existing NLI datasets. Remarkably, training a model on WANLI improves performance on eight out-of-domain test sets we consider, including by 11% on HANS and 9% on Adversarial NLI, compared to training on the 4x larger MultiNLI. Moreover, it continues to be more effective than MultiNLI augmented with other NLI datasets. Our results demonstrate the promise of leveraging natural language generation techniques and re-imagining the role of humans in the dataset creation process.
연구 동기 및 목표
- 크라우드소싱된 NLP 데이터셋에서 언어적 다양성 부족과 유사 패턴에 대한 과적합 문제를 해결하기 위해.
- 언어 모델을 활용한 생성과 인간의 평가 및 수정을 통합하는 새로운 데이터셋 생성 패러다임을 탐색하기 위해.
- 희귀하고 어려운 추론 패턴에 중점을 두어 일반화 능력이 향상된 데이터셋을 만들기 위해.
- 인간 애너테이터의 역할을 주로 생성자에서 평가자 및 수정자로 재정의하기 위해.
- 최소한의 인간 노동으로도 확장 가능한 자동화된 파이프라인을 개발하여 다양하고 고도로 품질이 높은 NLI 예시를 생성하기 위해.
제안 방법
- 훈련된 모델에 비해 어려운 추론 패턴을 보이는 예시의 '구역'을 MultiNLI에서 데이터셋 지도를 활용해 식별하기 위해.
- 각 식별된 패턴 그룹의 인라인 예시를 프롬프트로 사용하여 GPT-3를 데이터 생성기로 활용해 새로운, 패턴에 일관된 NLI 인스턴스를 생성하기 위해.
- 데이터셋 지도에서 영감을 얻은 새로운 메트릭을 도입하여 GPT-3의 저품질 또는 정보가 없는 생성물을 자동으로 필터링하기 위해.
- 필터링된 AI 생성 예시를 인간 크라우드워커에게 제출하여 골드 수준의 레이블링과 선택적 수정을 통해 품질과 정확도를 확보하기 위해.
- 수정 및 레이블링된 예시들을 종합하여 최종적으로 107,885개의 NLI 인스턴스를 포함한 데이터셋 WaNLI로 구성하기 위해.
- WaNLI로 모델을 피지테이닝하고 HANS 및 Adversarial NLI와 같은 도메인 외부 벤치마크에서 테스트하여 결과 데이터셋의 성능 평가하기 위해.
실험 결과
연구 질문
- RQ1식별된 추론 패턴을 바탕으로 AI가 생성한 예시는 도메인 외부 NLI 벤치마크에서 모델의 일반화 능력을 향상시키는가?
- RQ2인간 평가를 인간 생성보다 중시하는 인간-AI 협업 파이프라인은 더 다양하고 강건한 NLP 데이터셋을 만들어내는가?
- RQ3WaNLI로 피지테이닝한 모델의 성능은 MultiNLI와 같은 더 큰 전통적 데이터셋으로 훈련한 모델보다 어떻게 비교되는가?
- RQ4데이터셋 지도 메트릭을 기반으로 한 자동 필터링은 얼마나 많은 인간 검토가 필요로 하는지를 줄일 수 있으며, 이는 데이터 품질을 유지하는가?
- RQ5AI 생성 데이터의 한계는 무엇이며, 인간 감시는 이러한 편향과 아티팩트의 확산을 어떻게 완화할 수 있는가?
주요 결과
- WaNLI로 훈련한 모델은 MultiNLI 데이터셋의 네 배 더 큰 데이터셋으로 훈련한 경우에 비해 HANS 벤치마크에서 11% 높은 정확도를 기록한다.
- WaNLI로 훈련한 모델은 MultiNLI로 훈련한 모델보다 Adversarial NLI 벤치마크에서 9% 높은 성능을 보이며, 악성 예제에 대한 강건성을 더 잘 유지함을 보여준다.
- MultiNLI에 다른 NLI 데이터셋을 추가로 증강한 경우조차도 WaNLI로 피지테이닝한 모델이 더 뛰어난 성능을 보이며, WaNLI의 고유한 경험적 가치를 입증한다.
- 인간 수정 단계는 AI 생성 예시의 품질을 크게 향상시키며, 애너테이터들이 오류를 수정하고 어휘를 다듬어 언어적 정확성과 레이블 정확도를 확보한다.
- 이 파이프라인은 희귀한 추론 패턴, 예를 들어 否정, 역전, 암시된 의도 등을 성공적으로 식별하고 재현하였으며, 기존 크라우드소싱된 데이터셋에서 부족한 패턴을 보완한다.
- GPT-3를 사용했음에도 불구하고 최종 데이터셋은 인간 애너테이터들이 수정 과정에서 이러한 예시를 기각함으로써 유해하거나 불쾌감을 주는 콘텐츠의 흔적을 거의 보이지 않아, 안전성에 문제가 없음을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.