[논문 리뷰] Towards Question Format Independent Numerical Reasoning: A Set of Prerequisite Tasks
이 논문은 외부 지식, 일반 지식, 영역 전문 지식이 필요한 새로운 유형을 포함하여 여덟 가지 다양한 수치 추론 질문 형식을 갖춘 다기능 벤치마크인 NUMBERGAME를 소개한다. 이는 보조 자료를 통한 지식 탐색을 포함하는 다중 작업 학습 프레임워크를 제안하며, 심지어 개선된 베이스라인 모델조차도 인간 성능에 크게 뒤지며, 형식에 종속되지 않는 수치 추론의 과제를 드러낸다.
Numerical reasoning is often important to accurately understand the world. Recently, several format-specific datasets have been proposed, such as numerical reasoning in the settings of Natural Language Inference (NLI), Reading Comprehension (RC), and Question Answering (QA). Several format-specific models and architectures in response to those datasets have also been proposed. However, there exists a strong need for a benchmark which can evaluate the abilities of models, in performing question format independent numerical reasoning, as (i) the numerical reasoning capabilities we want to teach are not controlled by question formats, (ii) for numerical reasoning technology to have the best possible application, it must be able to process language and reason in a way that is not exclusive to a single format, task, dataset or domain. In pursuit of this goal, we introduce NUMBERGAME, a multifaceted benchmark to evaluate model performance across numerical reasoning tasks of eight diverse formats. We add four existing question types in our compilation. Two of the new types we add are about questions that require external numerical knowledge, commonsense knowledge and domain knowledge. For building a more practical numerical reasoning system, NUMBERGAME demands four capabilities beyond numerical reasoning: (i) detecting question format directly from data (ii) finding intermediate common format to which every format can be converted (iii) incorporating commonsense knowledge (iv) handling data imbalance across formats. We build several baselines, including a new model based on knowledge hunting using a cheatsheet. However, all baselines perform poorly in contrast to the human baselines, indicating the hardness of our benchmark. Our work takes forward the recent progress in generic system development, demonstrating the scope of these under-explored tasks.
연구 동기 및 목표
- 실제 교육, 의료, 과학 분야의 적용에 필수적인 질문 형식에 종속되지 않는 수치 추론을 위한 벤치마크 부족 문제를 해결하기 위해.
- 외부 지식, 일반 지식, 영역 전문 지식이 필요한 네 가지 새로운 유형을 포함하여 여덟 가지의 수치 추론 형식을 통합한 단일 데이터셋을 구축하기 위해.
- 다양한 형식, 작업, 데이터 분포 간의 모델 일반화 능력을 평가하기 위해.
- 형식 검출, 중간 표현 매핑, 지식 통합, 데이터 불균형과 같은 실용적인 수치 추론 시스템 구축의 핵심 과제를 규명하기 위해.
- 향후 신경-기호 모델의 일반화 능력 향상과 지식 인식 추론을 향한 연구를 자극하기 위해.
제안 방법
- 저자들은 기존의 여덟 가지와 새로운 네 가지 질문 유형을 통합하여 다기능 데이터셋을 구축하였으며, 이는 외부 지식, 일반 지식, 영역 특화 사실을 포함한 수치 추론을 포함한다.
- 단일 모델이 여덟 가지 형식을 모두 처리할 수 있도록 다중 작업 학습 설정을 설계하였으며, 이는 형식 검출 및 공통 중간 표현으로의 변환을 요구한다.
- 지식 탐색 모듈은 Elasticsearch를 사용하여 보조 자료에서 관련 외부 지식을 검색하며, 이를 추론에 활용하기 위해 입력에 첨부한다.
- NumNet+v2를 질문 유형 변환기와 지식 주입 파이프라인으로 확장하여 외부 지식 통합이 가능한 베이스라인 모델을 구축한다.
- 다양한 베이스라인을 평가하였으며, 맥락이나 질문을 제거하여 데이터셋 편향을 테스트하는 편향 검사 변형과 클래스 불균형을 해결하기 위한 오버샘플링 전략을 포함한다.
- 인간 기준 성능을 확보하기 위해 각 형식별 100개 샘플에 대해 네 명의 평가자가 평균 점수를 산출하여 기준 성능으로 삼는다.
실험 결과
연구 질문
- RQ1형식에 특화된 적응 없이 단일 모델이 여덟 가지의 수치 추론 질문 형식을 모두 잘 수행할 수 있는가?
- RQ2외부 지식을 통합할 경우, 일반 지식이나 영역 전문 지식이 필요한 수치 추론 작업의 성능이 얼마나 향상되는가?
- RQ3데이터 불균형과 데이터셋 편향은 다중 형식 수치 추론 벤치마크에서 모델의 일반화에 어떤 영향을 미치는가?
- RQ4지식 검색은 모든 질문 유형에서 도움이 되는가, 아니면 일부 형식에서는 잡음을 유발하는가?
- RQ5통합 프레임워크는 질문 형식을 검출하고 이를 공통 중간 표현으로 변환하여 공동 추론을 수행할 수 있는가?
주요 결과
- 지식 증강된 확장된 NumNet+v2를 포함한 모든 베이스라인 모델이 인간 기준에 비해 유의미하게 뒤져, 형식에 종속되지 않는 수치 추론의 높은 과제를 시사한다.
- 외부 지식가 필요한 형식 1이 가장 어려운 유형으로, 가장 낮은 모델 성능를 보이며, 이러한 지식을 학습하는 데 특히 어려움이 있음을 시사한다.
- 정량적 NLI(형식 3)와 스팸 기반 다중 선택 문제 형식(형식 6)은 숫자 답변 형식보다 더 높은 성능를 보이며, 모델이 스팸 기반 답변 예측을 더 쉽게 처리함을 나타낸다.
- 지식 검색은 외부 지식가 필요한 형식 1, 2, 4에서는 성능 향상을 보였지만, 외부 지식이 필요 없는 형식 5, 6, 7, 8에서는 도움이 되지 않거나 오히려 악영향을 미치는 것으로 나타났다.
- 오버샘플링 전략은 자원이 적은 형식의 성능 향상에 기여하지만, 자원이 많은 형식에서는 성능 저하를 초래하여 데이터 불균형이 여전히 핵심 과제임을 시사한다.
- 편향 검사 실험 결과, 모델이 데이터셋 편향을 악용하지 않아, 벤치마크에 최소한의 애너테이션 편향이 존재하고 단순 학습 편법에 강건함을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.