[논문 리뷰] Towards Zero-Shot and Few-Shot Table Question Answering using GPT-3
이 논문은 피팅 튜닝 없이 GPT-3를 사용하여 제로샷 및 희소샷 테이블 질의 응답을 탐색하며, GPT-3가 직렬화된 JSON 표현 방식으로 제공된 표 데이터를 이해하고 자연어 질문에 답할 수 있음을 입증한다. 소수의 예시를 포함한 프롬프트 엔지니어링을 통해 정확도가 제로샷의 73.6%에서 새로운 신문 인포그래픽 표 데이터셋에서 86.8%로 크게 향상됨을 확인하였다.
We present very early results on using GPT-3 to perform question answering on tabular data. We find that stock pre-trained GPT-3 is able to zero-shot learn the table structure from a serialized JSON array-of-arrays representation, and able to answer lookup queries and simple comparison questions in natural language without any fine-tuning. We further find that simple prompt engineering to include few-shot static Q&A examples significantly improves accuracy. Lastly, we find that intermixing passage text improves accuracy even further on heterogeneous data. We apply our approach on a novel dataset of simple tables in newspaper infographics with promising results. Overall, we find much cause for optimism in this basic approach.
연구 동기 및 목표
- GPT-3가 문맥 내 학습 능력을 활용하여 피팅 튜닝 없이도 표 질의 응답을 수행할 수 있는지 탐구하기.
- 소수의 예시를 포함한 프롬프트 엔지니어링이 GPT-3의 표 질의 응답 작업 성능 향상에 얼마나 효과적인지 평가하기.
- 다양한 데이터 소스를 포함하는 질문에 대해 GPT-3의 성능에 미치는 주변 문장 텍스트의 영향을 탐색하기.
- 미래의 표 질의 응답 연구를 위해 신문 인포그래픽에서 유래한 단순 표의 새로운 데이터셋을 개발하고 공개하기.
- 기초 모델(GPT-3 등)이 시각 장애가 있는 사용자 및 K-6 교육 분야에서 접근 가능한 데이터 해석 가능성을 평가하기.
제안 방법
- 표의 직렬화된 JSON 표현, OCR로 추출한 비구조화된 문장 텍스트, 자연어 질문을 사용하여 프롬프트를 구성하였다.
- 모델를 수정하지 않고 사전 학습된 GPT-3를 사용하여 피팅 튜닝 없이 제로샷 추론을 수행하였다.
- 대상 표와 관련이 없는 동일 카테고리(예: 스포츠, 날씨)의 소수의 예시를 사용하여 프롬프트를 개선했다.
- 기본 통계 질의(최소값, 최대값, 평균)를 표 열에 대해 포함하는 합성 Q&A 쌍을 생성하기 위해 튜닝된 T5 모델을 사용하였다.
- 객체 검출(Faster R-CNN)과 OCR (Azure Form Recognizer)를 사용하여 신문 인포그래픽 이미지에서 표와 문장 텍스트를 추출하였다.
- 후속 프롬프트 엔지니어링의 일관성을 확보하기 위해 튜닝된 RoBERTa를 사용하여 표를 날씨, 스포츠, 금융, 기타 등 카테고리로 분류하였다.
실험 결과
연구 질문
- RQ1GPT-3는 피팅 튜닝 없이도 표 데이터에서 제로샷 표 질의 응답을 수행할 수 있는가?
- RQ2소수의 예시 프롬프트는 GPT-3의 표 기반 질문에 대한 정확도를 어느 정도 향상시키는가?
- RQ3주변 문장 텍스트를 포함시키면 이질적인 표 및 텍스트 질의 응답에서 GPT-3의 성능에 어떤 영향을 미치는가?
- RQ4GPT-3의 제로샷 성능은 신문 인포그래픽 표의 새로운 데이터셋에서 튜닝된 모델(TAPAS)과 비교해 어떻게 되는가?
- RQ5합성된 소수의 예시는 제로샷 성능 향상에 있어 새로운 표 질의 응답 작업에 효과적으로 일반화될 수 있는가?
주요 결과
- GPT-3는 피팅 튜닝 없이도 12개의 인포그래픽 표로 구성된 소규모 테스트 세트에서 제로샷 정확도 73.6%를 달성하였다.
- 동일한 카테고리에서 유사하지만 대상 표와 관련이 없는 합성 Q&A 예시를 포함한 소수의 예시 프롬프트를 적용함으로써 정확도가 86.8%로 향상되었으며, 이는 제로샷 및 튜닝된 TAPAS(18.4%)보다 유의미하게 높았다.
- GPT-3는 직렬화된 JSON 입력을 통해 표의 구조를 이해하고 조회 및 비교 질문에 정확히 답할 수 있었다.
- 표가 비구조화된 텍스트 내에 포함되어 있더라도, 모델은 관련 셀과 문장 텍스트를 성공적으로 식별하여 질문에 답하였다.
- 표 데이터와 함께 주변 문장 텍스트를 혼합함으로써 정답 정확도가 향상되었으며, 이는 맥락 기반 지식이 추론 능력을 향상시킨다는 것을 시사한다.
- 강력한 제로샷 성능에도 불구하고, 최소값을 잘못 식별하거나 선수 순위를 잘못 판단하는 등의 실패 사례가 존재했으나, 소수의 예시 프롬프트로 이를 해결할 수 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.