[논문 리뷰] TAT-LLM: A Specialized Language Model for Discrete Reasoning over Tabular and Textual Data
TAT-LLM는 LLaMA 2를 미세조정하여 표와 텍스트 데이터에 대한 이산적 추론을 수행할 수 있도록 전문화된 언어 모델이다. 세 단계로 구성된 파ip라인(Extractor, Reasoner, Executor)을 통해 작동하며, FinQA, TAT-QA, TAT-DQA 벤치마크에서 GPT-4와 같은 대규모 모델을 포함한 모든 기준 모델을 능가한다. 이는 작업에 특화된 전문화가 더 작은 모델이 훨씬 큰 모델의 추론 성능을 따라하거나 초월할 수 있음을 보여준다.
In this work, we address question answering (QA) over a hybrid of tabular and textual data that are very common content on the Web (e.g. SEC filings), where discrete reasoning capabilities are often required. Recently, large language models (LLMs) like GPT-4 have demonstrated strong multi-step reasoning capabilities. We then consider harnessing the amazing power of LLMs to solve our task. We abstract a Step-wise Pipeline for tabular and textual QA, which consists of three key steps, including Extractor, Reasoner and Executor, and initially design an instruction to instantiate the pipeline and validate that GPT-4 outperforms all existing methods. However, utilizing an online LLM like GPT-4 holds various challenges in terms of cost, latency, and data security risk, which motivates us to specialize smaller LLMs in this task. We develop a TAT-LLM language model by fine-tuning LLaMA 2 with the training data generated automatically from existing expert-annotated datasets following the Step-wise Pipeline. The experimental results have verified that our TAT-LLM model can outperform all baseline models, including the previous best fine-tuned models and very large-scale LLMs like GPT-4 on FinQA, TAT-QA and TAT-DQA benchmarks.
연구 동기 및 목표
- 하이브리드 표와 텍스트 데이터에 대한 질문 응답 문제를 해결하기 위해, 산술, 비교, 세기와 같은 복잡한 이산적 추론이 요구되는 도전 과제를 해결하기 위해.
- 직접 답변 생성 방식의 한계를 극복하기 위해, 추론 단계가 명확히 구분된 구조적이고 단계적인 파이프라인으로 QA를 분해하기 위해.
- GPT-4와 같은 대규모 온라인 LLM의 대안으로서 비용 효율적이고 안전하며 높은 성능을 발휘하는 작은 모델을 이 Task에 특화시켜 개발하기 위해.
- 전문가가 애너테이션한 데이터셋에서 자동으로 생성된 데이터로 작은 LLM을 미세조정함으로써 표와 텍스트 기반 질의응답에서 뛰어난 성능을 달성할 수 있는지 검증하기 위해.
제안 방법
- TAT-LLM 모델은 전문가가 애너테이션한 표와 텍스트 기반 QA 데이터셋에서 유도된 합성 데이터셋을 사용하여 LLaMA 2에 대해 미세조정된다.
- 파이프라인은 세 단계로 구성된다: Extractor(관련 증거 식별), Reasoner(논리적 또는 수학적 표현 생성), Executor(표현 실행하여 답변 도출).
- 각 훈련 예제는 지시사항, 표, 텍스트, 질문, 응답의 구조를 가지며, 응답은 단계별 출력을 담은 구조화된 표 형식으로 구성된다.
- 외부 Executor가 통합되어 수학적 및 논리적 연산의 정확한 실행을 보장하여 신뢰성 향상과 계산 오류 감소에 기여한다.
- 모델는 구조적이고 인간이 읽기 쉬운 형식으로 다단계 추론 출력을 생성하도록 훈련되어 평가 및 개선이 용이해진다.
- 훈련 데이터는 기존의 전문가가 애너테이션한 QA 예제에 파이프라인을 적용하여 자동으로 생성되며, 요구되는 추론 구조와의 일치를 보장한다.

실험 결과
연구 질문
- RQ1표와 텍스트 데이터에 대한 이산적 추론에서, 전문화된 더 작은 언어 모델이 GPT-4와 같은 대규모 일반 목적 LLM을 능가할 수 있는가?
- RQ2Extractor, Reasoner, Executor로 구성된 단계별 파이프라인 아키텍처는 하이브리드 데이터 QA의 추론 정확도 향상에 얼마나 효과적인가?
- RQ3자동으로 생성된 파이프라인 구조화된 데이터로 LLaMA 2를 미세조정하면, 표와 텍스트 기반 QA 벤치마크에서 성능 향상에 얼마나 기여하는가?
- RQ4외부 Executor의 통합은 추론 파이프라인 내 수학적 및 논리적 실행의 신뢰성 향상에 어떻게 기여하는가?
- RQ5추론 파이프라인의 주요 오류 원인은 무엇이며, 모델 전문화와 데이터 증강을 통해 이를 어떻게 완화할 수 있는가?
주요 결과
- TAT-LLM(7B)는 FinQA, TAT-QA, TAT-DQA 벤치마크에서 이전 최고 성능을 기록한 미세조정 모델과 GPT-4를 포함한 모든 기준 모델을 능가한다.
- LLaMA 2-Chat(7B) 대비 TAT-QA의 세기 질문에서 109.1%의 상대적 향상과 TAT-DQA의 산술 질문에서 200% 이상의 향상을 기록한다.
- 외부 Executor는 특히 산술 및 논리 연산에서의 실행 오류를 감소시키며, 추론 집약적인 작업에서 성능 향상에 기여한다.
- 오류 분석 결과, 48%의 오류가 Extractor 단계에서 기인하며 주로 잘못된 증거 선택 때문임을 확인하여, 표와 텍스트 콘텐츠의 정확한 해석이 핵심 과제임을 시사한다.
- TAT-LLM(7B)와 LLaMA 2-Chat(7B) 간의 성능 격차는 산술 및 세기 질문에서 가장 두드러지며, 100% 이상의 성과 향상을 기록하지만, 스판 및 다중 스판 유형의 개선율 역시 30% 이상 유지된다.
- 외부 Executor 없이도 70B 파라미터 버전의 TAT-LLM는 데이터셋 전반에서 EM 점수에 7점 이내의 하락만을 보이며, 이는 더 큰 모델이 본질적으로 강력한 추론 능력을 지닌다는 점을 시사하지만, 외부 Executor는 정밀도 향상에 명백한 기여를 한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.