Skip to main content
QUICK REVIEW

[논문 리뷰] Large Language Models Can Learn Temporal Reasoning

Siheng Xiong, Ali Payani|arXiv (Cornell University)|2024. 01. 12.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 자연어 텍스트를 구조화된 시간적 그래프로 변환한 후, 체인 오브 토우트 부트스트래핑 및 데이터 증강을 통한 상징적 추론을 적용하여 대규모 언어 모델(Langauge Models, LLMs)의 시간적 추론 능력을 향상시키는 새로운 프레임워크인 TempGraph-LLM을 제안한다. 이 방법은 시간적 질의응답 벤치마크에서 최신 기술 수준의 성능을 달성하며, Llama2-13B를 사용할 경우 정확도가 79.5%에 이르며, 자유형 텍스트 추론 방식에 비해 정확성과 일관성이 크게 향상됨을 보여준다.

ABSTRACT

While large language models (LLMs) have demonstrated remarkable reasoning capabilities, they are not without their flaws and inaccuracies. Recent studies have introduced various methods to mitigate these limitations. Temporal reasoning (TR), in particular, presents a significant challenge for LLMs due to its reliance on diverse temporal concepts and intricate temporal logic. In this paper, we propose TG-LLM, a novel framework towards language-based TR. Instead of reasoning over the original context, we adopt a latent representation, temporal graph (TG) that enhances the learning of TR. A synthetic dataset (TGQA), which is fully controllable and requires minimal supervision, is constructed for fine-tuning LLMs on this text-to-TG translation task. We confirmed in experiments that the capability of TG translation learned on our dataset can be transferred to other TR tasks and benchmarks. On top of that, we teach LLM to perform deliberate reasoning over the TGs via Chain-of-Thought (CoT) bootstrapping and graph data augmentation. We observed that those strategies, which maintain a balance between usefulness and diversity, bring more reliable CoTs and final results than the vanilla CoT distillation.

연구 동기 및 목표

  • 기존 LLM의 시간, 논리, 일반 지식 통합이 필요한 신뢰할 수 있는 시간적 추론 능력에 한계가 있음을 해결하기 위해.
  • 자연어 텍스트 내의 시간적 관계를 구조화된 시간적 그래프로 명시적으로 모델링하여, 자유형 텍스트 추론 방식을 초월한 정확도 향상을 도모하기 위해.
  • 텍스트에서 시간적 그래프로의 정렬 작업을 위한 완전히 제어 가능하고 최소한의 감독이 필요한 합성 데이터셋을 구축하기 위해.
  • 부트스트래핑된 추론 단계와 데이터 증강을 활용해 상징적 추론을 LLM에 통합함으로써, 복잡한 시간적 작업에서의 신뢰성과 성능을 향상시키기 위해.

제안 방법

  • 프레임워크는 규칙 기반 파이프라인을 사용해 자연어 스토리를 시간적 그래프로 변환하며, 이벤트 간 시간 관계(시작/종료 시간, 지속 시간, 순서)로 연결된다.
  • YAGO11k 기반 템플릿을 사용해 고도로 제어되고 최소한의 감독으로 이루어진 (스토리, 시간적 그래프, 질문, 정답) 샘플을 포함하는 합성 데이터셋인 TempGraph QA를 구성한다.
  • 이를 통해 모델을 사전 훈련하여 시간적 그래프 추출 능력을 향상시키고, 이후의 작업으로의 전이를 가능하게 한다.
  • 체인 오브 토우트 부트스트래핑을 통해 상징적 추론을 유도하며, 감독적 미세조정을 위한 신뢰할 수 있는 중간 추론 단계를 생성한다.
  • 신경-상징적 추론 작업에서의 데이터 부족 문제를 완화하기 위해 두 가지 데이터 증강 전략을 도입한다.
  • 추론 중에 수학적 및 일반 지식 외부 지식을 통합하여 추론 능력을 향상시킨다.
Figure 1: Our TempGraph-LLM framework has two steps: text-to-tempgraph translation and neuro-symbolic reasoning.
Figure 1: Our TempGraph-LLM framework has two steps: text-to-tempgraph translation and neuro-symbolic reasoning.

실험 결과

연구 질문

  • RQ1최소한의 감독으로 자연어 텍스트에서 구조화된 시간적 그래프를 효과적으로 추출할 수 있는 대규모 언어 모델을 훈련시킬 수 있는가?
  • RQ2자연어 텍스트 기반 체인 오브 토우트 추론 방식에 비해, 중간 단계를 구조화된 형태로 제공하는 상징적 추론이 LLM의 시간적 추론 능력의 신뢰성과 정확도를 향상시키는가?
  • RQ3완전히 제어 가능한 합성 시간적 질의응답 데이터셋에 대해 사전 훈련을 수행할 경우, 추후의 시간적 추론 작업에서 zero-shot 또는 few-shot 성능 향상 정도는 어느 정도인가?
  • RQ4데이터 증강과 외부 지식 통합은 복잡한 뉴런-상징적 추론 작업에서 LLM의 성능에 어떤 영향을 미치는가?
  • RQ5그래프 기반 뉴런-상징적 프레임워크는 다양한 시간적 추론 벤치마크에서 일반화될 수 있으며, 기존의 프ompting 및 미세조정 방법을 능가할 수 있는가?

주요 결과

  • TempGraph-LLM 프레임워크는 Llama2-13B를 사용하여 TempGraph QA 벤치마크에서 79.5%의 정확도를 달성하며, 기준 미세조정 모델보다 14.9%포인트 높은 성능을 보였다.
  • 부트스트래핑된 체인 오브 토우트 단계를 포함한 상징적 추론은 자유형 CoT에 비해 성능을 5.9%포인트 향상시켜 더 높은 일관성과 신뢰성을 입증했다.
  • 상징적 추론과 결합했을 때 데이터 증강은 성능을 4.0%포인트 향상시켰다(75.3%에서 79.7%로), 낮은 데이터 환경에서의 중요성을 입증했다.
  • 합성된 TempGraph QA 데이터셋에 대해 사전 훈련한 결과는 다른 작업으로의 전이가 잘 이루어져, 시간적 그래프 학습이 훈련 분포를 초월해 일반화됨을 보여주었다.
  • 외부 지식(수학적 및 일반 지식) 통합은 상징적 추론과 결합했을 때 성능을 2.1%포인트 향상시켰다(75.3%에서 77.6%로), 성능 향상에 기여했다.
  • 제거 실험 결과, 시간적 그래프 표현과 상징적 추론 모두가 핵심 요소임을 확인했으며, 둘 중 하나를 제거할 경우 성능이 크게 저하됨을 입증했다.
Figure 2: Performance comparison between different strategies of CoT generation on TempGraph QA.
Figure 2: Performance comparison between different strategies of CoT generation on TempGraph QA.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.