[논문 리뷰] TRAM: Benchmarking Temporal Reasoning for Large Language Models
TRAM은 10개의 시간적 추론 작업을 포함하는 종합적인 벤치마크로, 지속 기간, 빈도, 산술, 인과관계 및 시간적 관계를 포함한다. 다양한 출처에서 유래한 526.1만 개의 다중선택지 문제로 구성되어 있다. GPT-4 및 Llama2와 같은 LLM에서 평가된 결과, 심지어 최첨단 모델들이라도 인간 수준의 성능에 못 미치며, GPT-4는 평균 정확도 87.8%를 기록하여 암묵적인 시간적 신호 이해에 여전히 도전 과제가 있음을 드러낸다.
Reasoning about time is essential for understanding the nuances of events described in natural language. Previous research on this topic has been limited in scope, characterized by a lack of standardized benchmarks that would allow for consistent evaluations across different studies. In this paper, we introduce TRAM, a temporal reasoning benchmark composed of ten datasets, encompassing various temporal aspects of events such as order, arithmetic, frequency, and duration, designed to facilitate a comprehensive evaluation of the TeR capabilities of large language models (LLMs). We evaluate popular LLMs like GPT-4 and Llama2 in zero-shot and few-shot scenarios, and establish baselines with BERT-based and domain-specific models. Our findings indicate that the best-performing model lags significantly behind human performance. It is our aspiration that TRAM will spur further progress in enhancing the TeR capabilities of LLMs.
연구 동기 및 목표
- 대규모 언어 모델(LMM)의 시간적 추론 평가를 위한 통합적이고 표준화된 벤치마크 부족 문제를 해결하기 위함.
- 지속 기간, 빈도, 산술, 인과관계 및 시간적 관계를 포함한 기본적이고 고급 시간적 추론 능력에 대한 종합적 평가를 수행하기 위함.
- 다양한 LLM 아키텍처와 프롬프팅 전략(제로샷, 희소샷, 체인 오브 썬스) 간 일관된 평가를 지원하는 벤치마크를 구축하기 위함.
- 현재 LLM에서 암묵적인 시간적 신호와 세밀한 시간적 서사 이해에 있어 지속적인 한계를 규명하기 위함.
제안 방법
- TRAM은 기존 데이터셋, 인간이 만든 템플릿, 웹 자료, 프로그래밍적 생성 방식으로 유래한 10개의 시간적 추론 작업을 통합한다.
- 각 작업은 다중선택지 문제 형식으로 구성되어 있어 LLM의 표준화된 제로샷 평가가 가능하도록 설계되었다.
- 질문은 다양한 출처에서 유래한다: 시간적 관계는 TimeBank 및 TempEval-3에서, 시간적 NLI는 SNLI/MNLI에서, 인과관계는 COPA 기반에서, 스토리텔링은 ROCStories/SCT에서 유래하였다.
- 전문가의 주석과 프로그래밍적 생성을 활용해 답변를 생성함으로써 고품질이고 일관된 레이블링을 보장한다.
- 벤치마크는 38개의 하위작업과 526.1만 개의 질문을 포함하며, 다양한 맥락에서 명시적 및 암묵적인 시간적 표현을 모두 다룬다.
- 모델 평가는 제로샷, 희소샷, 체인 오브 썬스 프롬프팅을 사용하며, 제한된 데이터로 미세조정된 BERT 스타일 모델을 활용한다.
실험 결과
연구 질문
- RQ1현재의 대규모 언어 모델은 통합적이고 종합적인 시간적 추론 작업 벤치마크에서 얼마나 잘 수행되는가?
- RQ2GPT-4, Llama2, PaLM2와 같은 다양한 LLM 아키텍처가 시간적 지속 기간, 빈도 및 산술 능력에서 상대적으로 어떤 강점과 약점을 지니는가?
- RQ3LLM이 인과관계나 맥락 기반 시간 참조와 같은 암묵적인 시간적 신호를 처리하는 데 얼마나 어려움을 겪는가?
- RQ4표준 프롬프팅 대비 복잡한 시간적 추론 작업에서 체인 오브 썬스 프롬프팅이 성능에 어떤 영향을 미치는가?
- RQ5최첨단 LLM은 시간적 추론에서 인간 수준의 성능에 얼마나 뒤쳐져 있는가?
주요 결과
- GPT-4는 TRAM 작업 전반에서 평균 정확도 87.8%를 기록하며 다른 LLM과 BERT 기반 모델보다 뛰어난 성능을 보였다.
- 강력한 성능에도 불구하고 GPT-4는 인간 수준의 성능보다 약 10% 뒤져 있어 향후 개선 여지가 크다는 것을 시사한다.
- 모델들은 암묵적인 시간적 신호, 예를 들어 시간적 인과관계나 세밀한 사건 순서에 대해 일관되게 어려움을 겪고 있으며, 고급 모델들 역시 마찬가지다.
- 작업 유형 간 성능 격차가 존재하며, 특히 산술과 인과관계 작업에서 도전 과제가 뚜렷하다.
- 수동 오류 분석 결과, 모델들은 신호가 암묵적이거나 맥락 의존적인 경우 시간적 관계를 잘못 해석하는 경향이 있다.
- 벤치마크는 현재 LLM이 시간적 서사와 사건 기반 추론에 대해 견고한 이해를 하지 못하며, 특히 현실적이고 맥락이 풍부한 상황에서의 이해에 한계를 지닌다는 것을 드러낸다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.