Skip to main content
QUICK REVIEW

[논문 리뷰] Reliable Natural Language Understanding with Large Language Models and Answer Set Programming

Abhiramon Rajasekharan, Yankai Zeng|arXiv (Cornell University)|2023. 02. 07.
Topic Modeling참고 문헌 27인용 수 5
한 줄 요약

이 논문은 자연어 이해에서 신뢰할 수 있고 설명 가능한 추론을 위해 대규모 언어 모델(Large Language Models, LLMs)을 의미 분석에, 답변 집합 프로그래밍(Answer Set Programming, ASP)을 논리 기반 추론에 활용하는 STAR라는 프레임워크를 제안한다. LLM을 사용해 텍스트에서 술어를 추출하고, ASP를 통해 목표 지향적이고 논리 기반의 추론을 수행함으로써, STAR는 특히 작은 LLM에서의 추론 정확도를 크게 향상시키며, 질적 추론, 수학 word 문제, 상호작용 기반 콘시어지 대화에 이르기까지 전반적인 설명 가능성에 기여하는 증명 트리를 생성한다.

ABSTRACT

Humans understand language by extracting information (meaning) from sentences, combining it with existing commonsense knowledge, and then performing reasoning to draw conclusions. While large language models (LLMs) such as GPT-3 and ChatGPT are able to leverage patterns in the text to solve a variety of NLP tasks, they fall short in problems that require reasoning. They also cannot reliably explain the answers generated for a given question. In order to emulate humans better, we propose STAR, a framework that combines LLMs with Answer Set Programming (ASP). We show how LLMs can be used to effectively extract knowledge -- represented as predicates -- from language. Goal-directed ASP is then employed to reliably reason over this knowledge. We apply the STAR framework to three different NLU tasks requiring reasoning: qualitative reasoning, mathematical reasoning, and goal-directed conversation. Our experiments reveal that STAR is able to bridge the gap of reasoning in NLU tasks, leading to significant performance improvements, especially for smaller LLMs, i.e., LLMs with a smaller number of parameters. NLU applications developed using the STAR framework are also explainable: along with the predicates generated, a justification in the form of a proof tree can be produced for a given output.

연구 동기 및 목표

  • 복잡한 추론 작업에서 LLM의 한계를 해결하기 위해, 잘못된 추론이나 설명 가능성 부족으로 인해 오류가 자주 발생하는 문제를 해결한다.
  • 의미 분석, 일반 지식, 명시적 추론을 통합함으로써 인간과 유사한 언어 이해를 모방하는 시스템을 개발한다.
  • 다단계 추론이 필요한 NLU 응용 프로그램에서 성능과 신뢰성을 향상시키며, 특히 추론 능력이 제한된 작은 LLM을 대상으로 한다.
  • 추론 과정을 설명할 수 있는 증명 트리를 통해 설명 가능한 출력을 생성함으로써 투명성과 오류 분석을 가능하게 한다.
  • 유저가 제공한 정보를 잘못 추론하거나 모순 없이 정확히 추적하는 상호작용 기반의 목표 지향적 대화를 가능하게 한다.

제안 방법

  • 세부적으로 튜닝하거나 인라인 학습을 활용한 LLM(GPT-3 변종 등)을 사용해 자연어를 의미를 담은 논리적 술어로 변환한다.
  • 도메인 특화 일반 지식을 답변 집합 프로그래밍(ASP)의 규칙으로 인코딩하여 형식적이고 논리 기반의 추론을 가능하게 한다.
  • LLM이 추출한 술어와 ASP로 코드화된 지식을 결합한 지식 기반을 기반으로 목표 지향적 ASP 솔버(s(CASP))를 실행하여 질의를 처리한다.
  • 사용자 질문이나 대화 목표를 나타내기 위해 수동 또는 LLM을 통해 질의를 생성한다.
  • ASP 추론 과정에서 유도된 증명 트리를 구성하여 각 답변에 대한 설명 가능한 출력을 생성한다.
  • 세 가지 다른 NLU 응용 프로그램에 프레임워크를 통합한다: 질적 추론, 수학 word 문제, 상호작용 기반 콘시어지 대화.

실험 결과

연구 질문

  • RQ1LLM과 ASP를 융합함으로써 LLM 단독 사용 대비 NLU 작업에서 추론 성능을 향상시킬 수 있는가?
  • RQ2STAR 프레임워크는 다단계 논리가 필요한 작업에서 특히 작은 LLM에서 추론 오류를 줄일 수 있는가?
  • RQ3시스템은 추론 과정을 추적할 수 있는 증명 트리를 통해 설명 가능한 출력을 생성할 수 있는가?
  • RQ4LLM 기반 봇과 비교했을 때, 상호작용 기반의 목표 지향적 대화에서 프레임워크의 성능은 어떠한가?
  • RQ5의미 분석(Lang. LLM)과 추론(ASP)의 분리가 신뢰성 향상과 지식 투명성 향상에 어느 정도 기여하는가?

주요 결과

  • STAR는 질적 추론과 수학 word 문제에서 답변 예측 정확도를 크게 향상시키며, 특히 Curie(~6.7B 파rameters)와 같은 작은 LLM에서 성능 향상이 두드러진다.
  • 시스템은 각 답변을 정당화하는 증명 트리를 생성하여 추론의 완전한 설명 가능성과 투명성을 확보한다. 이는 LLM 단독으로는 이룰 수 없는 것이다.
  • 콘시어지 대화 작업에서 STAR 기반 봇은 LLM 단독 대화 봇과 달리 일관성을 유지하고, 사용자가 제공한 정보를 잘못 생성하거나 혼동하지 않는다.
  • 시스템은 잘못된 정보를 정확히 식별하고 누락된 정보를 요청함으로써 상호작용 환경에서 더 나은 제어를 가능하게 하여 더 신뢰성 있고 일관성 있는 대화를 이끈다.
  • LLM이 추출한 술어와 ASP 지식의 통합을 통해 추론 실패 원인 진단과 일반 지식의 격차를 식별할 수 있다.
  • STAR는 대부분의 QuaRel 데이터셋에서 질적 추론 작업에서 최신 기술 수준을 넘어섰으며, 이는 구조화된 추론 작업에서의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.