Skip to main content
QUICK REVIEW

[논문 리뷰] "I'd Like to Have an Argument, Please": Argumentative Reasoning in Large Language Models

Adrian de Wynter, Tangming Yuan|arXiv (Cornell University)|2023. 09. 29.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 GPT-3와 GPT-4의 추론 능력을 논증 마이닝(AM) 및 논증 쌍 추출(APE) 작업을 통해 평가하며, 구체적인 텍스트에서 추상적인 기호 형식인 AMR 그래프에 이르기까지 다양한 입력 및 출력 표현 방식을 검토한다. 모델 성능은 표현 설계에 매우 민감하며, 최적의 예시 수는 4~5개이지만, 체인 오브 토우(Chain-of-Thought, CoT) 프롬프팅이 이러한 민감성을 완화시키고 '예시 효과'를 제거함으로써 복잡한 추론 시나리오에서의 강인성을 향상시킨다는 점을 발견한다.

ABSTRACT

We evaluate two large language models (LLMs) ability to perform argumentative reasoning. We experiment with argument mining (AM) and argument pair extraction (APE), and evaluate the LLMs' ability to recognize arguments under progressively more abstract input and output (I/O) representations (e.g., arbitrary label sets, graphs, etc.). Unlike the well-known evaluation of prompt phrasings, abstraction evaluation retains the prompt's phrasing but tests reasoning capabilities. We find that scoring-wise the LLMs match or surpass the SOTA in AM and APE, and under certain I/O abstractions LLMs perform well, even beating chain-of-thought--we call this symbolic prompting. However, statistical analysis on the LLMs outputs when subject to small, yet still human-readable, alterations in the I/O representations (e.g., asking for BIO tags as opposed to line numbers) showed that the models are not performing reasoning. This suggests that LLM applications to some tasks, such as data labelling and paper reviewing, must be done with care.

연구 동기 및 목표

  • GPT-3 및 GPT-4와 같은 대규모 언어 모델(Large Language Models, LLMs)의 논증적 추론 능력이 데이터 레이블링 및 동료 검토와 같은 실제 응용 분야에서 어떻게 평가되는지 평가하는 것.
  • 구체적인 텍스트에서 추상적인 기호 형식인 AMR 그래프에 이르기까지 다양한 입력 및 출력 표현 방식—예를 들어, 논증 마이닝(AM) 및 논증 쌍 추출(APE) 작업에서 LLM 성능에 미치는 영향을 조사하는 것.
  • 예시 수가 추론 성능에 미치는 영향을 평가하고, 너무 많은 예시가 성능을 떨어뜨리는 '예시 효과'가 존재하는지 확인하는 것.
  • 체인 오브 토우(Chain-of-Thought, CoT) 프롬프팅이 부적절한 입력/출력 표현 방식이나 과도한 예시로 인한 성능 저하를 얼마나 줄이는지 평가하는 것.

제안 방법

  • 연구는 논문-반박 제출 버전 2(RRv2) 데이터셋을 사용하며, 이는 4,764개의 논문-반박 쌍으로 구성되어 있으며, 논증 구간과 논증-반박 대응 관계가 주석 처리되어 있다.
  • 다양한 입력 및 출력 표현 설정—구체적(원시 텍스트), 기호적(임의의 레이블), 추상적(AMR 그래프)—을 통해 추론의 추상화 수준을 테스트하기 위해 실험을 수행한다.
  • AM의 경우 표준 평가 지표(BIO 태깅)와 APE의 경우 표준 평가 지표(이진 매트릭스 정렬)를 사용하여 성능을 평가하며, 다양한 수의 인라인 예시(1~40개)에 따라 결과를 분석한다.
  • 체인 오브 토우(Chain-of-Thought, CoT) 프롬프팅은 단계별 추론 템플릿(예: '한 걸음씩 생각해 봅시다')을 모델에 조건부로 적용하여 비-CoT 기준선과 성능을 비교한다.
  • 분석은 표현 설계와 예시 수가 모델 정확도에 미치는 영향에 집중하며, 다양한 설정 간 성능 추세에 대한 통계적 평가를 수행한다.
  • 연구는 GPT-3와 GPT-4를 모두 평가하며, 특히 CoT가 AMR와 같은 추상적 표현에서 성능에 미치는 영향을 특별히 주목한다. 다만 토큰 제한으로 인해 전체 CoT-AMR 평가는 불가능했다.

실험 결과

연구 질문

  • RQ1구체적인 텍스트에서 추상적인 AMR 그래프에 이르기까지 다양한 입력 및 출력 표현 방식이 AM 및 APE 작업에서 LLM의 논증적 추론 성능에 어떻게 영향을 미치는가?
  • RQ2인라인 예시 수가 추론 성능에 체계적인 영향을 미치는가? 만약 그렇다면 최적의 예시 수가 존재하는가?
  • RQ3체인 오브 토우(Chain-of-Thought, CoT) 프롬프팅이 부적절한 입력/출력 표현 방식이나 과도한 예시로 인한 성능 저하를 어느 정도 완화하는가?
  • RQ4기호적 또는 추상적 표현으로 강제로 전환되었을 때 모델의 추론 행동은 어떻게 변화하며, 이는 신뢰성에 영향을 미치는가?

주요 결과

  • GPT-4는 APE 작업에서 최고 성능(SOTA)을 기록하고, AM 작업에선 거의 최고 성능에 가까운 성능을 보이며, 논증적 추론 능력에 있어 강력한 기본 성능을 확보하고 있음을 시사한다.
  • 입력 표현 방식이 너무 추상적(예: AMR 그래프)이 되면 성능이 크게 저하되지만, 출력 표현이 기호적(예: 레이블 매트릭스)일 경우 상대적으로 안정된 성능을 유지한다. 다만 후자의 경우 절대 성능은 낮아진다.
  • '예시 효과'가 관찰됨: 성능은 4~5개의 예시에서 최고에 도달하고, 더 많은 예시(최대 40개)로 갈수록 선형적으로 감소함. 이는 과도한 컨텍스트가 추론 정확도에 악영향을 미친다는 것을 시사한다.
  • 체인 오브 토우(Chain-of-Thought, CoT) 프롬프팅은 예시 효과를 완전히 제거하고, 다양한 입력 및 출력 표현 방식 간 일관된 출력 분포를 생성함으로써 강인성을 향상시킴을 시사한다.
  • CoT는 절대 성능을 비-CoT 기준선보다 높게 만들지는 않지만, 부적절한 표현 설계나 높은 예시 수로 인한 부정적 영향을 완화시킨다.
  • 연구는 전체 CoT-AMR 평가가 토큰 길이 제약로 인해 불가능하다고 지적하며, 비-CoT AMR와 CoT AMR 간 관찰된 성능 격차는 향후 연구의 핵심 영역임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.