Skip to main content
QUICK REVIEW

[논문 리뷰] Language Models of Code are Few-Shot Commonsense Learners

Aman Madaan, Shuyan Zhou|arXiv (Cornell University)|2022. 10. 13.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 구조화된 공통 지식 추론 작업(예: 스크립트 및 추론 그래프 생성)을 대규모 프로그래밍 언어 모델(코드-LLM)을 사용해 코드 생성 문제로 재정의하는 CoCoGen을 제안한다. 구조적 출력을 실행 가능한 파이썬 코드로 변환함으로써 CoCoGen은 Codex와 같은 코드-LLM이 자연어 LLM(예: T5, GPT-3)보다 세 가지 다양한 작업에서 few-shot 설정에서 더 뛰어난 구조적 정확도와 추론 품질을 달성하도록 한다. 이는 작업별 미세조정 없이도 가능하다.

ABSTRACT

We address the general task of structured commonsense reasoning: given a natural language input, the goal is to generate a graph such as an event -- or a reasoning-graph. To employ large language models (LMs) for this task, existing approaches ``serialize'' the output graph as a flat list of nodes and edges. Although feasible, these serialized graphs strongly deviate from the natural language corpora that LMs were pre-trained on, hindering LMs from generating them correctly. In this paper, we show that when we instead frame structured commonsense reasoning tasks as code generation tasks, pre-trained LMs of code are better structured commonsense reasoners than LMs of natural language, even when the downstream task does not involve source code at all. We demonstrate our approach across three diverse structured commonsense reasoning tasks. In all these natural language tasks, we show that using our approach, a code generation LM (CODEX) outperforms natural-LMs that are fine-tuned on the target task (e.g., T5) and other strong LMs such as GPT-3 in the few-shot setting.

연구 동기 및 목표

  • 대규모 언어 모델을 사용해 구조화된 공통 지식 출력(예: 이벤트 그래프, 추론 그래프)을 생성하는 데 도전하는 것.
  • 기존 접근 방식이 자연어 모델에 적합하지 않은 평탄하고 자연스럽지 않은 텍스트 형식으로 구조적 출력을 직렬화하는 한계를 규명하는 것.
  • 프로그래밍 구문과 구조에 대해 사전 훈련된 코드 생성 모델이 구조적 추론 작업을 더 잘 처리할 수 있는지 탐색하는 것.
  • 공동 지식 추론을 코드 생성으로 프레임링하는 것이 few-shot 설정에서 모델 성능을 향상시킨다는 것을 입증하는 것.

제안 방법

  • 구조화된 공통 지식 출력(예: 이벤트 또는 추론 그래프)을 계층적이고 관계적인 구조를 유지하는 실행 가능한 파이썬 코드 표현으로 변환하는 것.
  • 사전 훈련된 코드-LLM(예: Codex)을 사용해 자연어 프롬프트에서 이러한 코드 표현을 직접 생성하는 것.
  • 파이썬의 객체 지향 구문을 사용해 노드를 클래스 인스턴스로, 간선을 부모-자식 관계로 표현하는 것.
  • 작업별 미세조정 없이 few-shot 설정에서 코드-LLM을 훈련하거나 프롬프팅하며, 코드 코퍼스에 대한 사전 훈련을 활용하는 것.
  • 생성된 코드를 유효한 구조적 출력(예: 그래프)으로 파싱하여 후속 평가를 위한 것.
  • 표준 평가 지표(예: F1, 정확한 일치, 구조적 정확도)를 사용해 자연어 LLM과의 성능 비교를 수행하는 것.

실험 결과

연구 질문

  • RQ1동일한 작업에 대해 미세조정된 경우, 코드-LLM이 자연어 LLM보다 구조화된 공통 지식 출력을 더 정확하게 생성할 수 있는가?
  • RQ2구조적 출력을 실행 가능한 코드로 표현하면 few-shot 추론 설정에서 모델 성능이 향상되는가?
  • RQ3코드 형식 대비 직렬화된 텍스트 형식(예: DOT 또는 간선 목록)을 사용할 때 생성된 출력의 구조적 충실도는 어떻게 비교되는가?
  • RQ4한 개의 코드-LLM이 작업별 미세조정 없이 다양한 구조화된 공통 지식 추론 작업에 일반화될 수 있는가?

주요 결과

  • 스크립트 생성, 이벤트 그래프 구축, 추론 그래프 생성의 세 가지 구조화된 공통 지식 추론 작업 전반에서, Codex는 few-shot 설정에서 미세조정된 T5 및 GPT-3 모델보다 성능이 뛰어났다.
  • 특히 구조적 정확도에서 성능 향상이 두드러졌으며, 자연어 LLM에 비해 구문적 오류와 위상적 오류가 적게 발생했다.
  • CoCoGen은 기준 모델보다 더 높은 F1 점수와 정확한 일치 점수를 확보하여, 코드 표현 방식이 직렬화된 텍스트 형식보다 그래프 구조를 더 잘 유지함을 입증했다.
  • 이 방법은 다양한 작업에 걸쳐 뛰어난 강건성을 보였으며, 입력이 순수한 자연어일지라도 코드-LLM이 구조적 추론에 일반화될 수 있음을 시사한다.
  • 결과는 코드-LLM의 프로그래밍 구문과 의미에 대한 사전 훈련이 구조적 생성을 위한 뛰어난 구조적 추론 능력을 제공한다는 것을 시사한다.
  • 저자들은 자연어 LLM이 직렬화된 형식을 생성할 때 그래프 위상을 유지하는 데 어려움을 겪는 반면, 코드-LLM은 적절한 코드 구조를 통해 관계를 유지함을 관찰했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.