Skip to main content
QUICK REVIEW

[논문 리뷰] CKBP v2: Better Annotation and Reasoning for Commonsense Knowledge Base Population

Tianqing Fang, Quyet V. Do|arXiv (Cornell University)|2023. 04. 20.
Topic Modeling인용 수 7
한 줄 요약

CKBP v2는 공감 지식 기반 인덱스(population)를 위한 고품질 전문가 주석 평가 기준을 도입하며, CKBP v1의 한계를 보완한다. CKBP v1은 군중 주석을 사용하고 무작위 샘플링을 하였지만, CKBP v2는 전문가 주석으로 대체하고 다양한 악성 샘플을 통합하여 대표성과 난이도를 향상시켰다. 최신 기술 모델, 특히 ChatGPT와 같은 대규모 언어 모델들조차도 성능이 낮게 나타나, 이 작업이 여전히 매우 도전적인 과제임을 시사한다.

ABSTRACT

Commonsense Knowledge Bases (CSKB) Population, which aims at automatically expanding knowledge in CSKBs with external resources, is an important yet hard task in NLP. Fang et al. (2021a) proposed a CSKB Population (CKBP) framework with an evaluation set CKBP v1. However, CKBP v1 relies on crowdsourced annotations that suffer from a considerable number of mislabeled answers, and the evaluationset lacks alignment with the external knowledge source due to random sampling. In this paper, we introduce CKBP v2, a new high-quality CSKB Population evaluation set that addresses the two aforementioned issues by employing domain experts as annotators and incorporating diversified adversarial samples to make the evaluation data more representative. We show that CKBP v2 serves as a challenging and representative evaluation dataset for the CSKB Population task, while its development set aids in selecting a population model that leads to improved knowledge acquisition for downstream commonsense reasoning. A better population model can also help acquire more informative commonsense knowledge as additional supervision signals for both generative commonsense inference and zero-shot commonsense question answering. Specifically, the question-answering model based on DeBERTa-v3-large (He et al., 2023b) even outperforms powerful large language models in a zero-shot setting, including ChatGPT and GPT-3.5.

연구 동기 및 목표

  • CKBP v1의 낮은 품질과 낮은 대표성 문제를 해결하기 위해, 군중 주석과 무작위 샘플링에 의존하는 기존 방식을 개선하고자 한다.
  • NLP 및 기계적 공감 지식 전문성을 지닌 연구자들이 주석한 전문가 주석으로 군중 주석을 대체함으로써 평가 신뢰도를 향상시키고자 한다.
  • 확장된 LLM 예측에서 유도된 악성으로 구성된 샘플을 통합함으로써 데이터셋의 다양성과 난이도를 향상시키고자 한다.
  • 향후 CSKB 인덱스 모델 평가를 위한 새로운 더 엄격한 기준을 수립하고자 한다.
  • 심지어 최신 모델, 특히 LLMs조차도 분포 외(out-of-distribution, OOD) 및 악성 예측에 어려움을 겪고 있음을 입증함으로써, 이 과제가 여전히 높은 난이도를 지닌다는 점을 강조하고자 한다.

제안 방법

  • 관계 비율을 유지하기 위해 CKBP v1에서 무작위로 2,500개의 인스턴스를 샘플링하여 균형 잡힌 표현을 확보하였다.
  • 미세조정된 KG-BERT 모델이 유의미하게 타당성(점수 ≥ 0.9)으로 판단한 ASER의 삼중항을 활용해 2,500개의 악성 인스턴스를 생성하였다.
  • 자기-BLEU를 사용한 다양성 필터를 적용하여 악성 샘플이 의미적으로 유사하지 않도록 하고, 중복을 방지하였다.
  • NLP 및 공감 추론 경험이 있는 4명의 전문가 주석자들이 전체 5,000개 인스턴스의 타당성에 대해 주석을 제공하였다.
  • 분류 모델에서 관계 표현을 위해 특수 토큰 [r]을 사용하고, 제로샷 LLM 추론을 위해 프롬프트 형식을 적절히 조정하였다.
  • 분류 모델(KG-BERT)과 생성 모델(COMET, GPT2)을 대상으로 광범위한 실험을 수행하였으며, 제로샷 및 반감독 설정을 포함하였다.

실험 결과

연구 질문

  • RQ1전문가 주석 데이터가 군중 주석에 비해 CSKB 인덱스 평가 기준의 신뢰도와 품질을 크게 향상시킬 수 있는가?
  • RQ2악성으로 구성된 샘플의 포함 여부가 평가 세트의 난이도와 대표성에 기여하는가?
  • RQ3최신 기술 모델, 특히 ChatGPT와 같은 LLM들이 CKBP v2 기준에서 CKBP v1에 비해 어떻게 성능을 내는가?
  • RQ4모델들이 공감 추론에서 분포 외(OOD) 및 악성 예측에 얼마나 잘 일반화되는가?
  • RQ5성능 저하를 초래하는 주요 예측 실패 패턴은 무엇인가? 이는 새로운 또는 복잡한 공감 시나리오에서 나타난다.

주요 결과

  • CKBP v2는 전체 어휘 항목 3,852개 중 단지 83개의 아티팩트를 포함하고 있으나, 이들의 낮은 빈도는 평가 세트의 품질에 크게 영향을 주지 않는다.
  • OOD 서브셋에서의 F1 스코어는 악성 서브셋보다 낮은데, 이는 타당한 샘플 비율이 낮고 악성 세트에서 재현율(recall)이 더 높기 때문이다.
  • GPT2-large와 GPT2-XL은 파라미터 수가 더 많음에도 불구하고 유사한 성능을 보이며, 이는 이 작업에 대해 규모 증가의 수익 감소 현상이 나타남을 시사한다.
  • KG-BERT는 AUC 측면에서 COMET(GPT2)를 크게 앞서며, 양방향 삼중항(긍정 및 부정)을 학습한 덕분에 분류 능력이 뛰어나다는 점을 입증한다.
  • 모든 모델, ChatGPT를 포함해도 OOD 일반화 문제로 심각한 성능 저하를 겪고 있어, 새로운 공감 시나리오에 대한 강건성(robustness)이 떨어짐을 시사한다.
  • 오류 패턴으로는 의미적으로 관련은 있지만 타당하지 않은 삼중항을 타당하다고 잘못 분류하거나, 새로운 개체나 사건을 포함한 타당한 삼중항을 잘못 거부하는 경우가 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.