[논문 리뷰] Exploring Large Language Models as a Source of Common-Sense Knowledge for Robots
이 논문은 서비스 로봇을 위한 일반 지식 소스로 대규모 언어 모델(Large Language Models, LLMs)을 조사하며, 온톨로지 구축을 위한 구조적 행동 패턴(행동, 주체, 대상, 도구, 사전 및 사후 행동 상태, 공간 관계 포함)을 추출하는 데 초점을 맞춘다. LLMs는 일반적인 행동 지식의 대규모 추출 잠재력을 보여주지만, 정밀하고 맥락에 특화된 지식에서는 여전히 신뢰할 수 없어, 강력한 로봇 응용을 위해 상징적 지식 그래프와의 융합이 필수적임을 시사한다.
Service robots need common-sense knowledge to help humans in everyday situations as it enables them to understand the context of their actions. However, approaches that use ontologies face a challenge because common-sense knowledge is often implicit, i.e., it is obvious to humans but not explicitly stated. This paper investigates if Large Language Models (LLMs) can fill this gap. Our experiments reveal limited effectiveness in the selective extraction of contextual action knowledge, suggesting that LLMs may not be sufficient on their own. However, the large-scale extraction of general, actionable knowledge shows potential, indicating that LLMs can be a suitable tool for efficiently creating ontologies for robots. This paper shows that the technique used for knowledge extraction can be applied to populate a minimalist ontology, showcasing the potential of LLMs in synergy with formal knowledge representation.
연구 동기 및 목표
- 대규모 언어 모델(Large Language Models, LLMs)이 서비스 로봇을 위한 실용적인 일반 지식 소스로 기능할 수 있는지 평가하는 것.
- LLMs가 도구, 대상 상태, 공간 관계를 포함한 구조적 행동 패턴을 추출하는 데 얼마나 효과적인지 조사하는 것.
- 로봇 지식 표현을 위한 최소한의 온톨로지에 LLMs를 사용해 구축하는 가능성 평가하는 것.
- 전통적 지식 기반 시스템과의 비교를 통해 실세계 로봇 구현에서의 신뢰성 격차를 특정하는 것.
제안 방법
- OWL 2 기술 논리학을 사용해 행동 패턴을 정형화하여, 행동, 주체, 대상, 도구, 사전 및 사후 행동 상태, 공간 관계를 포함한 튜플로 정의한다.
- 제로샷 프롬프팅 전략을 설계: 프롬프트 1은 특정 추출을 위한 전략(예: 주어진 행동에 대한 도구), 프롬프트 2는 도메인(예: '주방')당 100개의 행동 패턴을 대규모로 추출하기 위한 전략.
- GPT-3.5-turbo, GPT-4, BLOOMZ, BERT 등 다양한 LLMs를 사용해 97개의 인간 레이블링된 행동 패턴으로 구성된 기준 데이터셋을 평가한다.
- 정합성 있는 출력을 확보하기 위해 온도=0을 설정하고, 후보 목록 제공을 통해 신뢰도 향상 방법을 시뮬레이션하여 로봇 인식 기반 추출을 모방한다.
- 추출된 행동 패턴을 OWL 2 온톨로지로 변환하는 파이프라인을 구현하여 상징적 AI 추론 시스템과의 통합 가능성을 확보한다.
- F1@n 점수를 사용해 다양한 추출 작업에서 정밀도와 재현율을 측정하며, n은 상위 n개의 결과 순위를 의미한다.

실험 결과
연구 질문
- RQ1LLMs는 로봇 작업을 위한 도구나 대상 상태와 같은 행동 가능한 일반 지식을 신뢰성 있게 추출할 수 있는가?
- RQ2인간 레이블링 기준 데이터와 비교했을 때, LLMs는 완전한 행동 패턴을 얼마나 효과적으로 추출하는가?
- RQ3LLMs는 도메인 특화 온톨로지에 대해 유효하고 일반적인 목적의 행동 패턴을 얼마나 잘 확장하여 생성할 수 있는가?
- RQ4프롬프팅 전략과 후보 기반 지식 보정이 추출 정확도 향상에 어떤 역할을 하는가?
- RQ5LLMs로 추출한 지식는 로봇 추론 시스템에서 사용 가능한 공식 온톨로지에 효과적으로 통합될 수 있는가?
주요 결과
- GPT-3.5-turbo와 GPT-4는 다른 모델들보다 도구 추출에서 뛰어난 성능을 보였으며, 가장 높은 F1@n 점수를 기록했고, 특히 GPT-4는 구조적 출력 일관성에서 뛰어난 성능을 보였다.
- 데마스킹 기법을 사용해 공간 관계를 추출한 결과가 가장 우수했으며, 이는 일부 지식 유형이 LLM 기반 추출에 더 적합함을 시사한다.
- 행동 이전 및 이후의 대상 상태 추출이 가장 정확도가 낮았으며, 이는 LLMs가 동적 상태 변화를 모델링하는 데 핵심적인 한계를 지닌다는 것을 시사한다.
- 세부 추출 정밀도가 낮음에도 불구하고, '주방' 도메인에 대해 추출한 100개의 행동 패턴 모두 수작업으로 유효성 검증되었으며, 이는 확장성과 일반적 유용성을 입증한다.
- 온도 조정이 성능에 미치는 영향은 미미했으며, 이는 결정론적 추론(온도=0)이 지식 추출 파이프라인에 충분하고 신뢰할 수 있음을 확인한다.
- 이 연구는 LLMs가 아직 로봇 응용을 위한 단독 지식 소스로는 신뢰할 수 없지만, 상징적 추론과 결합할 경우 초기 온톨로지 구축을 위한 확장 가능한 도구로 매우 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.