Skip to main content
QUICK REVIEW

[논문 리뷰] Properties and Challenges of LLM-Generated Explanations

Jenny Kunz, Marco Kuhlmann|arXiv (Cornell University)|2024. 02. 16.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)이 생성한 설명의 성질을 조사하며, Alpaca 지시 미세조정 데이터셋에서 GPT-4가 생성한 출력을 중심으로 분석한다. 연구 결과, LLM에 의해 생성된 설명은 인간 설명에서 흔히 볼 수 있는 선택성과 예시적 요소를 자주 보이며, 이는 인간 설명의 특성과 유사하다. 반면 주관성과 오해를 유도하는 내용은 덜 빈도로 나타나지만 여전히 존재한다. 본 연구는 이러한 성질이 적용 맥락과 사용자 집단에 따라 긍정적·부정적 영향을 미칠 수 있음을 강조한다.

ABSTRACT

The self-rationalising capabilities of large language models (LLMs) have been explored in restricted settings, using task/specific data sets. However, current LLMs do not (only) rely on specifically annotated data; nonetheless, they frequently explain their outputs. The properties of the generated explanations are influenced by the pre-training corpus and by the target data used for instruction fine-tuning. As the pre-training corpus includes a large amount of human-written explanations "in the wild", we hypothesise that LLMs adopt common properties of human explanations. By analysing the outputs for a multi-domain instruction fine-tuning data set, we find that generated explanations show selectivity and contain illustrative elements, but less frequently are subjective or misleading. We discuss reasons and consequences of the properties' presence or absence. In particular, we outline positive and negative implications depending on the goals and user groups of the self-rationalising system.

연구 동기 및 목표

  • 인간 설명에서 흔히 간주되지만 설명 가능한 인공지능(XAI)에 부적절하다고 여겨지는 일반적인 성질들, 예를 들어 선택성, 주관성, 예시적 요소를 식별하고 체계화하기.
  • 이러한 인간 유사 설명 성질이 GPT-4를 통해 Alpaca 데이터셋을 사용해 생성된 LLM의 설명에 어느 정도 반영되어 있는지 조사하기.
  • 이러한 성질이 신뢰성, 안전성, 문제 진단, 지식 탐색 등의 설명 가능한 자연어 처리(NLP) 목표에 미치는 영향을 평가하기.
  • 이러한 설명 성질이 다양한 응용 맥락에서 종류별 사용자 집단(예: 최종 사용자, 개발자, 연구자)에게 어떻게 영향을 미치는지 평가하기.
  • 인간 유사 자연스러움과 모델 설명의 충실성, 정확성, 완전성에 대한 기술적 요구 사항 사이의 상충 관계를 부각하기.

제안 방법

  • GPT-4가 생성한 Alpaca 데이터셋의 지시 수행 예시 100건을 대상으로 인간 주관 연구를 수행하였다.
  • 선택성, 예시적 요소, 주관성, 오해를 유도하는 내용 등 특정 성질을 보이는지 평가하기 위해 구조화된 설문지를 사용하였다.
  • 일致한 주관 가이드라인을 바탕으로 세 명의 평가자가 질적·정량적 코드화를 통해 각 성질의 빈도와 맥락을 분석하였다.
  • 신뢰성, 문제 진단, 지식 탐색 등의 특정 용도와 성질의 존재를 연결하여 功能적 영향을 평가하기 위해 매핑하였다.
  • 지시 미세조정 및 필터링과 같은 정렬 기법이 주관성과 오해 유도성과 같은 바람직하지 않은 성질을 줄이는 데 미치는 영향을 평가하였다.
  • 이전 인간 주관 설명 데이터셋 연구와의 비교를 통해 모델 생성 설명과 인간 주관 설명 간 성질의 차이를 대비 분석하였다.
Figure 1: Distribution of the categories defined in Section 4.1 in the evaluation set.
Figure 1: Distribution of the categories defined in Section 4.1 in the evaluation set.

실험 결과

연구 질문

  • RQ1Alpaca 데이터셋 내 LLM에 의해 생성된 설명이 인간 설명에서 흔히 볼 수 있는 성질들, 예를 들어 선택성과 예시적 요소를 어느 정도 반영하고 있는가?
  • RQ2LLM에 의해 생성된 설명에서 주관성 또는 오해를 유도하는 내용이 얼마나 자주 나타나며, 이러한 성질을 줄이는 데 기여하는 훈련 및 정렬 과정의 요소는 무엇인가?
  • RQ3LLM에 의해 생성된 설명의 성질이 모델 신뢰성 향상, 문제 진단 지원, 지식 탐색 지원 등의 목적으로서의 유용성에 어떻게 영향을 미치는가?
  • RQ4LLM에 의해 생성된 설명의 성질이 종류별 사용자 집단(예: 최종 사용자, 개발자, 연구자)의 기대와 어떻게 일치하거나 충돌하는가?
  • RQ5지시 유형과 도메인에 따라 설명 성질이 어떻게 다름을 보이며, Alpaca 데이터셋의 결과를 일반화할 수 있는 한계는 무엇인가?

주요 결과

  • Alpaca 데이터셋 내 LLM에 의해 생성된 설명은 종종 선택성을 보이며, 이는 전체 추론 과정을 완전히 설명하기보다는 특정 측면만 강조하기 때문이다.
  • 비유, 예시, 은유와 같은 예시적 요소는 설명 과정에서 흔히 존재하여 접근성과 논리적 설득력 향상에 기여한다.
  • 주관적 내용은 상대적으로 빈도가 낮았으며, 이는 GPT-4의 훈련 파이프라인 내 지시 미세조정 및 필터링과 같은 정렬 과정의 영향으로 보인다.
  • 오해를 유도하는 설명은 매우 드물게 관찰되었지만, Alpaca 데이터셋에 포함되지 않은 저확률 또는 분포 외 입력에서는 위험이 증가할 수 있다.
  • 부정적인 특성인 불완전성이나 논리적 설득력이 있음에도 불구하고, 이러한 성질은 교육 또는 디버깅과 같이 명확성과 참여도가 중요한 맥락에서는 유용할 수 있다.
  • 본 연구는 선택성과 예시적 요소와 같은 성질이 본질적으로 문제가 되지 않으며, 특히 숙련도가 낮은 사용자에게서는 사용성 향상에 기여할 수 있음을 강조한다. 이는 모델 추론에 대한 충실도가 약간 훼손되더라도 성립한다.
Figure 2: Comparison of the yes -answers the three annotators (A1, A2, A3) for Questions Q1 (“Does the output contain an explanation for the prediction?”) and Q2 (“Would you give an explanation/justify your reasoning if you were asked this question by a friend?”).
Figure 2: Comparison of the yes -answers the three annotators (A1, A2, A3) for Questions Q1 (“Does the output contain an explanation for the prediction?”) and Q2 (“Would you give an explanation/justify your reasoning if you were asked this question by a friend?”).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.