Skip to main content
QUICK REVIEW

[論文レビュー] Unsupervised Real-Time Hallucination Detection based on the Internal States of Large Language Models

Weihang Su, Changyue Wang|arXiv (Cornell University)|Mar 11, 2024
Anomaly Detection Techniques and Applications被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)の推論中に内部状態(例:文脈的埋め込み、注目、活性化)を活用して、手動のアノテーションを必要とせず事実誤認を検出する、非教師ありでリアルタイムな幻覚検出フレームワークMINDを提案する。MINDは新しいHELMBenchmarkにおいて最先端の性能を達成し、低遅延かつ既存のLLMsと完全に互換性を持つ高精度な性能を示している。

ABSTRACT

Hallucinations in large language models (LLMs) refer to the phenomenon of LLMs producing responses that are coherent yet factually inaccurate. This issue undermines the effectiveness of LLMs in practical applications, necessitating research into detecting and mitigating hallucinations of LLMs. Previous studies have mainly concentrated on post-processing techniques for hallucination detection, which tend to be computationally intensive and limited in effectiveness due to their separation from the LLM's inference process. To overcome these limitations, we introduce MIND, an unsupervised training framework that leverages the internal states of LLMs for real-time hallucination detection without requiring manual annotations. Additionally, we present HELM, a new benchmark for evaluating hallucination detection across multiple LLMs, featuring diverse LLM outputs and the internal states of LLMs during their inference process. Our experiments demonstrate that MIND outperforms existing state-of-the-art methods in hallucination detection.

研究の動機と目的

  • 後処理による幻覚検出手法の限界、すなわち計算コストが高く、LLMの推論との統合が難しいという点を解決すること。
  • 推論中における内部モデル状態のみを用いて、非教師ありでリアルタイムに幻覚を検出するフレームワークを構築すること。
  • 生成された出力と内部活性化を備えた複数のLLMを含む新規のHELMBenchmarkを導入することで、幻覚検出における再現可能性とベンチマーク手法の向上を図ること。
  • 訓練用に高価な人工作業によるアノテーションデータに依存することを排除すること。
  • 任意のTransformerベースのLLMに軽量で互換性のある形で幻覚検出を統合可能にすること。

提案手法

  • MINDはWikipediaから直接擬似学習データを抽出し、人工作業のアノテーションを一切必要としないため、非教師あり学習が可能になる。
  • フレームワークは、推論中における各トークンの文脈的埋め込み、自己注意マップ、隠れ層の活性化を処理する軽量な多層パーセプトロン(MLP)分類器を採用している。
  • 幻覚検出は、応答を生成する際のLLMの内部状態を分析することでリアルタイムに実行され、後処理の遅延を回避する。
  • この手法は、生成時における中間モデル状態へのアクセスのみを要するため、任意のTransformerベースのLLMと互換性を持つ。
  • Wikipediaからの自己教師信号を用いて、各トークンの幻覚発生確率をエンドツーエンドで予測するように、フレームワークを訓練する。
  • 新規のベンチマークであるHELMBenchmarkを導入し、6種類のLLMの出力と、それらの完全な内部状態(埋め込み、注目、活性化)を評価に提供する。

実験結果

リサーチクエスチョン

  • RQ1後処理や正解アノテーションに依存せずに、リアルタイムでの幻覚検出が可能か?
  • RQ2内部LLM状態のみに依存する非教師あり手法が、教師ありまたは後処理ベースのベースラインと比較してどれほど有効か?
  • RQ3注目や隠れ状態などの異なる内部状態が、幻覚検出性能に与える影響は何か?
  • RQ4再トレーニングなしで、多様なLLMアーキテクチャに軽量で汎用的な検出器を効果的に統合できるか?
  • RQ5分類器の深さや学習データサイズの変化に伴い、MINDの性能はどのように変化するか?

主な発見

  • MINDは、人工作業によるアノテーションデータを一切必要とせず、HELMBenchmarkにおいて最先端の幻覚検出性能を達成した。
  • 4層の分類器で精度が最大0.7291に達し、それ以上の深さでは感度が著しく低下しなかった。
  • 4,096件の学習データポイントを超えると性能が頭打ちとなり、これ以上の追加データでは利益が著しく減少した。
  • 大規模LLMを用いた後処理手法と比較して、大幅に遅延が低減されたリアルタイム検出が可能になった。
  • HELMBenchmarkは、多様なLLMの出力と完全な内部状態記録を備えた包括的な評価プラットフォームを提供し、再現性とマルチモデル比較の向上に寄与した。
  • Wikipediaデータにおける非教師あり事前学習により、微調整なしに多数のLLMに強く一般化可能な性能が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。