[論文レビュー] Estimating the Hallucination Rate of Generative AI
本稿では、事例内学習(ICL)設定における生成AIモデルが幻覚的出力を生成する確率を推定するためのベイジアン手法として、後方幻覚率(PHR)を提案する。モデルの予測分布からのサンプリングと応答の対数尤度の評価を通じて、外部分類器やタスク固有の調整を一切必要とせず、不確実性に基づいた正確な幻覚リスク推定が可能である。Llama-2モデルを用いた合成的および自然言語タスクにおいて、その有効性が検証された。
This paper presents a method for estimating the hallucination rate for in-context learning (ICL) with generative AI. In ICL, a conditional generative model (CGM) is prompted with a dataset and a prediction question and asked to generate a response. One interpretation of ICL assumes that the CGM computes the posterior predictive of an unknown Bayesian model, which implicitly defines a joint distribution over observable datasets and latent mechanisms. This joint distribution factorizes into two components: the model prior over mechanisms and the model likelihood of datasets given a mechanism. With this perspective, we define a hallucination as a generated response to the prediction question with low model likelihood given the mechanism. We develop a new method that takes an ICL problem and estimates the probability that a CGM will generate a hallucination. Our method only requires generating prediction questions and responses from the CGM and evaluating its response log probability. We empirically evaluate our method using large language models for synthetic regression and natural language ICL tasks.
研究の動機と目的
- 条件付き生成モデル(CGM)を用いた事例内学習(ICL)における幻覚率を推定する手法の開発。
- 幻覚を真の潜在パラメータ下での低尤度予測として定義し、ICLのベイジアン解釈に基づくものとする。
- モデル生成と対数尤度評価のみを必要とする計算効率の良い推定器の構築。
- Llama-2モデルを用いて合成的回帰タスクと自然言語ICLベンチマークにおいて、この手法の妥当性を検証すること。
- PHR推定器が実際の誤差率と強く相関しており、エピステミック不確実性を捉えられることを示すこと。
提案手法
- CGMが未知の潜在モデルの事後予測分布からサンプリングすることとしてICLをベイジアン推論として形式化する。
- 生成された予測が真の潜在パラメータ下で低尤度である確率として、後方幻覚率(PHR)を定義する。
- 文脈の完成形のモンテカルロサンプリングを用いた有限標本推定器を開発し、生成された応答の対数尤度を評価する。
- CGMの予測分布を用いて、真のモデルや外部分類器へのアクセスなしにPHRを推定する。
- 合成データと自然言語タスクを用いて推定器を検証し、PHRを実際の誤差率および相互情報量と比較する。
- PHRが相互情報量と強く相関しており、エピステミック不確実性を捉えていることが示された。
実験結果
リサーチクエスチョン
- RQ1生成モデルが事後予測推論を実行するとみなすベイジアン枠組みを用いて、事例内学習における幻覚率を推定できるか?
- RQ2合成的回帰タスクにおいて、提案されたPHR推定器は真の幻覚率をどの程度正確に予測できるか?
- RQ3Llama-2モデルを用いた自然言語ICLタスクにおいて、PHR推定器は実際の誤差率と相関しているか?
- RQ4文脈長、少数例の数、モデルサイズの変動に対してPHR推定器は頑健か?
- RQ5PHRは、エピステミック不確実性を捉えるために他の不確実性指標(相互情報量など)とどのように関係しているか?
主な発見
- 20個のモンテカルロサンプルと100個のyサンプルを用いたSST-2ベンチマークにおいて、PHR推定器は実際の誤差率と相関が強く、決定係数R²が0.711に達した。
- 合成的回帰タスクにおいて、PHR推定器は真の幻覚率を正確に予測でき、文脈サイズが増加するに従い誤差が顕著に減少した。
- 相互情報量よりもPHRが真の幻覚率との間により線形の関係を示したため、エピステミック不確実性のより信頼性の高い指標であると考えられる。
- 全評価タスクにおいて、相互情報量は実際の誤差率およびPHRの両方と有意に相関しており、PHRが不確実性の代理指標として有効であることを裏付けた。
- モンテカルロサンプルおよびyサンプルの数を増やすことでPHR推定器の精度が向上した一方、生成例の数やモデルサイズを増やすだけでは性能が劣化した。
- PHR推定器は、AG News、Medical QP、RTE、WNLIなど複数のデータセットで良好なキャリブレーションを示し、平均絶対誤差(MAE)が低く抑えられた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。