Skip to main content
QUICK REVIEW

[論文レビュー] Supporting Human-AI Collaboration in Auditing LLMs with LLMs

Charvi Rastogi, Marco Túlio Ribeiro|arXiv (Cornell University)|Apr 19, 2023
Ethics and Social Impacts of AI参考文献 32被引用数 6
ひとこと要約

本論文では、人間とAIの協働を活用して大規模言語モデル(LLMs)の障害を効果的に検出するための強化された監査ツール、AdaTest++ を紹介する。意味づけ支援、構造的な障害整理、および専門家が作成したプロンプトテンプレートを統合することで、監査担当者が人間の推論とLLMが生成するテストケースを効果的に組み合わせられるようになり、GPT-3およびAzureの感情分析モデルにおいて26の異なる障害トピックが同定された。これは、これまでに報告が不足していた有害性を含むものである。

ABSTRACT

Large language models are becoming increasingly pervasive and ubiquitous in society via deployment in sociotechnical systems. Yet these language models, be it for classification or generation, have been shown to be biased and behave irresponsibly, causing harm to people at scale. It is crucial to audit these language models rigorously. Existing auditing tools leverage either or both humans and AI to find failures. In this work, we draw upon literature in human-AI collaboration and sensemaking, and conduct interviews with research experts in safe and fair AI, to build upon the auditing tool: AdaTest (Ribeiro and Lundberg, 2022), which is powered by a generative large language model (LLM). Through the design process we highlight the importance of sensemaking and human-AI communication to leverage complementary strengths of humans and generative models in collaborative auditing. To evaluate the effectiveness of the augmented tool, AdaTest++, we conduct user studies with participants auditing two commercial language models: OpenAI's GPT-3 and Azure's sentiment analysis model. Qualitative analysis shows that AdaTest++ effectively leverages human strengths such as schematization, hypothesis formation and testing. Further, with our tool, participants identified a variety of failures modes, covering 26 different topics over 2 tasks, that have been shown before in formal audits and also those previously under-reported.

研究の動機と目的

  • 社会的・技術的システムにおけるLLMのバイアスおよび有害行動の監査の課題に対処すること。
  • 人間と生成的LLMの相補的な強みを活用することで、監査の効果性を向上させること。
  • AI補助ツールを通じて、監査担当者が仮説形成、テスト、意味づけを支援すること。
  • 監査ワークフローにおける一時的な人間の創造性やシステム主導の自動化への依存を減らすこと。
  • 専門家および初心者双方の監査担当者が、多様な障害モードを特定できるツールを開発すること。

提案手法

  • 意味づけを支援する機能を備えたAdaTestの拡張。自然言語プロンプトによるテスト生成を可能にした。
  • グローバルな文脈を提供するため、発見された障害を視覚化および整理するためのツリー構造インターフェースを導入した。
  • 専門家の「声に出して考える」インタビューに基づいて、経験の浅い監査担当者を支援する再利用可能なプロンプトテンプレートを設計した。
  • 人間が提供した仮説に基づき、オンデマンドでテストケースを生成するLLMを共同監査者として統合した。
  • AI研究者および業界の実務家を対象に、思考 aloud ユーザースタディを実施し、ツールの有効性を評価した。
  • 定性的分析を用いて設計インサイトを導出し、ツールが共同監査において果たす役割を検証した。

実験結果

リサーチクエスチョン

  • RQ1人間とAIの協働をどのように構造化すれば、LLMの監査を効果的に支援できるか?
  • RQ2意味づけとコミュニケーションは、監査プロセスにおける人間とLLMの協働を効果的にする上で果たす役割は何か?
  • RQ3専門家の監査戦略は、より広範なツールの使いやすさを実現するために、どのように再利用可能なプロンプトテンプレートに変換できるか?
  • RQ4AdaTest++ は、これまでに報告が不足していた障害モードを含め、多様な障害モードを監査担当者が特定するのをどの程度支援できるか?
  • RQ5監査担当者がLLMによるテスト生成を信頼し、効果的に使用するにあたり、直面する課題は何か?

主な発見

  • AdaTest++ を使用した参加者は、LLMと協働しながら、仮説形成とテストの主要な意味づけ段階を効果的に遂行した。
  • このツールにより、質問応答と感情分類の2つのタスクにおいて、代表的、割り当て、誤情報に関する有害性を含む、合計26の固有の障害トピックが同定された。
  • 監査担当者は、LLMが生成したテストケースと併せて、自らの専門的知識と文脈的推論を活用し、相補的な強みを示した。
  • 一部の障害は、以前の公式監査で報告済みであったが、他は報告が不足していたため、このツールが微細な障害モードにも感受性が高いことが示された。
  • ユーザーは、プロンプトの作成や仮説評価における自己効力感の調整に苦労しており、より良いサポートと自己効力感の支援の必要性が浮き彫りになった。
  • 研究では、現在の協働支援の限界、たとえば意見の相違をモデル化できないこと、障害ツリーの共有構造が制限されていることといった課題が明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。