[論文レビュー] Unsupervised Human Activity Recognition through Two-stage Prompting with ChatGPT
本稿では、オブジェクト使用シーケンスを用いた教師なし人体活動認識(HAR)を可能にするために、ChatGPT向けの2段階プロンプト工学手法を提案する。最初に、特徴的なオブジェクトに焦点を当てた活動記述を生成し、次に知識強化プロンプトを用いて予測を精緻化することで、Opportunityで91.15%、50Saladsで100%、CMU-MMACで100%の最先端のF1スコアを達成した。ゼロショット、リtrievalベース、少数ショットのベースラインを上回った。
Wearable sensor devices, which offer the advantage of recording daily objects used by a person while performing an activity, enable the feasibility of unsupervised Human Activity Recognition (HAR). Unfortunately, previous unsupervised approaches using the usage sequence of objects usually require a proper description of activities manually prepared by humans. Instead, we leverage the knowledge embedded in a Large Language Model (LLM) of ChatGPT. Because the sequence of objects robustly characterizes the activity identity, it is possible that ChatGPT already learned the association between activities and objects from existing contexts. However, previous prompt engineering for ChatGPT exhibits limited generalization ability when dealing with a list of words (i.e., sequence of objects) due to the similar weighting assigned to each word in the list. In this study, we propose a two-stage prompt engineering, which first guides ChatGPT to generate activity descriptions associated with objects while emphasizing important objects for distinguishing similar activities; then outputs activity classes and explanations for enhancing the contexts that are helpful for HAR. To the best of our knowledge, this is the first study that utilizes ChatGPT to recognize activities using objects in an unsupervised manner. We conducted our approach on three datasets and demonstrated the state-of-the-art performance.
研究の動機と目的
- 高価な人手によるラベル付きデータに依存せずに、教師なし人体活動認識(HAR)を可能にすること。
- 既存のプロンプト工学の限界を克服し、オブジェクトシーケンスにおける均等な語割合割り当てによる類似活動の区別が困難な問題を解決すること。
- ChatGPTに内蔵された事前学習済み知識を活用し、オブジェクト使用に基づいて自動的かつ文脈に適した活動記述を生成すること。
- 構造化されたプロンプトを通じて、ChatGPTに特徴的なオブジェクトに注目させることで、HAR性能を向上させること。
- 教師なし環境下で、強力で汎用性の高い知識を生成するための2段階プロンプトの有効性を示すこと。
提案手法
- 最初の段階では、類似した2つの活動とその関連オブジェクトシーケンスを提示する知識生成プロンプトを用い、ChatGPTに特徴的な区別要素となるオブジェクトに焦点を当てた記述の差異を生成させる。
- 2番目の段階では、知識プロンプト工学を用いて最終的な活動予測を生成し、生成された記述を文脈として組み込み、予測の根拠を明記させる必要がある。
- 出力の決定論的を保つために、GPT-3.5 text-Davinci-003モデルを温度=0、top_p=0.5で使用する。
- 時間的セグメントに分けられたオブジェクトシーケンスを入力とし、ゼロショット、少数ショット、リtrievalベースのベースラインでは、プロンプトに活動クラスを含める。
- タスク固有の知識をプロンプト構造に直接埋め込むことで、文脈の関連性を高めることを意図している。
- 2段階のプロセスにより、ChatGPTが識別に有用な特徴に注目するよう保証され、多様なデータセットにわたる一般化性能が向上する。

実験結果
リサーチクエスチョン
- RQ1オブジェクト使用シーケンスのみを用いて、GPT-3.5のような大規模言語モデルが教師なしHARに効果的に活用可能か。
- RQ2重複するオブジェクト使用を示す類似活動を区別できるように、プロンプト工学をどのように設計すべきか。
- RQ3中間の知識生成段階と精緻化された予測段階を含む2段階プロンプトは、標準的なプロンプト手法に比べ、HAR性能を向上させるか。
- RQ4人手によるラベルなし記述を前提に、モデルが高品質で特徴的な活動記述を自動生成可能か。
- RQ5本手法は、オブジェクトの重複度が異なる多様なHARデータセットに、どのように一般化するか。
主な発見
- 提案された2段階プロンプト手法は、Opportunityデータセットで91.15%のF1スコアを達成し、ゼロショットベースライン(53.61%)およびリtrievalベース手法(48.19%)を顕著に上回った。
- 50Saladsデータセットでは、提案手法が100.00%のF1スコアを達成し、少数ショットベースライン(90.61%)およびリtrievalベース手法(93.87%)を上回った。
- CMU-MMACデータセットでも、提案手法は100.00%のF1スコアを達成し、すべてのベースラインを上回った。少数ショット手法(100.00%)およびリtrievalベース手法(71.05%)を含む。
- Opportunityデータセットの混同行列は、高濃度のオブジェクト重複にもかかわらず、クリーニング活動が他の活動と的確に区別されたことを示し、特徴的な要因に的確に注目していることを裏付けた。
- 本手法は、オブジェクト重複度が異なるデータセットにおいても安定した性能を示し、教師なしHARにおける強力な一般化能力を示した。
- 結果から、2段階プロンプトによる自動生成知識は、手作業で準備された少数ショット例や取得済み知識よりも、特に複雑な現実世界の状況において、より効果的で一貫性があることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。