Skip to main content
QUICK REVIEW

[论文解读] Inferring agent objectives at different scales of a complex adaptive system

Dieter Hendricks, Adam D. Cobb|arXiv (Cornell University)|Dec 4, 2017
Complex Systems and Decision Making被引用 4
一句话总结

本文提出了一种多尺度逆强化学习框架,通过从总体市场行为中估计特定时间尺度的奖励函数,以推断金融市场的代理目标。在时间聚合的状态-动作轨迹上应用最大熵逆强化学习,结果表明特征向量在不同时间尺度下具有不同的相对吸引力——这表明高频与长期投资目标存在差异——暗示市场动态中存在分层结构。

ABSTRACT

We introduce a framework to study the effective objectives at different time scales of financial market microstructure. The financial market can be regarded as a complex adaptive system, where purposeful agents collectively and simultaneously create and perceive their environment as they interact with it. It has been suggested that multiple agent classes operate in this system, with a non-trivial hierarchy of top-down and bottom-up causation classes with different effective models governing each level. We conjecture that agent classes may in fact operate at different time scales and thus act differently in response to the same perceived market state. Given scale-specific temporal state trajectories and action sequences estimated from aggregate market behaviour, we use Inverse Reinforcement Learning to compute the effective reward function for the aggregate agent class at each scale, allowing us to assess the relative attractiveness of feature vectors across different scales. Differences in reward functions for feature vectors may indicate different objectives of market participants, which could assist in finding the scale boundary for agent classes. This has implications for learning algorithms operating in this domain.

研究动机与目标

  • 理解金融市场中不同代理类别在不同时间尺度下如何运作,其目标可能有所不同。
  • 开发一种从总体市场数据中推断多时间尺度下有效奖励函数的方法。
  • 探究不同时间尺度下奖励函数的差异是否表明存在不同的代理目标或策略行为。
  • 通过识别特定时间尺度下的状态表示和目标,支持多尺度学习算法的设计。
  • 探索是否存在高頻交易员、做市商与长期投资者等代理类别之间的时标分界。

提出的方法

  • 将最大熵逆强化学习(MaxEnt IRL)应用于不同时间尺度下的观测状态-动作轨迹,以估计奖励函数。
  • 使用从总体市场数据中提取的时间序列状态轨迹和动作序列,按5分钟、15分钟、30分钟和60分钟的间隔进行分段。
  • 采用线性奖励函数 r = θ⊤fζ,其中 fζ 表示轨迹上特征计数,通过优化 θ 以匹配经验特征期望。
  • 通过马尔可夫决策过程转移模型 T 的前向与后向传递计算状态访问频率 Dsi,以估计梯度。
  • 基于特征向量相似性对状态进行归一化和聚类(K-means,k=6),以比较相同特征模式在不同时间尺度下的相对奖励。
  • 通过基于聚类的图表可视化并比较不同时间尺度下的归一化奖励,其中节点大小表示时间尺度,颜色表示奖励大小。

实验结果

研究问题

  • RQ1金融市场的代理目标是否因时间尺度而异,表现为有效奖励函数的差异?
  • RQ2能否利用逆强化学习从总体市场行为中可靠地推断出特定时间尺度的奖励函数?
  • RQ3某些特征向量是否在特定时间尺度下更具吸引力,表明不同代理类别的策略行为存在差异?
  • RQ4是否存在市场因果关系的分层结构的证据,即不同时间尺度由不同的模型支配?
  • RQ5成交量不平衡与买卖价差特征如何在不同时间范围内以不同方式影响状态的吸引力?

主要发现

  • 具有相似值的特征向量在不同时间尺度下表现出不同的相对奖励,表明同一市场状态对不同时间视野的观察者可能更具或更少吸引力。
  • 聚类3在5分钟尺度下表现出负价差和较大的负成交量不平衡,有利可图,但在60分钟尺度下则不利,表明其策略响应具有时间尺度依赖性。
  • 聚类5具有正成交量不平衡和负价差,在5分钟尺度下产生正奖励(对短期卖出有利),但在更长的时间尺度下为负奖励,表明可能存在价格压力效应。
  • 聚类6具有负成交量不平衡和正价差,在所有时间尺度下均表现出持续的正奖励,表明在较低价格水平上买入并伴随价格上涨压力的有利条件。
  • 同一特征向量的相对奖励在不同时间尺度间存在显著差异,表明代理目标(如高频交易与长期投资)并非一致,而是可能具有时间尺度依赖性。
  • 该框架为市场动态中的多尺度结构提供了实证证据,支持不同时间分辨率下运行的独立代理类别的存在。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。