跳到正文
稳定报道时间 2026-10-02 12:00

PPO-HRAP:结合混合制度感知策略的近端策略优化用于风险控制交易

一种新的强化学习策略PPO-HRAP被引入,以更有效地在风险和收益之间进行平衡,从而改进交易策略。

01

证据

  • AarXiv cs.AI一手来源2026-10-02 12:00
    combines Proximal Policy Optimization with an interpretable regime prior
    查看来源
  • AarXiv cs.AI一手来源2026-10-02 12:00
    Abstract: Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization…
    查看来源