稳定报道时间 2026-10-02 12:00
PPO-HRAP:结合混合制度感知策略的近端策略优化用于风险控制交易
一种新的强化学习策略PPO-HRAP被引入,以更有效地在风险和收益之间进行平衡,从而改进交易策略。
一种新的强化学习策略PPO-HRAP被引入,以更有效地在风险和收益之间进行平衡,从而改进交易策略。
combines Proximal Policy Optimization with an interpretable regime prior
Abstract: Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization…