Skip to content
StableReported 2026-10-02 12:00

PPO-HRAP: Proximal Policy Optimization with a Hybrid Regime-Aware Policy for Risk-Controlled Trading

A new reinforcement learning policy, PPO-HRAP, is introduced to improve trading strategies by balancing risk and reward more effectively.

01

Evidence

  • AarXiv cs.AIPrimary source2026-10-02 12:00
    combines Proximal Policy Optimization with an interpretable regime prior
    View source
  • AarXiv cs.AIPrimary source2026-10-02 12:00
    Abstract: Reinforcement learning for trading often struggles to balance upside participation with drawdown control. Profit-only policies can collapse toward passive long exposure on upward-drifting assets, while aggressively risk-penalized rewards can become too defensive during volatile periods. This paper proposes PPO-HRAP, a hybrid regime-aware policy that combines Proximal Policy Optimization…
    View source